Aller au contenu
Accueil › Cours de maths › Sommes de variables aléatoires et loi des grands nombres : cours de maths Terminale

Sommes de variables aléatoires et loi des grands nombres : cours de maths Terminale

  • par
Rate this post
Cours de maths Terminale : cours de maths Terminale

Un sondeur interroge mille personnes, un casino fait tourner sa roulette des millions de fois, une usine contrôle un échantillon de pièces : à chaque fois, on additionne ou on moyenne beaucoup de résultats aléatoires, et pourtant le résultat final semble étrangement prévisible. Dans ce chapitre, tu apprends à calculer l’espérance et la variance d’une somme de variables aléatoires, tu découvres les inégalités de concentration qui mesurent l’écart à la moyenne, puis tu démontres la loi des grands nombres, qui justifie qu’une fréquence observée se rapproche d’une probabilité. Mathbot te propose même de simuler tout cela en Python !

1. Rappels : espérance, variance, indépendance

Une variable aléatoire X associe un nombre réel à chaque issue d’une expérience aléatoire. Si X prend les valeurs x1, …, xr avec les probabilités pi = P(X = xi), on retrouve les trois grandeurs de la classe de 1ère.

Espérance, variance, écart-type

  • Espérance : E(X) = x1p1 + … + xrpr (la valeur moyenne « à long terme »).
  • Variance : V(X) = E((X − E(X))²) = E(X²) − (E(X))² (la dispersion autour de la moyenne).
  • Écart-type : σ(X) = √V(X), exprimé dans la même unité que X.
Variables indépendantes

Deux variables aléatoires X et Y sont indépendantes si, pour tous réels x et y, P(X = x et Y = y) = P(X = x) × P(Y = y). C’est le cas, par exemple, des résultats de deux lancers successifs d’un même dé.

Exemple : le dé équilibré

Soit D le numéro obtenu avec un dé équilibré à six faces. E(D) = (1 + 2 + 3 + 4 + 5 + 6) ÷ 6 = 72. E(D²) = (1 + 4 + 9 + 16 + 25 + 36) ÷ 6 = 916, donc V(D) = 916 − (72)² = 916 − 494 = 3512 ≈ 2,92 et σ(D) ≈ 1,71. Garde ces valeurs : elles serviront souvent.

2. Linéarité de l’espérance

Propriété (linéarité de l’espérance)

Pour toutes variables aléatoires X et Y définies sur la même expérience et pour tous réels a et b :

  • E(X + Y) = E(X) + E(Y) ;
  • E(aX + b) = a E(X) + b.

Ces égalités sont vraies sans aucune hypothèse d’indépendance.

Démonstration. Notons Ω l’ensemble (fini) des issues. L’espérance de X vaut la somme, sur toutes les issues ω, de X(ω) × P(ω). Donc E(X + Y) = Σ (X(ω) + Y(ω)) P(ω) = Σ X(ω)P(ω) + Σ Y(ω)P(ω) = E(X) + E(Y). De même E(aX + b) = Σ (aX(ω) + b) P(ω) = a Σ X(ω)P(ω) + b Σ P(ω) = a E(X) + b, car la somme de toutes les probabilités vaut 1.

Exemple : deux dés

On lance deux dés équilibrés et on note S la somme des deux numéros. Plutôt que de dresser la loi de S, on écrit S = D1 + D2 : E(S) = E(D1) + E(D2) = 72 + 72 = 7. La loi de S, tracée ci-dessous, est bien symétrique autour de 7.

0,000,050,100,1523456789101112sP(S = s)

Astuce : décomposer pour calculer

Pour trouver l’espérance d’une quantité compliquée (nombre de succès, gain total…), cherche à l’écrire comme somme de variables simples dont tu connais l’espérance. La linéarité fait le reste, même si ces variables dépendent les unes des autres.

3. Variance d’une somme de variables indépendantes

Propriété (variance et indépendance)

  • Pour tous réels a et b : V(aX + b) = a² V(X) (ajouter b ne change pas la dispersion).
  • Si X et Y sont indépendantes : V(X + Y) = V(X) + V(Y).

Démonstration de la seconde égalité. On a V(X + Y) = E((X + Y)²) − (E(X) + E(Y))². En développant, E((X + Y)²) = E(X²) + 2E(XY) + E(Y²) et (E(X) + E(Y))² = (E(X))² + 2E(X)E(Y) + (E(Y))². Donc V(X + Y) = V(X) + V(Y) + 2(E(XY) − E(X)E(Y)). Pour des variables indépendantes, E(XY) = E(X)E(Y) (la probabilité de chaque couple se factorise), le dernier terme est nul et V(X + Y) = V(X) + V(Y).

Exemple : suite des deux dés

Les deux dés sont indépendants, donc V(S) = V(D1) + V(D2) = 3512 + 3512 = 356 ≈ 5,83. On peut le confirmer avec la loi de S : E(S²) = 3296, donc V(S) = 3296 − 49 = 356.

Pièges classiques

  • V(X + Y) = V(X) + V(Y) exige l’indépendance. Contre-exemple : si Y = X, alors V(X + Y) = V(2X) = 4V(X) ≠ 2V(X).
  • Pour une différence : V(X − Y) = V(X) + V(−Y) = V(X) + V(Y). Les variances s’ajoutent toujours, jamais elles ne se retranchent.
  • V(aX) = a² V(X) et non a V(X) ; l’écart-type, lui, est multiplié par |a|.
Application : retrouver la loi binomiale

Une variable de Bernoulli B de paramètre p a pour espérance p et variance p(1 − p). Une variable X qui suit la loi binomiale B(n ; p) est la somme de n variables de Bernoulli indépendantes. Par linéarité E(X) = np, et par indépendance V(X) = np(1 − p). Pour n = 60 et p = 16, on obtient E(X) = 10 et V(X) = 60 × 16 × 56 = 253.

4. Échantillon, somme et moyenne d’un échantillon

Échantillon de variables aléatoires

Un échantillon de taille n d’une loi de probabilité est une liste (X1 ; X2 ; … ; Xn) de n variables aléatoires indépendantes qui suivent toutes cette même loi. On note μ leur espérance commune, V leur variance commune et σ leur écart-type commun. On définit :

  • la somme Sn = X1 + X2 + … + Xn ;
  • la moyenne Mn = Sn ÷ n = (X1 + X2 + … + Xn) ÷ n.

Répéter n fois, de façon indépendante, une même expérience (lancer un dé, tirer avec remise, interroger au hasard une personne) fournit un échantillon de taille n.

Propriété (somme et moyenne d’un échantillon)

Espérance Variance Écart-type
Somme Sn nμ nV σ√n
Moyenne Mn μ Vn σ√n

Justification. Par linéarité, E(Sn) = μ + … + μ = nμ. Par indépendance, V(Sn) = V + … + V = nV. Comme Mn = 1n Sn, on a E(Mn) = 1n × nμ = μ et V(Mn) = (1n)² × nV = Vn.

Exemple : cent lancers de dé

Pour n = 100 lancers (μ = 72, V = 3512) : E(S100) = 350, V(S100) = 350012 ≈ 291,7 et σ(S100) ≈ 17,1. Pour la moyenne : E(M100) = 3,5, V(M100) = 351200 = 7240 ≈ 0,0292 et σ(M100) ≈ 0,171.

L’écart-type de la moyenne diminue comme 1√n : pour le dé, il passe de 1,71 (un seul lancer) à 0,171 (cent lancers). La courbe ci-dessous montre cette décroissance.

0,000,501,001,50020406080100nσ(M)

Deux effets opposés

Quand n augmente, la somme Sn se disperse de plus en plus (σ√n grandit), alors que la moyenne Mn se concentre de plus en plus autour de μ (σ ÷ √n diminue). Ne confonds jamais les deux.

5. Inégalité de Markov

Inégalité de Markov

Soit X une variable aléatoire à valeurs positives ou nulles et a un réel strictement positif. Alors P(X ≥ a) ≤ (E(X)) ÷ a.

Démonstration. Dans la somme qui définit E(X) = Σ xi pi, tous les termes sont positifs. En ne gardant que les termes pour lesquels xi ≥ a, on obtient E(X) ≥ (somme des xipi avec xi ≥ a) ≥ a × (somme des pi avec xi ≥ a) = a P(X ≥ a). Il suffit de diviser par a > 0.

Exemple

Un standard téléphonique reçoit en moyenne 4 appels par minute en soirée ; soit X le nombre d’appels reçus en une minute (X ≥ 0 et E(X) = 4). Alors P(X ≥ 20) ≤ 420 = 0,2 : il y a au plus 20 % de chances de recevoir 20 appels ou plus en une minute.

Quand la borne est inutile

Si a ≤ E(X), la borne (E(X)) ÷ a est supérieure ou égale à 1 : l’inégalité est vraie mais ne dit rien. Markov n’est intéressante que pour a nettement plus grand que l’espérance. Et la positivité de X est indispensable.

6. Inégalité de Bienaymé-Tchebychev

Inégalité de Bienaymé-Tchebychev

Soit X une variable aléatoire d’espérance μ et de variance V. Pour tout réel δ > 0 : P(|X − μ| ≥ δ) ≤ Vδ².

Démonstration. La variable Y = (X − μ)² est positive et E(Y) = V par définition de la variance. L’événement « |X − μ| ≥ δ » est le même que « (X − μ)² ≥ δ² ». L’inégalité de Markov appliquée à Y avec a = δ² donne P(Y ≥ δ²) ≤ Vδ².

Par passage à l’événement contraire : P(|X − μ| < δ) ≥ 1 − Vδ², ce qui signifie que X est dans l’intervalle ]μ − δ ; μ + δ[ avec une probabilité au moins égale à 1 − Vδ².

Exemple : la somme de deux dés

Pour S de la partie 2 (μ = 7 et V = 356) avec δ = 4 : P(|S − 7| ≥ 4) ≤ 356 ÷ 16 = 3596 ≈ 0,365. La valeur exacte est bien plus petite : |S − 7| ≥ 4 correspond aux sommes 2, 3, 11 et 12, soit (1 + 2 + 2 + 1) ÷ 36 = 16 ≈ 0,167. L’inégalité est vraie, mais pessimiste : c’est le prix de sa généralité, elle s’applique à toute loi.

Méthode : utiliser Bienaymé-Tchebychev

  1. Identifie μ = E(X) et V = V(X).
  2. Traduis l’événement demandé sous la forme |X − μ| ≥ δ (ou son contraire |X − μ| < δ).
  3. Calcule la borne Vδ² ; vérifie qu’elle est inférieure à 1, sinon elle n’apporte rien.
  4. Conclus par une phrase : « la probabilité est inférieure ou égale à … » ou, pour le contraire, « supérieure ou égale à … ».

7. Inégalité de concentration

Appliquons Bienaymé-Tchebychev à la moyenne Mn d’un échantillon, dont on connaît l’espérance μ et la variance Vn.

Inégalité de concentration

Soit (X1 ; … ; Xn) un échantillon de variables aléatoires d’espérance μ et de variance V, et Mn sa moyenne. Pour tout réel δ > 0 : P(|Mn − μ| ≥ δ) ≤ Vnδ².

Démonstration. D’après la partie 4, E(Mn) = μ et V(Mn) = Vn. L’inégalité de Bienaymé-Tchebychev appliquée à Mn donne P(|Mn − μ| ≥ δ) ≤ (V ÷ n) ÷ δ² = Vnδ².

Exemple : mille lancers de dé

Avec V = 3512, δ = 0,1 et n = 1000 : P(|M1000 − 3,5| ≥ 0,1) ≤ 3512 ÷ (1000 × 0,01) = 724 ≈ 0,29. Autrement dit, avec une probabilité d’au moins 0,71, la moyenne des mille lancers est dans ]3,4 ; 3,6[.

Méthode : trouver la taille de l’échantillon

On cherche n pour que P(|Mn − μ| ≥ δ) soit inférieure à un risque α fixé. Il suffit que Vnδ² ≤ α, c’est-à-dire n ≥ Vαδ².

Pour le dé avec δ = 0,1 et α = 0,05 : n ≥ 3512 ÷ (0,01 × 0,05) ≈ 5833,3, donc il suffit de prendre n = 5834 lancers.

Le graphique suivant compare, pour une pièce équilibrée (V = 0,25) et δ = 0,1, la borne 25n (en orange) à la vraie probabilité P(|Fn − 0,5| ≥ 0,1) (en bleu), calculée avec la loi binomiale. La borne est toujours au-dessus, mais elle décroît elle aussi vers 0.

0,000,250,500,751,00050100150200nprobabilité

8. La loi des grands nombres

Loi (faible) des grands nombres

Soit (X1 ; … ; Xn) un échantillon de variables aléatoires d’espérance μ et de moyenne Mn. Pour tout réel δ > 0 fixé : limn→+∞ P(|Mn − μ| ≥ δ) = 0.

Démonstration. Pour tout n, 0 ≤ P(|Mn − μ| ≥ δ) ≤ Vnδ² d’après l’inégalité de concentration. Or δ et V sont fixés, donc Vnδ² tend vers 0 quand n tend vers +∞. Le théorème des gendarmes donne le résultat.

Interprétation. Aussi petit que soit l’écart δ choisi, la probabilité que la moyenne observée s’écarte de μ d’au moins δ devient aussi petite que l’on veut quand n est grand. Si les Xi sont des variables de Bernoulli de paramètre p (succès = 1, échec = 0), alors μ = p et Mn est la fréquence de succès : la fréquence observée se rapproche de la probabilité p. C’est ce qui justifie l’estimation d’une probabilité par une fréquence dans une simulation ou un sondage.

Voici trois simulations indépendantes de la moyenne de n lancers d’un dé ; la bande orange représente l’intervalle ]3,25 ; 3,75[ autour de μ = 3,5.

2,02,53,03,54,04,55,00100200300400500nM

Ce que la loi des grands nombres ne dit PAS

  • Elle ne dit pas que le hasard « compense » : après dix « pile » de suite, la probabilité d’avoir « pile » au lancer suivant vaut toujours 12, car les lancers sont indépendants.
  • Elle ne dit pas que la somme se rapproche de nμ : l’écart Sn − nμ a un écart-type σ√n qui grandit. Seule la moyenne (ou la fréquence) se stabilise.
  • Elle ne garantit rien pour un n précis : il s’agit d’une probabilité qui tend vers 0, pas d’une certitude.

9. Simulations avec Python

La loi des grands nombres se visualise très bien avec un programme. Le module random fournit random.randint(a, b) (entier aléatoire entre a et b inclus) et random.random() (nombre aléatoire de [0 ; 1[).

Moyenne de n lancers de dé

import random

def moyenne(n):
    somme = 0
    for _ in range(n):
        somme = somme + random.randint(1, 6)
    return somme / n

print(moyenne(10))
print(moyenne(1000))
print(moyenne(100000))

Les trois affichages sont proches de 3,5, de plus en plus lorsque n grandit (les valeurs exactes changent à chaque exécution).

Estimer une probabilité d’écart

Pour estimer P(|Mn − 3,5| ≥ 0,1), on répète l’expérience « calculer Mn » un grand nombre de fois et on compte la proportion d’écarts trop grands.

def proba_ecart(n, delta, essais):
    mauvais = 0
    for _ in range(essais):
        if abs(moyenne(n) - 3.5) >= delta:
            mauvais = mauvais + 1
    return mauvais / essais

print(proba_ecart(100, 0.1, 2000))
print(proba_ecart(1000, 0.1, 2000))

Les résultats seront nettement plus petits que les bornes de Bienaymé-Tchebychev (724 pour n = 1000) : la borne est valable, mais loin d’être optimale.

Conseil de Mathbot

Avant de lancer une simulation, calcule la borne théorique : si ta simulation donne une proportion plus grande que la borne, c’est que ton programme (ou ton calcul de V) contient une erreur !

À retenir

  • Linéarité : E(X + Y) = E(X) + E(Y) et E(aX + b) = aE(X) + b, toujours (sans indépendance).
  • V(aX + b) = a²V(X) ; si X et Y sont indépendantes, V(X + Y) = V(X) + V(Y) (et V(X − Y) = V(X) + V(Y)).
  • Échantillon de taille n : n variables indépendantes de même loi (μ, V, σ). Sn : espérance nμ, variance nV. Mn = Sn/n : espérance μ, variance V/n, écart-type σ/√n.
  • Markov : X ≥ 0 et a > 0 ⇒ P(X ≥ a) ≤ E(X)/a.
  • Bienaymé-Tchebychev : P(|X − μ| ≥ δ) ≤ V/δ², donc P(|X − μ| < δ) ≥ 1 − V/δ².
  • Concentration : P(|Mn − μ| ≥ δ) ≤ V/(nδ²) ; pour un risque α, il suffit de n ≥ V/(αδ²).
  • Loi des grands nombres : pour tout δ > 0, P(|Mn − μ| ≥ δ) tend vers 0 quand n tend vers +∞ ; une fréquence se rapproche de la probabilité.
  • La loi des grands nombres concerne la moyenne, pas la somme, et n’a rien d’une loi de compensation.