
Un sondeur interroge mille personnes, un casino fait tourner sa roulette des millions de fois, une usine contrôle un échantillon de pièces : à chaque fois, on additionne ou on moyenne beaucoup de résultats aléatoires, et pourtant le résultat final semble étrangement prévisible. Dans ce chapitre, tu apprends à calculer l’espérance et la variance d’une somme de variables aléatoires, tu découvres les inégalités de concentration qui mesurent l’écart à la moyenne, puis tu démontres la loi des grands nombres, qui justifie qu’une fréquence observée se rapproche d’une probabilité. Mathbot te propose même de simuler tout cela en Python !
1. Rappels : espérance, variance, indépendance
Une variable aléatoire X associe un nombre réel à chaque issue d’une expérience aléatoire. Si X prend les valeurs x1, …, xr avec les probabilités pi = P(X = xi), on retrouve les trois grandeurs de la classe de 1ère.
- Espérance : E(X) = x1p1 + … + xrpr (la valeur moyenne « à long terme »).
- Variance : V(X) = E((X − E(X))²) = E(X²) − (E(X))² (la dispersion autour de la moyenne).
- Écart-type : σ(X) = √V(X), exprimé dans la même unité que X.
Deux variables aléatoires X et Y sont indépendantes si, pour tous réels x et y, P(X = x et Y = y) = P(X = x) × P(Y = y). C’est le cas, par exemple, des résultats de deux lancers successifs d’un même dé.
Soit D le numéro obtenu avec un dé équilibré à six faces. E(D) = (1 + 2 + 3 + 4 + 5 + 6) ÷ 6 = 72. E(D²) = (1 + 4 + 9 + 16 + 25 + 36) ÷ 6 = 916, donc V(D) = 916 − (72)² = 916 − 494 = 3512 ≈ 2,92 et σ(D) ≈ 1,71. Garde ces valeurs : elles serviront souvent.
2. Linéarité de l’espérance
Pour toutes variables aléatoires X et Y définies sur la même expérience et pour tous réels a et b :
- E(X + Y) = E(X) + E(Y) ;
- E(aX + b) = a E(X) + b.
Ces égalités sont vraies sans aucune hypothèse d’indépendance.
Démonstration. Notons Ω l’ensemble (fini) des issues. L’espérance de X vaut la somme, sur toutes les issues ω, de X(ω) × P(ω). Donc E(X + Y) = Σ (X(ω) + Y(ω)) P(ω) = Σ X(ω)P(ω) + Σ Y(ω)P(ω) = E(X) + E(Y). De même E(aX + b) = Σ (aX(ω) + b) P(ω) = a Σ X(ω)P(ω) + b Σ P(ω) = a E(X) + b, car la somme de toutes les probabilités vaut 1.
On lance deux dés équilibrés et on note S la somme des deux numéros. Plutôt que de dresser la loi de S, on écrit S = D1 + D2 : E(S) = E(D1) + E(D2) = 72 + 72 = 7. La loi de S, tracée ci-dessous, est bien symétrique autour de 7.
Pour trouver l’espérance d’une quantité compliquée (nombre de succès, gain total…), cherche à l’écrire comme somme de variables simples dont tu connais l’espérance. La linéarité fait le reste, même si ces variables dépendent les unes des autres.
3. Variance d’une somme de variables indépendantes
- Pour tous réels a et b : V(aX + b) = a² V(X) (ajouter b ne change pas la dispersion).
- Si X et Y sont indépendantes : V(X + Y) = V(X) + V(Y).
Démonstration de la seconde égalité. On a V(X + Y) = E((X + Y)²) − (E(X) + E(Y))². En développant, E((X + Y)²) = E(X²) + 2E(XY) + E(Y²) et (E(X) + E(Y))² = (E(X))² + 2E(X)E(Y) + (E(Y))². Donc V(X + Y) = V(X) + V(Y) + 2(E(XY) − E(X)E(Y)). Pour des variables indépendantes, E(XY) = E(X)E(Y) (la probabilité de chaque couple se factorise), le dernier terme est nul et V(X + Y) = V(X) + V(Y).
Les deux dés sont indépendants, donc V(S) = V(D1) + V(D2) = 3512 + 3512 = 356 ≈ 5,83. On peut le confirmer avec la loi de S : E(S²) = 3296, donc V(S) = 3296 − 49 = 356.
- V(X + Y) = V(X) + V(Y) exige l’indépendance. Contre-exemple : si Y = X, alors V(X + Y) = V(2X) = 4V(X) ≠ 2V(X).
- Pour une différence : V(X − Y) = V(X) + V(−Y) = V(X) + V(Y). Les variances s’ajoutent toujours, jamais elles ne se retranchent.
- V(aX) = a² V(X) et non a V(X) ; l’écart-type, lui, est multiplié par |a|.
Une variable de Bernoulli B de paramètre p a pour espérance p et variance p(1 − p). Une variable X qui suit la loi binomiale B(n ; p) est la somme de n variables de Bernoulli indépendantes. Par linéarité E(X) = np, et par indépendance V(X) = np(1 − p). Pour n = 60 et p = 16, on obtient E(X) = 10 et V(X) = 60 × 16 × 56 = 253.
4. Échantillon, somme et moyenne d’un échantillon
Un échantillon de taille n d’une loi de probabilité est une liste (X1 ; X2 ; … ; Xn) de n variables aléatoires indépendantes qui suivent toutes cette même loi. On note μ leur espérance commune, V leur variance commune et σ leur écart-type commun. On définit :
- la somme Sn = X1 + X2 + … + Xn ;
- la moyenne Mn = Sn ÷ n = (X1 + X2 + … + Xn) ÷ n.
Répéter n fois, de façon indépendante, une même expérience (lancer un dé, tirer avec remise, interroger au hasard une personne) fournit un échantillon de taille n.
| Espérance | Variance | Écart-type | |
|---|---|---|---|
| Somme Sn | nμ | nV | σ√n |
| Moyenne Mn | μ | Vn | σ√n |
Justification. Par linéarité, E(Sn) = μ + … + μ = nμ. Par indépendance, V(Sn) = V + … + V = nV. Comme Mn = 1n Sn, on a E(Mn) = 1n × nμ = μ et V(Mn) = (1n)² × nV = Vn.
Pour n = 100 lancers (μ = 72, V = 3512) : E(S100) = 350, V(S100) = 350012 ≈ 291,7 et σ(S100) ≈ 17,1. Pour la moyenne : E(M100) = 3,5, V(M100) = 351200 = 7240 ≈ 0,0292 et σ(M100) ≈ 0,171.
L’écart-type de la moyenne diminue comme 1√n : pour le dé, il passe de 1,71 (un seul lancer) à 0,171 (cent lancers). La courbe ci-dessous montre cette décroissance.
Quand n augmente, la somme Sn se disperse de plus en plus (σ√n grandit), alors que la moyenne Mn se concentre de plus en plus autour de μ (σ ÷ √n diminue). Ne confonds jamais les deux.
5. Inégalité de Markov
Soit X une variable aléatoire à valeurs positives ou nulles et a un réel strictement positif. Alors P(X ≥ a) ≤ (E(X)) ÷ a.
Démonstration. Dans la somme qui définit E(X) = Σ xi pi, tous les termes sont positifs. En ne gardant que les termes pour lesquels xi ≥ a, on obtient E(X) ≥ (somme des xipi avec xi ≥ a) ≥ a × (somme des pi avec xi ≥ a) = a P(X ≥ a). Il suffit de diviser par a > 0.
Un standard téléphonique reçoit en moyenne 4 appels par minute en soirée ; soit X le nombre d’appels reçus en une minute (X ≥ 0 et E(X) = 4). Alors P(X ≥ 20) ≤ 420 = 0,2 : il y a au plus 20 % de chances de recevoir 20 appels ou plus en une minute.
Si a ≤ E(X), la borne (E(X)) ÷ a est supérieure ou égale à 1 : l’inégalité est vraie mais ne dit rien. Markov n’est intéressante que pour a nettement plus grand que l’espérance. Et la positivité de X est indispensable.
6. Inégalité de Bienaymé-Tchebychev
Soit X une variable aléatoire d’espérance μ et de variance V. Pour tout réel δ > 0 : P(|X − μ| ≥ δ) ≤ Vδ².
Démonstration. La variable Y = (X − μ)² est positive et E(Y) = V par définition de la variance. L’événement « |X − μ| ≥ δ » est le même que « (X − μ)² ≥ δ² ». L’inégalité de Markov appliquée à Y avec a = δ² donne P(Y ≥ δ²) ≤ Vδ².
Par passage à l’événement contraire : P(|X − μ| < δ) ≥ 1 − Vδ², ce qui signifie que X est dans l’intervalle ]μ − δ ; μ + δ[ avec une probabilité au moins égale à 1 − Vδ².
Pour S de la partie 2 (μ = 7 et V = 356) avec δ = 4 : P(|S − 7| ≥ 4) ≤ 356 ÷ 16 = 3596 ≈ 0,365. La valeur exacte est bien plus petite : |S − 7| ≥ 4 correspond aux sommes 2, 3, 11 et 12, soit (1 + 2 + 2 + 1) ÷ 36 = 16 ≈ 0,167. L’inégalité est vraie, mais pessimiste : c’est le prix de sa généralité, elle s’applique à toute loi.
- Identifie μ = E(X) et V = V(X).
- Traduis l’événement demandé sous la forme |X − μ| ≥ δ (ou son contraire |X − μ| < δ).
- Calcule la borne Vδ² ; vérifie qu’elle est inférieure à 1, sinon elle n’apporte rien.
- Conclus par une phrase : « la probabilité est inférieure ou égale à … » ou, pour le contraire, « supérieure ou égale à … ».
7. Inégalité de concentration
Appliquons Bienaymé-Tchebychev à la moyenne Mn d’un échantillon, dont on connaît l’espérance μ et la variance Vn.
Soit (X1 ; … ; Xn) un échantillon de variables aléatoires d’espérance μ et de variance V, et Mn sa moyenne. Pour tout réel δ > 0 : P(|Mn − μ| ≥ δ) ≤ Vnδ².
Démonstration. D’après la partie 4, E(Mn) = μ et V(Mn) = Vn. L’inégalité de Bienaymé-Tchebychev appliquée à Mn donne P(|Mn − μ| ≥ δ) ≤ (V ÷ n) ÷ δ² = Vnδ².
Avec V = 3512, δ = 0,1 et n = 1000 : P(|M1000 − 3,5| ≥ 0,1) ≤ 3512 ÷ (1000 × 0,01) = 724 ≈ 0,29. Autrement dit, avec une probabilité d’au moins 0,71, la moyenne des mille lancers est dans ]3,4 ; 3,6[.
On cherche n pour que P(|Mn − μ| ≥ δ) soit inférieure à un risque α fixé. Il suffit que Vnδ² ≤ α, c’est-à-dire n ≥ Vαδ².
Pour le dé avec δ = 0,1 et α = 0,05 : n ≥ 3512 ÷ (0,01 × 0,05) ≈ 5833,3, donc il suffit de prendre n = 5834 lancers.
Le graphique suivant compare, pour une pièce équilibrée (V = 0,25) et δ = 0,1, la borne 25n (en orange) à la vraie probabilité P(|Fn − 0,5| ≥ 0,1) (en bleu), calculée avec la loi binomiale. La borne est toujours au-dessus, mais elle décroît elle aussi vers 0.
8. La loi des grands nombres
Soit (X1 ; … ; Xn) un échantillon de variables aléatoires d’espérance μ et de moyenne Mn. Pour tout réel δ > 0 fixé : limn→+∞ P(|Mn − μ| ≥ δ) = 0.
Démonstration. Pour tout n, 0 ≤ P(|Mn − μ| ≥ δ) ≤ Vnδ² d’après l’inégalité de concentration. Or δ et V sont fixés, donc Vnδ² tend vers 0 quand n tend vers +∞. Le théorème des gendarmes donne le résultat.
Interprétation. Aussi petit que soit l’écart δ choisi, la probabilité que la moyenne observée s’écarte de μ d’au moins δ devient aussi petite que l’on veut quand n est grand. Si les Xi sont des variables de Bernoulli de paramètre p (succès = 1, échec = 0), alors μ = p et Mn est la fréquence de succès : la fréquence observée se rapproche de la probabilité p. C’est ce qui justifie l’estimation d’une probabilité par une fréquence dans une simulation ou un sondage.
Voici trois simulations indépendantes de la moyenne de n lancers d’un dé ; la bande orange représente l’intervalle ]3,25 ; 3,75[ autour de μ = 3,5.
- Elle ne dit pas que le hasard « compense » : après dix « pile » de suite, la probabilité d’avoir « pile » au lancer suivant vaut toujours 12, car les lancers sont indépendants.
- Elle ne dit pas que la somme se rapproche de nμ : l’écart Sn − nμ a un écart-type σ√n qui grandit. Seule la moyenne (ou la fréquence) se stabilise.
- Elle ne garantit rien pour un n précis : il s’agit d’une probabilité qui tend vers 0, pas d’une certitude.
9. Simulations avec Python
La loi des grands nombres se visualise très bien avec un programme. Le module random fournit random.randint(a, b) (entier aléatoire entre a et b inclus) et random.random() (nombre aléatoire de [0 ; 1[).
import random
def moyenne(n):
somme = 0
for _ in range(n):
somme = somme + random.randint(1, 6)
return somme / n
print(moyenne(10))
print(moyenne(1000))
print(moyenne(100000))
Les trois affichages sont proches de 3,5, de plus en plus lorsque n grandit (les valeurs exactes changent à chaque exécution).
Pour estimer P(|Mn − 3,5| ≥ 0,1), on répète l’expérience « calculer Mn » un grand nombre de fois et on compte la proportion d’écarts trop grands.
def proba_ecart(n, delta, essais):
mauvais = 0
for _ in range(essais):
if abs(moyenne(n) - 3.5) >= delta:
mauvais = mauvais + 1
return mauvais / essais
print(proba_ecart(100, 0.1, 2000))
print(proba_ecart(1000, 0.1, 2000))
Les résultats seront nettement plus petits que les bornes de Bienaymé-Tchebychev (724 pour n = 1000) : la borne est valable, mais loin d’être optimale.
Avant de lancer une simulation, calcule la borne théorique : si ta simulation donne une proportion plus grande que la borne, c’est que ton programme (ou ton calcul de V) contient une erreur !
À retenir
- Linéarité : E(X + Y) = E(X) + E(Y) et E(aX + b) = aE(X) + b, toujours (sans indépendance).
- V(aX + b) = a²V(X) ; si X et Y sont indépendantes, V(X + Y) = V(X) + V(Y) (et V(X − Y) = V(X) + V(Y)).
- Échantillon de taille n : n variables indépendantes de même loi (μ, V, σ). Sn : espérance nμ, variance nV. Mn = Sn/n : espérance μ, variance V/n, écart-type σ/√n.
- Markov : X ≥ 0 et a > 0 ⇒ P(X ≥ a) ≤ E(X)/a.
- Bienaymé-Tchebychev : P(|X − μ| ≥ δ) ≤ V/δ², donc P(|X − μ| < δ) ≥ 1 − V/δ².
- Concentration : P(|Mn − μ| ≥ δ) ≤ V/(nδ²) ; pour un risque α, il suffit de n ≥ V/(αδ²).
- Loi des grands nombres : pour tout δ > 0, P(|Mn − μ| ≥ δ) tend vers 0 quand n tend vers +∞ ; une fréquence se rapproche de la probabilité.
- La loi des grands nombres concerne la moyenne, pas la somme, et n’a rien d’une loi de compensation.
