
Une série statistique est une longue liste de nombres : impossible de la lire d’un coup d’œil ! Dans ce chapitre, tu apprends à la résumer par quelques nombres bien choisis : des indicateurs de position (moyenne, médiane, quartiles) et des indicateurs de dispersion (étendue, écart interquartile, écart-type). Tu apprends aussi à les dessiner (diagramme en boîte) et à les utiliser pour comparer deux séries.
1. Rappels : moyenne, médiane, étendue
Une série statistique est la liste des valeurs x1, x2, …, xn prises par un caractère quantitatif sur une population de n individus (n est l’effectif total).
La moyenne est x̄ = [[x1 + x2 + … + xn/n]]. La médiane Me est une valeur qui partage la série rangée dans l’ordre croissant en deux groupes de même effectif : si n est impair, c’est la valeur du milieu ; si n est pair, c’est la moyenne des deux valeurs centrales. L’étendue est la différence entre la plus grande et la plus petite valeur.
Temps de trajet (en minutes) d’un élève sur 7 jours : 12 ; 15 ; 9 ; 20 ; 15 ; 11 ; 18. Moyenne : 100 ÷ 7 ≈ 14,29 min. Rangée : 9 ; 11 ; 12 ; 15 ; 15 ; 18 ; 20 ; n = 7 est impair, la médiane est la 4ᵉ valeur : 15 min. Étendue : 20 − 9 = 11 min.
2. Effectifs, fréquences et cumuls
Quand les valeurs se répètent, on regroupe la série dans un tableau. Voici le nombre de livres lus pendant un trimestre par 30 élèves d’une classe (données inventées).
| Nombre de livres lus | 0 | 1 | 2 | 3 | 4 | 5 | Total |
|---|---|---|---|---|---|---|---|
| Effectif | 3 | 6 | 8 | 7 | 4 | 2 | 30 |
| Effectif cumulé croissant | 3 | 9 | 17 | 24 | 28 | 30 | |
| Fréquence | 10,0 % | 20,0 % | 26,7 % | 23,3 % | 13,3 % | 6,7 % | 100 % |
| Fréquence cumulée croissante | 10,0 % | 30,0 % | 56,7 % | 80,0 % | 93,3 % | 100,0 % |
La fréquence d’une valeur est fi = [[ni/n]] (souvent écrite en pourcentage). L’effectif cumulé croissant d’une valeur est le nombre d’individus dont la valeur est inférieure ou égale à celle-ci ; la fréquence cumulée croissante est ce nombre divisé par n.
Dans la colonne « 2 livres », l’effectif cumulé est 17 : 17 élèves sur 30 ont lu au plus 2 livres, soit 56,7 % de la classe.
On multiplie chaque valeur par son effectif : x̄ = [[n1x1 + n2x2 + … + npxp/n]]. Ici : x̄ = (3 × 0 + 6 × 1 + 8 × 2 + 7 × 3 + 4 × 4 + 2 × 5) ÷ 30 = 69 ÷ 30 = 2,3 livre en moyenne. C’est la moyenne pondérée par les effectifs.
3. Médiane et quartiles
On range la série dans l’ordre croissant : x1 ≤ x2 ≤ … ≤ xn.
Le premier quartile Q1 est la plus petite valeur de la série telle qu’au moins 25 % des valeurs lui sont inférieures ou égales : c’est la valeur de rang ⌈n/4⌉ (on arrondit n ÷ 4 à l’entier supérieur).
Le troisième quartile Q3 est la plus petite valeur telle qu’au moins 75 % des valeurs lui sont inférieures ou égales : c’est la valeur de rang ⌈3n/4⌉.
La médiane Me joue le même rôle pour 50 %.
1) Ranger les valeurs dans l’ordre croissant. 2) Calculer n ÷ 4 et 3n ÷ 4 et arrondir à l’entier supérieur : ce sont les rangs de Q1 et Q3. 3) Lire ces valeurs dans la liste rangée. 4) Pour Me : valeur du milieu (n impair) ou moyenne des deux valeurs centrales (n pair).
Temps d’attente (en minutes) de 12 clients à un guichet, déjà rangés : 3 ; 5 ; 5 ; 6 ; 8 ; 9 ; 11 ; 12 ; 14 ; 15 ; 19 ; 27. n = 12 ; 12 ÷ 4 = 3 donc Q1 est la 3ᵉ valeur : Q1 = 5. 3 × 12 ÷ 4 = 9 donc Q3 = 14 (9ᵉ valeur). Me = (9 + 11) ÷ 2 = 10.
Pour la série des livres lus (n = 30) : 30 ÷ 4 = 7,5 donc Q1 est la 8ᵉ valeur ; les effectifs cumulés valent 3 ; 9 ; 17 ; 24 ; 28 ; 30, et 8 est dépassé pour la première fois à la valeur 1 (cumul 9) : Q1 = 1. De même 3 × 30 ÷ 4 = 22,5 donc la 23ᵉ valeur : le cumul passe de 17 à 24 pour la valeur 3, donc Q3 = 3. Les valeurs de rang 15 et 16 valent toutes les deux 2 : Me = 2.
Certaines calculatrices ou certains tableurs utilisent d’autres méthodes d’interpolation et peuvent donner des quartiles légèrement différents. En 2de, on suit toujours la définition ci-dessus (rangs ⌈n/4⌉ et ⌈3n/4⌉).
L’écart interquartile est Q3 − Q1. Il contient au moins la moitié des valeurs « du milieu » de la série et mesure leur dispersion. Pour les clients : 14 − 5 = 9 min.
4. Diagramme en boîte
Sur un axe gradué, on dessine un rectangle (la boîte) allant de Q1 à Q3, coupé par un trait vertical à la médiane. Les moustaches relient la boîte au minimum et au maximum.
Diagramme du temps d’attente : minimum 3, Q1 = 5, Me = 10, Q3 = 14, maximum 27. Le trait orange est la médiane.
Chaque « morceau » du diagramme (moustache gauche, moitié gauche de la boîte, moitié droite, moustache droite) contient environ un quart des valeurs. La boîte seule contient au moins 50 % des valeurs ; sa largeur est l’écart interquartile. Une boîte déséquilibrée (médiane non centrée) ou une longue moustache signale une série asymétrique : ici, quelques clients attendent très longtemps.
« Bip ! Pour comparer deux séries, dessine leurs boîtes sur le même axe : tu verras en une seconde laquelle est la plus haute et laquelle est la plus étalée. »
5. Variance et écart-type
L’étendue et l’écart interquartile ne tiennent compte que de quelques valeurs. Pour mesurer à quel point toutes les valeurs s’écartent de la moyenne, on utilise l’écart-type.
Pour une série de moyenne x̄, la variance est la moyenne des carrés des écarts à la moyenne :
V = [[(x1 − x̄)² + (x2 − x̄)² + … + (xn − x̄)²/n]].
Avec des effectifs : V = [[n1(x1 − x̄)² + … + np(xp − x̄)²/n]].
L’écart-type est σ = √V. Il s’exprime dans la même unité que les valeurs.
Nombre de leçons apprises par un élève durant 5 semaines : 4 ; 7 ; 7 ; 9 ; 13. Moyenne : 40 ÷ 5 = 8. Écarts à la moyenne : −4 ; −1 ; −1 ; 1 ; 5. Leurs carrés : 16 ; 1 ; 1 ; 1 ; 25, de somme 44. Donc V = 44 ÷ 5 = 8,8 et σ = √8,8 ≈ 2,97.
La variance est égale à la moyenne des carrés moins le carré de la moyenne : V = [[x1² + … + xn²/n]] − x̄².
Démonstration. On développe (xi − x̄)² = xi² − 2x̄xi + x̄². En faisant la moyenne des n termes : V = (moyenne des xi²) − 2x̄ × (moyenne des xi) + x̄² = (moyenne des xi²) − 2x̄² + x̄² = (moyenne des xi²) − x̄². CQFD.
Avec les leçons : moyenne des carrés = (16 + 49 + 49 + 81 + 169) ÷ 5 = 72,8 ; moins 8² = 64 : on retrouve bien 8,8.
On saisit les valeurs (et les effectifs) en mode statistiques et on lit σx (ou « xσn »), pas « sx » qui divise par n − 1. Au tableur : =ECARTYPE.PEARSON(plage) (ou ECARTYPEP selon la version). Pour la série des livres lus, on trouve σ ≈ 1,37.
6. Effet d’un changement de variable
Si on transforme chaque valeur xi en yi = a·xi + b (a et b réels), alors : la moyenne devient a·x̄ + b ; la médiane et les quartiles suivent la même transformation si a > 0 ; l’écart-type devient |a|·σ ; l’écart interquartile et l’étendue sont multipliés par |a|. Ajouter b ne change donc aucune mesure de dispersion.
Une série de masses en kg a pour moyenne 62 et pour écart-type 4. En grammes (y = 1 000x) : moyenne 62 000 g, écart-type 4 000 g. Si on mesure l’écart à une masse de référence de 60 kg (y = x − 60) : moyenne 2 kg, écart-type toujours 4 kg.
Si a < 0, les valeurs sont retournées : les quartiles Q1 et Q3 s’échangent. L’écart-type, lui, reste positif grâce à la valeur absolue.
7. Données regroupées en classes
Quand les données sont données par intervalles (« classes »), on ne connaît plus les valeurs exactes. On estime la moyenne en remplaçant chaque classe par son centre (milieu de l’intervalle) : on obtient une valeur approchée, pas la moyenne exacte. La classe qui contient la médiane s’appelle la classe médiane ; on la repère avec les effectifs cumulés. Pour estimer médiane et quartiles, on peut aussi tracer le polygone des fréquences cumulées croissantes : on lit l’abscisse correspondant à 25 %, 50 % et 75 %.
On part de 50 % sur l’axe vertical, on trace l’horizontale jusqu’à la courbe, puis on descend à la verticale sur l’axe horizontal. Le segment entre deux points de la courbe étant supposé droit, on peut aussi calculer cette valeur par proportionnalité (interpolation linéaire).
8. Choisir des indicateurs et comparer deux séries
La moyenne et l’écart-type utilisent toutes les valeurs : ils sont sensibles aux valeurs extrêmes. La médiane et l’écart interquartile n’utilisent que les valeurs centrales : ils sont peu sensibles aux valeurs extrêmes.
1) Comparer les positions : moyennes ou médianes (laquelle est la plus élevée ?). 2) Comparer les dispersions : écarts-types ou écarts interquartiles (laquelle est la plus régulière ?). 3) Choisir les indicateurs adaptés : (médiane ; écart interquartile) si la série a des valeurs extrêmes ou est asymétrique, (moyenne ; écart-type) sinon. 4) Rédiger une phrase de conclusion dans le contexte, avec les unités.
Deux joueuses ont la même moyenne de 12 points par match, mais σ = 2 pour la première et σ = 7 pour la seconde. La première est plus régulière ; la seconde alterne gros matchs et matchs ratés.
À retenir
- Moyenne x̄ = somme des valeursn ; avec effectifs, x̄ = [[Σ nixi/n]]. Médiane : partage la série rangée en deux moitiés.
- Q1 = valeur de rang ⌈n/4⌉ ; Q3 = valeur de rang ⌈3n/4⌉ (série rangée) ; écart interquartile = Q3 − Q1 ; étendue = max − min.
- Fréquence = effectifeffectif total ; les effectifs et fréquences cumulés croissants servent à repérer la médiane et les quartiles.
- Diagramme en boîte : min, Q1, Me, Q3, max ; chaque quart de la série occupe un « morceau ».
- Variance V = moyenne des (xi − x̄)² = moyenne des xi² − x̄² ; écart-type σ = √V, dans la même unité que les valeurs.
- y = ax + b : moyenne a·x̄ + b, écart-type |a|σ.
- Moyenne et écart-type sont sensibles aux valeurs extrêmes, médiane et écart interquartile le sont peu ; on compare deux séries par une position et une dispersion, avec une phrase de conclusion.
