Calculez la moyenne, la variance et l'écart type d'un jeu de données.
Saisissez des valeurs pour voir le résultat.
Guide : écart-type et variance
Variance mesure la dispersion des données autour de la moyenne. Elle se calcule comme la moyenne des écarts au carré par rapport à la moyenne. Une variance plus grande indique des données plus dispersées. C'est une mesure de dispersion fondamentale en statistique.
Écart-type est la racine carrée de la variance. Elle s'exprime dans les mêmes unités que les données d'origine, ce qui facilite l'interprétation. Par exemple, si les ventes moyennes sont de 1000 avec un écart type de 200, les valeurs typiques se situent généralement entre 800 et 1200.
Population vs échantillon : La variance de population divise par N et s'applique à l'ensemble de la population. La variance d'échantillon divise par N-1 et constitue une meilleure estimation d'une population plus large à partir d'un échantillon. C'est la correction de Bessel, qui supprime le biais de l'estimation.
Interprétation : Un petit écart type signifie que les données se regroupent autour de la moyenne. Un grand écart type traduit une large dispersion. La règle 68-95-99,7 énonce qu'environ 68 % des données se situent à un écart type, 95 % à deux et 99,7 % à trois.
Deux jeux de données de même moyenne 50 diffèrent d'un facteur vingt en dispersion
La moyenne dit où se trouve le centre et rien sur la distance qui en sépare quoi que ce soit. L'ensemble 48, 49, 50, 51, 52 et l'ensemble 10, 30, 50, 70, 90 ont exactement la même moyenne de 50, pourtant l'un a un écart-type de 1,58 et l'autre de 31,62. Ne rapporter que la moyenne jette toute la différence entre eux.
Comment ça marche
- Calcule l'écart-type et la variance d'un ensemble de valeurs.
- Utilise la formule d'échantillon, en divisant par n − 1, et explique quand la formule de population convient mieux.
- Montre quelle part des données tombe à un, deux et trois écarts de la moyenne.
échantillon : s = √( Σ(x − x̄)² ÷ (n − 1) ) population : σ = √( Σ(x − µ)² ÷ n ) la variance est la même chose avant la racine pour des données à peu près normales : 68% à 1 écart, 95% à 2 écarts, 99,7% à 3 écarts
Exemple chiffré
Deux ensembles de cinq valeurs aux moyennes identiques.
- A = 48, 49, 50, 51, 52 → moyenne 50,0, écart-type 1,58
- B = 10, 30, 50, 70, 90 → moyenne 50,0, écart-type 31,62
- la dispersion diffère d'un facteur 20
- avec une moyenne de 50 et un écart-type de 10, environ 68% des valeurs tombent entre 40 et 60
- et environ 95% entre 30 et 70
Les deux ensembles annoncent une moyenne de 50 et décrivent des situations totalement différentes. A est un processus stable ; B en est à peine un. Tout résumé citant la seule moyenne masque cela entièrement.
Lire le résultat
- Divisez par n − 1 pour un échantillon et par n pour une population entière. La correction compte surtout quand n est petit : avec cinq valeurs, diviser par n sous-estime l'écart de 10,56%, alors qu'à n = 100 l'erreur vaut 0,50% et devient négligeable.
- Pour l'ensemble A la formule de population donne 1,414 et celle d'échantillon 1,581. Aucune n'est fausse : elles répondent à des questions différentes, et la version échantillon est l'honnête quand vos cinq valeurs proviennent de plus vaste.
- La règle 68–95–99,7 suppose une distribution à peu près normale. Appliquée à des données asymétriques — revenus, temps d'attente, tailles de fichiers — elle se trompe lourdement sur ce que contient chaque bande, et ces distributions sont extrêmement courantes.
- L'écart-type partage les unités des données, d'où sa préférence sur la variance. La variance est en unités au carré : une dispersion de 31,62 devient une variance de 1 000, un nombre sans signification physique.
Questions fréquentes
- Pourquoi diviser par n − 1 plutôt que par n ?
- Parce que la moyenne propre d'un échantillon est plus proche de ses valeurs que ne l'est la vraie moyenne de population, ce qui fait paraître les écarts plus petits qu'ils ne sont. Diviser par n − 1 corrige ce biais. Avec cinq valeurs cela relève le résultat de 10,56%, avec cent de un demi pour cent.
- Un écart-type élevé est-il mauvais ?
- Seulement au regard de ce qu'on attend. Une forte dispersion sur une tolérance de fabrication est un défaut ; une forte dispersion sur un portefeuille de rendements peut être le prix de ces rendements. Le nombre décrit la régularité, et savoir si la régularité est souhaitable dépend entièrement de la chose mesurée.