Calcula la media, la varianza y la desviación típica de un conjunto de datos.
Introduce valores para ver el resultado.
Guía: desviación típica y varianza
Varianza mide cuánto se dispersan los datos alrededor de la media. Se calcula como el promedio de las desviaciones al cuadrado respecto a la media. Una varianza mayor indica datos más dispersos. Es una medida de dispersión fundamental en estadística.
Desviación típica es la raíz cuadrada de la varianza. Se expresa en las mismas unidades que los datos originales, lo que facilita su interpretación. Por ejemplo, si las ventas medias son 1000 con una desviación típica de 200, los valores habituales suelen situarse entre 800 y 1200.
Población vs muestra: La varianza poblacional divide entre N y se aplica a toda la población. La varianza muestral divide entre N-1 y es una mejor estimación de una población mayor a partir de una muestra. Es la corrección de Bessel, que elimina el sesgo de la estimación.
Interpretación: Una desviación típica pequeña significa que los datos se agrupan en torno a la media. Una grande indica una amplia dispersión de valores. La regla 68-95-99,7 establece que aproximadamente el 68 % de los datos cae dentro de una desviación típica, el 95 % dentro de dos y el 99,7 % dentro de tres.
Dos conjuntos con la misma media de 50 difieren veinte veces en dispersión
La media dice dónde está el centro y nada sobre cuán lejos queda cualquier cosa de él. El conjunto 48, 49, 50, 51, 52 y el conjunto 10, 30, 50, 70, 90 promedian exactamente 50, y sin embargo uno tiene una desviación típica de 1,58 y el otro de 31,62. Informar solo del promedio descarta toda la diferencia entre ambos.
Cómo funciona
- Calcula la desviación típica y la varianza de un conjunto de valores.
- Usa la fórmula muestral, dividiendo por n − 1, y explica cuándo corresponde la fórmula poblacional.
- Muestra qué parte de los datos cae dentro de una, dos y tres desviaciones de la media.
muestra: s = √( Σ(x − x̄)² ÷ (n − 1) ) población: σ = √( Σ(x − µ)² ÷ n ) la varianza es lo mismo antes de la raíz para datos aproximadamente normales: 68% dentro de 1 DT, 95% dentro de 2 DT, 99,7% dentro de 3 DT
Ejemplo resuelto
Dos conjuntos de cinco valores con medias idénticas.
- A = 48, 49, 50, 51, 52 → media 50,0, DT 1,58
- B = 10, 30, 50, 70, 90 → media 50,0, DT 31,62
- la dispersión difiere en un factor de 20
- con media 50 y DT 10, alrededor del 68% de los valores cae entre 40 y 60
- y en torno al 95% entre 30 y 70
Ambos conjuntos declaran un promedio de 50 y describen situaciones completamente distintas. A es un proceso estable; B apenas es un proceso. Cualquier resumen que cite solo la media lo oculta por entero.
Cómo leer el resultado
- Divide por n − 1 para una muestra y por n para una población completa. La corrección pesa más cuando n es pequeño: con cinco valores, dividir por n subestima la desviación un 10,56%, mientras que con n = 100 el error es del 0,50% y resulta irrelevante.
- Para el conjunto A la fórmula poblacional da 1,414 y la muestral 1,581. Ninguna es incorrecta: responden a preguntas distintas, y la versión muestral es la honesta cuando tus cinco valores proceden de algo mayor.
- La regla 68–95–99,7 supone una distribución aproximadamente normal. Aplicada a datos asimétricos — ingresos, tiempos de espera, tamaños de archivo — errará mucho sobre cuánto hay en cada banda, y esas distribuciones son extremadamente comunes.
- La desviación típica comparte las unidades de los datos, y por eso se cita en lugar de la varianza. La varianza va en unidades al cuadrado, así que una dispersión de 31,62 se convierte en una varianza de 1.000, un número sin significado físico.
Preguntas frecuentes
- ¿Por qué dividir por n − 1 y no por n?
- Porque la propia media de una muestra queda más cerca de sus valores que la verdadera media poblacional, lo que hace que las desviaciones parezcan menores de lo que son. Dividir por n − 1 corrige ese sesgo. Con cinco valores eleva el resultado un 10,56%; con cien, medio punto porcentual.
- ¿Una desviación típica alta es mala?
- Solo en relación con lo que esperas. Mucha dispersión en una tolerancia de fabricación es un defecto; mucha dispersión en una cartera de rentabilidades puede ser el precio de esas rentabilidades. El número describe la regularidad, y si la regularidad es deseable depende por completo de lo que se mida.