Varianza

Estadística y Probabilidad

La varianza mide la distancia cuadrática promedio de los valores de un conjunto de datos respecto a la media, indicando qué tan dispersos están los datos.

Formula

s^2 = \dfrac{\sum (x_i - \bar{x})^2}{n-1}
Visualization

Definition

La varianza es un número que mide cuánto varían los valores de un conjunto de datos respecto al promedio: una varianza mayor significa que los valores están más dispersos. La varianza muestral $s^2 = \sum (x_i-\bar{x})^2/(n-1)$ es la desviación cuadrática promedio respecto a la media muestral, siempre no negativa e igual a cero solo cuando todos los valores son idénticos; tomar la raíz cuadrada da la desviación estándar, que está en las unidades originales. Formalmente, la varianza poblacional $\sigma^2 = E[(X-\mu)^2] = E[X^2] - \mu^2$ es una propiedad fundamental de una distribución, y la varianza muestral es insesgada: $E[s^2] = \sigma^2$. En el ANOVA, la varianza total se descompone en componentes entre grupos y dentro de grupos, permitiendo las pruebas F.

Example

Las calificaciones $80$, $80$, $80$, $80$ tienen varianza $0$ (sin dispersión), mientras que las calificaciones $60$, $70$, $90$, $100$ tienen una gran varianza porque están lejos del promedio de $80$. Para los datos $2$, $4$, $4$, $4$, $5$, $5$, $7$, $9$ con media $5$: las desviaciones al cuadrado $9$, $1$, $1$, $1$, $0$, $0$, $4$, $16$ suman $32$, dando varianza $s^2 = 32/7 = 4.57$ y desviación estándar $s = \sqrt{4.57} = 2.14$. La ley de la varianza total, $\text{Var}(Y) = E[\text{Var}(Y|X)] + \text{Var}(E[Y|X])$, descompone la varianza en un componente promedio dentro de grupos y un componente entre grupos, sustentando los modelos de efectos aleatorios y el marco del análisis de varianza.

Key Insight

La varianza y la desviación estándar miden ambas la dispersión, pero la desviación estándar está en las unidades originales (como pulgadas o puntos), haciéndola más fácil de interpretar, mientras que la varianza está en unidades al cuadrado; elevar al cuadrado las desviaciones elimina los signos negativos y penaliza las desviaciones grandes más fuertemente que las pequeñas. La cota inferior de Cramer-Rao establece que ningún estimador insesgado de $\theta$ puede tener una varianza menor que $1/I(\theta)$, donde $I(\theta)$ es la información de Fisher, y para datos normales $s^2$ alcanza esta cota, haciéndola el estimador insesgado de varianza mínima (MVUE) de $\sigma^2$.