Puntaje Z

Estadística y Probabilidad

Un puntaje z mide cuántas desviaciones estándar se aleja un valor de dato de la media, permitiendo comparaciones entre distintas distribuciones.

Formula

z = \dfrac{x - \text{mean}}{\text{standard deviation}}
Visualization

Definition

Un puntaje z indica qué tan lejos está un valor del promedio, medido en desviaciones estándar: un puntaje z de 0 significa exactamente el promedio, los puntajes z positivos están por encima del promedio, los negativos por debajo. Formalmente, $z = (x-\mu)/\sigma$, donde $\mu$ es la media poblacional y $\sigma$ es la desviación estándar poblacional (usa $\bar{x}$ y $s$ para datos muestrales); los puntajes z estandarizan los datos para que tengan media $0$ y desviación estándar $1$, permitiendo la comparación entre distintas escalas. Cuando $X \sim N(\mu, \sigma^2)$, $z \sim N(0,1)$; para medias muestrales, el puntaje z $z = (\bar{x}-\mu)/(\sigma/\sqrt{n})$ sigue $N(0,1)$ exactamente para poblaciones normales y aproximadamente por el TLC para $n$ grande, formando la base de las pruebas z y los intervalos de confianza normales.

Example

En un examen con media $75$ y desviación estándar $10$, una calificación de $90$ tiene $z = (90-75)/10 = 1.5$ y una calificación de $65$ tiene $z = (65-75)/10 = -1$, así que la calificación de $90$ está $1.5$ desviaciones estándar por encima del promedio. María obtuvo $82$ en un examen de historia (media $70$, DE $8$, $z=1.5$) y $78$ en un examen de ciencias (media $65$, DE $6.5$, $z=2.0$); su calificación de ciencias es relativamente mejor a pesar de ser menor en puntos crudos. Un intervalo de confianza del $95\%$ para $\mu$ usa $z^* = 1.96$: para una muestra de $n=100$ con $\bar{x}=52$ y $\sigma=10$, $CI = 52 \pm 1.96(10/10) = (50.04, 53.96)$.

Key Insight

Los puntajes z te permiten comparar valores de conjuntos de datos completamente distintos: un puntaje z de $+2$ en un examen de matemáticas y un puntaje z de $+2$ en un tiempo de carrera significan ambos "inusualmente alto para ese grupo," y los puntajes z por encima de $2$ o por debajo de $-2$ se consideran inusuales (aproximadamente $5\%$ de las veces en una distribución normal), mientras que los que están por encima de $3$ o por debajo de $-3$ son muy raros (aproximadamente $0.3\%$). La transformada integral de probabilidad establece que $F(X) \sim \text{Uniform}(0,1)$ para $X$ continua; para una $X$ normal, esto implica que $\Phi(z) \sim \text{Uniform}(0,1)$ donde $\Phi$ es la CDF normal estándar, conectando los puntajes z con los percentiles.