Cuartil

Estadística y Probabilidad

Los cuartiles dividen un conjunto de datos en cuatro partes iguales, con Q1, Q2 (mediana) y Q3 marcando los límites.

Visualization

Definition

Los cuartiles son tres valores que dividen un conjunto de datos ordenado en cuatro grupos iguales: $Q_1$ es el límite por debajo del primer 25%, $Q_2$ es la mediana (50%), y $Q_3$ es el límite por debajo del 25% superior. $Q_1$ es la mediana de la mitad inferior y $Q_3$ es la mediana de la mitad superior, aunque distintos métodos (incluyendo o excluyendo la mediana) pueden dar resultados ligeramente diferentes. Formalmente, los cuartiles son casos especiales de los cuantiles: $Q_1 = F^{-1}(0.25)$, $Q_2 = F^{-1}(0.50)$, $Q_3 = F^{-1}(0.75)$; para una muestra finita, el cálculo de cuantiles usa interpolación, y R implementa nueve algoritmos distintos de cuantiles (tipos $1$-$9$), con el tipo $7$ (interpolación lineal de estadísticos de orden) como el predeterminado.

Example

Las calificaciones ordenadas $10$, $20$, $30$, $40$, $50$, $60$, $70$, $80$ dan $Q_1 = 25$ (límite entre el primer y segundo cuarto), $Q_2 = 45$ (mediana), y $Q_3 = 65$ (límite entre el tercer y cuarto cuarto). Para los datos $3$, $5$, $7$, $8$, $9$, $11$, $14$, $16$, $21$: mediana ($Q_2$) $= 9$; la mitad inferior $3$, $5$, $7$, $8$ da $Q_1 = (5+7)/2 = 6$; la mitad superior $11$, $14$, $16$, $21$ da $Q_3 = (14+16)/2 = 15$; así que $\text{IQR} = 15 - 6 = 9$. Para la distribución normal estándar, $Q_1 = -0.6745$, $Q_2 = 0$, $Q_3 = 0.6745$, dando $\text{IQR} = 1.349$, valores exactos usados para calibrar estimadores robustos de escala para datos normales.

Key Insight

Piensa en los cuartiles como dividir una fila de estudiantes en cuatro grupos de igual tamaño según la estatura, con $Q_1$, $Q_2$, y $Q_3$ los tres puntos divisorios; junto con el IQR, el resumen de cinco números (mín, $Q_1$, $Q_2$, $Q_3$, máx) captura la forma de una distribución de manera concisa sin verse afectado por los valores atípicos. La varianza asintótica del cuantil muestral $p$-ésimo es $p(1-p)/(nf(Q_p)^2)$, donde $f$ es la PDF, mostrando que los cuantiles en los extremos ($p$ cerca de $0$ o $1$) se estiman con menos precisión, lo cual explica por qué los percentiles extremos requieren muestras mucho más grandes para una estimación confiable.