Valor Atípico
Un valor atípico es un dato significativamente distinto del resto del conjunto de datos, que aparece muy alejado de los demás valores.
Formula
\text{Outlier if value} < Q_1 - 1.5 \cdot \text{IQR} \quad \text{or} \quad \text{value} > Q_3 + 1.5 \cdot \text{IQR}
Definition
Un valor atípico es un dato muy diferente del resto, que se encuentra muy separado de los demás valores del conjunto de datos, una observación que se aleja de manera anormal de los demás valores. Un método común de detección marca un valor como atípico si cae por debajo de $Q_1 - 1.5 \cdot \text{IQR}$ o por encima de $Q_3 + 1.5 \cdot \text{IQR}$; los valores atípicos pueden señalar errores en los datos, eventos inusuales, o descubrimientos importantes. Otros métodos de detección incluyen la prueba de Grubbs, el umbral del puntaje z ($|z| > 3$), y la prueba generalizada de desviación estudentizada extrema (ESD) para múltiples valores atípicos; en la regresión, las observaciones influyentes se detectan mediante la distancia de Cook y el apalancamiento (diagonal de la matriz sombrero), que miden respectivamente el impacto sobre los valores ajustados y las estimaciones de los coeficientes.
Example
Las calificaciones de examen $78$, $80$, $82$, $84$, $86$, y $3$ tienen un valor atípico en $3$, muy por debajo de todos los demás, lo cual arrastraría el promedio hacia abajo significativamente. Con $\text{IQR} = Q_3 - Q_1 = 90 - 70 = 20$, la cerca inferior es $70 - 30 = 40$ y la cerca superior es $90 + 30 = 120$, así que una calificación de $35$ o $130$ sería marcada como atípica. La distancia de Cook $D_i = \frac{1}{p}\sum \frac{(\hat{y}_j - \hat{y}_{j(i)})^2}{\text{MSE}}$ (sumada sobre todas las $n$ observaciones) usa un umbral común de $D_i > 4/n$ o $D_i > 1$ para marcar puntos influyentes en la regresión.
Key Insight
Los valores atípicos pueden ser errores (un error de captura de datos) o valores reales e importantes (un atleta que rompe un récord), así que siempre hay que investigarlos antes de decidir qué hacer. La media se ve afectada por los valores atípicos mientras que la mediana no, así que la mediana suele ser una mejor medida de centro cuando hay valores atípicos presentes, y los diagramas de caja muestran los valores atípicos como puntos individuales más allá de los bigotes. Los métodos de regresión robusta (M-estimadores, mínimos cuadrados recortados) reducen el peso o excluyen automáticamente los valores atípicos, proporcionando estimaciones que resisten la distorsión de observaciones extremas sin requerir la eliminación manual de valores atípicos.