Línea de Mejor Ajuste
La línea de mejor ajuste es la línea recta que sigue más de cerca el patrón de los puntos de datos en un diagrama de dispersión, minimizando el error general.
Formula
\hat{y} = b_0 + b_1 x
Definition
La línea de mejor ajuste es la línea recta trazada a través de un diagrama de dispersión que se acerca lo más posible a todos los puntos de datos, resumiendo la tendencia general de los datos. Formalmente, es la línea de regresión por mínimos cuadrados $\hat{y} = b_0 + b_1 x$ que minimiza la suma de los residuos al cuadrado $\sum (y_i - \hat{y}_i)^2$, con pendiente $b_1 = r(s_y/s_x)$ e intercepto $b_0 = \bar{y} - b_1\bar{x}$; la línea siempre pasa por $(\bar{x}, \bar{y})$. Se obtiene resolviendo las ecuaciones normales $(X^TX)\beta = X^TY$; los valores ajustados caen sobre la línea y los residuos son ortogonales a todos los vectores predictores, una propiedad geométrica de la proyección sobre el espacio columna de $X$.
Example
En un diagrama de dispersión de horas estudiadas frente a calificaciones de examen, la línea de mejor ajuste pasa por el medio de la nube de puntos, mostrando la tendencia general ascendente, aunque no tiene que pasar por ningún punto de dato individual. Para datos con $\bar{x}=5$, $\bar{y}=80$, $s_x=2$, $s_y=10$, $r=0.8$: $b_1 = 0.8(10/2) = 4$, $b_0 = 80 - 4(5) = 60$, dando la línea $\hat{y} = 60 + 4x$ y una predicción de $\hat{y} = 88$ para $x=7$. Geométricamente, los MCO proyectan el vector de respuesta $Y$ sobre el espacio columna de $X$: los valores ajustados $\hat{Y} = HY$ donde $H = X(X^TX)^{-1}X^T$ es la matriz sombrero (de proyección), y los residuos $e = Y - \hat{Y} = (I-H)Y$ están en el complemento ortogonal del espacio columna de $X$.
Key Insight
La línea de mejor ajuste está posicionada para minimizar la distancia general entre ella misma y todos los puntos, y solo es válida para la interpolación (predecir dentro del rango de valores de x usados para construirla); extrapolar mucho más allá del rango de los datos no es confiable porque la relación lineal podría no cumplirse. La matriz sombrero $H$ tiene entradas diagonales $h_{ii}$ (apalancamientos) que miden cuánta influencia tiene cada observación sobre su propio valor ajustado; los puntos de alto apalancamiento con residuos grandes son los más influyentes y se diagnostican con la distancia de Cook.