Regresión
La regresión es un método estadístico que modela la relación entre variables, generalmente para predecir el valor de una a partir de otra.
Definition
La regresión es un método para encontrar la mejor línea (o curva) que pasa por los puntos de datos en un diagrama de dispersión, la cual puede usarse para predecir un valor con base en otro. La regresión lineal encuentra la ecuación de la línea que mejor se ajusta a los datos minimizando la suma de los residuos al cuadrado (distancias verticales de cada punto a la línea), produciendo la línea de regresión por mínimos cuadrados $\hat{y} = b_0 + b_1 x$, donde $b_1 = r(s_y/s_x)$ y $b_0 = \bar{y} - b_1\bar{x}$. Formalmente, la regresión por mínimos cuadrados ordinarios (MCO) estima $\beta$ en $Y = X\beta + \epsilon$ minimizando $\|Y - X\beta\|^2$, dando $\hat{\beta} = (X^TX)^{-1}X^TY$; bajo el teorema de Gauss-Markov, los MCO son BLUE (el mejor estimador lineal insesgado) cuando los errores son i.i.d. con media cero y varianza constante, y el estadístico $R^2$ mide la bondad de ajuste.
Example
Si cada hora de estudio tiende a agregar $5$ puntos a una calificación, la regresión encuentra esa relación exacta para que puedas predecir una calificación a partir de cualquier número de horas estudiadas. Para la temperatura diaria promedio ($x$) y las ventas de helado ($y$), una línea de regresión $\hat{y} = -50 + 3.2x$ predice ventas de $-50 + 3.2(85) = \$222$ para un día a $85$ grados, siendo el residuo el valor real menos el predicho. En la regresión lineal simple, $R^2 = r^2$ (la correlación al cuadrado); en la regresión múltiple, $R^2 = 1 - RSS/TSS$, y el $R^2$ ajustado penaliza por predictores adicionales: $R^2_{adj} = 1 - \frac{RSS/(n-p-1)}{TSS/(n-1)}$.
Key Insight
La regresión convierte el patrón que ves en un diagrama de dispersión en una ecuación matemática que puedes usar para hacer predicciones: la pendiente $b_1$ te dice que por cada aumento de $1$ unidad en $x$, se predice que $y$ aumentará $b_1$ unidades, mientras que el intercepto $b_0$ es el valor predicho de $y$ cuando $x = 0$ (que puede no tener sentido en el contexto). El teorema de Gauss-Markov garantiza que los MCO son BLUE bajo supuestos leves pero no requiere normalidad; agregar el supuesto de normalidad para los errores permite la inferencia exacta t y F, mientras que violar los supuestos (heterocedasticidad, autocorrelación) requiere mínimos cuadrados robustos o generalizados.