Regresión Lineal Simple & Correlación
Optimización por Mínimos Cuadrados Ordinarios (MCO), evaluación mediante R² y diagnóstico formal de supuestos de Gauss-Markov.
Objetivos Estratégicos de la Sesión
Hoja de ruta para el modelado lineal predictivo e inferencial.
Correlación vs Regresión
Distinguir la asociación simétrica (Pearson/Spearman) de la modelación de dependencia funcional asimétrica por MCO.
Derivación e Inferencia MCO
Interpretar los estimadores $\hat{\beta}_0$ y $\hat{\beta}_1$, contrastando la significación estadística de la pendiente ($p < 0.05$).
Bondad de Ajuste R²
Descomponer la variabilidad total en explicada y residual, identificando las limitaciones del $R^2$ ante relaciones no lineales.
Supuestos de Gauss-Markov
Auditar la homocedasticidad, linealidad e independencia de residuos para validar la condición MELI (BLUE) del estimador.
1. Medición de Asociación: Pearson vs Spearman
Selección del coeficiente adecuado según la linealidad y presencia de anomalías.
Coeficiente r de Pearson
Lineal ParamétricoCuantifica el grado de asociación estrictamente rectilínea entre dos variables continuas.
- ▪ Rango acotado: $[-1, +1]$ ($0 = $ ausencia de relación lineal).
- ▪ Sensible a outliers (un solo punto anómalo distorsiona el signo).
- ▪ Invariante ante cambios de escala lineal ($y' = a + by$).
Coeficiente ρ de Spearman
Monótono No ParamétricoCalcula el coeficiente de Pearson sobre los rangos ordinales de las observaciones.
- ▪ Captura relaciones monótonas crecientes o decrecientes no lineales.
- ▪ Altamente robusto ante la presencia de valores atípicos severos.
- ▪ Aplicable a variables cuantitativas y escalas ordinales.
2. Mínimos Cuadrados Ordinarios (MCO)
Minimización de la suma de distancias verticales al cuadrado.
Criterio de Mínimos Cuadrados:
Se busca la recta $\hat{y} = \hat{\beta}_0 + \hat{\beta}_1 x$ que minimice la función de costo de los residuos verticales $e_i = y_i - \hat{y}_i$.
- Pendiente ($\hat{\beta}_1$): Variación esperada en $Y$ por cada unidad adicional en $X$.
- Ordenada ($\hat{\beta}_0$): Valor esperado de $Y$ cuando $X = 0$ (interpretable solo si $X=0$ tiene sentido físico).
- Propiedad Ortogonal: La suma de los residuos $\sum e_i = 0$ y la recta pasa siempre por el centroide $(\bar{x}, \bar{y})$.
Fórmulas cerradas algebraicas de los estimadores MCO
# R-squared: 0.842
# superficie coef: 1450.2 | P>|t|: 0.000
# const coef: 25000.0 | P>|t|: 0.001
Interpretación: Por cada m² adicional, el precio medio esperado se incrementa en USD 1,450.2 con $p < 0.001$.
3. Descomposición de la Varianza y R²
Cuantificando la proporción de variabilidad explicada por el modelo.
Partición de Sumas de Cuadrados
Identidad FundamentalLa variabilidad total de $Y$ se descompone exactamente en componente explicada por la recta y error no explicado.
- ▪ SST: Suma de Cuadrados Total $\sum (y_i - \bar{y})^2$.
- ▪ SSR: Suma de Cuadrados de la Regresión $\sum (\hat{y}_i - \bar{y})^2$.
- ▪ SSE: Suma de Cuadrados del Error $\sum (y_i - \hat{y}_i)^2$.
Coeficiente de Determinación (R²)
Métrica NormalizadaPorcentaje de la varianza total de $Y$ que es explicada linealmente por la variable independiente $X$.
- ▪ En regresión simple coincide con el cuadrado de Pearson: $R^2 = r^2$.
- ▪ Rango: $0 \le R^2 \le 1$ ($1 =$ ajuste perfecto sobre la recta).
- ▪ No garantiza causalidad ni valida por sí solo la ausencia de sesgo.
4. Supuestos Clásicos del Teorema de Gauss-Markov
Condiciones requeridas para que los estimadores MCO sean los Mejores Estimadores Lineales Insesgados (MELI / BLUE).
| Supuesto | Enunciado Matemático | Patología si se Viola | Método de Detección |
|---|---|---|---|
| Linealidad en Parámetros | \mathbb{E}[y \mid X] = \beta_0 + \beta_1 X |
Estimadores sesgados; subestimación sistemática. | Gráfico de Residuos vs Valores Ajustados (curvaturas). |
| Homocedasticidad | Var(e_i \mid X) = \sigma^2 = \text{cte} |
Errores estándar erróneos; t-tests e intervalos inválidos. | Test de Breusch-Pagan / Gráfico con forma de embudo. |
| Independencia de Errores | Cov(e_i, e_j) = 0 \quad \forall i \ne j |
Varianza subestimada; falsos positivos en significación. | Test de Durbin-Watson (autocorrelación en series). |
| Normalidad de Residuos | e_i \sim \mathcal{N}(0, \sigma^2) |
Inferencia en muestras chicas imprecisa. | Q-Q Plot de residuos y Test de Shapiro-Wilk. |
5. Diagnóstico Gráfico: Residuos vs Ajustados
La herramienta diagnóstica fundamental para auditar el comportamiento del modelo.
Banda Horizontal Aleatoria
Un modelo correcto produce una dispersión homogénea de puntos alrededor del cero sin tendencias ni formas geométricas.
Tres Patologías Visuales Clásicas:
La dispersión de los residuos se ensancha a medida que $\hat{y}$ crece. Indica que la variabilidad se incrementa con la escala (solución: aplicar $\ln(y)$).
Los residuos muestran un patrón parabólico o en U. Evidencia que el proceso físico requiere términos cuadráticos ($x^2$) o modelos no lineales.
Observaciones con residuos $|e_i| > 3s$ que tiran de la recta alejándola del comportamiento general de la población.
6. El Cuarteto de Anscombe: El Peligro del R² Ciego
Cuatro conjuntos de datos con idéntica estadística descriptiva pero naturalezas completamente diferentes.
Mismo R² = 0.67
Misma media (9.0), misma varianza (11.0), misma recta de regresión (y = 3 + 0.5x) y mismo R², pero dinámicas radicalmente dispares.
Lección de los 4 Escenarios:
Dispersión simétrica alrededor de la recta con residuos homogéneos. Caso donde MCO es el modelo óptimo.
Relación cuadrática determinística pura. Ajustar una recta comete un error metodológico grave.
Un único punto influyente o de alto apalancamiento genera artificialmente la correlación o distorsiona la pendiente real.
7. Laboratorio Visual: Impacto de un Punto de Apalancamiento en MCO
Mueve la posición del punto atípico para verificar cómo la minimización de residuos cuadráticos desvía la recta entera.
Efecto Palanca (Leverage):
Ajusta la posición vertical del outlier ubicado en el extremo derecho ($X=45$).8. Inferencia Estadística sobre los Parámetros
Contrastando la significación del efecto y construyendo bandas de confianza.
Test t para la Pendiente (β₁)
SignificaciónEvalúa si existe evidencia suficiente para descartar que la relación observada sea producto del azar.
- ▪ Hipótesis: $H_0: \beta_1 = 0$ (X no aporta información) vs $H_1: \beta_1 \ne 0$.
- ▪ Estadístico: $t = \frac{\hat{\beta}_1 - 0}{SE(\hat{\beta}_1)} \sim t_{n-2}$.
- ▪ Si p-valor < 0.05: Se rechaza $H_0$ (relación estadísticamente significativa).
Banda de Confianza vs Predicción
IncertidumbreDistingue la incertidumbre de la media esperada de la incertidumbre de un individuo específico.
- ▪ Intervalo de Confianza: Para el promedio $\mathbb{E}[Y \mid X_0]$ (banda estrecha hiperbólica).
- ▪ Intervalo de Predicción: Para una nueva observación individual $Y_{nuevo}$ (banda ancha que suma la varianza $\sigma^2$).
- ▪ Ambos intervalos se ensanchan al alejarse de la media $\bar{x}$.
9. Protocolo de Modelado en Regresión Simple
Secuencia metodológica ineludible en proyectos de analítica predictiva.
Control de Calidad
Tres validaciones obligatorias antes de poner un modelo lineal en producción.
Checklist Metodológico:
Inspeccionar el diagrama de dispersión para confirmar que no existan curvaturas ni agrupaciones bimodales antes de calcular la recta.
Verificar que la gráfica de residuos vs predichos sea una nube homogénea y que el test de normalidad en residuos no se rechace.
Validar que la magnitud y el signo del coeficiente $\hat{\beta}_1$ sean coherentes con la física o la economía del problema.
¡A Programar en Jupyter Notebooks!
Validación Computacional en Entorno Jupyter Notebooks (Semana 5)
Correlación Lineal
01_correlacion_lineal.ipynb
Cálculo de matrices de Pearson y Spearman con pruebas de significación.
Análisis de Regresión
02_analisis_regresion_simple.ipynb
Ajuste MCO con statsmodels y Scikit-Learn e interpretación de tablas.
Diagnóstico de Residuos
03_diagnostico_modelo_regresion.ipynb
Validación de supuestos de Gauss-Markov y detección de heterocedasticidad.
Modelado Inmobiliario
02_analisis_regresion_simple.ipynb
Caso práctico aplicado de fijación de precios en función de superficie.
45 min: El profesor guía el cálculo de correlación, la calibración de la recta MCO en statsmodels y la interpretación de p-valores y del $R^2$.
75 min: Los estudiantes resuelven los ejercicios de la Guía 3 (Problemas 1 a 4), realizando el diagnóstico completo de residuos sobre un dataset real.