Unidad 3

Regresión Lineal Simple & Correlación

Diapositiva 1 / 12
Cátedra de Métodos Cuantitativos • Clase 5

Regresión Lineal Simple & Correlación

Optimización por Mínimos Cuadrados Ordinarios (MCO), evaluación mediante R² y diagnóstico formal de supuestos de Gauss-Markov.

Estimación MCO Bondad de Ajuste R² Diagnóstico de Residuos
Usa las flechas o haz clic para avanzar

Objetivos Estratégicos de la Sesión

Hoja de ruta para el modelado lineal predictivo e inferencial.

Hoja de Ruta
1

Correlación vs Regresión

Distinguir la asociación simétrica (Pearson/Spearman) de la modelación de dependencia funcional asimétrica por MCO.

2

Derivación e Inferencia MCO

Interpretar los estimadores $\hat{\beta}_0$ y $\hat{\beta}_1$, contrastando la significación estadística de la pendiente ($p < 0.05$).

3

Bondad de Ajuste R²

Descomponer la variabilidad total en explicada y residual, identificando las limitaciones del $R^2$ ante relaciones no lineales.

4

Supuestos de Gauss-Markov

Auditar la homocedasticidad, linealidad e independencia de residuos para validar la condición MELI (BLUE) del estimador.

Ajuste e inferencia en los notebooks 01_correlacion, 02_analisis_regresion y 03_diagnostico.

1. Medición de Asociación: Pearson vs Spearman

Selección del coeficiente adecuado según la linealidad y presencia de anomalías.

Correlación

Coeficiente r de Pearson

Lineal Paramétrico

Cuantifica el grado de asociación estrictamente rectilínea entre dos variables continuas.

  • Rango acotado: $[-1, +1]$ ($0 = $ ausencia de relación lineal).
  • Sensible a outliers (un solo punto anómalo distorsiona el signo).
  • Invariante ante cambios de escala lineal ($y' = a + by$).
$$r = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sqrt{\sum (x_i - \bar{x})^2 \sum (y_i - \bar{y})^2}}$$
Alerta: Una relación cuadrática perfecta puede tener r = 0 en Pearson.

Coeficiente ρ de Spearman

Monótono No Paramétrico

Calcula el coeficiente de Pearson sobre los rangos ordinales de las observaciones.

  • Captura relaciones monótonas crecientes o decrecientes no lineales.
  • Altamente robusto ante la presencia de valores atípicos severos.
  • Aplicable a variables cuantitativas y escalas ordinales.
$$\rho = 1 - \frac{6 \sum d_i^2}{n(n^2 - 1)}, \quad d_i = rg(x_i) - rg(y_i)$$
Ventaja: Inmune a curvaturas suaves y colas largas en los datos.

2. Mínimos Cuadrados Ordinarios (MCO)

Minimización de la suma de distancias verticales al cuadrado.

Optimización

Criterio de Mínimos Cuadrados:

Se busca la recta $\hat{y} = \hat{\beta}_0 + \hat{\beta}_1 x$ que minimice la función de costo de los residuos verticales $e_i = y_i - \hat{y}_i$.

  • Pendiente ($\hat{\beta}_1$): Variación esperada en $Y$ por cada unidad adicional en $X$.
  • Ordenada ($\hat{\beta}_0$): Valor esperado de $Y$ cuando $X = 0$ (interpretable solo si $X=0$ tiene sentido físico).
  • Propiedad Ortogonal: La suma de los residuos $\sum e_i = 0$ y la recta pasa siempre por el centroide $(\bar{x}, \bar{y})$.
$$\hat{\beta}_1 = \frac{s_{xy}}{s_x^2} = r \frac{s_y}{s_x}, \quad \hat{\beta}_0 = \bar{y} - \hat{\beta}_1 \bar{x}$$

Fórmulas cerradas algebraicas de los estimadores MCO

statsmodels_ols.py Resumen de Ajuste
import statsmodels.api as sm
X = sm.add_constant(df['superficie'])
modelo = sm.OLS(df['precio'], X).fit()
print(modelo.summary())
# R-squared: 0.842
# superficie coef: 1450.2 | P>|t|: 0.000
# const coef: 25000.0 | P>|t|: 0.001

Interpretación: Por cada m² adicional, el precio medio esperado se incrementa en USD 1,450.2 con $p < 0.001$.

3. Descomposición de la Varianza y R²

Cuantificando la proporción de variabilidad explicada por el modelo.

Bondad de Ajuste

Partición de Sumas de Cuadrados

Identidad Fundamental

La variabilidad total de $Y$ se descompone exactamente en componente explicada por la recta y error no explicado.

  • SST: Suma de Cuadrados Total $\sum (y_i - \bar{y})^2$.
  • SSR: Suma de Cuadrados de la Regresión $\sum (\hat{y}_i - \bar{y})^2$.
  • SSE: Suma de Cuadrados del Error $\sum (y_i - \hat{y}_i)^2$.
$$SST = SSR + SSE$$
Buscamos modelos donde SSE sea mínimo respecto a SST.

Coeficiente de Determinación (R²)

Métrica Normalizada

Porcentaje de la varianza total de $Y$ que es explicada linealmente por la variable independiente $X$.

  • En regresión simple coincide con el cuadrado de Pearson: $R^2 = r^2$.
  • Rango: $0 \le R^2 \le 1$ ($1 =$ ajuste perfecto sobre la recta).
  • No garantiza causalidad ni valida por sí solo la ausencia de sesgo.
$$R^2 = \frac{SSR}{SST} = 1 - \frac{SSE}{SST}$$
Un R² = 0.85 indica que el 85% de la dispersión de precios se debe a la superficie.

4. Supuestos Clásicos del Teorema de Gauss-Markov

Condiciones requeridas para que los estimadores MCO sean los Mejores Estimadores Lineales Insesgados (MELI / BLUE).

Teoría Asintótica
Supuesto Enunciado Matemático Patología si se Viola Método de Detección
Linealidad en Parámetros \mathbb{E}[y \mid X] = \beta_0 + \beta_1 X Estimadores sesgados; subestimación sistemática. Gráfico de Residuos vs Valores Ajustados (curvaturas).
Homocedasticidad Var(e_i \mid X) = \sigma^2 = \text{cte} Errores estándar erróneos; t-tests e intervalos inválidos. Test de Breusch-Pagan / Gráfico con forma de embudo.
Independencia de Errores Cov(e_i, e_j) = 0 \quad \forall i \ne j Varianza subestimada; falsos positivos en significación. Test de Durbin-Watson (autocorrelación en series).
Normalidad de Residuos e_i \sim \mathcal{N}(0, \sigma^2) Inferencia en muestras chicas imprecisa. Q-Q Plot de residuos y Test de Shapiro-Wilk.
Teorema MELI / BLUE: Bajo estos supuestos, MCO posee la menor varianza posible entre todos los estimadores lineales insesgados.

5. Diagnóstico Gráfico: Residuos vs Ajustados

La herramienta diagnóstica fundamental para auditar el comportamiento del modelo.

Diagnóstico Visual
RESIDUOS

Banda Horizontal Aleatoria

Un modelo correcto produce una dispersión homogénea de puntos alrededor del cero sin tendencias ni formas geométricas.

Tres Patologías Visuales Clásicas:

Patología 1: Forma en Embudo (Heterocedasticidad)

La dispersión de los residuos se ensancha a medida que $\hat{y}$ crece. Indica que la variabilidad se incrementa con la escala (solución: aplicar $\ln(y)$).

Patología 2: Curvatura Cóncava o Convexa (No Linealidad)

Los residuos muestran un patrón parabólico o en U. Evidencia que el proceso físico requiere términos cuadráticos ($x^2$) o modelos no lineales.

Patología 3: Puntos Aislados con Gran Residuo (Outliers)

Observaciones con residuos $|e_i| > 3s$ que tiran de la recta alejándola del comportamiento general de la población.

6. El Cuarteto de Anscombe: El Peligro del R² Ciego

Cuatro conjuntos de datos con idéntica estadística descriptiva pero naturalezas completamente diferentes.

Caso Emblemático
ANSCOMBE

Mismo R² = 0.67

Misma media (9.0), misma varianza (11.0), misma recta de regresión (y = 3 + 0.5x) y mismo R², pero dinámicas radicalmente dispares.

Lección de los 4 Escenarios:

Dataset I: Relación Lineal Genuina

Dispersión simétrica alrededor de la recta con residuos homogéneos. Caso donde MCO es el modelo óptimo.

Dataset II: Curvatura No Lineal Perfecta

Relación cuadrática determinística pura. Ajustar una recta comete un error metodológico grave.

Dataset III y IV: Dominancia por Outliers

Un único punto influyente o de alto apalancamiento genera artificialmente la correlación o distorsiona la pendiente real.

7. Laboratorio Visual: Impacto de un Punto de Apalancamiento en MCO

Mueve la posición del punto atípico para verificar cómo la minimización de residuos cuadráticos desvía la recta entera.

Simulador en Vivo

Efecto Palanca (Leverage):

Ajusta la posición vertical del outlier ubicado en el extremo derecho ($X=45$).
Pendiente (β₁): --
Bondad de Ajuste R²: --
MCO penaliza errores al cuadrado, haciendo que un solo punto lejano rote la recta completa.
Ajuste MCO con Punto Influyente n = 25
● Muestra base ● Outlier palanca MCO en tiempo real

8. Inferencia Estadística sobre los Parámetros

Contrastando la significación del efecto y construyendo bandas de confianza.

Inferencia

Test t para la Pendiente (β₁)

Significación

Evalúa si existe evidencia suficiente para descartar que la relación observada sea producto del azar.

  • Hipótesis: $H_0: \beta_1 = 0$ (X no aporta información) vs $H_1: \beta_1 \ne 0$.
  • Estadístico: $t = \frac{\hat{\beta}_1 - 0}{SE(\hat{\beta}_1)} \sim t_{n-2}$.
  • Si p-valor < 0.05: Se rechaza $H_0$ (relación estadísticamente significativa).
$$SE(\hat{\beta}_1) = \sqrt{\frac{s_e^2}{\sum (x_i - \bar{x})^2}}$$
Regla de decisión: Solo se utiliza el modelo para predecir si la pendiente es significativa.

Banda de Confianza vs Predicción

Incertidumbre

Distingue la incertidumbre de la media esperada de la incertidumbre de un individuo específico.

  • Intervalo de Confianza: Para el promedio $\mathbb{E}[Y \mid X_0]$ (banda estrecha hiperbólica).
  • Intervalo de Predicción: Para una nueva observación individual $Y_{nuevo}$ (banda ancha que suma la varianza $\sigma^2$).
  • Ambos intervalos se ensanchan al alejarse de la media $\bar{x}$.
$$IC = \hat{y}_0 \pm t_{\alpha/2} s_e \sqrt{\frac{1}{n} + \frac{(x_0 - \bar{x})^2}{\sum (x_i - \bar{x})^2}}$$
Para pronósticos de casos particulares, reportar siempre el intervalo de predicción.

9. Protocolo de Modelado en Regresión Simple

Secuencia metodológica ineludible en proyectos de analítica predictiva.

Mejores Prácticas
MCO AUDIT

Control de Calidad

Tres validaciones obligatorias antes de poner un modelo lineal en producción.

Checklist Metodológico:

1. Inspección Gráfica Previa

Inspeccionar el diagrama de dispersión para confirmar que no existan curvaturas ni agrupaciones bimodales antes de calcular la recta.

2. Auditoría de Residuos

Verificar que la gráfica de residuos vs predichos sea una nube homogénea y que el test de normalidad en residuos no se rechace.

3. Interpretación en el Contexto del Negocio

Validar que la magnitud y el signo del coeficiente $\hat{\beta}_1$ sean coherentes con la física o la economía del problema.

¡A Programar en Jupyter Notebooks!

Validación Computacional en Entorno Jupyter Notebooks (Semana 5)

Laboratorio Hands-On

Correlación Lineal

01_correlacion_lineal.ipynb

Cálculo de matrices de Pearson y Spearman con pruebas de significación.

Análisis de Regresión

02_analisis_regresion_simple.ipynb

Ajuste MCO con statsmodels y Scikit-Learn e interpretación de tablas.

Diagnóstico de Residuos

03_diagnostico_modelo_regresion.ipynb

Validación de supuestos de Gauss-Markov y detección de heterocedasticidad.

Modelado Inmobiliario

02_analisis_regresion_simple.ipynb

Caso práctico aplicado de fijación de precios en función de superficie.

Práctica Guiada (Profesor proyectando)

45 min: El profesor guía el cálculo de correlación, la calibración de la recta MCO en statsmodels y la interpretación de p-valores y del $R^2$.

Trabajo Autónomo (Alumnos en parejas)

75 min: Los estudiantes resuelven los ejercicios de la Guía 3 (Problemas 1 a 4), realizando el diagnóstico completo de residuos sobre un dataset real.

¿Dudas sobre la interpretación de la pendiente o la validación de los residuos de Gauss-Markov?