Unidad 3 • Semana 5 MCO & Inferencia

Laboratorio Interactivo de Regresión Lineal Simple y Múltiple

Simulador Matemático en Tiempo Real

Calibración de la Recta MCO e Intervalos

Ajusta los puntos muestrales, modifica o desplaza el punto influyente y analiza cómo la función de costo de Mínimos Cuadrados Ordinarios minimiza la suma de errores cuadráticos ($\sum e_i^2$). Observa la apertura hiperbólica de las bandas de confianza e intervalos de predicción.

Parámetros del Experimento n = 24

32.0
15 (Hundimiento) 32 (Línea normal) 45 (Sobreestimación)
1.80
25
Capas Gráficas Visibles:

Pronosticador de Valores Nuevos ($X_0$) Nivel $1-\alpha = 0.95$

Valor Predicho $\hat{Y}_0$: --
IC Media (95%): --
IP Individual (95%): --

*Nota clínica/metodológica: El IP siempre es sustancialmente más amplio que el IC porque incorpora la varianza aleatoria intrínseca $\sigma_\varepsilon^2$ del nuevo individuo.

Pendiente ($\hat{\beta}_1$) 0.780 p < 0.001 ***
Ordenada ($\hat{\beta}_0$) 3.914 SE: 1.829
Bondad de Ajuste ($R^2$) 0.610 r = 0.781
Error Residual ($S_e$) 1.590 F: 35.89
Ajuste de Mínimos Cuadrados Ordinarios: Perímetro Cefálico (cm) vs Edad Gestacional (sem)
Datos Palanca
Modelo Calibrado: $\hat{Y} = 3.914 + 0.780 \cdot X$
SST: 120.4 SSR: 73.4 SSE: 47.0

Fundamentos Matemáticos del Modelo Lineal Simple

Deducción algebraica de los estimadores MCO, propiedades asintóticas y el Teorema de Gauss-Markov.

Teoría Asintótica

El Modelo Poblacional

El modelo postula que para cada individuo $i$, la variable respuesta continua $Y_i$ se relaciona funcionalmente con la covariable o predictora $X_i$ según:

$$Y_i = \beta_0 + \beta_1 X_i + \varepsilon_i, \quad i = 1, \dots, n$$

donde $\beta_0$ es la ordenada al origen (intercepto), $\beta_1$ es la pendiente (tasa marginal de cambio esperada en $Y$ ante un aumento unitario en $X$), y $\varepsilon_i$ es el término de perturbación aleatoria no observable.

Criterio de MCO (Mínimos Cuadrados)

MCO busca los estimadores $\hat{\beta}_0$ y $\hat{\beta}_1$ que minimicen la función de costo de las distancias verticales al cuadrado entre los puntos empíricos y la recta postulada:

$$S(\beta_0, \beta_1) = \sum_{i=1}^n e_i^2 = \sum_{i=1}^n (Y_i - \beta_0 - \beta_1 X_i)^2$$

Derivando respecto a $\beta_0$ y $\beta_1$ e igualando a cero se obtienen las ecuaciones normales, garantizando que $\sum e_i = 0$ y que la recta pase siempre por el centroide $(\bar{X}, \bar{Y})$.

Estimadores Analíticos

Pendiente y Ordenada

$$\hat{\beta}_1 = \frac{S_{xy}}{S_{xx}} = \frac{\sum (X_i - \bar{X})(Y_i - \bar{Y})}{\sum (X_i - \bar{X})^2} = r \frac{S_y}{S_x}$$ $$\hat{\beta}_0 = \bar{Y} - \hat{\beta}_1 \bar{X}$$

La pendiente es directamente proporcional a la correlación lineal de Pearson $r$ y ajustada por el ratio de dispersiones $S_y / S_x$.

Dispersión de Errores

Varianza y Error Estándar

$$S_e^2 = \frac{SSE}{n - 2} = \frac{\sum (Y_i - \hat{Y}_i)^2}{n - 2}$$ $$SE(\hat{\beta}_1) = \sqrt{\frac{S_e^2}{\sum (X_i - \bar{X})^2}} = \frac{S_e}{\sqrt{S_{xx}}}$$

Se divide por $n-2$ grados de libertad porque se estimaron dos parámetros $(\beta_0, \beta_1)$, dejando solo $n-2$ residuos libres independientes.

Bondad de Ajuste

Identidad $SST = SSR + SSE$

$$SST = \sum (Y_i - \bar{Y})^2$$ $$SSR = \sum (\hat{Y}_i - \bar{Y})^2$$ $$R^2 = \frac{SSR}{SST} = 1 - \frac{SSE}{SST} = r^2$$

$R^2$ cuantifica qué proporción de la variabilidad observada en $Y$ es absorbida y explicada linealmente por la covariable $X$.

Los 4 Supuestos Fundamentales de Gauss-Markov (Propiedad MELI / BLUE)

Bajo estas condiciones, los estimadores MCO tienen varianza mínima dentro de la clase de estimadores lineales e insesgados.

MELI / BLUE
Supuesto Expresión Formal Consecuencia de la Violación Método de Diagnóstico Acción Correctiva
1. Linealidad $\mathbb{E}[\varepsilon_i \mid X_i] = 0$ Estimadores sesgados; predicciones sistemáticamente erradas. Gráfico de Residuos vs Ajustados ($\hat{Y}$ vs $e_i$): patrones curvos. Transformación $\ln(X), \ln(Y)$ o términos polinomiales ($X^2$).
2. Homocedasticidad $\mathbb{V}\text{ar}(\varepsilon_i \mid X_i) = \sigma^2 = \text{cte}$ MCO ya no es eficiente. Errores estándar sesgados; tests t y F inválidos. Residuos en abanico o embudo; test de Breusch-Pagan / White. Mínimos Cuadrados Ponderados (WLS) o errores robustos Huber-White.
3. Independencia $\text{Cov}(\varepsilon_i, \varepsilon_j) = 0, \; \forall i \neq j$ Varianzas subestimadas fuertemente; falsos descubrimientos significativos. Gráfico secuencial de residuos; Test Durbin-Watson / Ljung-Box. Modelos de Series Temporales (ARIMA), Diferencias o Efectos Mixtos.
4. Normalidad $\varepsilon_i \sim \mathcal{N}(0, \sigma^2)$ En muestras chicas, intervalos de confianza $t$ y predicciones inexactas. Q-Q Plot de residuos estandarizados, test Shapiro-Wilk / Jarque-Bera. Transformaciones Box-Cox o técnicas de remuestreo (Bootstrap).

Modelos Lineales Multivariados y Efectos de Grupo

Extensión a múltiples predictores, interpretación de pendientes parciales y modelado con variables dicotómicas (Dummies e Interacciones).

Dos o más Variables

Función de Respuesta Multivariada

En el modelo $Y_i = \beta_0 + \beta_1 X_{i1} + \beta_2 X_{i2} + \dots + \beta_k X_{ik} + \varepsilon_i$, el coeficiente $\hat{\beta}_j$ representa la pendiente parcial:

Interpretación ceteris paribus: El cambio promedio esperado en $Y$ por cada unidad adicional en $X_j$, manteniendo constantes todas las demás covariables del modelo.

En forma matricial compacta: $\mathbf{Y} = \mathbf{X}\boldsymbol{\beta} + \boldsymbol{\varepsilon}$, con solución óptima de mínimos cuadrados dada por:

$$\hat{\boldsymbol{\beta}} = (\mathbf{X}^T \mathbf{X})^{-1} \mathbf{X}^T \mathbf{Y}, \quad \text{Var}(\hat{\boldsymbol{\beta}}) = S_e^2 (\mathbf{X}^T \mathbf{X})^{-1}$$

Modelado de Factores Cualitativos (Variables Indicadoras)

Para incorporar una variable cualitativa con $K$ categorías (por ejemplo, Género o Tratamiento), se deben crear exactamente $K-1$ variables indicadoras o dummies binarias $(0, 1)$ para evitar la trampa de la multicolinealidad perfecta (singularidad de $\mathbf{X}^T\mathbf{X}$).

Grupo Referencia ($D=0$): $\mathbb{E}[Y \mid X, D=0] = \beta_0 + \beta_1 X$
Grupo Tratado ($D=1$): $\mathbb{E}[Y \mid X, D=1] = (\beta_0 + \beta_2) + \beta_1 X$
$\beta_2$ representa la distancia vertical (desplazamiento paralelo) entre ambas rectas.

Simulador Interactivo: Rectas de Grupo y Término de Interacción

Evalúa la hipótesis de pendientes paralelas ($H_0: \beta_3 = 0$) frente a pendientes cruzadas ($\beta_1 + \beta_3 \cdot D$).

Parámetros de Control:
Offset Grupo 2 ($\beta_2$): 10.0
Efecto Interacción ($\beta_3$): 0.0
Ecuaciones Ajustadas por Estrato:
Grupo A ($D=0$): $\hat{Y} = 15.0 + 1.20 X$
Grupo B ($D=1$): $\hat{Y} = 25.0 + 1.20 X$

Diagnóstico de Residuos y Patologías Visuales

"Nunca confíes ciegamente en $R^2$ sin mirar el gráfico de dispersión de residuos". Análisis de curvatura, heterocedasticidad y puntos influyentes.

Auditoría de Modelos

El Célebre Cuarteto de Anscombe (1973)

Idéntica media ($\bar{X}=9, \bar{Y}=7.5$), misma recta ($\hat{Y} = 3 + 0.5X$) y mismo $R^2 = 0.67$.
Dataset I: Lineal Estándar

Dispersión homogénea normal. Caso ideal para MCO.

Dataset II: Curvatura Pura

Relación no lineal cuadrática perfecta. Recta inapropiada.

Dataset III: Outlier Vertical

Línea casi perfecta destruida por un solo punto anómalo.

Dataset IV: Apalancamiento

Un solo punto en el extremo genera artificialmente la recta.

Inspección de Residuos vs Valores Predichos ($\hat{Y}_i$ vs $e_i$)

El gráfico de residuos frente a los valores ajustados es la prueba reina para verificar los supuestos del modelo. Si el modelo es correcto, la nube de residuos debe lucir como una banda horizontal aleatoria centrada en cero, sin tendencias, curvaturas ni formas geométricas reconocibles.

Forma en Embudo (Megáfono): Indica heterocedasticidad (variabilidad creciente con la escala).
Patrón Parabólico en U: Evidencia no linealidad; requiere modelos polinomiales o logaritmos.

Mapeo de Notebooks y Casos Prácticos de Cátedra

Guía paso a paso para resolver la ejercitación de la Guía 3 y el laboratorio en Python / R.

Hands-on Cátedra
01

01_correlacion_lineal.ipynb

Cálculo de matrices de correlación de Pearson y Spearman. Comparación de sensibilidad frente a outliers severos y test $t$ para $H_0: \rho = 0$.

scipy.stats.pearsonr
02

02_analisis_regresion_simple.ipynb

Ajuste OLS con statsmodels y sklearn. Caso de estudio de los 100 bebés de bajo peso (Szretter Noste) y producción de naranjas vs riego.

statsmodels.OLS.fit()
03

03_diagnostico_modelo_regresion.ipynb

Auditoría de supuestos de Gauss-Markov. Gráficos de residuos, apalancamiento ($h_{ii}$), distancias de Cook y test de Breusch-Pagan.

statsmodels.graphics
Caso Clásico: Perímetro Cefálico en Bebés de Bajo Peso $n = 100$, Boston Massachusetts

Se modela la respuesta continua $Y =$ Perímetro cefálico (cm) en función de la edad gestacional $X_1$ (semanas) y el peso al nacer $X_2$ (gramos):

Modelo Simple (1 Predictor): $\widehat{\text{headcirc}} = 3.9143 + 0.7801 \cdot \text{gestage}$
$R^2 = 0.6095, \quad S_e = 1.590$ cm, $\quad p < 0.001$
Modelo Múltiple (2 Predictores): $\widehat{\text{headcirc}} = 8.3080 + 0.4487 \cdot \text{gestage} + 0.0047 \cdot \text{birthwt}$
$R^2 = 0.7520, \quad R^2_{adj} = 0.7469, \quad S_e = 1.274$ cm

Conclusión clave: Al controlar por el peso al nacer, la pendiente de edad gestacional baja de 0.78 a 0.45, el $R^2_{adj}$ sube al 74.7% y el error de estimación se reduce a 1.27 cm, confirmando la utilidad clínica del modelo multivariado.