Regresión Múltiple & Reducción Dimensional (PCA)
Formulación matricial MCO, diagnóstico de multicolinealidad (VIF), puntos de influencia de Cook y descomposición ortogonal por componentes principales.
Objetivos Estratégicos de la Sesión
Hoja de ruta para el modelado econométrico multivariable y compresión espectral.
Álgebra Matricial y Ceteris Paribus
Dominar la estimación analítica $\hat{\beta} = (X^T X)^{-1} X^T Y$ y la interpretación condicional de coeficientes parciales.
Diagnóstico de Multicolinealidad
Calcular e interpretar el Factor de Inflación de la Varianza (VIF) para resolver dependencias lineales entre predictores.
Puntos de Influencia (Cook)
Aislar observaciones con apalancamiento excesivo mediante la Distancia de Cook y la matriz hat $H$.
PCA y Proyección Espectral
Comprimir matrices de alta dimensión mediante autovectores de covarianza, preservando la máxima varianza explicada.
1. Formulación Matricial del Modelo Lineal
Compactación algebraica de múltiples predictores en un sistema unificado.
Ecuación Matricial Fundamental:
El conjunto de $n$ ecuaciones se compacta en $Y = X\beta + \epsilon$, donde $X$ es la matriz de diseño de tamaño $n \times (p+1)$ con una primera columna de unos para el intercepto.
- Invertibilidad de $X^T X$: Exige que ninguna columna sea combinación lineal exacta de otras (ausencia de multicolinealidad perfecta).
- Residuos Vectoriales: $e = Y - \hat{Y} = (I - H) Y$, donde $H = X(X^T X)^{-1} X^T$ es la matriz Hat.
- R² Ajustado: $R^2_{adj} = 1 - \frac{SSE / (n - p - 1)}{SST / (n - 1)}$ penaliza la inclusión de variables espurias.
Solución cerrada exacta para el vector de coeficientes
# R-sq: 0.884 | Adj R-sq: 0.880
# sup coef: 1200.5 | P>|t|: 0.000
# dorms coef: 4500.0 | P>|t|: 0.042
# antiguedad coef: -850.0 | P>|t|: 0.003
Interpretación Ceteris Paribus: Cada año adicional de antigüedad reduce el precio esperado en USD 850, manteniendo superficie y dormitorios constantes.
2. Patología de Multicolinealidad & Factor VIF
Cuando los predictores compiten entre sí por la misma información.
El Problema de la Multicolinealidad
Varianza InfladaOcurre cuando dos o más variables independientes presentan una fuerte correlación lineal mutua.
- ▪ La matriz $X^T X$ se vuelve casi singular (determinante cercano a 0).
- ▪ Los errores estándar de los coeficientes se disparan a valores gigantescos.
- ▪ Los signos de los coeficientes pueden volverse contraintuitivos (ej. superficie con signo negativo).
Factor de Inflación de la Varianza (VIF)
Métrica DiagnósticaMide cuánto se incrementa la varianza del coeficiente $\hat{\beta}_j$ debido a la colinealidad con el resto de predictores.
- ▪ $R_j^2$ es el $R^2$ de hacer la regresión de $X_j$ contra todas las demás $X$.
- ▪ VIF = 1: Ausencia total de correlación ortogonal.
- ▪ VIF > 5: Señal de alarma moderada; requiere monitoreo.
- ▪ VIF > 10: Multicolinealidad severa inadmisible (eliminar variable o usar PCA/Ridge).
3. Puntos Influyentes: Distancia de Cook y Leverage
Diferenciando outliers en el residuo de observaciones que secuestran la estimación.
Criterio de Influencia
Mide el desplazamiento de todos los coeficientes del modelo si se removiera la observación i-ésima.
Tres Métricas de Influencia Multivariada:
Diagonal de la matriz Hat $H = X(X^T X)^{-1} X^T$. Cuantifica cuán extremo es el vector de predictores $X_i$ respecto al centroide de la muestra. Umbral de alerta: $h_{ii} > 2(p+1)/n$.
Residuo normalizado por el error estándar estimado sin la observación $i$. Valores $|t_i| > 3$ señalan un dato atípico severo en el eje de respuesta $Y$.
Combina el apalancamiento y el residuo: $D_i = \frac{r_i^2}{p+1} \frac{h_{ii}}{1 - h_{ii}}$. Si $D_i > 4/n$, el punto distorsiona drásticamente las predicciones globales.
4. Selección de Variables y Regularización
Métodos para optimizar el balance entre parsimonia, capacidad predictiva y estabilidad.
| Método | Mecanismo Operativo | Ventajas | Riesgos / Limitaciones |
|---|---|---|---|
| Stepwise (AIC / BIC) | Adición/eliminación iterativa minimizando criterios de información. | Automático y fácil de interpretar. | Inestable ante multicolinealidad; p-valores distorsionados. |
| Regresión Ridge (L2) | Penaliza la suma de coeficientes al cuadrado: $\lambda \sum \beta_j^2$. | Resuelve la multicolinealidad y estabiliza $X^T X$. | No anula coeficientes (no hace selección de variables). |
| Regresión Lasso (L1) | Penaliza la norma 1 absoluta: $\lambda \sum |\beta_j|$. | Fuerza coeficientes exactamente a cero (selección automática). | Selecciona una sola variable al azar entre grupos correlacionados. |
| Componentes Principales (PCA) | Transformación ortogonal previa a la regresión (PCR). | Garantiza $VIF = 1$ en todos los nuevos componentes. | Pérdida de interpretabilidad directa de variables originales. |
5. Análisis de Componentes Principales (PCA)
Transformación espectral para comprimir dimensiones sin supervisión.
Principio Geométrico de PCA:
Busca un nuevo sistema de coordenadas ortogonales donde el primer eje ($PC_1$) captura la dirección de máxima varianza de los datos, el segundo ($PC_2$) la segunda mayor varianza perpendicular a $PC_1$, y así sucesivamente.
- Estandarización Previa OBLIGATORIA: Si las variables no están en la misma escala ($Z$-score), la de mayor magnitud numérica dominará artificialmente el PCA.
- Descomposición Espectral: Se obtienen los autovalores $\lambda_i$ y autovectores $v_i$ de la matriz de correlación $\Sigma$.
- Independencia Estricta: Los componentes resultantes tienen correlación exactamente igual a cero ($r = 0$).
Autovalores como cuantificadores de varianza de cada componente
# [0.652, 0.221] -> 87.3% varianza total retenida
Resultado: Redujimos 10 predictores correlacionados a solo 2 componentes reteniendo casi el 90% de la información del sistema.
6. ¿Cuántos Componentes Retener? Scree Plot
Reglas objetivas para definir la dimensión reducida del espacio latente.
Gráfico de Sedimentación
Gráfico de autovalores ordenados de mayor a menor para identificar el punto de inflexión o 'codo'.
Tres Criterios Formales de Retención:
Se retienen los componentes antes del punto donde la curva se aplana horizontalmente (la 'sedimentación' o ruido aleatorio residual).
En datos estandarizados, cada variable original aporta varianza 1. Retener únicamente componentes con autovalor $\lambda_i > 1.0$ (aportan más que una variable aislada).
Fijar una meta pragmática de información retenida (típicamente $\ge 80\%$ de la varianza total) y seleccionar el número mínimo $k$ de componentes necesario.
7. Laboratorio Visual: Rotación Ortogonal y Proyección PCA
Gira interactivamente el eje principal para observar cómo se maximiza la varianza proyectada sobre el primer autovector.
Rotación de Ejes:
Ajusta el ángulo del eje de proyección para buscar la dirección de máxima varianza (Autovector $PC_1$).8. Regresión sobre Componentes Principales (PCR)
Ajuste de modelos estables combinando PCA con MCO.
Metodología PCR
Flujo de TrabajoEn lugar de hacer la regresión contra las variables crudas $X$, se ajusta contra los $k$ primeros componentes ortogonales.
- ▪ 1. Estandarizar la matriz $X$.
- ▪ 2. Aplicar PCA y seleccionar $k$ componentes ($Z = X V_k$).
- ▪ 3. Ajustar MCO: $\hat{Y} = \gamma_0 + \gamma_1 Z_1 + \dots + \gamma_k Z_k$.
Desventajas de PCR frente a PLS
Limitación No SupervisadaPCA no mira la variable target $Y$; maximiza varianza interna en $X$ sin saber si esas direcciones predicen a $Y$.
- ▪ El componente de menor varianza ($PC_{último}$) podría contener la información clave para $Y$.
- ▪ Alternativa supervisada: **Partial Least Squares (PLS)**, que maximiza la covarianza entre $X$ e $Y$ simultáneamente.
- ▪ Dificultad para explicar a la dirección ejecutiva el significado de un 'Componente 1'.
9. Protocolo de Auditoría en Regresión Múltiple
Procedimiento integral de aseguramiento de calidad antes de validar predicciones.
Auditoría Multivariada
Tres pasos metodológicos obligatorios para evitar modelos inestables y conclusiones falaces.
Protocolo Metodológico:
Verificar en código que ningún predictor supere $VIF = 5$. Si existe colinealidad, fusionar variables o eliminar la redundante.
Inspeccionar los puntos influyentes que puedan estar rotando artificialmente los planos de regresión.
Validar que la inclusión de nuevas variables incremente genuinamente el $R^2_{adj}$ y reduzca el criterio bayesiano BIC.
¡A Programar en Jupyter Notebooks!
Validación Computacional en Entorno Jupyter Notebooks (Semana 6)
Regresión Múltiple
04_regresion_lineal_multiple.ipynb
Ajuste matricial con statsmodels e interpretación de coeficientes ceteris paribus.
Cálculo de VIF
04_regresion_lineal_multiple.ipynb
Implementación de variance_inflation_factor y resolución de colinealidad.
Ingeniería de Features
05_ingenieria_de_caracteristicas.ipynb
Transformaciones polinómicas, escalado StandardScaler y análisis de Cook.
Reducción con PCA
06_analisis_componentes_principales_pca.ipynb
Ajuste de PCA con Scikit-Learn, Scree plot y regresión sobre componentes (PCR).
45 min: El profesor guía la calibración de la regresión múltiple, el cálculo de VIF y el ajuste del pipeline de PCA con Scikit-Learn.
75 min: Los estudiantes resuelven los problemas de la Guía 3 (Problemas 5 a 8), eliminando multicolinealidad y aplicando PCA sobre datos de sensores industriales.