Unidad 3

Regresión Múltiple & Reducción Dimensional (PCA)

Diapositiva 1 / 12
Cátedra de Métodos Cuantitativos • Clase 6

Regresión Múltiple & Reducción Dimensional (PCA)

Formulación matricial MCO, diagnóstico de multicolinealidad (VIF), puntos de influencia de Cook y descomposición ortogonal por componentes principales.

Álgebra Matricial MCO Multicolinealidad (VIF > 5) PCA & Ortogonalidad
Usa las flechas o haz clic para avanzar

Objetivos Estratégicos de la Sesión

Hoja de ruta para el modelado econométrico multivariable y compresión espectral.

Hoja de Ruta
1

Álgebra Matricial y Ceteris Paribus

Dominar la estimación analítica $\hat{\beta} = (X^T X)^{-1} X^T Y$ y la interpretación condicional de coeficientes parciales.

2

Diagnóstico de Multicolinealidad

Calcular e interpretar el Factor de Inflación de la Varianza (VIF) para resolver dependencias lineales entre predictores.

3

Puntos de Influencia (Cook)

Aislar observaciones con apalancamiento excesivo mediante la Distancia de Cook y la matriz hat $H$.

4

PCA y Proyección Espectral

Comprimir matrices de alta dimensión mediante autovectores de covarianza, preservando la máxima varianza explicada.

Validación computacional en los notebooks 04_regresion_lineal_multiple y 06_pca.

1. Formulación Matricial del Modelo Lineal

Compactación algebraica de múltiples predictores en un sistema unificado.

Álgebra Lineal

Ecuación Matricial Fundamental:

El conjunto de $n$ ecuaciones se compacta en $Y = X\beta + \epsilon$, donde $X$ es la matriz de diseño de tamaño $n \times (p+1)$ con una primera columna de unos para el intercepto.

  • Invertibilidad de $X^T X$: Exige que ninguna columna sea combinación lineal exacta de otras (ausencia de multicolinealidad perfecta).
  • Residuos Vectoriales: $e = Y - \hat{Y} = (I - H) Y$, donde $H = X(X^T X)^{-1} X^T$ es la matriz Hat.
  • R² Ajustado: $R^2_{adj} = 1 - \frac{SSE / (n - p - 1)}{SST / (n - 1)}$ penaliza la inclusión de variables espurias.
$$\hat{\beta} = (X^T X)^{-1} X^T Y$$

Solución cerrada exacta para el vector de coeficientes

statsmodels_multiple.py p = 3 predictores
import statsmodels.formula.api as smf
formula = 'precio ~ sup + dorms + antiguedad'
modelo = smf.ols(formula, data=df).fit()
print(modelo.summary())
# R-sq: 0.884 | Adj R-sq: 0.880
# sup coef: 1200.5 | P>|t|: 0.000
# dorms coef: 4500.0 | P>|t|: 0.042
# antiguedad coef: -850.0 | P>|t|: 0.003

Interpretación Ceteris Paribus: Cada año adicional de antigüedad reduce el precio esperado en USD 850, manteniendo superficie y dormitorios constantes.

2. Patología de Multicolinealidad & Factor VIF

Cuando los predictores compiten entre sí por la misma información.

Inestabilidad

El Problema de la Multicolinealidad

Varianza Inflada

Ocurre cuando dos o más variables independientes presentan una fuerte correlación lineal mutua.

  • La matriz $X^T X$ se vuelve casi singular (determinante cercano a 0).
  • Los errores estándar de los coeficientes se disparan a valores gigantescos.
  • Los signos de los coeficientes pueden volverse contraintuitivos (ej. superficie con signo negativo).
$$Var(\hat{\beta}_j) = \frac{\sigma^2}{\sum (x_{ij} - \bar{x}_j)^2} \times \frac{1}{1 - R_j^2}$$
Consecuencia: Se descartan variables teóricamente fundamentales por p-valores inflados artificialmente.

Factor de Inflación de la Varianza (VIF)

Métrica Diagnóstica

Mide cuánto se incrementa la varianza del coeficiente $\hat{\beta}_j$ debido a la colinealidad con el resto de predictores.

  • $R_j^2$ es el $R^2$ de hacer la regresión de $X_j$ contra todas las demás $X$.
  • VIF = 1: Ausencia total de correlación ortogonal.
  • VIF > 5: Señal de alarma moderada; requiere monitoreo.
  • VIF > 10: Multicolinealidad severa inadmisible (eliminar variable o usar PCA/Ridge).
$$VIF_j = \frac{1}{1 - R_j^2}$$
Regla industrial: Todo modelo para inferencia debe tener VIF < 5 en todos sus predictores.

3. Puntos Influyentes: Distancia de Cook y Leverage

Diferenciando outliers en el residuo de observaciones que secuestran la estimación.

Diagnóstico de Influencia
COOK > 4/n

Criterio de Influencia

Mide el desplazamiento de todos los coeficientes del modelo si se removiera la observación i-ésima.

Tres Métricas de Influencia Multivariada:

1. Apalancamiento (Leverage $h_{ii}$)

Diagonal de la matriz Hat $H = X(X^T X)^{-1} X^T$. Cuantifica cuán extremo es el vector de predictores $X_i$ respecto al centroide de la muestra. Umbral de alerta: $h_{ii} > 2(p+1)/n$.

2. Residuos Estudentizados Externos ($t_i$)

Residuo normalizado por el error estándar estimado sin la observación $i$. Valores $|t_i| > 3$ señalan un dato atípico severo en el eje de respuesta $Y$.

3. Distancia de Cook ($D_i$)

Combina el apalancamiento y el residuo: $D_i = \frac{r_i^2}{p+1} \frac{h_{ii}}{1 - h_{ii}}$. Si $D_i > 4/n$, el punto distorsiona drásticamente las predicciones globales.

4. Selección de Variables y Regularización

Métodos para optimizar el balance entre parsimonia, capacidad predictiva y estabilidad.

Selección de Modelos
Método Mecanismo Operativo Ventajas Riesgos / Limitaciones
Stepwise (AIC / BIC) Adición/eliminación iterativa minimizando criterios de información. Automático y fácil de interpretar. Inestable ante multicolinealidad; p-valores distorsionados.
Regresión Ridge (L2) Penaliza la suma de coeficientes al cuadrado: $\lambda \sum \beta_j^2$. Resuelve la multicolinealidad y estabiliza $X^T X$. No anula coeficientes (no hace selección de variables).
Regresión Lasso (L1) Penaliza la norma 1 absoluta: $\lambda \sum |\beta_j|$. Fuerza coeficientes exactamente a cero (selección automática). Selecciona una sola variable al azar entre grupos correlacionados.
Componentes Principales (PCA) Transformación ortogonal previa a la regresión (PCR). Garantiza $VIF = 1$ en todos los nuevos componentes. Pérdida de interpretabilidad directa de variables originales.
Criterio Recomendado: Utilizar Lasso/ElasticNet cuando se busca interpretabilidad, y PCA/Ridge cuando el foco es puramente predictivo y libre de colinealidad.

5. Análisis de Componentes Principales (PCA)

Transformación espectral para comprimir dimensiones sin supervisión.

Reducción Dimensional

Principio Geométrico de PCA:

Busca un nuevo sistema de coordenadas ortogonales donde el primer eje ($PC_1$) captura la dirección de máxima varianza de los datos, el segundo ($PC_2$) la segunda mayor varianza perpendicular a $PC_1$, y así sucesivamente.

  • Estandarización Previa OBLIGATORIA: Si las variables no están en la misma escala ($Z$-score), la de mayor magnitud numérica dominará artificialmente el PCA.
  • Descomposición Espectral: Se obtienen los autovalores $\lambda_i$ y autovectores $v_i$ de la matriz de correlación $\Sigma$.
  • Independencia Estricta: Los componentes resultantes tienen correlación exactamente igual a cero ($r = 0$).
$$\Sigma v_i = \lambda_i v_i, \quad \text{Varianza Explicada } = \frac{\lambda_i}{\sum \lambda_k}$$

Autovalores como cuantificadores de varianza de cada componente

sklearn_pca.py Pipeline Estándar
from sklearn.preprocessing import StandardScaler
from sklearn.decomposition import PCA
# 1. Escalar datos (media 0, varianza 1)
X_scaled = StandardScaler().fit_transform(X)
# 2. Ajustar PCA a 2 componentes
pca = PCA(n_components=2)
X_pca = pca.fit_transform(X_scaled)
print(pca.explained_variance_ratio_)
# [0.652, 0.221] -> 87.3% varianza total retenida

Resultado: Redujimos 10 predictores correlacionados a solo 2 componentes reteniendo casi el 90% de la información del sistema.

6. ¿Cuántos Componentes Retener? Scree Plot

Reglas objetivas para definir la dimensión reducida del espacio latente.

Criterios de Corte
SCREE PLOT

Gráfico de Sedimentación

Gráfico de autovalores ordenados de mayor a menor para identificar el punto de inflexión o 'codo'.

Tres Criterios Formales de Retención:

1. Criterio del Codo (Elbow Method)

Se retienen los componentes antes del punto donde la curva se aplana horizontalmente (la 'sedimentación' o ruido aleatorio residual).

2. Regla de Kaiser (Autovalor > 1)

En datos estandarizados, cada variable original aporta varianza 1. Retener únicamente componentes con autovalor $\lambda_i > 1.0$ (aportan más que una variable aislada).

3. Umbral de Varianza Acumulada (70% - 90%)

Fijar una meta pragmática de información retenida (típicamente $\ge 80\%$ de la varianza total) y seleccionar el número mínimo $k$ de componentes necesario.

7. Laboratorio Visual: Rotación Ortogonal y Proyección PCA

Gira interactivamente el eje principal para observar cómo se maximiza la varianza proyectada sobre el primer autovector.

Simulador en Vivo

Rotación de Ejes:

Ajusta el ángulo del eje de proyección para buscar la dirección de máxima varianza (Autovector $PC_1$).
Varianza Retenida: -- %
Estado del Eje: Óptimo (PC1)
PCA encuentra automáticamente el ángulo exacto que maximiza la suma de proyecciones cuadráticas.
Nube de Datos y Ejes Principales n = 60
● Puntos correlacionados ― Eje proyectado Ortogonalidad pura

8. Regresión sobre Componentes Principales (PCR)

Ajuste de modelos estables combinando PCA con MCO.

Modelado Híbrido

Metodología PCR

Flujo de Trabajo

En lugar de hacer la regresión contra las variables crudas $X$, se ajusta contra los $k$ primeros componentes ortogonales.

  • 1. Estandarizar la matriz $X$.
  • 2. Aplicar PCA y seleccionar $k$ componentes ($Z = X V_k$).
  • 3. Ajustar MCO: $\hat{Y} = \gamma_0 + \gamma_1 Z_1 + \dots + \gamma_k Z_k$.
$$VIF(Z_j) = 1.0 \quad \forall j$$
Ventaja crítica: Erradicación total de la multicolinealidad por construcción matemática.

Desventajas de PCR frente a PLS

Limitación No Supervisada

PCA no mira la variable target $Y$; maximiza varianza interna en $X$ sin saber si esas direcciones predicen a $Y$.

  • El componente de menor varianza ($PC_{último}$) podría contener la información clave para $Y$.
  • Alternativa supervisada: **Partial Least Squares (PLS)**, que maximiza la covarianza entre $X$ e $Y$ simultáneamente.
  • Dificultad para explicar a la dirección ejecutiva el significado de un 'Componente 1'.
$$\max Cov^2(X w, Y) \quad \text{(Enfoque PLS Supervisado)}$$
Si se requiere interpretabilidad directa, priorizar selección Lasso sobre PCR.

9. Protocolo de Auditoría en Regresión Múltiple

Procedimiento integral de aseguramiento de calidad antes de validar predicciones.

Mejores Prácticas
MLR QA

Auditoría Multivariada

Tres pasos metodológicos obligatorios para evitar modelos inestables y conclusiones falaces.

Protocolo Metodológico:

1. Chequeo de VIF en Todos los Predictores

Verificar en código que ningún predictor supere $VIF = 5$. Si existe colinealidad, fusionar variables o eliminar la redundante.

2. Detección y Tratamiento de Cook > 4/n

Inspeccionar los puntos influyentes que puedan estar rotando artificialmente los planos de regresión.

3. Comparación por R² Ajustado y Criterio BIC

Validar que la inclusión de nuevas variables incremente genuinamente el $R^2_{adj}$ y reduzca el criterio bayesiano BIC.

¡A Programar en Jupyter Notebooks!

Validación Computacional en Entorno Jupyter Notebooks (Semana 6)

Laboratorio Hands-On

Regresión Múltiple

04_regresion_lineal_multiple.ipynb

Ajuste matricial con statsmodels e interpretación de coeficientes ceteris paribus.

Cálculo de VIF

04_regresion_lineal_multiple.ipynb

Implementación de variance_inflation_factor y resolución de colinealidad.

Ingeniería de Features

05_ingenieria_de_caracteristicas.ipynb

Transformaciones polinómicas, escalado StandardScaler y análisis de Cook.

Reducción con PCA

06_analisis_componentes_principales_pca.ipynb

Ajuste de PCA con Scikit-Learn, Scree plot y regresión sobre componentes (PCR).

Práctica Guiada (Profesor proyectando)

45 min: El profesor guía la calibración de la regresión múltiple, el cálculo de VIF y el ajuste del pipeline de PCA con Scikit-Learn.

Trabajo Autónomo (Alumnos en parejas)

75 min: Los estudiantes resuelven los problemas de la Guía 3 (Problemas 5 a 8), eliminando multicolinealidad y aplicando PCA sobre datos de sensores industriales.

¿Dudas sobre cómo interpretar coeficientes parciales o elegir el número de componentes de PCA?