Calibración de la Recta MCO e Intervalos
Ajusta los puntos muestrales, modifica o desplaza el punto influyente y analiza cómo la función de costo de Mínimos Cuadrados Ordinarios minimiza la suma de errores cuadráticos ($\sum e_i^2$). Observa la apertura hiperbólica de las bandas de confianza e intervalos de predicción.
Parámetros del Experimento n = 24
Pronosticador de Valores Nuevos ($X_0$) Nivel $1-\alpha = 0.95$
*Nota clínica/metodológica: El IP siempre es sustancialmente más amplio que el IC porque incorpora la varianza aleatoria intrínseca $\sigma_\varepsilon^2$ del nuevo individuo.
Fundamentos Matemáticos del Modelo Lineal Simple
Deducción algebraica de los estimadores MCO, propiedades asintóticas y el Teorema de Gauss-Markov.
El Modelo Poblacional
El modelo postula que para cada individuo $i$, la variable respuesta continua $Y_i$ se relaciona funcionalmente con la covariable o predictora $X_i$ según:
donde $\beta_0$ es la ordenada al origen (intercepto), $\beta_1$ es la pendiente (tasa marginal de cambio esperada en $Y$ ante un aumento unitario en $X$), y $\varepsilon_i$ es el término de perturbación aleatoria no observable.
Criterio de MCO (Mínimos Cuadrados)
MCO busca los estimadores $\hat{\beta}_0$ y $\hat{\beta}_1$ que minimicen la función de costo de las distancias verticales al cuadrado entre los puntos empíricos y la recta postulada:
Derivando respecto a $\beta_0$ y $\beta_1$ e igualando a cero se obtienen las ecuaciones normales, garantizando que $\sum e_i = 0$ y que la recta pase siempre por el centroide $(\bar{X}, \bar{Y})$.
Pendiente y Ordenada
La pendiente es directamente proporcional a la correlación lineal de Pearson $r$ y ajustada por el ratio de dispersiones $S_y / S_x$.
Varianza y Error Estándar
Se divide por $n-2$ grados de libertad porque se estimaron dos parámetros $(\beta_0, \beta_1)$, dejando solo $n-2$ residuos libres independientes.
Identidad $SST = SSR + SSE$
$R^2$ cuantifica qué proporción de la variabilidad observada en $Y$ es absorbida y explicada linealmente por la covariable $X$.
Los 4 Supuestos Fundamentales de Gauss-Markov (Propiedad MELI / BLUE)
Bajo estas condiciones, los estimadores MCO tienen varianza mínima dentro de la clase de estimadores lineales e insesgados.
| Supuesto | Expresión Formal | Consecuencia de la Violación | Método de Diagnóstico | Acción Correctiva |
|---|---|---|---|---|
| 1. Linealidad | $\mathbb{E}[\varepsilon_i \mid X_i] = 0$ | Estimadores sesgados; predicciones sistemáticamente erradas. | Gráfico de Residuos vs Ajustados ($\hat{Y}$ vs $e_i$): patrones curvos. | Transformación $\ln(X), \ln(Y)$ o términos polinomiales ($X^2$). |
| 2. Homocedasticidad | $\mathbb{V}\text{ar}(\varepsilon_i \mid X_i) = \sigma^2 = \text{cte}$ | MCO ya no es eficiente. Errores estándar sesgados; tests t y F inválidos. | Residuos en abanico o embudo; test de Breusch-Pagan / White. | Mínimos Cuadrados Ponderados (WLS) o errores robustos Huber-White. |
| 3. Independencia | $\text{Cov}(\varepsilon_i, \varepsilon_j) = 0, \; \forall i \neq j$ | Varianzas subestimadas fuertemente; falsos descubrimientos significativos. | Gráfico secuencial de residuos; Test Durbin-Watson / Ljung-Box. | Modelos de Series Temporales (ARIMA), Diferencias o Efectos Mixtos. |
| 4. Normalidad | $\varepsilon_i \sim \mathcal{N}(0, \sigma^2)$ | En muestras chicas, intervalos de confianza $t$ y predicciones inexactas. | Q-Q Plot de residuos estandarizados, test Shapiro-Wilk / Jarque-Bera. | Transformaciones Box-Cox o técnicas de remuestreo (Bootstrap). |
Modelos Lineales Multivariados y Efectos de Grupo
Extensión a múltiples predictores, interpretación de pendientes parciales y modelado con variables dicotómicas (Dummies e Interacciones).
Función de Respuesta Multivariada
En el modelo $Y_i = \beta_0 + \beta_1 X_{i1} + \beta_2 X_{i2} + \dots + \beta_k X_{ik} + \varepsilon_i$, el coeficiente $\hat{\beta}_j$ representa la pendiente parcial:
En forma matricial compacta: $\mathbf{Y} = \mathbf{X}\boldsymbol{\beta} + \boldsymbol{\varepsilon}$, con solución óptima de mínimos cuadrados dada por:
Modelado de Factores Cualitativos (Variables Indicadoras)
Para incorporar una variable cualitativa con $K$ categorías (por ejemplo, Género o Tratamiento), se deben crear exactamente $K-1$ variables indicadoras o dummies binarias $(0, 1)$ para evitar la trampa de la multicolinealidad perfecta (singularidad de $\mathbf{X}^T\mathbf{X}$).
Simulador Interactivo: Rectas de Grupo y Término de Interacción
Evalúa la hipótesis de pendientes paralelas ($H_0: \beta_3 = 0$) frente a pendientes cruzadas ($\beta_1 + \beta_3 \cdot D$).
Diagnóstico de Residuos y Patologías Visuales
"Nunca confíes ciegamente en $R^2$ sin mirar el gráfico de dispersión de residuos". Análisis de curvatura, heterocedasticidad y puntos influyentes.
El Célebre Cuarteto de Anscombe (1973)
Dispersión homogénea normal. Caso ideal para MCO.
Relación no lineal cuadrática perfecta. Recta inapropiada.
Línea casi perfecta destruida por un solo punto anómalo.
Un solo punto en el extremo genera artificialmente la recta.
Inspección de Residuos vs Valores Predichos ($\hat{Y}_i$ vs $e_i$)
El gráfico de residuos frente a los valores ajustados es la prueba reina para verificar los supuestos del modelo. Si el modelo es correcto, la nube de residuos debe lucir como una banda horizontal aleatoria centrada en cero, sin tendencias, curvaturas ni formas geométricas reconocibles.
Mapeo de Notebooks y Casos Prácticos de Cátedra
Guía paso a paso para resolver la ejercitación de la Guía 3 y el laboratorio en Python / R.
01_correlacion_lineal.ipynb
Cálculo de matrices de correlación de Pearson y Spearman. Comparación de sensibilidad frente a outliers severos y test $t$ para $H_0: \rho = 0$.
02_analisis_regresion_simple.ipynb
Ajuste OLS con statsmodels y sklearn. Caso de estudio de los 100 bebés de bajo peso (Szretter Noste) y producción de naranjas vs riego.
03_diagnostico_modelo_regresion.ipynb
Auditoría de supuestos de Gauss-Markov. Gráficos de residuos, apalancamiento ($h_{ii}$), distancias de Cook y test de Breusch-Pagan.
Se modela la respuesta continua $Y =$ Perímetro cefálico (cm) en función de la edad gestacional $X_1$ (semanas) y el peso al nacer $X_2$ (gramos):
$R^2 = 0.6095, \quad S_e = 1.590$ cm, $\quad p < 0.001$
$R^2 = 0.7520, \quad R^2_{adj} = 0.7469, \quad S_e = 1.274$ cm
Conclusión clave: Al controlar por el peso al nacer, la pendiente de edad gestacional baja de 0.78 a 0.45, el $R^2_{adj}$ sube al 74.7% y el error de estimación se reduce a 1.27 cm, confirmando la utilidad clínica del modelo multivariado.