Inferencia, Estimación Rigurosa y Pruebas de Normalidad
Fundamentos de convergencia, superación del mito didáctico del n = 30 con normativas industriales de calidad y batería de bondad de ajuste.
Objetivos Estratégicos de la Sesión
Hoja de RutaTeorema Central del Límite Real
Comprender la convergencia asintótica de las medias muestrales hacia la campana gaussiana y por qué la velocidad de convergencia depende de la simetría de la población.
Estimación e Incertidumbre
Diferenciar el estimador puntual del intervalo de confianza y su rol en la cuantificación del riesgo operativo en la toma de decisiones.
Desmitificando el "n = 30"
Reemplazar la regla didáctica por criterios normativos reales: AIAG SPC (subgrupos racionales), normas de muestreo de aceptación (ISO 2859) y cálculo formal por potencia ().
Batería de Normalidad
Dominar el diagnóstico bimodal: evaluación gráfica (Q-Q Plot) y contrastes formales de hipótesis (Shapiro-Wilk, Anderson-Darling) previos a la regresión.
1. Teorema Central del Límite (TCL)
La distribución de las medias muestrales converge a la normalidad al aumentar el tamaño muestral.
Principio Fundamental:
Dadas variables independientes con media y varianza finita , la media muestral converge a:
2. Estimación Paramétrica e Incertidumbre
¿Cómo inferir los verdaderos parámetros del proceso a partir de datos finitos?
Un único número muestral
Asigna un valor escalar único como mejor aproximación al parámetro poblacional desconocido.
- ■ Media muestral () para estimar
- ■ Desviación muestral () para estimar
Tiene probabilidad prácticamente nula de coincidir exactamente con el parámetro real. Oculta la variabilidad e induce a falsa sensación de certeza.
Un rango con nivel de certeza
Establece un recorrido de valores verosímiles asociado a una probabilidad formal de cobertura:
- ✓ Cuantifica formalmente el error muestral.
- ✓ A mayor tamaño muestral (), menor ancho del intervalo.
Base ineludible para auditorías de capacidad, liberaciones de lote y cumplimiento de tolerancias de diseño.
"En ingeniería de procesos no gestionamos certezas puntuales; gestionamos intervalos y riesgos de desvío."
3. Fórmulas de Intervalos de Confianza para la Media
El dilema industrial: ¿Conocemos la verdadera variabilidad del proceso?
Varianza Poblacional () Conocida
Solo aplicable cuando el proceso tiene un historial masivo y estable con dispersión calibrada.
Varianza () Desconocida (se usa )
Obligatoria en el 99% de los casos: estimamos la desviación poblacional con la muestra.
4. Matriz de Decisión: Costos y Riesgos de Calidad
Traducción directa de los errores estadísticos a consecuencias de planta.
| Decisión sobre el Proceso | H₀ Verdadera (Proceso en Control) | H₀ Falsa (Proceso Descalibrado) |
|---|---|---|
|
Rechazar H₀ (Frenar línea / Descartar lote) |
ERROR TIPO I (α)
Riesgo del Productor: Falsa alarma. Detener maquinaria conforme o rechazar lotes óptimos. Pérdida de productividad.
|
DECISIÓN CORRECTA (1 − β)
Potencia Estadística: Capacidad real del sistema de control para capturar anomalías y desvíos críticos a tiempo.
|
|
No Rechazar H₀ (Liberar lote a distribución) |
DECISIÓN CORRECTA (1 − α)
Nivel de Confianza: El proceso está centrado y se autoriza la producción regular sin sobresaltos.
|
ERROR TIPO II (β)
Riesgo del Cliente: Falso negativo. Despachar piezas fuera de tolerancia a ensambladoras o clientes finales. Retiros de mercado (Recalls).
|
5. Criterios de Muestreo: Superando el Mito "n = 30"
Manuales de CalidadPor qué las normas de ingeniería automotriz y manufactura rechazan reglas empíricas de libro.
AIAG SPC Manual (Automotive Industry Action Group)
Para validar estabilidad de proceso e índices de capacidad preliminares (), la norma no acepta :
ISO 2859-1 / ANSI-ASQ Z1.4 (Aceptación de Lotes)
El muestreo por atributos se indexa según el tamaño del lote () y el Nivel de Calidad Aceptable (AQL):
Dimensión de Muestra para la Media
Supera ampliamente el mito de n=30.
6. Pruebas de Normalidad: ¿Por qué son Críticas?
El supuesto de normalidad en residuos para MCO, ANOVA e Índices de Capacidad.
Supuesto Fundamental
En modelos de Regresión Lineal Clásica (MCO), los errores o residuos poblacionales deben distribuirse:
Garantiza que los estimadores sean eficientes y de mínima varianza (Teorema de Gauss-Markov).
Riesgo si se Viola
Si los datos o residuos violan severamente la normalidad y aplicamos tests paramétricos clásicos:
- • Valores distorsionados y falsos.
- • Intervalos de predicción demasiado estrechos o sesgados.
- • Cálculo erróneo de PPM en estudios Six Sigma.
Las inferencias ejecutivas quedan invalidadas.
Protocolo Recomendado
Ninguna prueba aislada es suficiente. Las buenas prácticas exigen triangulación metodológica:
Decisión basada en evidencia convergente.
7. Diagnóstico Gráfico: Q-Q Plot (Cuantil-Cuantil)
Contrasta los cuantiles observados de la muestra frente a los cuantiles teóricos gaussianos.
Alineación Normal
Los puntos muestrales se alinean con fidelidad sobre la diagonal a 45 grados. No hay evidencia gráfica de violación de normalidad.
8. Contraste Formal: Test de Shapiro-Wilk
Máxima PotenciaEl estándar más riguroso para muestras continuas de ingeniería ().
Planteamiento de Hipótesis
Los datos provienen de una población con distribución Normal.
Los datos NO provienen de una distribución Normal.
Evalúa el estadístico comparando la correlación de los datos ordenados con ponderadores gaussianos teóricos:
scipy.stats.shapiro(datos)
Regla Universal de Decisión ()
Existe evidencia estadística suficiente para afirmar que los datos NO son normales.
No hay evidencia para descartar la normalidad. Se asume el supuesto como válido para el modelo.
9. Pruebas de Bondad de Ajuste Alternativas
Cuándo utilizar Kolmogorov-Smirnov y por qué Anderson-Darling domina en Six Sigma.
Kolmogorov-Smirnov (K-S)
Calcula la distancia vertical máxima () entre la función de distribución acumulada empírica () y la teórica ().
Si y no se conocen a priori y son estimadas de la misma muestra, el test K-S estándar es demasiado conservador; se debe emplear Lilliefors obligatoriamente.
Anderson-Darling (A-D)
Modificación sofisticada de K-S que aplica una función de ponderación cuadrática en las colas de la distribución.
En calidad automotriz o aeroespacial, las piezas defectuosas ocurren en las colas (> 3σ o 4σ). Anderson-Darling es el test más implacable para detectar outliers y colas pesadas.
scipy.stats.anderson(datos, dist='norm')
¡A Programar en Jupyter Notebooks!
Implementación real de pipelines de inferencia estadística y control de normalidad.
1. Simulación TCL
Generación Monte Carlo con distintas poblaciones y convergencia de medias.
teorema_limite.ipynb
2. Diagnóstico Q-Q
Visualización cuantil-cuantil e identificación visual de patologías en residuos.
probplot() & qqplot()
3. Tests Numéricos
Ejecución combinada de Shapiro-Wilk, Anderson-Darling y test de Lilliefors.
scipy.stats.shapiro()
4. Capacidad (Cpk)
Cálculo de subgrupos racionales AIAG y validación de supuestos previos a índices.
spc_capability.ipynb