Laboratorio Interactivo de ANOVA & Test de Tukey

Estadística Aplicada: Comparación de Medias, Verificación de Supuestos y Contrastes Post-Hoc

¿Qué es el Análisis de Varianza (ANOVA de un factor)?

El ANOVA de un factor es una técnica inferencial paramétrica que permite contrastar la hipótesis de igualdad de medias poblacionales entre $k \ge 3$ grupos independientes, a partir de una variable numérica dependiente continua y un factor categórico.

Hipótesis Nula ($H_0$):

Todas las medias poblacionales son iguales:

$\mu_1 = \mu_2 = \dots = \mu_k$

Hipótesis Alternativa ($H_1$):

Al menos una media poblacional difiere del resto:

$\exists \, i \neq j \text{ tal que } \mu_i \neq \mu_j$

Principio de descomposición de la varianza: $$SS_{Total} = SS_{Entre} + SS_{Intra} \quad \Longleftrightarrow \quad \sum (X_{ij} - \bar{X}_{\cdot\cdot})^2 = \sum n_i(\bar{X}_{i\cdot} - \bar{X}_{\cdot\cdot})^2 + \sum \sum (X_{ij} - \bar{X}_{i\cdot})^2$$ El estadístico de prueba es el cociente de cuadrados medios: $$F = \frac{MS_{Entre}}{MS_{Intra}} = \frac{SS_{Entre} / (k - 1)}{SS_{Intra} / (N - k)} \sim F_{(k-1, \, N-k)}$$

Los 3 Supuestos Obligatorios para ANOVA y Tukey

Supuesto 1

Independencia

Las observaciones dentro de cada grupo y entre grupos deben ser independientes. No puede haber correlación serial ni emparejamiento.

¿Cómo se garantiza? Mediante un diseño experimental adecuado y muestreo aleatorio. Si hay medidas repetidas, debe utilizarse ANOVA de medidas repetidas.
Supuesto 2

Normalidad

Los residuos del modelo $\epsilon_{ij} = X_{ij} - \bar{X}_i$ deben distribuirse normalmente: $\epsilon_{ij} \sim \mathcal{N}(0, \sigma^2)$.

Diagnóstico: Test de Shapiro-Wilk, Jarque-Bera o gráfico Q-Q. Si no se cumple y las muestras son pequeñas ($n < 20$), usar Kruskal-Wallis.
Supuesto 3

Homocedasticidad

Las varianzas de todos los grupos deben ser homogéneas: $\sigma_1^2 = \sigma_2^2 = \dots = \sigma_k^2$.

Diagnóstico: Test de Levene o Bartlett. Si se viola severamente con grupos desbalanceados, se debe recurrir al ANOVA de Welch y Games-Howell post-hoc.

¿Por qué el Test de Tukey (HSD) y no múltiples tests t?

Si se rechaza $H_0$ en ANOVA, sabemos que al menos un par difiere, pero no cuáles. Si ejecutáramos pruebas $t$ estándar para cada par, cometeríamos el problema de la inflación del Error Tipo I ($\alpha$).

Para $k$ grupos, la cantidad de comparaciones por pares es $c = \frac{k(k-1)}{2}$. El error acumulado de cometer al menos un falso positivo es: $$\alpha_{\text{global}} = 1 - (1 - \alpha_{\text{individual}})^c$$ Ejemplo: con $k=4$ grupos ($c=6$ contrastes) y $\alpha=0.05$, ¡el riesgo real de error Tipo I asciende a $1 - (0.95)^6 \approx 26.5\%$!

El Test de Tukey HSD (Honestly Significant Difference) soluciona esto controlando la tasa de error por familia (FWER) utilizando la distribución del rango studentizado ($q$):

$$HSD_{ij} = \frac{q_{(\alpha; \, k, \, N-k)}}{\sqrt{2}} \sqrt{MS_{Intra} \left( \frac{1}{n_i} + \frac{1}{n_j} \right)}$$

Si $|\bar{X}_i - \bar{X}_j| > HSD_{ij}$, la diferencia entre ese par específico es estadísticamente significativa al nivel de significancia elegido.