¿Qué es el Análisis de Varianza (ANOVA de un factor)?
El ANOVA de un factor es una técnica inferencial paramétrica que permite contrastar la hipótesis de igualdad de medias poblacionales entre $k \ge 3$ grupos independientes, a partir de una variable numérica dependiente continua y un factor categórico.
Todas las medias poblacionales son iguales:
$\mu_1 = \mu_2 = \dots = \mu_k$
Al menos una media poblacional difiere del resto:
$\exists \, i \neq j \text{ tal que } \mu_i \neq \mu_j$
Los 3 Supuestos Obligatorios para ANOVA y Tukey
Independencia
Las observaciones dentro de cada grupo y entre grupos deben ser independientes. No puede haber correlación serial ni emparejamiento.
Normalidad
Los residuos del modelo $\epsilon_{ij} = X_{ij} - \bar{X}_i$ deben distribuirse normalmente: $\epsilon_{ij} \sim \mathcal{N}(0, \sigma^2)$.
Homocedasticidad
Las varianzas de todos los grupos deben ser homogéneas: $\sigma_1^2 = \sigma_2^2 = \dots = \sigma_k^2$.
¿Por qué el Test de Tukey (HSD) y no múltiples tests t?
Si se rechaza $H_0$ en ANOVA, sabemos que al menos un par difiere, pero no cuáles. Si ejecutáramos pruebas $t$ estándar para cada par, cometeríamos el problema de la inflación del Error Tipo I ($\alpha$).
El Test de Tukey HSD (Honestly Significant Difference) soluciona esto controlando la tasa de error por familia (FWER) utilizando la distribución del rango studentizado ($q$):
$$HSD_{ij} = \frac{q_{(\alpha; \, k, \, N-k)}}{\sqrt{2}} \sqrt{MS_{Intra} \left( \frac{1}{n_i} + \frac{1}{n_j} \right)}$$
Si $|\bar{X}_i - \bar{X}_j| > HSD_{ij}$, la diferencia entre ese par específico es estadísticamente significativa al nivel de significancia elegido.