Unidad 1

Repaso de Python & Análisis Exploratorio

Diapositiva 1 / 12
Cátedra de Métodos Cuantitativos • Clase 1

Repaso de Python & Análisis Exploratorio

Fundamentos de computación vectorial, caracterización cuantitativa de distribuciones y detección rigurosa de valores atípicos.

Pandas & NumPy Visualización con Seaborn Estadística Descriptiva
Usa las flechas o haz clic para avanzar

Objetivos Estratégicos de la Sesión

Hoja de ruta para el bloque de nivelación computacional y estadística descriptiva.

Hoja de Ruta
1

Vectorización y Rendimiento

Dominar operaciones vectorizadas en Pandas y NumPy para eliminar bucles iterativos ineficientes en conjuntos de datos masivos.

2

Medidas Robustas vs Sensibles

Diferenciar la media y desvío estándar de métricas robustas (mediana, IQR) ante la presencia de datos asimétricos o valores atípicos.

3

Detección Formal de Outliers

Aplicar el criterio del rango intercuartílico (Tukey) y z-scores para aislar y auditar anomalías operativas.

4

Visualización Diagnóstica

Construir histogramas KDE, boxplots y diagramas de dispersión para formular hipótesis antes del modelado estadístico.

Todo el código será ejecutado en vivo en los Jupyter Notebooks de la Unidad 1.

1. El Ecosistema PyData y Vectorización

Por qué la computación orientada a columnas supera a los bucles secuenciales.

Rendimiento

Principio de Vectorización:

Las operaciones en Pandas y NumPy se delegan internamente a rutinas optimizadas en C/Fortran (BLAS/LAPACK), procesando bloques contiguos de memoria simultáneamente.

  • Evitar iterrows(): Un bucle manual en Python puro penaliza el rendimiento en un factor superior a 100x.
  • Indexación Booleana: Filtrado directo mediante máscaras lógicas df[df['valor'] > umbral].
  • Agregaciones Agrupadas: Agregación eficiente en memoria con groupby().agg().
$$Tiempo_{vectorizado} \approx \frac{1}{50} \times Tiempo_{bucle\_for}$$

Ganancia típica de velocidad en cómputos sobre arrays

benchmark_vectorizado.py 100,000 filas
# Ineficiente (Python puro):
resultado = []
for _, row in df.iterrows():
  resultado.append(row['x'] * 1.21)
# Óptimo (Vectorizado NumPy/Pandas):
df['resultado'] = df['x'] * 1.21
# Rendimiento: 1.2 ms vs 480 ms
Siempre priorizar broadcasting y funciones vectorizadas universales (ufuncs).

2. Medidas de Posición: Media vs Mediana

Evaluación del punto de ruptura (breakdown point) y robustez analítica.

Tendencia Central

Media Aritmética (\bar{x})

Sensible a Outliers

Centro de gravedad numérico de las observaciones. Óptima bajo supuestos gaussianos pero altamente vulnerable a colas pesadas.

  • Incorpora el valor exacto de cada dato muestreado.
  • Punto de ruptura: 0% (un solo outlier infinito colapsa la media).
  • Base matemática indispensable para el Teorema Central del Límite.
$$\bar{x} = \frac{1}{n} \sum_{i=1}^n x_i$$
Riesgo: Reportar costos o salarios medios en distribuciones asimétricas distorsiona las decisiones de negocio.

Mediana Muestral (\tilde{x})

Estadístico Robusto

Punto de corte percentil 50. Divide al conjunto ordenado de datos en dos mitades exactamente equiprobables.

  • Depende del orden secuencial, no de la magnitud extrema.
  • Punto de ruptura: 50% (resiste hasta la mitad de datos contaminados).
  • Recomendada obligatoriamente en variables asimétricas (tiempos de falla, ingresos).
$$\tilde{x} = x_{(\frac{n+1}{2})} \text{ si n impar}$$
Ventaja: Refleja con fidelidad la experiencia del individuo típico sin distorsión por multimillonarios.

3. Medidas de Dispersión y Escala

Cuantificando la variabilidad inherente del proceso productivo o analítico.

Variabilidad

Desvío Estándar (s)

Métrica Paramétrica

Promedio cuadrático de los desvíos respecto a la media con corrección de Bessel ($n-1$).

  • Mismas unidades físicas que la variable analizada.
  • Regla empírica: $\bar{x} \pm 2s$ contiene el 95.4% de los datos bajo normalidad.
  • Coeficiente de Variación: $CV = \frac{s}{\bar{x}} \times 100\%$.
$$s = \sqrt{\frac{1}{n-1} \sum_{i=1}^n (x_i - \bar{x})^2}$$
Limitación: Se infla drásticamente con errores de medición aislados.

Rango Intercuartílico (IQR)

Métrica No Paramétrica

Distancia entre el percentil 75 ($Q_3$) y el percentil 25 ($Q_1$), abarcando el 50% central.

  • Inmune a valores atípicos en los extremos.
  • Base formal del diagrama de caja de John Tukey.
  • Desviación Absoluta de la Mediana (MAD) como alternativa complementaria.
$$IQR = Q_3 - Q_1 = P_{75} - P_{25}$$
Ventaja: Estabilidad total para fijar bandas de tolerancia y umbrales de limpieza.

4. Matriz de Selección de Visualizaciones

Correspondencia entre tipo de variable, objetivo de negocio y sintaxis gráfica en Python.

Visualización
Objetivo Analítico Tipo de Variables Gráfico Recomendado Sintaxis Seaborn / Matplotlib
Distribución Unidimensional Continua numérica Histograma + KDE sns.histplot(df['x'], kde=True)
Comparación de Subgrupos Numérica vs Categórica Boxplot / Violinplot sns.boxplot(x='cat', y='val', data=df)
Relación Bivariada Continua vs Continua Scatter Plot + Regresión sns.regplot(x='x', y='y', data=df)
Matriz de Asociación Múltiples Numéricas Heatmap de Correlaciones sns.heatmap(df.corr(), annot=True)
Regla de Oro: Siempre visualizar la distribución antes de calcular correlaciones para evitar trampas estadísticas.

5. Detección de Outliers: Criterio de Tukey

Barreras internas y externas para el control de calidad de datos.

Limpieza de Datos
1.5 × IQR

Regla Clásica de Tukey

Umbral universal para banderas de advertencia sin asumir normalidad estricta.

Límites Formales de Aceptación:

Límite Inferior de Control (LIF)

Se calcula como LIF = Q_1 - 1.5 \times IQR. Cualquier observación menor a esta cota requiere auditoría.

Límite Superior de Control (LSF)

Se calcula como LSF = Q_3 + 1.5 \times IQR. Valores superiores corresponden al 0.7% más extremo en curvas normales.

Outliers Severos (3.0 × IQR)

Distancias mayores a 3.0 \times IQR señalan con alta probabilidad fallas en sensores, errores de tipeo o anomalías graves.

6. Diagnóstico de Forma: Asimetría y Curtosis

Momentos de orden superior para caracterizar desviaciones de la campana de Gauss.

Forma

Asimetría (Skewness)

Momento Central 3

Cuantifica el balance bilateral de la curva de densidad.

  • Sesgo Nulo (~0): Distribución simétrica (Gaussiana, Uniforme).
  • Sesgo Positivo (> +0.5): Cola derecha extendida (Salarios, Tiempos de ciclo).
  • Sesgo Negativo (< -0.5): Cola izquierda extendida (Confiabilidad).
$$Skew = \frac{\frac{1}{n} \sum (x_i - \bar{x})^3}{s^3}$$
Si |Skew| > 1, aplicar transformaciones logarítmicas o Box-Cox antes de modelar.

Curtosis (Kurtosis)

Momento Central 4

Mide el peso relativo de las colas y la tasa de ocurrencia de eventos extremos.

  • Mesocúrtica (~0): Colas equivalentes a la Normal teórica.
  • Leptocúrtica (> 0): Colas pesadas; mayor probabilidad de eventos cisne negro.
  • Platicúrtica (< 0): Colas ligeras y dispersión aplanada.
$$Kurt = \frac{\frac{1}{n} \sum (x_i - \bar{x})^4}{s^4} - 3$$
Curtosis excesiva debilita los intervalos de confianza sustentados en t de Student.

7. Laboratorio Visual: Sensibilidad del Centro y Dispersión

Inyecta un valor anómalo extremo para contrastar en tiempo real el desvío de la Media vs la Mediana.

Simulador en Vivo

Experimento en Tiempo Real:

Modifica el valor del dato anómalo inyectado a una muestra base gaussiana de 50 elementos.
Media Muestral: -- --
Mediana Muestral: -- Inmune a la escala extrema
La mediana protege las conclusiones gerenciales frente a datos corrompidos.
Distribución Muestral con Outlier n = 51
Muestra normal Outlier inyectado Eje dinámico

8. Estrategias de Transformación de Variables

Técnicas algebraicas para estabilizar la varianza y normalizar asimetrías severas.

Ingeniería de Datos
Transformación Fórmula Matemática Condición de Aplicación Efecto Principal
Logarítmica y' = \ln(y) \text{ o } \ln(y + 1) Datos positivos estrictos ($y > 0$) con fuerte sesgo derecho. Comprime la cola superior; transforma relaciones multiplicativas en aditivas.
Raíz Cuadrada y' = \sqrt{y} Datos de conteo de eventos (distribución Poisson). Estabiliza la varianza proporcional a la media.
Estandarización Z z = \frac{x - \bar{x}}{s} Variables continuas con unidades dispares para algoritmos ML. Centra en media 0 y fija varianza unitaria.
Box-Cox Paramétrico y^{(\lambda)} = \frac{y^\lambda - 1}{\lambda} Búsqueda óptima de normalidad mediante máxima verosimilitud. Maximiza el ajuste paramétrico formal de la variable.
Advertencia Metodológica: Al transformar la variable target ($y$), todo pronóstico predictivo debe re-escalarse mediante la función inversa.

9. Protocolo de Auditoría Exploratoria

Checklist estándar previo a la calibración de modelos inferenciales o de regresión.

Mejores Prácticas
EDA CHECK

Auditoría de Entrada

Tres hitos obligatorios para asegurar integridad analítica y evitar fallos numéricos silenciosos.

Protocolo Metodológico:

1. Integridad de Tipos y Detección de Faltantes

Verificar que columnas numéricas no contengan caracteres especiales ocultos y tipificar nulos (decidir imputación estratégica vs descarte).

2. Validación de Rango Físico y Coherencia

Comprobar que magnitudes como importes, edades o presiones no presenten valores negativos imposibles causados por errores de ingesta.

3. Mapeo de Multicolinealidad Temprana

Examinar correlaciones bivariadas absolutas mayores a 0.85 para prevenir inestabilidades en los modelos de regresión.

¡A Programar en Jupyter Notebooks!

Validación Computacional en Entorno Jupyter Notebooks (Semana 1)

Laboratorio Hands-On

Manipulación de Datos

01_pandas_manipulacion_datos.ipynb

Indexación booleana, transformaciones y agrupamientos con groupby.

Visualización Analítica

02_visualizacion_datos.ipynb

Histogramas KDE, boxplots y gráficos de dispersión con Seaborn.

Medidas de Posición

03_medidas_posicion.ipynb

Cálculo empírico de media, mediana, cuantiles y sensibilidad a anomalías.

Dispersión y Outliers

04_medidas_dispersion.ipynb

Filtro de Tukey (IQR) y detección de datos atípicos en series reales.

Práctica Guiada (Profesor proyectando)

45 min: El profesor guía la ejecución de 01_pandas y 02_visualizacion, enseñando buenas prácticas de código limpio y diagnóstico gráfico.

Trabajo Autónomo (Alumnos en parejas)

75 min: Los estudiantes resuelven de forma autónoma los ejercicios de 03_medidas y 04_dispersion, aplicando el criterio de Tukey a datasets de producción.

¿Dudas sobre la vectorización de operaciones o la selección de métricas robustas antes de pasar a la práctica?