Fundamentos del test de Kolmogorov-Smirnov y Lilliefors
El contraste de Kolmogorov-Smirnov (K-S) es una de las pruebas no paramétricas más utilizadas en estadística inferencial y ciencia de datos para evaluar la bondad de ajuste. Permite responder con rigor a la pregunta: ¿proceden las observaciones de mi muestra de una distribución continua teórica concreta?
1. Planteamiento formal de hipótesis
- Hipótesis nula (H₀): Las observaciones muestrales proceden de la distribución teórica especificada con función acumulada F(x).
- Hipótesis alternativa (H₁): Las observaciones no proceden de dicha distribución continua.
2. La función de distribución empírica (ECDF)
Dada una muestra de n observaciones ordenadas x(1) ≤ x(2) ≤ ... ≤ x(n), la función escalonada Fn(x) representa la proporción acumulada de datos menores o iguales a x:
3. El estadístico bilateral D
El estadístico D cuantifica la suprema discrepancia vertical entre la función empírica Fn(x) y la función teórica continua F(x). Para calcularlo con exactitud matemática, se evalúan las diferencias inmediatamente después y antes de cada salto muestral:
D⁻ = máx [ F(x(i)) - ((i - 1) / n) ]
D = máx(D⁺, D⁻) = sup |Fn(x) - F(x)|
4. p-valor asintótico y corrección de Stephens
Bajo H₀, la distribución asintótica del estadístico D no depende de la distribución F(x) evaluada (es libre de distribución). Para muestras finitas, aplicamos el factor de escala ajustado de Stephens (1970):
p-valor = 2 · Σ_{j=1}^∞ (-1)^{j-1} · exp(-2 · j² · λ²)
5. Cuándo usar el test de Lilliefors para normalidad
Una limitación crítica del test de Kolmogorov-Smirnov clásico es que asume que los parámetros de la distribución teórica son conocidos de antemano (por ejemplo, contrastar contra una Normal estándar prefijada con media 0 y desviación 1). Si estimamos la media (x̄) y la desviación típica (s) a partir de los propios datos, la curva teórica se "adapta" a la muestra, reduciendo la discrepancia observada. Esto hace que el test KS estándar sea excesivamente conservador y no rechace la normalidad cuando debería hacerlo.
La prueba de Lilliefors corrige este fenómeno ajustando la distribución nula del estadístico D, proporcionando p-valores y valores críticos exactos para el contraste de normalidad con parámetros estimados.
Preguntas frecuentes sobre Kolmogorov-Smirnov
El test de Shapiro-Wilk está optimizado específicamente para contrastar la normalidad en muestras pequeñas a medianas (n < 50), ofreciendo mayor potencia estadística para ese caso particular. En cambio, Kolmogorov-Smirnov es un test de propósito general aplicable a cualquier distribución continua (Normal, Exponencial, Uniforme, Weibull, etc.) y permite visualizar directamente la discrepancia en la escala de probabilidad acumulada.
La derivación matemática de la distribución de Kolmogorov asume que la función de distribución teórica F(x) es estrictamente continua. Si se aplica sobre variables discretas con múltiples empates (valores repetidos), el estadístico D resulta conservador y el p-valor real es menor que el calculado asintóticamente.
El gráfico P-P (Probability-Probability plot) enfrenta la probabilidad acumulada teórica F(x) con la empírica Fn(x). Si la muestra sigue la distribución propuesta, los puntos se alinean con la diagonal a 45°. Las desviaciones indican zonas donde la distribución real acumula mayor o menor probabilidad de la esperada.