Calculadora de Kolmogorov-Smirnov

Test de bondad de ajuste y Lilliefors • Ciencia y estadística
Publicidad

Datos muestrales y contraste

Introduce observaciones numéricas o sube un archivo CSV / TXT para contrastar la hipótesis nula H₀.

Ejemplos didácticos preparados:
Sin datos
Arrastra un archivo CSV, TSV o TXT aquí o pulsa para examinar

Historial de análisis recientes

Registros guardados en este navegador para consultar o restaurar rápidamente.

No hay contrastes previos guardados en este navegador.

Fundamentos del test de Kolmogorov-Smirnov y Lilliefors

El contraste de Kolmogorov-Smirnov (K-S) es una de las pruebas no paramétricas más utilizadas en estadística inferencial y ciencia de datos para evaluar la bondad de ajuste. Permite responder con rigor a la pregunta: ¿proceden las observaciones de mi muestra de una distribución continua teórica concreta?

1. Planteamiento formal de hipótesis

  • Hipótesis nula (H₀): Las observaciones muestrales proceden de la distribución teórica especificada con función acumulada F(x).
  • Hipótesis alternativa (H₁): Las observaciones no proceden de dicha distribución continua.

2. La función de distribución empírica (ECDF)

Dada una muestra de n observaciones ordenadas x(1) ≤ x(2) ≤ ... ≤ x(n), la función escalonada Fn(x) representa la proporción acumulada de datos menores o iguales a x:

Fn(x) = (1 / n) · Σ I(x_i ≤ x) = { 0 si x < x(1); i / n si x(i) ≤ x < x(i+1); 1 si x ≥ x(n) }

3. El estadístico bilateral D

El estadístico D cuantifica la suprema discrepancia vertical entre la función empírica Fn(x) y la función teórica continua F(x). Para calcularlo con exactitud matemática, se evalúan las diferencias inmediatamente después y antes de cada salto muestral:

D⁺ = máx [ (i / n) - F(x(i)) ]
D⁻ = máx [ F(x(i)) - ((i - 1) / n) ]
D = máx(D⁺, D⁻) = sup |Fn(x) - F(x)|

4. p-valor asintótico y corrección de Stephens

Bajo H₀, la distribución asintótica del estadístico D no depende de la distribución F(x) evaluada (es libre de distribución). Para muestras finitas, aplicamos el factor de escala ajustado de Stephens (1970):

λ = (√n + 0.12 + 0.11 / √n) · D
p-valor = 2 · Σ_{j=1}^∞ (-1)^{j-1} · exp(-2 · j² · λ²)

5. Cuándo usar el test de Lilliefors para normalidad

Una limitación crítica del test de Kolmogorov-Smirnov clásico es que asume que los parámetros de la distribución teórica son conocidos de antemano (por ejemplo, contrastar contra una Normal estándar prefijada con media 0 y desviación 1). Si estimamos la media (x̄) y la desviación típica (s) a partir de los propios datos, la curva teórica se "adapta" a la muestra, reduciendo la discrepancia observada. Esto hace que el test KS estándar sea excesivamente conservador y no rechace la normalidad cuando debería hacerlo.

La prueba de Lilliefors corrige este fenómeno ajustando la distribución nula del estadístico D, proporcionando p-valores y valores críticos exactos para el contraste de normalidad con parámetros estimados.

Preguntas frecuentes sobre Kolmogorov-Smirnov

¿Cuál es la diferencia entre el test de Kolmogorov-Smirnov y el test de Shapiro-Wilk?

El test de Shapiro-Wilk está optimizado específicamente para contrastar la normalidad en muestras pequeñas a medianas (n < 50), ofreciendo mayor potencia estadística para ese caso particular. En cambio, Kolmogorov-Smirnov es un test de propósito general aplicable a cualquier distribución continua (Normal, Exponencial, Uniforme, Weibull, etc.) y permite visualizar directamente la discrepancia en la escala de probabilidad acumulada.

¿Por qué este test solo es válido para variables continuas?

La derivación matemática de la distribución de Kolmogorov asume que la función de distribución teórica F(x) es estrictamente continua. Si se aplica sobre variables discretas con múltiples empates (valores repetidos), el estadístico D resulta conservador y el p-valor real es menor que el calculado asintóticamente.

¿Qué significa el gráfico P-P?

El gráfico P-P (Probability-Probability plot) enfrenta la probabilidad acumulada teórica F(x) con la empírica Fn(x). Si la muestra sigue la distribución propuesta, los puntos se alinean con la diagonal a 45°. Las desviaciones indican zonas donde la distribución real acumula mayor o menor probabilidad de la esperada.