Calculadora de test A/B

Experimentación de producto • Tamaño muestral, uplift, p-valor y z-score
Publicidad

Variante B ganadora con significancia estadística (95 %)

El incremento de conversión observado es concluyente. Se recomienda desplegar la Variante B al 100 % del tráfico.

Control (A) Versión original
3.00 % Tasa de conversión
Variación (B) +20.00 %
3.60 % Tasa de conversión
p-valor exacto 0.0034 Umbral crítico α = 0.05
Estadístico Z (Z-Score) +2.930 Desviaciones estándar
Intervalo de confianza 95 % [+0.20 %, +1.00 %] Diferencia absoluta (PB - PA)
Potencia estadística 83.2 % Probabilidad de evitar falso negativo

Distribución de probabilidad y solapamiento

Densidad normal de la tasa de conversión para ambas variantes
Variante Control (A)
Variante B (Variación)
Inferencia estadística para optimización digital

Fundamentos matemáticos del A/B testing riguroso

Aprende a interpretar p-valores, intervalos de confianza y errores de tipo I y II para validar decisiones de producto.

1. ¿Qué significa el p-valor en experimentación?

El p-valor es la probabilidad de observar una diferencia en la conversión igual o superior a la obtenida asumiendo que la hipótesis nula ($H_0$) es cierta (es decir, que no existe ninguna diferencia real entre las variantes).

Si $p < 0.05$, rechazamos la hipótesis nula y concluimos que el cambio produjo una variación real con un nivel de confianza del $95\,\%$.

2. Errores Tipo I (Falso positivo) y Tipo II (Falso negativo)

  • Error Tipo I ($\alpha$): Declarar que la variante B es ganadora cuando en realidad no mejora el producto. Se controla fijando el nivel de confianza (típicamente $\alpha = 5\,\%$).
  • Error Tipo II ($\beta$): Descartar una variante B que sí mejoraba el producto por falta de muestra. La potencia estadística ($1-\beta$, típicamente $80\,\%$) garantiza evitar este error.

3. El peligro de mirar antes de tiempo (Peeking Problem)

Revisar a diario un test y detenerlo en el primer momento en que «marca verde» multiplica la tasa de falsos positivos del $5\,\%$ hasta más del $30\,\%$. Para evitarlo, define el tamaño muestral de antemano y no tomes decisiones definitivas hasta que ambas variantes alcancen el número calculado de visitantes.

4. La regla de los ciclos semanales completos

El tráfico web y móvil sufre una fuerte estacionalidad: los patrones de compra y registro en fin de semana difieren drásticamente de los días laborables. Todo experimento debe durar como mínimo **7 o 14 días completos** independientemente del volumen de visitas.

Preguntas frecuentes sobre A/B testing

¿Por qué usar un test bilateral (Two-tailed) en vez de unilateral?

Un test bilateral examina si la nueva variante es tanto significativamente mejor como significativamente peor que el control. En desarrollo de producto es esencial saber si un cambio empeora la conversión para detenerlo a tiempo, por lo que el enfoque bilateral es el estándar recomendado por la industria.

¿Qué es el MDE (Efecto Mínimo Detectable)?

El MDE representa el menor porcentaje de mejora relativa en la conversión que un experimento es capaz de detectar con fiabilidad estadística. Cuanto más pequeño sea el efecto que buscas detectar (por ejemplo, un +2 % frente a un +15 %), mayor será el tamaño de muestra requerido.

¿Puedo usar esta calculadora para métricas no binarias (ingresos por usuario)?

Esta calculadora aplica la prueba Z de dos proporciones para variables dicotómicas (conversión sí/no: registro, compra, clic). Para variables continuas con alta dispersión como el valor medio de pedido (AOV) o ingresos por visitante (RPV), se recomienda aplicar pruebas t de Student o contrastes de Kolmogorov-Smirnov.