Calculadora de pruebas A/B

Compara dos tasas de conversión con una prueba z de dos proporciones, el valor p y la mejora relativa.

Significancia de la prueba A/B
Ingresa los visitantes y las conversiones de las variantes de control y de prueba.
Variante A (control)
Variante B (prueba)

Acerca de la significancia de las pruebas A/B

Una prueba A/B asigna aleatoriamente visitantes comparables a una experiencia de control y a otra alternativa, y mide un resultado predefinido, como una compra, un registro, un clic o una tarea completada. Esta calculadora compara dos tasas de conversión binarias mediante una prueba z de dos proporciones con proporción combinada. Informa cada tasa, la mejora relativa, la puntuación z, un valor p bilateral y si el resultado supera el umbral convencional de significancia de 0.05. En cada variante, la tasa de conversión es el número de conversiones dividido entre los visitantes. Bajo la hipótesis nula de que ambas variantes tienen la misma tasa subyacente, la calculadora combina las conversiones de ambas muestras. Usa esa proporción combinada para estimar el error estándar de la diferencia y divide la diferencia observada entre tasas por dicho error para obtener la puntuación z. El valor p bilateral mide cuán sorprendente sería una diferencia al menos tan grande si la hipótesis nula fuera cierta. Un valor p inferior a 0.05 suele describirse como estadísticamente significativo al nivel de confianza del noventa y cinco por ciento. No significa que exista esa probabilidad de que la variante de prueba sea mejor, ni mide el valor comercial del cambio. La mejora relativa compara la diferencia entre tasas con la tasa de control, mientras que la mejora absoluta es simplemente la tasa B menos la tasa A. Una mejora pequeña pero estadísticamente fiable puede tener gran valor a escala, y una mejora observada grande puede seguir siendo incierta con muestras pequeñas. La inferencia válida depende del diseño experimental. Asigna usuarios al azar, mantén estable la asignación, evita contar varias veces la misma unidad independiente, elige la métrica principal antes de revisar los resultados y ejecuta el experimento durante un periodo que capture los ciclos habituales. Detenerlo en cuanto aparece significancia aumenta el riesgo de falsos positivos. Varias métricas, revisiones repetidas y muchas comparaciones entre variantes también requieren un análisis ajustado o un método secuencial planificado. La aproximación normal funciona mejor cuando cada variante tiene suficientes conversiones y no conversiones esperadas. Los resultados muy escasos pueden requerir la prueba exacta de Fisher u otro método exacto. La significancia tampoco protege de errores de medición, efectos de novedad, desajustes en la proporción de la muestra, tráfico de bots o cambios durante la prueba. Antes de decidir el despliegue, utiliza el resultado junto con intervalos de confianza, métricas de protección, umbrales de efecto práctico y una revisión de la calidad experimental.

Ejemplos de pruebas A/B

Visitantes y conversionesTasas y valor pConclusión con α = 0.05
A: 1,000/100; B: 1,000/14010.00% frente a 14.00%; p ≈ 0.006Mejora significativa
A: 500/50; B: 500/5410.00% frente a 10.80%; p ≈ 0.676No significativo
A: 2,000/300; B: 2,000/27015.00% frente a 13.50%; p ≈ 0.176Caída observada, no significativa

Cómo calcular la significancia A/B

  1. Ingresa el número de visitantes asignados y las conversiones completadas de la variante A.
  2. Ingresa los visitantes y las conversiones correspondientes a la variante B.
  3. Selecciona Calcular significancia para ejecutar la prueba z de dos proporciones con proporción combinada.
  4. Revisa las tasas, la mejora, el valor p y la importancia práctica antes de decidir.

Preguntas frecuentes

¿Qué valor p es estadísticamente significativo?

Es habitual usar un umbral de 0.05 elegido antes del experimento. El umbral de decisión debe reflejar el plan de prueba, el riesgo y cualquier corrección por comparaciones múltiples.

¿Qué es la mejora relativa?

La mejora relativa es (tasa B − tasa A) dividida entre la tasa A. Describe el cambio proporcional y debe considerarse junto con la diferencia absoluta en puntos porcentuales.

¿La significancia demuestra que la variante B es mejor?

No. Cuantifica la evidencia contra la igualdad de tasas bajo los supuestos del modelo. La calidad de los datos, el diseño, los intervalos de confianza y el valor práctico siguen siendo importantes.

¿Puedo detener una prueba A/B cuando p baje de 0.05?

Revisar repetidamente y detenerse al primer resultado significativo aumenta los falsos positivos. Usa un plan de muestra fija o un método válido de pruebas secuenciales.

¿Cuándo debo evitar una prueba z?

La aproximación normal puede ser poco fiable con muy pocas conversiones o no conversiones. Para datos escasos, es más adecuada una prueba exacta o un análisis especializado.