Calculadora de teste A/B

Compare duas taxas de conversão com um teste z de duas proporções, valor p e aumento relativo.

Significância do teste A/B
Informe os visitantes e as conversões das variantes de controle e de teste.
Variante A (controle)
Variante B (teste)

Sobre a significância do teste A/B

Um teste A/B distribui aleatoriamente visitantes comparáveis entre uma experiência de controle e outra alternativa, depois mede um resultado predefinido, como compra, cadastro, clique ou tarefa concluída. Esta calculadora compara duas taxas de conversão binárias com um teste z de duas proporções usando proporção combinada. Ela apresenta cada taxa, o aumento relativo, o escore z, um valor p bilateral e se o resultado ultrapassa o limiar convencional de significância de 0.05. Para cada variante, a taxa de conversão é o número de conversões dividido pelo de visitantes. Sob a hipótese nula de que as variantes têm a mesma taxa subjacente, a calculadora combina as conversões das duas amostras. Usa essa proporção combinada para estimar o erro-padrão da diferença e divide a diferença observada entre taxas pelo erro-padrão para obter o escore z. O valor p bilateral mede quão surpreendente seria uma diferença pelo menos tão grande se a hipótese nula fosse verdadeira. Um valor p abaixo de 0.05 costuma ser descrito como estatisticamente significativo no nível de confiança de noventa e cinco por cento. Isso não significa que exista essa probabilidade de a variante de teste ser melhor, nem mede o valor de negócio da mudança. O aumento relativo compara a diferença entre taxas com a taxa de controle; o aumento absoluto é simplesmente a taxa B menos a taxa A. Um ganho pequeno, mas estatisticamente confiável, pode ter grande valor em escala, enquanto um ganho observado grande pode continuar incerto em amostras pequenas. A inferência válida depende do desenho experimental. Distribua usuários aleatoriamente, mantenha a atribuição estável, evite contar a mesma unidade independente várias vezes, escolha a métrica principal antes de examinar os resultados e execute o experimento por tempo suficiente para captar ciclos normais. Parar assim que surge significância aumenta o risco de falsos positivos. Várias métricas, consultas repetidas e muitas comparações entre variantes também exigem análise ajustada ou um método sequencial planejado. A aproximação normal funciona melhor quando cada variante tem conversões e não conversões esperadas em quantidade suficiente. Resultados muito raros podem exigir o teste exato de Fisher ou outro método exato. A significância estatística também não protege contra erros de instrumentação, efeitos de novidade, desvio na proporção amostral, tráfego de bots ou mudanças durante o teste. Antes de decidir pela implementação, use o resultado com intervalos de confiança, métricas de proteção, limiares de efeito prático e uma revisão da qualidade do experimento.

Exemplos de testes A/B

Visitantes e conversõesTaxas e valor pConclusão em α = 0.05
A: 1,000/100; B: 1,000/14010.00% contra 14.00%; p ≈ 0.006Melhora significativa
A: 500/50; B: 500/5410.00% contra 10.80%; p ≈ 0.676Não significativo
A: 2,000/300; B: 2,000/27015.00% contra 13.50%; p ≈ 0.176Queda observada, não significativa

Como calcular a significância A/B

  1. Informe o número de visitantes atribuídos e de conversões concluídas da variante A.
  2. Informe as contagens correspondentes de visitantes e conversões da variante B.
  3. Selecione Calcular significância para executar o teste z de duas proporções com proporção combinada.
  4. Revise taxas de conversão, aumento, valor p e relevância prática antes de decidir.

Perguntas frequentes

Qual valor p é estatisticamente significativo?

É comum usar um limiar de 0.05 escolhido antes do experimento. O limite de decisão deve refletir o plano de teste, o risco e qualquer correção para comparações múltiplas.

O que é aumento relativo?

O aumento relativo é (taxa B − taxa A) dividido pela taxa A. Ele descreve a mudança proporcional e deve ser considerado junto com a diferença absoluta em pontos percentuais.

A significância prova que a variante B é melhor?

Não. Ela quantifica a evidência contra taxas iguais sob as premissas do modelo. Qualidade dos dados, desenho experimental, intervalos de confiança e valor prático continuam importantes.

Posso parar o teste A/B assim que p ficar abaixo de 0.05?

Verificar repetidamente e parar no primeiro resultado significativo aumenta os falsos positivos. Use um plano de amostra fixa ou um método válido de teste sequencial.

Quando devo evitar um teste z?

A aproximação normal pode ser pouco confiável com pouquíssimas conversões ou não conversões. Um teste exato ou uma análise especializada é mais adequado para dados esparsos.