A/B测试计算器

通过双比例z检验、p值和相对提升幅度,比较两组转化率。

A/B测试显著性
输入对照版本与测试版本的访客数和转化数。
版本A(对照组)
版本B(测试组)

关于A/B测试显著性

A/B测试将具有可比性的访客随机分配至对照体验和替代体验,再衡量预先定义的结果,例如购买、注册、点击或完成任务。本计算器使用合并比例的双比例z检验,比较两个二元转化率,报告各组转化率、相对提升幅度、z分数、双侧p值,以及结果是否达到常用的0.05显著性阈值。 每个版本的转化率等于转化数除以访客数。在两个版本真实转化率相同的原假设下,计算器合并两组样本的转化数,使用合并转化率估计差异的标准误,再将观测到的转化率差除以标准误,得到z分数。双侧p值衡量:若原假设成立,出现至少如此大的差异有多么罕见。 p值低于0.05通常称为在百分之九十五的置信水平下具有统计显著性。这不意味着测试版本有百分之九十五的概率更好,也不衡量改动的业务价值。相对提升将转化率差与对照组转化率比较,而绝对提升只是B转化率减去A转化率。幅度虽小但统计上可靠的提升,在大规模应用时可能很有价值;样本较小时,即使观测到较大提升,结果也可能仍不确定。 有效推断依赖实验设计。应随机分配用户并保持分组稳定,避免对同一独立单位重复计数,在查看结果前确定主要指标,并让实验持续足够长的时间以覆盖正常周期。一出现显著性就停止会增加假阳性风险。多个指标、反复查看结果及多版本比较,也需要调整分析方法或采用预先规划的序贯方法。 当每个版本都有足够的预期转化数及未转化数时,正态近似效果最好。结果非常稀少时,可能需要Fisher精确检验或其他精确方法。统计显著性也无法防范埋点错误、新奇效应、样本比例失配、机器人流量或测试期间发生的变化。决定全面上线前,应将本结果与置信区间、护栏指标、实际效应阈值及实验质量审查结合使用。

A/B测试示例

访客数与转化数转化率与p值α = 0.05时的结论
A: 1,000/100; B: 1,000/14010.00% 对比 14.00%;p ≈ 0.006显著提升
A: 500/50; B: 500/5410.00% 对比 10.80%;p ≈ 0.676不显著
A: 2,000/300; B: 2,000/27015.00% 对比 13.50%;p ≈ 0.176观测到下降,但不显著

如何计算A/B测试显著性

  1. 输入分配到版本A的访客数及已完成的转化数。
  2. 输入版本B对应的访客数与转化数。
  3. 选择“计算显著性”,运行合并比例的双比例z检验。
  4. 做出决定前,查看转化率、提升幅度、p值及实际意义。

常见问题

p值达到多少才具有统计显著性?

常用阈值为0.05,前提是在实验开始前选定。决策阈值应体现测试计划、风险及多重比较所需的校正。

什么是相对提升?

相对提升等于(B转化率 − A转化率)除以A转化率,描述的是相对变化,应结合绝对百分点差一起考虑。

显著性是否证明版本B更好?

不能。显著性量化的是在模型假设下反对两组转化率相同的证据。数据质量、实验设计、置信区间和实际价值仍然重要。

p值一低于0.05就可以停止A/B测试吗?

反复查看结果,并在首次显著时停止,会增加假阳性。请使用固定样本计划或有效的序贯检验方法。

什么情况下不宜使用z检验?

转化数或未转化数很少时,正态近似可能不可靠。对于稀疏数据,精确检验或专门分析更合适。