A/B测试计算器
通过双比例z检验、p值和相对提升幅度,比较两组转化率。
A/B测试显著性
输入对照版本与测试版本的访客数和转化数。
关于A/B测试显著性
A/B测试将具有可比性的访客随机分配至对照体验和替代体验,再衡量预先定义的结果,例如购买、注册、点击或完成任务。本计算器使用合并比例的双比例z检验,比较两个二元转化率,报告各组转化率、相对提升幅度、z分数、双侧p值,以及结果是否达到常用的0.05显著性阈值。
每个版本的转化率等于转化数除以访客数。在两个版本真实转化率相同的原假设下,计算器合并两组样本的转化数,使用合并转化率估计差异的标准误,再将观测到的转化率差除以标准误,得到z分数。双侧p值衡量:若原假设成立,出现至少如此大的差异有多么罕见。
p值低于0.05通常称为在百分之九十五的置信水平下具有统计显著性。这不意味着测试版本有百分之九十五的概率更好,也不衡量改动的业务价值。相对提升将转化率差与对照组转化率比较,而绝对提升只是B转化率减去A转化率。幅度虽小但统计上可靠的提升,在大规模应用时可能很有价值;样本较小时,即使观测到较大提升,结果也可能仍不确定。
有效推断依赖实验设计。应随机分配用户并保持分组稳定,避免对同一独立单位重复计数,在查看结果前确定主要指标,并让实验持续足够长的时间以覆盖正常周期。一出现显著性就停止会增加假阳性风险。多个指标、反复查看结果及多版本比较,也需要调整分析方法或采用预先规划的序贯方法。
当每个版本都有足够的预期转化数及未转化数时,正态近似效果最好。结果非常稀少时,可能需要Fisher精确检验或其他精确方法。统计显著性也无法防范埋点错误、新奇效应、样本比例失配、机器人流量或测试期间发生的变化。决定全面上线前,应将本结果与置信区间、护栏指标、实际效应阈值及实验质量审查结合使用。
A/B测试示例
| 访客数与转化数 | 转化率与p值 | α = 0.05时的结论 |
|---|---|---|
| A: 1,000/100; B: 1,000/140 | 10.00% 对比 14.00%;p ≈ 0.006 | 显著提升 |
| A: 500/50; B: 500/54 | 10.00% 对比 10.80%;p ≈ 0.676 | 不显著 |
| A: 2,000/300; B: 2,000/270 | 15.00% 对比 13.50%;p ≈ 0.176 | 观测到下降,但不显著 |
如何计算A/B测试显著性
- 输入分配到版本A的访客数及已完成的转化数。
- 输入版本B对应的访客数与转化数。
- 选择“计算显著性”,运行合并比例的双比例z检验。
- 做出决定前,查看转化率、提升幅度、p值及实际意义。
常见问题
p值达到多少才具有统计显著性?
常用阈值为0.05,前提是在实验开始前选定。决策阈值应体现测试计划、风险及多重比较所需的校正。
什么是相对提升?
相对提升等于(B转化率 − A转化率)除以A转化率,描述的是相对变化,应结合绝对百分点差一起考虑。
显著性是否证明版本B更好?
不能。显著性量化的是在模型假设下反对两组转化率相同的证据。数据质量、实验设计、置信区间和实际价值仍然重要。
p值一低于0.05就可以停止A/B测试吗?
反复查看结果,并在首次显著时停止,会增加假阳性。请使用固定样本计划或有效的序贯检验方法。
什么情况下不宜使用z检验?
转化数或未转化数很少时,正态近似可能不可靠。对于稀疏数据,精确检验或专门分析更合适。