A/Bテスト計算ツール
2標本比率のz検定、p値、相対改善率で2つのコンバージョン率を比較します。
A/Bテストの有意性
対照版とテスト版の訪問者数とコンバージョン数を入力してください。
A/Bテストの有意性について
A/Bテストでは、比較可能な訪問者を対照の体験と別の体験に無作為に割り当て、購入、登録、クリック、タスク完了など、事前に定めた結果を測定します。この計算ツールは、プールした比率を用いる2標本比率のz検定で、2つの二値コンバージョン率を比較します。各率、相対改善率、zスコア、両側p値、一般的な有意水準0.05の基準を満たすかどうかを表示します。
各バリエーションのコンバージョン率は、コンバージョン数を訪問者数で割った値です。両者の真の率が等しいという帰無仮説の下で、2つの標本のコンバージョンを合算します。そのプールした率から差の標準誤差を推定し、観測された率の差を標準誤差で割ってzスコアを求めます。両側p値は、帰無仮説が正しい場合に、少なくとも観測値と同程度に大きな差がどれほど珍しいかを表します。
p値が0.05未満の場合、通常は信頼水準九十五パーセントで統計的に有意と表現されます。これはテスト版が優れている確率が九十五パーセントという意味ではなく、変更の事業価値を測るものでもありません。相対改善率は率の差を対照の率と比較した値で、絶対改善幅はBの率からAの率を引いた値です。小さくても統計的に信頼できる改善は大規模な運用で大きな価値を持つ一方、標本が少なければ大きな改善が見えても不確実なままの場合があります。
妥当な推論には実験設計が重要です。ユーザーを無作為に割り当て、その割り当てを維持し、同じ独立単位を重複計上せず、結果を見る前に主要指標を決め、通常の周期を捉えられる期間実施してください。有意になった時点で毎回終了すると、偽陽性のリスクが高まります。複数指標、繰り返しの途中確認、多数のバリエーション比較では、調整した分析または事前に計画した逐次的手法が必要です。
正規近似は、各バリエーションでコンバージョンと非コンバージョンの期待数が十分な場合に最もよく機能します。結果が非常に少ない場合は、フィッシャーの正確検定などの正確な手法が必要になることがあります。統計的有意性は、計測の誤り、新奇性効果、標本比率の不一致、ボット流入、テスト中の変化を防ぎません。展開を決める前に、信頼区間、ガードレール指標、実用的な効果の基準、実験品質の確認と併せて結果を使ってください。
A/Bテストの例
| 訪問者数とコンバージョン数 | 率とp値 | α = 0.05での結論 |
|---|---|---|
| A: 1,000/100; B: 1,000/140 | 10.00% 対 14.00%;p ≈ 0.006 | 有意な改善 |
| A: 500/50; B: 500/54 | 10.00% 対 10.80%;p ≈ 0.676 | 有意差なし |
| A: 2,000/300; B: 2,000/270 | 15.00% 対 13.50%;p ≈ 0.176 | 低下は見られるが有意差なし |
A/Bテストの有意性を計算する方法
- バリエーションAに割り当てた訪問者数と完了したコンバージョン数を入力します。
- バリエーションBの対応する訪問者数とコンバージョン数を入力します。
- 「有意性を計算」を選び、プールした比率による2標本比率のz検定を実行します。
- 判断する前に、コンバージョン率、改善率、p値、実務上の重要性を確認します。
よくある質問
統計的に有意となるp値はいくつですか?
実験前に定める基準として0.05が一般的です。判断基準にはテスト計画、リスク、多重比較の補正を反映させてください。
相対改善率とは何ですか?
相対改善率は(Bの率 − Aの率)をAの率で割った値です。比例的な変化を表すため、絶対的なパーセントポイント差と併せて考えます。
有意性はバリエーションBが優れている証拠ですか?
いいえ。有意性はモデルの仮定の下で、率が等しいという仮説に反する証拠を定量化します。データ品質、実験設計、信頼区間、実用的価値も重要です。
pが0.05未満になったらすぐ終了できますか?
繰り返し確認し、初めて有意になった時点で終了すると偽陽性が増えます。固定標本数の計画または妥当な逐次検定法を使ってください。
z検定を避けるべきなのはどんな場合ですか?
コンバージョン数または非コンバージョン数が極めて少ないと、正規近似は信頼できないことがあります。疎なデータには正確検定や専門的な分析が適しています。