A/B測試計算機

透過雙比例z檢定、p值與相對提升幅度,比較兩組轉換率。

A/B測試顯著性
輸入對照版本與測試版本的訪客數及轉換數。
版本A(對照組)
版本B(測試組)

關於A/B測試顯著性

A/B測試將條件相近的訪客隨機分派至對照體驗及替代體驗,再衡量預先定義的結果,例如購買、註冊、點擊或完成任務。本計算機使用合併比例的雙比例z檢定,比較兩個二元轉換率,提供各組轉換率、相對提升幅度、z分數、雙尾p值,以及結果是否達到慣用的0.05顯著性門檻。 每個版本的轉換率等於轉換數除以訪客數。在兩個版本真實轉換率相同的虛無假設下,計算機會合併兩組樣本的轉換數,以合併轉換率估計差異的標準誤,再將觀察到的轉換率差除以標準誤,得到z分數。雙尾p值衡量的是:若虛無假設成立,出現至少這麼大差異的結果有多罕見。 p值低於0.05通常稱為在百分之九十五的信心水準下具有統計顯著性。這不代表測試版本有百分之九十五的機率更好,也不衡量變更的商業價值。相對提升是將轉換率差與對照組轉換率比較,絕對提升則只是B轉換率減去A轉換率。幅度雖小但統計上可靠的提升,在大規模應用時可能很有價值;樣本較少時,即使觀察到很大的提升,也可能仍不確定。 有效的推論取決於實驗設計。應隨機分派使用者、維持分組穩定,避免重複計算同一獨立單位,在查看結果前選定主要指標,並讓實驗持續足夠長的時間,以涵蓋正常週期。一出現顯著性就停止會提高偽陽性風險。多個指標、反覆查看結果及多版本比較,也需要調整分析方式或採用預先規劃的序列方法。 每個版本都有足夠的預期轉換數與未轉換數時,常態近似效果最好。結果非常稀少時,可能需要費雪精確檢定或其他精確方法。統計顯著性也無法防範追蹤設定錯誤、新奇效應、樣本比例失配、機器人流量或測試期間的變動。決定全面推出前,應搭配信賴區間、護欄指標、實際效果門檻及實驗品質檢視來運用結果。

A/B測試範例

訪客數與轉換數轉換率與p值α = 0.05時的結論
A: 1,000/100; B: 1,000/14010.00% 對比 14.00%;p ≈ 0.006顯著提升
A: 500/50; B: 500/5410.00% 對比 10.80%;p ≈ 0.676未達顯著
A: 2,000/300; B: 2,000/27015.00% 對比 13.50%;p ≈ 0.176觀察到下降,但未達顯著

如何計算A/B測試顯著性

  1. 輸入分派至版本A的訪客數與已完成的轉換數。
  2. 輸入版本B對應的訪客數與轉換數。
  3. 選擇「計算顯著性」,執行合併比例的雙比例z檢定。
  4. 決策前,檢視轉換率、提升幅度、p值及實際重要性。

常見問題

p值多少才具有統計顯著性?

常見門檻為0.05,前提是在實驗前選定。決策門檻應反映測試計畫、風險,以及多重比較所需的校正。

什麼是相對提升?

相對提升等於(B轉換率 − A轉換率)除以A轉換率,描述相對變化,應搭配絕對百分點差一起考量。

顯著性能證明版本B較好嗎?

不能。顯著性量化的是在模型假設下,反對兩組轉換率相同的證據。資料品質、實驗設計、信賴區間與實際價值仍然重要。

p值一低於0.05就能停止A/B測試嗎?

反覆查看並在首次顯著時停止,會增加偽陽性。請採用固定樣本計畫或有效的序列檢定方法。

何時應避免使用z檢定?

轉換數或未轉換數極少時,常態近似可能不可靠。稀疏資料較適合使用精確檢定或專門分析。