馬修斯相關係數計算機

依混淆矩陣,以 MCC、準確率、精確率、召回率與特異度評估二元分類器。

計算馬修斯相關係數
輸入二元混淆矩陣中的四個非負整數計數。

關於馬修斯相關係數

馬修斯相關係數簡稱 MCC,以單一分數概括二元分類表現。它納入混淆矩陣的所有格子:真陽性、真陰性、偽陽性與偽陰性。不同於準確率,當某一類別遠多於另一類時,這個指標仍具有參考價值,因此適合詐欺偵測、醫療篩檢、異常偵測及其他類別不平衡問題。 MCC 範圍從負一到正一。正一表示分類完全正確,零表示預測與實際結果沒有淨相關性,負一表示完全不一致,也就是預測系統性地相反。中間值應搭配錯誤成本、類別平衡及使用的門檻解讀,不宜套用單一的品質標籤。 分子是真陽性乘以真陰性,再減去偽陽性乘以偽陰性。分母是四個邊際總數乘積的平方根:預測陽性、實際陽性、實際陰性與預測陰性。此結構使 MCC 等同於觀測與預測二元標籤之間的皮爾森相關係數。只要任何必要邊際總數為零,數學分母就為零,係數因此未定義。 計算機也提供常用的輔助指標。準確率是所有案例中正確分類的比例。精確率是陽性預測中真陽性的比例。召回率又稱敏感度,是實際陽性中被偵測出的比例。特異度是實際陰性中被正確判為陰性的比例。這些指標回答不同問題,搭配 MCC 查看可揭露看似良好的整體表現是否掩蓋特定類別的弱點。 建立混淆矩陣時,應清楚定義陽性類別並固定分類門檻。交換正負類別標籤會改變精確率、召回率與特異度,但同時重新標記實際及預測類別時,MCC 本身不變。計數應來自未用於模型擬合的資料,最好是具代表性的測試集,或正確建立的交叉驗證預測。 在相同評估樣本上比較候選分類器時,MCC 特別有用,但仍須考量不確定性。小型測試集可能產生不穩定分數,分布偏移也可能使歷史表現失去效力。選擇或部署模型前,請結合信賴區間、子群檢查、校準分析,以及偽陽性與偽陰性的實際後果來解讀結果。

MCC 範例

這些混淆矩陣示範完美、有效與反向的分類器。

混淆矩陣MCC解讀
TP 50, TN 50, FP 0, FN 01.000000每個案例都分類正確。
TP 90, TN 80, FP 10, FN 200.703526兩個類別皆表現良好,但仍有部分漏判陽性與誤報。
TP 0, TN 0, FP 50, FN 50-1.000000每個預測都與真實類別相反。

如何計算 MCC

  1. 確認哪種結果屬於陽性類別,並以評估預測建立混淆矩陣。
  2. 輸入真陽性、真陰性、偽陽性與偽陰性計數。
  3. 選取「計算 MCC」,取得係數與輔助效能百分比。
  4. 搭配精確率、召回率、特異度、類別占比及各種錯誤的實際成本比較 MCC。

馬修斯相關係數常見問題

為何使用 MCC 而非準確率?

當多數類別占樣本大部分時,準確率可能看起來很高。MCC 納入混淆矩陣的四個格子,並對偏向單一類別的預測扣分。

MCC 為負值代表什麼?

代表預測與真實標籤呈負相關。強烈負相關的分類器可能在反轉所有預測後改善,但應先調查其處理流程。

MCC 可能未定義嗎?

會。若必要的預測或實際結果邊際總數為零,分母就為零。計算機會回報此情況,而非產生誤導分數。

MCC 適用於多類別模型嗎?

本計算機採標準二元公式。確實存在廣義多類別 MCC 定義,但需要完整的多類別混淆矩陣。

MCC 會選擇分類門檻嗎?

不會,它評估您選定門檻下產生的計數。請比較相關門檻的結果,並依驗證資料與錯誤成本選擇。