Calculateur du coefficient de corrélation de Matthews

Évaluez un classifieur binaire à partir de sa matrice de confusion : MCC, exactitude, précision, rappel et spécificité.

Calculer la corrélation de Matthews
Saisissez les quatre effectifs entiers positifs ou nuls d'une matrice de confusion binaire.

À propos du coefficient de corrélation de Matthews

Le coefficient de corrélation de Matthews, ou MCC, résume la performance d'une classification binaire en un seul score. Il combine toutes les cases de la matrice de confusion : vrais positifs, vrais négatifs, faux positifs et faux négatifs. Contrairement à l'exactitude, il reste informatif lorsqu'une classe est beaucoup plus fréquente que l'autre, ce qui le rend utile pour la détection de fraude, le dépistage médical, la détection d'anomalies et d'autres problèmes déséquilibrés. Le MCC varie de moins un à plus un. Plus un indique une classification parfaite, zéro une absence de corrélation nette entre prédictions et résultats, et moins un un désaccord total où les prédictions sont systématiquement inversées. Les valeurs intermédiaires doivent être interprétées selon le coût des erreurs, l'équilibre des classes et le seuil opérationnel, plutôt qu'avec une étiquette universelle de qualité. Le numérateur est le produit des vrais positifs et des vrais négatifs, moins celui des faux positifs et des faux négatifs. Le dénominateur est la racine carrée du produit de quatre totaux marginaux : positifs prédits, positifs réels, négatifs réels et négatifs prédits. Cette structure rend le MCC équivalent à une corrélation de Pearson entre étiquettes binaires observées et prédites. Si un total marginal requis est nul, le dénominateur mathématique est nul et le coefficient est indéfini. Le calculateur fournit aussi des indicateurs complémentaires courants. L'exactitude est la proportion de tous les cas correctement classés. La précision est la proportion de prédictions positives qui sont de vrais positifs. Le rappel, aussi appelé sensibilité, est la proportion de positifs réels détectés. La spécificité est la proportion de négatifs réels correctement rejetés. Ces mesures répondent à des questions différentes ; les examiner avec le MCC révèle si une bonne performance globale masque une faiblesse propre à une classe. Construisez toujours la matrice avec une classe positive clairement définie et un seuil fixe. Inverser les étiquettes positive et négative modifie précision, rappel et spécificité, tandis que le MCC reste identique si les étiquettes réelles et prédites sont inversées simultanément. Les effectifs doivent provenir de données non utilisées pour ajuster le modèle, de préférence un jeu de test représentatif ou des prédictions de validation croisée correctement construites. Le MCC est particulièrement utile pour comparer des classifieurs sur le même échantillon d'évaluation, mais l'incertitude reste importante. Un petit jeu de test peut produire un score instable, et les changements de distribution peuvent invalider les performances passées. Avant de choisir ou déployer un modèle, utilisez ce résultat avec des intervalles de confiance, des contrôles par sous-groupe, une analyse de calibration et les conséquences concrètes des faux positifs et faux négatifs.

Exemples de MCC

Ces matrices illustrent des classifieurs parfaits, utiles et inversés.

Matrice de confusionMCCInterprétation
TP 50, TN 50, FP 0, FN 01.000000Tous les cas sont correctement classés.
TP 90, TN 80, FP 10, FN 200.703526Les deux classes sont bien traitées, avec quelques positifs manqués et fausses alertes.
TP 0, TN 0, FP 50, FN 50-1.000000Chaque prédiction est l'inverse de la classe réelle.

Comment calculer le MCC

  1. Définissez la classe positive et construisez une matrice de confusion à partir des prédictions d'évaluation.
  2. Saisissez les effectifs de vrais positifs, vrais négatifs, faux positifs et faux négatifs.
  3. Sélectionnez Calculer le MCC pour obtenir le coefficient et les pourcentages complémentaires.
  4. Comparez le MCC à la précision, au rappel, à la spécificité, à la fréquence des classes et au coût concret de chaque erreur.

Questions sur la corrélation de Matthews

Pourquoi utiliser le MCC plutôt que l'exactitude ?

L'exactitude peut sembler élevée lorsqu'une classe majoritaire domine l'échantillon. Le MCC utilise les quatre cases de la matrice et pénalise les prédictions favorisant une seule classe.

Que signifie un MCC négatif ?

Les prédictions sont inversement associées aux vraies étiquettes. Un classifieur très négatif pourrait s'améliorer en inversant toutes ses prédictions, mais il faut d'abord examiner sa chaîne de traitement.

Le MCC peut-il être indéfini ?

Oui, le dénominateur est nul lorsqu'une marge requise de prédiction ou de résultat est vide. Le calculateur le signale plutôt que d'inventer un score trompeur.

Le MCC convient-il aux modèles multiclasses ?

Ce calculateur applique la formule binaire standard. Des définitions généralisées multiclasses existent, mais exigent la matrice de confusion multiclasse complète.

Le MCC choisit-il un seuil de classification ?

Non, il évalue les effectifs produits au seuil choisi. Comparez les seuils pertinents et choisissez selon les données de validation et le coût des erreurs.