Калькулятор точности классификации

Рассчитайте долю верных ответов, точность, полноту, специфичность и F1 по матрице ошибок бинарной классификации.

Метрики классификации
Введите четыре количества из матрицы ошибок для оценки бинарного классификатора.

О точности классификации

Доля верных ответов, или accuracy, показывает, какую часть всех предсказаний модель классифицировала правильно. Для расчёта складывают истинно положительные и истинно отрицательные результаты и делят сумму на все наблюдения матрицы ошибок. Метрика понятна интуитивно, но редко должна интерпретироваться отдельно. При дисбалансе классов модель может почти всегда предсказывать наиболее частый класс и показывать высокую долю верных ответов, пропуская самые важные случаи. Поэтому калькулятор выводит пять взаимодополняющих метрик бинарной классификации. Точность, или precision, — доля действительно положительных случаев среди предсказанных положительных: TP, делённое на сумму TP и FP. Полнота, также называемая чувствительностью, — доля реальных положительных случаев, найденных моделью: TP, делённое на сумму TP и FN. Специфичность оценивает распознавание отрицательных случаев: TN, делённое на сумму TN и FP. F1-мера — гармоническое среднее точности и полноты, поэтому она поощряет их баланс, а не рост одной за счёт другой. Начните с представления результатов оценки в виде матрицы ошибок. Истинно положительный результат — положительный случай, правильно предсказанный как положительный. Ложноположительный — отрицательный случай, ошибочно предсказанный как положительный. Истинно отрицательный — отрицательный случай, правильно предсказанный как отрицательный; ложноотрицательный — положительный случай, пропущенный классификатором. Все четыре значения должны быть количествами из одного тестового набора при одном пороге решения. Смешивание процентов, обучающих наблюдений или результатов разных порогов делает метрики некорректными. Приоритет метрик зависит от задачи. В медицинском скрининге пропуск заболевания может дорого обойтись, поэтому полноте часто уделяют больше внимания. В спам-фильтрах или автоматическом применении санкций дорогими могут быть ложные обвинения, что делает точность важной. Специфичность полезна, когда важно правильно исключать отрицательные случаи. Сравнивайте метрики на одном наборе данных, изучайте доли классов и учитывайте доверительные интервалы, прежде чем объявлять модель лучшей. Калькулятор даёт детерминированные точечные оценки для быстрого анализа, документации и сравнения порогов; он не заменяет проверку на репрезентативных данных.

Примеры расчёта точности классификации

Матрица ошибокОсновные результатыИнтерпретация
TP 80, FP 20, TN 90, FN 10Доля верных ответов 85.00%; F1 84.21%Хорошее, достаточно сбалансированное качество
TP 50, FP 0, TN 50, FN 0Все метрики 100.00%Идеальная классификация на этой выборке
TP 10, FP 5, TN 180, FN 5Доля верных ответов 95.00%; полнота 66.67%Высокая доля верных ответов скрывает пропуски положительных случаев

Как рассчитать метрики классификации

  1. Подсчитайте истинно положительные и ложноположительные результаты оцениваемых предсказаний.
  2. Подсчитайте истинно отрицательные и ложноотрицательные результаты из того же набора данных.
  3. Введите все четыре неотрицательных количества в соответствующие поля.
  4. Нажмите «Рассчитать метрики» и сравните долю верных ответов с точностью, полнотой, специфичностью и F1.

Частые вопросы

Какая доля верных классификаций считается хорошей?

Это зависит от баланса классов, базового качества и цены каждой ошибки. Сравните результат с простым базовым решением и изучите остальные метрики, прежде чем оценивать модель.

Почему доля верных ответов может вводить в заблуждение?

Она одинаково учитывает каждое правильное предсказание и может определяться большим преобладающим классом. Модель способна показывать высокое значение, обнаруживая очень мало случаев редкого класса.

Чем отличаются точность и полнота?

Точность показывает, сколько предсказанных положительных случаев были верными. Полнота показывает, сколько реальных положительных случаев классификатор сумел найти.

Когда использовать F1-меру?

Используйте F1, когда важны и ложноположительные, и ложноотрицательные ошибки и нужна одна сбалансированная метрика. Она не учитывает истинно отрицательные случаи, поэтому также смотрите долю верных ответов и специфичность.

Можно ли вводить проценты вместо количества?

По возможности вводите количества: у всех ячеек должен быть общий знаменатель. Пропорциональные значения подходят только при едином масштабе и представлении полной матрицы ошибок.