分类准确率计算器

根据二分类混淆矩阵计算准确率、精确率、召回率、特异度和F1分数。

分类评估指标
输入混淆矩阵中的四个计数,评估二分类器。

关于分类准确率

分类准确率衡量模型正确分类的预测占全部预测的比例。计算时将真正例和真负例相加,再除以混淆矩阵中的总样本数。准确率直观易懂,但通常不应单独解读。当类别不平衡时,模型即使几乎总是预测为多数类,也可能获得很高的准确率,却无法识别最重要的样本。 因此,本计算器提供五个互补的二分类指标。精确率是预测为正例的样本中实际为正例的比例,计算式为TP除以TP加FP。召回率也称敏感度,表示实际正例中被模型找出的比例,计算式为TP除以TP加FN。特异度衡量模型识别负例的能力,即TN除以TN加FP。F1分数是精确率和召回率的调和平均数,鼓励两者兼顾,而不是牺牲其中一个来提高另一个。 首先将评估结果整理成混淆矩阵。真正例是被正确预测为正例的正样本;假正例是被错误预测为正例的负样本;真负例是被正确预测为负例的负样本;假负例是被分类器漏掉的正样本。四项都必须是来自同一测试集、同一决策阈值的计数。混用百分比、训练样本或不同阈值下的结果,会使指标失效。 指标的重要性取决于应用场景。医学筛查中,漏诊可能代价高昂,因此召回率往往更受关注。垃圾邮件过滤或自动违规处置中,误判可能带来较大损失,因此精确率很重要。需要正确排除负例时,特异度很有用。在认定某个模型更优之前,应在同一数据集上比较指标、查看类别占比,并考虑置信区间。本计算器提供确定性的点估计,方便快速分析、记录和阈值比较,但不能替代在有代表性的数据上进行验证。

准确率计算示例

混淆矩阵主要结果解读
TP 80, FP 20, TN 90, FN 10准确率85.00%;F1 84.21%表现较好且相对均衡
TP 50, FP 0, TN 50, FN 0所有指标均为100.00%在该样本上实现完全正确的分类
TP 10, FP 5, TN 180, FN 5准确率95.00%;召回率66.67%高准确率掩盖了漏掉的正例

如何计算分类指标

  1. 统计待评估预测中的真正例和假正例数量。
  2. 统计同一数据集中的真负例和假负例数量。
  3. 在对应字段中输入四个非负计数。
  4. 选择“计算指标”,将准确率与精确率、召回率、特异度和F1分数进行比较。

常见问题

分类准确率达到多少才算好?

这取决于类别是否平衡、基线表现以及各类错误的代价。评价模型前,应与简单基线比较,并查看其他指标。

为什么准确率可能具有误导性?

准确率对每个正确预测赋予相同权重,可能被占比很大的多数类主导。模型可能准确率很高,却只能识别极少数少数类样本。

精确率与召回率有什么区别?

精确率关注预测为正例的样本中有多少是正确的。召回率关注实际正例中有多少被分类器成功找出。

什么时候应该使用F1分数?

当假正例和假负例都很重要,且希望用一个指标体现两者的平衡时,可使用F1。它不考虑真负例,因此还应查看准确率和特异度。

可以输入百分比而不是计数吗?

应尽量使用计数,因为所有单元格必须使用相同分母。只有在缩放一致且代表完整混淆矩阵时,比例值才适用。