分类准确率计算器
根据二分类混淆矩阵计算准确率、精确率、召回率、特异度和F1分数。
分类评估指标
输入混淆矩阵中的四个计数,评估二分类器。
关于分类准确率
分类准确率衡量模型正确分类的预测占全部预测的比例。计算时将真正例和真负例相加,再除以混淆矩阵中的总样本数。准确率直观易懂,但通常不应单独解读。当类别不平衡时,模型即使几乎总是预测为多数类,也可能获得很高的准确率,却无法识别最重要的样本。
因此,本计算器提供五个互补的二分类指标。精确率是预测为正例的样本中实际为正例的比例,计算式为TP除以TP加FP。召回率也称敏感度,表示实际正例中被模型找出的比例,计算式为TP除以TP加FN。特异度衡量模型识别负例的能力,即TN除以TN加FP。F1分数是精确率和召回率的调和平均数,鼓励两者兼顾,而不是牺牲其中一个来提高另一个。
首先将评估结果整理成混淆矩阵。真正例是被正确预测为正例的正样本;假正例是被错误预测为正例的负样本;真负例是被正确预测为负例的负样本;假负例是被分类器漏掉的正样本。四项都必须是来自同一测试集、同一决策阈值的计数。混用百分比、训练样本或不同阈值下的结果,会使指标失效。
指标的重要性取决于应用场景。医学筛查中,漏诊可能代价高昂,因此召回率往往更受关注。垃圾邮件过滤或自动违规处置中,误判可能带来较大损失,因此精确率很重要。需要正确排除负例时,特异度很有用。在认定某个模型更优之前,应在同一数据集上比较指标、查看类别占比,并考虑置信区间。本计算器提供确定性的点估计,方便快速分析、记录和阈值比较,但不能替代在有代表性的数据上进行验证。
准确率计算示例
| 混淆矩阵 | 主要结果 | 解读 |
|---|---|---|
| TP 80, FP 20, TN 90, FN 10 | 准确率85.00%;F1 84.21% | 表现较好且相对均衡 |
| TP 50, FP 0, TN 50, FN 0 | 所有指标均为100.00% | 在该样本上实现完全正确的分类 |
| TP 10, FP 5, TN 180, FN 5 | 准确率95.00%;召回率66.67% | 高准确率掩盖了漏掉的正例 |
如何计算分类指标
- 统计待评估预测中的真正例和假正例数量。
- 统计同一数据集中的真负例和假负例数量。
- 在对应字段中输入四个非负计数。
- 选择“计算指标”,将准确率与精确率、召回率、特异度和F1分数进行比较。
常见问题
分类准确率达到多少才算好?
这取决于类别是否平衡、基线表现以及各类错误的代价。评价模型前,应与简单基线比较,并查看其他指标。
为什么准确率可能具有误导性?
准确率对每个正确预测赋予相同权重,可能被占比很大的多数类主导。模型可能准确率很高,却只能识别极少数少数类样本。
精确率与召回率有什么区别?
精确率关注预测为正例的样本中有多少是正确的。召回率关注实际正例中有多少被分类器成功找出。
什么时候应该使用F1分数?
当假正例和假负例都很重要,且希望用一个指标体现两者的平衡时,可使用F1。它不考虑真负例,因此还应查看准确率和特异度。
可以输入百分比而不是计数吗?
应尽量使用计数,因为所有单元格必须使用相同分母。只有在缩放一致且代表完整混淆矩阵时,比例值才适用。