返回首页

分类评估指标入门:准确率、精确率、召回率与 F1 到底在看什么

2026年10月8日 08:02来源: 润百AI0 条留言技术教程

准确率为什么常常“骗人”

训练一个分类模型后,最直觉的指标是准确率(Accuracy):预测对的样本占比。但当样本极度不平衡时,它会严重误导。比如 1000 个样本里只有 10 个是“患病”,模型只要一律预测“健康”,准确率就高达 99%,却一个病人都找不出来。

混淆矩阵:一切指标的起点

要看清模型到底错在哪,先看混淆矩阵:真正例(TP)、假正例(FP)、真负例(TN)、假负例(FN)四个格子,几乎所有分类指标都由它们的组合定义。

  • 精确率(Precision)= TP / (TP + FP):预测为“正”的里面,有多少是真的正。关注“别冤枉好人”时用它。
  • 召回率(Recall)= TP / (TP + FN):真正的正例里,有多少被找了出来。关注“别漏掉坏人”时用它。
  • F1 = 2·P·R / (P + R):精确率与召回率的调和平均,用来在两者之间取平衡。

精确率与召回率的取舍

两者往往此消彼长。把判定为正的门槛调低,召回率上升但精确率下降;门槛调高则相反。选哪个为主,取决于业务:垃圾邮件过滤宁可放行、不可错杀(偏精确率);疾病筛查宁可不漏、可以多复查(偏召回率)。

ROC 与 AUC:换个角度看排序能力

ROC 曲线把不同阈值下的真正例率(TPR)与假正例率(FPR)画在一起,曲线下的面积就是 AUC。AUC 衡量的是模型把正样本排在负样本前面的整体能力,与阈值无关;在类别极不平衡时,PR 曲线(精确率-召回率曲线)往往比 ROC 更能反映真实表现。

小结

没有放之四海皆准的“好指标”。先想清楚业务最怕哪种错误——是误报还是漏报,再据此选择指标,并在阈值上做取舍,评估才不会停留在漂亮的数字上。

【参考来源】综合整理自公开发布的机器学习教材与行业技术资料。

机器学习

AI 圆桌讨论

Introduction to Classification Evaluation Indicators: Accuracy, Precision, Recall, and F1. What are they really looking at

主题

  • 考察准确率、精确率、召回率和 F1,不仅将它们视为公式,更将它们视为观察分类器行为的透镜,尤其是在类别不平衡的情况下。
  • 核心问题:这些指标是模型的属性,还是涉及模型、阈值、人群、成本、反馈和标签的部署的属性?

要点

  • 准确率衡量总体正确性。当一个类别占主导时,它会具有误导性:在欺诈检测中,99.8% 的交易是正常的,一个全判为正常的分类器得分是 99.8% 准确率,但捕获的欺诈为零。在罕见病筛查中,99% 的准确率可能意味着漏掉大多数患者。
  • 准确率作为平凡基线仍有用,但必须辅以基线、置信区间和原始计数。
  • 精确率问的是:在被预测为正的样本中,有多少是正确的?它取决于流行率,并且对误报和人群偏移敏感。
  • 召回率问的是:在实际为正的样本中,有多少被找到?当假阴性代价高昂时,这很重要;欺诈召回率低意味着对罕见正类视而不见。
  • F1 是精确率和召回率的调和平均数。它忽略真阴性,并对精确率和召回率同等加权。它很简洁,但掩盖了有争议的权衡和流行率影响。
  • 指标描述的是一个三元组:模型 + 阈值 + 人群。同一个分类器在不同的医院或欺诈季节可能表现出不同的精确率和召回率。
  • 指标会反馈:一旦以召回率为目标,阈值就会被调整;一个成功的欺诈检测器可能会阻止欺诈,降低流行率和精确率,于是成功可能看起来像失败。
  • 精确率和召回率成长于信息检索领域,在那里真阴性实际上无法计数。F1 的盲点是其生境特有的,并非纯粹伦理问题。
  • 真实标签可能由系统制造:欺诈标签来自往往由警报触发的调查;筛查标签来自阳性筛查后的活检。评估在模型最重要之处可能最不可信。
  • 更好的评估包括成本、校准、原始计数、警报量、漏掉的欺诈金额、警报疲劳、留出期、随机对照和反馈回路。

主要分歧

  • 准确率:热衷者说,它只有在类别平衡且成本对称时才有用。怀疑者说,它回答的是一个狭窄的问题,单看并不具有误导性;脱离基线和计数来报告它才是错误。
  • F1:热衷者将其视为实用的警钟。怀疑者则认为它是虚假的安慰:它把有争议的权衡压缩成一个可优化的数字,并忽略真阴性。
  • 成本判断:怀疑者认为,偏向假阴性而不是假阳性是一种成本决策,而不是指标事实。精确率和召回率只是切分混淆矩阵。
  • 决策感知评估:热衷者想要校准后的概率,加上决策影响和反馈回路。怀疑者要求反事实证据,指出仪表盘可以被操纵,标签有延迟,而且政策变化后校准会失效。
  • 真实标签:观察者说,混淆矩阵假定存在外部标签,但标签往往与模型和机构相呼应。其他人关注部署和反馈;观察者说,衡量标准本身依赖于工具。
  • 模型与部署:热衷者部分接受三元组,但为指标辩护。观察者坚持认为,对象是部署的轨迹,而不是静态分类器。

结论

  • 没有任何指标天生就是“要紧之事”。准确率衡量总体正确性;精确率衡量正类预测可靠性;召回率衡量正类覆盖度;F1 在忽略真阴性的同时平衡两者。
  • 在不平衡情况下,准确率可能空洞无物。精确率和召回率揭示错误类型,但取决于流行率和阈值。F1 进行概括,但不做决定。
  • 指标不仅是描述性的:它们塑造阈值、激励、流行率、标签和表面上的成功。
  • 稳健的评估应结合原始计数、基线、置信区间、成本曲线、校准、流行率监测、反事实证据,以及对标签生成的审查。把评估视为动态的、特定于人群的、决策感知的,而不是一个单一分数。
留言讨论

留言 (0)

暂无留言,来写第一条吧

发表留言