跳到主内容
智客 ZICQ

智客百科 AI 概念

模型校准 (Calibration)

AI 概念
别名: 模型校准 Calibration 校准 Reliability ·2026-09-19

模型校准 (Calibration)

校准 是衡量"模型自报的置信度是否真实反映其准确率"的指标。一个 完美校准的模型说"我有 80% 把握",就意味着它在 100 次这种判断里真的 有 80 次是对的。

校准是 AI 自动化的关键前提:如果模型对自己的判断没把握, 下游代码就不能安全地用阈值决定"什么时候自动执行 / 什么时候交给人"。 校准好的模型可以组成可组合的自动化流水线;校准差的模型只能停在 "copilot 给人提建议"的角色里。

核心指标

  • Reliability Diagram:横轴是模型报的置信度分桶,纵轴是真实准确率, 完美校准是一条对角线
  • Expected Calibration Error (ECE):分桶预测概率与实际准确率差的加权平均
  • Brier Score:概率预测的均方误差,越小越好
  • AUROC:二分类时衡量排序能力,与 ECE 互补

典型失败模式

  • 过自信 (overconfident):模型永远说 95%+,实际准确率只有 70% —— RLHF 的典型副作用,因为人类偏好"自信有把握"的回答
  • 欠自信 (underconfident):模型说"50% 把握",实际准确率 90% —— 罕见,通常是训练早期或温度采样过高
  • 不一致:相似输入给相差很大的概率(缺乏 smoothing)

三种训练路线对比

路线 优化目标 校准表现
RLHF 人类偏好 通常差——偏好"自信回答"导致系统性过自信
RLVR 可验证奖励(数学、代码) 中等——能答对的问题校准好,答错的概率失真
RLCD(TypeSafe AI 提出) 校准过的概率 专门为校准设计,模型报告的置信度就是真实准确率

为什么重要

  • 自动化阈值:置信度 > 0.9 自动执行,< 0.5 转人工——前提是阈值可信
  • Agent 路由:用便宜的模型判断"该用哪个大模型",需要校准好的判别器
  • 模型监控:判断"模型今天跑偏了吗"靠比较预测置信度 vs 真实表现
  • AI 安全:校准差的模型在危险任务里"自信地错"——自动驾驶、医疗、法律
  • 可组合性:校准好的小模型组合起来能超过单一昂贵大模型

落地方法

  • Temperature scaling:训练后用 Platt scaling 把 logits 重新校准
  • Conformal prediction:用历史校准误差构造置信区间(分布自由保证)
  • 重新训练:直接用 calibration loss(如 label smoothing)训练
  • 选模型:评估时不仅看 accuracy,也看 ECE / Brier Score