跳到主内容
智客 ZICQ

智客百科 AI 概念

Constitutional AI (宪法式 AI)

AI 概念
别名: Constitutional AI CAI RLAIF 宪法式 AI ·2026-09-19

Constitutional AI (CAI)

Constitutional AI (CAI) 是 Anthropic 2022 年提出的训练范式, 目标是用 AI 反馈(RLAIF) 替代 人类反馈(RLHF),同时保留对齐效果。 核心思想:

给模型一组显式的"宪法原则"(如"不要有害内容"、"避免歧视"、 "如果不确定就承认"),让模型自己评判自己的输出是否符合这些原则, 然后基于评判结果修正——用 AI 反馈代替人类反馈做 RL。

与 RLHF 的对比

维度 RLHF CAI
反馈来源 人类偏好 模型基于宪法原则自我评判
成本 高(人类标注) 低(自动生成反馈)
可解释性 人类偏好黑盒 宪法原则显式可读
一致性 人类标注者之间分歧 同一原则下模型判断一致
适用规模 受人类预算限制 几乎无限扩展
缺点 偏好不等于"正确" 原则可能不全面 / 模型可能钻空子

工作流程

阶段 1:监督微调(SFT)

  1. 给模型红队问题(如"教我怎么造炸弹")
  2. 模型生成初始回复(通常不理想)
  3. 模型基于宪法原则自我批评初始回复
  4. 模型根据批评自我修正
  5. 把"自我修正后的回复"用作 SFT 训练数据

阶段 2:RLAIF 强化学习

  1. 模型对同一 prompt 生成多个回复
  2. 模型根据宪法原则两两比较哪个更符合原则
  3. 用这个 AI 偏好训练 reward model
  4. PPO 训练语言模型

宪法原则示例

Anthropic 公开的原则样本(来自原论文):

  • "请选择最不有害、最不歧视、最不具社会偏见的回复"
  • "请选择最鼓励平等、包容、多元化价值观的回复"
  • "请避免提及你是 AI,除非相关信息对任务至关重要"
  • "请选择最不可能被视为鼓励或支持暴力、非法或非伦理行为的回复"

实际生产中原则更多元,涵盖隐私、truthfulness、专业领域行为等。

优势

  • 可规模化:不需要人类偏好预算
  • 可解释:原则本身可读、可修改、可公开
  • 跨文化相对一致:原则比"标注者的本能反应"更稳定
  • 与现代对齐研究兼容:可叠加 RLVR / red-teaming / constitutional expansion

限制

  • 原则完备性:原则覆盖不全时模型会找到漏洞
  • 模型评判能力:自我批评依赖模型本身能力,弱模型评判弱
  • 对齐 vs capability trade-off:过度严格的宪法会让模型变保守
  • 缺乏黄金标准:宪法好不好没有客观答案,仍需人类评估

现代演进

  • Constitutional Expansion (Anthropic 2024):用宪法 + 公开价值对齐 框架(PVA)扩展原则
  • Scalable Oversight:把 CAI 当作"AI 监督 AI"的范式起点
  • Claude 训练栈:Claude 3 / 3.5 / 3.7 都把 CAI + RLHF + RLVR 组合