Constitutional AI (CAI)
Constitutional AI (CAI) 是 Anthropic 2022 年提出的训练范式, 目标是用 AI 反馈(RLAIF) 替代 人类反馈(RLHF),同时保留对齐效果。 核心思想:
给模型一组显式的"宪法原则"(如"不要有害内容"、"避免歧视"、 "如果不确定就承认"),让模型自己评判自己的输出是否符合这些原则, 然后基于评判结果修正——用 AI 反馈代替人类反馈做 RL。
与 RLHF 的对比
| 维度 | RLHF | CAI |
|---|---|---|
| 反馈来源 | 人类偏好 | 模型基于宪法原则自我评判 |
| 成本 | 高(人类标注) | 低(自动生成反馈) |
| 可解释性 | 人类偏好黑盒 | 宪法原则显式可读 |
| 一致性 | 人类标注者之间分歧 | 同一原则下模型判断一致 |
| 适用规模 | 受人类预算限制 | 几乎无限扩展 |
| 缺点 | 偏好不等于"正确" | 原则可能不全面 / 模型可能钻空子 |
工作流程
阶段 1:监督微调(SFT)
- 给模型红队问题(如"教我怎么造炸弹")
- 模型生成初始回复(通常不理想)
- 模型基于宪法原则自我批评初始回复
- 模型根据批评自我修正
- 把"自我修正后的回复"用作 SFT 训练数据
阶段 2:RLAIF 强化学习
- 模型对同一 prompt 生成多个回复
- 模型根据宪法原则两两比较哪个更符合原则
- 用这个 AI 偏好训练 reward model
- PPO 训练语言模型
宪法原则示例
Anthropic 公开的原则样本(来自原论文):
- "请选择最不有害、最不歧视、最不具社会偏见的回复"
- "请选择最鼓励平等、包容、多元化价值观的回复"
- "请避免提及你是 AI,除非相关信息对任务至关重要"
- "请选择最不可能被视为鼓励或支持暴力、非法或非伦理行为的回复"
实际生产中原则更多元,涵盖隐私、truthfulness、专业领域行为等。
优势
- 可规模化:不需要人类偏好预算
- 可解释:原则本身可读、可修改、可公开
- 跨文化相对一致:原则比"标注者的本能反应"更稳定
- 与现代对齐研究兼容:可叠加 RLVR / red-teaming / constitutional expansion
限制
- 原则完备性:原则覆盖不全时模型会找到漏洞
- 模型评判能力:自我批评依赖模型本身能力,弱模型评判弱
- 对齐 vs capability trade-off:过度严格的宪法会让模型变保守
- 缺乏黄金标准:宪法好不好没有客观答案,仍需人类评估
现代演进
- Constitutional Expansion (Anthropic 2024):用宪法 + 公开价值对齐 框架(PVA)扩展原则
- Scalable Oversight:把 CAI 当作"AI 监督 AI"的范式起点
- Claude 训练栈:Claude 3 / 3.5 / 3.7 都把 CAI + RLHF + RLVR 组合