📜

宪法AI(Constitutional AI)

Constitutional AI (CAI)
前沿概念
对齐安全

宪法AI(Constitutional AI,CAI)是 Anthropic 在 2022 年提出的模型对齐方法:把一组明确的行为原则(“宪法”)写进流程,让模型依据这些原则对自己的回答做批评和修订,再用修订后的数据训练自己。核心卖点是“用原则替代大规模人工标注”。

两个阶段

  • 监督学习阶段:模型生成初始回答 → 参照宪法条文自我批评 → 改出更好的回答 → 用改进版数据微调
  • 强化学习阶段:让模型按宪法评估两份回答的优劣,产生偏好数据训练奖励模型,再做强化学习(即 RLAIF,AI 反馈替代人类反馈)

与 RLHF 的区别

RLHF 依赖大量人工标注“哪个回答好”,贵、慢、标准难统一;CAI 把“什么是好”显式写成条文,AI 按条文评判,人只需设计并审查宪法本身。

意义与争议

好处是原则透明、可审计、扩展成本低;争议在于宪法本身仍是人写的——价值判断只是从“标注员手里”转移到“起草者手里”,且 AI 自我评估可能放大系统性偏差。它已成为 Claude 系列对齐训练的标志性组成。

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。

☆ 0