超级对齐(Superalignment)是OpenAI于2023年发起的研究项目,关注一个根本性难题:当AI能力远超人类时,如何确保它仍然忠实于人类意图?项目当时由Ilya Sutskever和Jan Leike共同牵头。
为什么要研究超级对齐
- 对齐(Alignment)指让AI系统的目标与人类价值观保持一致
- 传统对齐依赖人类反馈,但超级智能的水平可能远超人类的理解能力
- 如果不能提前解决对齐问题,强人工智能可能带来不可控风险
项目思路
- 探索“用更强的AI监督和评估较弱的AI行为”,形成AI监督AI的研究框架
- 发展可扩展的监督方法,让对齐技术能够跟随模型能力一起进化
- OpenAI当时承诺投入相当比例的算力支持该项目
后续进展
- 2024年项目主要发起人先后离开OpenAI,团队经历重组,相关研究方向被整合进更广泛的安全工作中
- 类似的对齐研究在其他实验室和学术机构持续展开
- 超级对齐已成为AI安全领域最受关注、也最具争议的方向之一
现状
距离“完全解决”仍有遥远距离,业界对超级智能的时间表分歧巨大,但普遍认为对齐研究需要提前布局。