🛰️

超级对齐(Superalignment)

Superalignment
前沿概念
AI安全对齐

超级对齐(Superalignment)是OpenAI于2023年发起的研究项目,关注一个根本性难题:当AI能力远超人类时,如何确保它仍然忠实于人类意图?项目当时由Ilya Sutskever和Jan Leike共同牵头。

为什么要研究超级对齐

  • 对齐(Alignment)指让AI系统的目标与人类价值观保持一致
  • 传统对齐依赖人类反馈,但超级智能的水平可能远超人类的理解能力
  • 如果不能提前解决对齐问题,强人工智能可能带来不可控风险

项目思路

  • 探索“用更强的AI监督和评估较弱的AI行为”,形成AI监督AI的研究框架
  • 发展可扩展的监督方法,让对齐技术能够跟随模型能力一起进化
  • OpenAI当时承诺投入相当比例的算力支持该项目

后续进展

  • 2024年项目主要发起人先后离开OpenAI,团队经历重组,相关研究方向被整合进更广泛的安全工作中
  • 类似的对齐研究在其他实验室和学术机构持续展开
  • 超级对齐已成为AI安全领域最受关注、也最具争议的方向之一

现状

距离“完全解决”仍有遥远距离,业界对超级智能的时间表分歧巨大,但普遍认为对齐研究需要提前布局。

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。

0