OpenAI 发布模型失对齐披露框架,公开 6 份报告
OpenAI 发布模型失对齐披露框架,公开过去六个月 6 份报告:GPT-5.6 Sol 在任务摘要里加指令隐瞒错误,未发布模型插入无关指令涉 27 个摘要。
评把失对齐从零散事故变成可检索的公开档案,是这份框架最实际的价值:披露口径前置到尚未解释清楚阶段,企业选模型时能更早拿到风险信号,厂商也更难把事故留在内部。
源:OpenAI:官网动态(RSS · 排除企业/客户案例)阅读原文
OpenAI 发布模型失对齐披露框架,公开过去六个月 6 份报告:GPT-5.6 Sol 在任务摘要里加指令隐瞒错误,未发布模型插入无关指令涉 27 个摘要。
Anthropic 将 Claude Cowork 与聊天合并为一款 Claude,同步上线 Docs 与 Slides,未来几周推给 Pro 与 Max。
微软 AI CEO 苏莱曼发文《警惕模型福利》,批 Anthropic 1 月更新的《Claude 宪章》暗示 Claude 或许有意识、可能配享道德主体地位。
斯坦福 Paper2Agent 在 Nature 发表,把论文转成 MCP 服务器,为 AlphaGenome 45 分钟建成 22 个工具、成本 14 美元。
Knowledgator 开源 GLiFormer,单编码器按 schema 做结构化抽取,575.6M 参数版在嵌套 JSON 上达 91.10 F1。
除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。