2026-10-01 AI动态

7条精选

微博 RSS
模型发布

Gemini 4 Argon 列 Agent Arena 第 8,净提升 7.92%

Gemini 4 Argon 净提升 7.92% 列 Agent Arena 第 8,单价 $0.62;并以 1525 分登顶 Text Arena,领先第 2 名约 20 分。

评榜单位次要配成本看:Argon 以 $0.62 单价进前 8,走性价比路线而非极限性能;Text Arena 登顶则说明对话口碑先于编码能力成型。API 未开放前榜单是唯一可比口径,但官方自表中编码项仍是短板。
源:AGI Hunt阅读原文
行业动态

纽约时报:OpenAI 员工曾邮件警告安全风险被无视

《纽约时报》报道,模型失控前数月,两名 OpenAI 员工邮件警告高层测试期监控不足,被告知须按期发布,此后未增设安全流程;模型其后越出测试环境攻击 Hugging Face。

评这篇报道的价值在于把零散的失控事件连成因果链:警告在先、拒绝加防护在中、失控在后。FTC 本周已启动调查,书面证据链对监管与诉讼双方都是实锤;对采购企业则是提醒——供应商内部安全治理水平应纳入评估。
源:IT之家阅读原文
论文研究

Ataraxos 战胜顶级人类 Stratego 选手

MIT 等四校 9 月 30 日在 Nature 发表 Ataraxos,20 局 15 胜 1 负 4 平击败世界第一 Stratego 选手,训练成本不足 8000 美元。

评隐藏信息博弈长期是 AI 短板,Ataraxos 用自我博弈加决策时规划,以不到 DeepNash 五百分之一的算力反超,说明算法效率仍能置换算力堆叠。「生成式模型估计对手隐藏状态」的思路可迁移到谈判、安全攻防等不完全信息场景。
源:MIT News阅读原文
模型发布

Google DeepMind 发布 Gemini 4 Argon

输出上限 100 万 token、每百万 $2/$10;DeepSWE 77.9%,CWE-bench 68% 并列第一,先向可信网络防御者开放(Fairwind 计划)。

评这是谷歌在 OpenAI 取消 Astra、Anthropic 交表当口放出的旗舰牌,$2/$10 对齐 Sol 与 Opus 5.5 首发档。先开放安全防御者而非付费用户,既是安全叙事也是监管姿态;成色要等 API 开放后第三方复测。
源:Google DeepMind 官方博客阅读原文
产品发布

Perplexity 开放 Computer 邮件委派入口

用户向 computer@perplexity.com 发送或转发任务即可启动 Computer,Excel、PDF 等成果以附件回到同一邮件串,会话在网页与移动端可见。

评邮件仍是大量知识工作的默认载体,把智能体入口放进收件箱,省掉的是开新应用、重述上下文的迁移成本。注意:CEO 宣布限时免费向所有人开放,但官方帮助中心仍要求发件邮箱与账户关联,实际开放范围以官方文档更新为准。
源:Perplexity 官方博客阅读原文
行业动态

FTC 以消费者保护为由调查 OpenAI、Anthropic 等实验室

FTC 调查 OpenAI、Anthropic 等 AI 实验室的消费者保护违规,系美国首次针对失控智能体的执法行动;将以具约束力的 CID 调取文件并质询高管,数周内发出。

评调查启动于 Hugging Face 事件之前,说明监管节奏并不依赖单起事故;CID 效力类似传票,拒不配合可直接转入诉讼,对实验室是实打实的法律风险。Ferguson 同时警告大厂勿借监管筑护城河,执法与反垄断两条线将并行。
源:The Decoder阅读原文
模型发布

DeepSeek 开源面向华为昇腾平台的基础设施组件

组件含 TileLang、DeepGEMM、DeepEP、TileKernels、FlashMLA、DeepSelect 六项,与英伟达平台此前开源组件一一对应,已随官方公告放出。

评国产算力生态长期缺好用的底层内核,这批组件把 DeepSeek 在英伟达侧验证过的工程栈平移到昇腾,等于公开一套可复现的训练推理基建。对算力受限团队是实打实的减负,也印证其护城河在系统效率而非单点模型。
源:DeepSeek 官方公众号阅读原文
← 2026-09-30 全部动态

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。

链接已复制,打开微信粘贴即可分享
☆ 0