2026-10-07 AI动态

7条精选

微博 RSS
论文研究

OpenAI 发布内部前沿模型产出的数学研究成果

OpenAI 以 GitHub 仓库公开前沿模型产出的数学成果,多数证明用 Lean 形式化,平均每个结果约耗 3 小时 ChatGPT Pro 算力。

评对数学界,这份公开更像一次可复核性实验:成果放 GitHub 而非期刊、用 Lean 让机器验算,把评审成本从人转给算力。对研究者,价值在于可直接引用的证明与协议;对 OpenAI,则是在安全审查压力下展示前沿模型科研能力的合规路径。
源:OpenAI:官网动态(RSS · 排除企业/客户案例)阅读原文
观点

Claude Code 云端会话上线:每任务独占一台 VM

Claude Code 云端会话上线:每任务独占一台 VM;Pro/Max 等计划不额外收费,用户 10 月 7 日前可领 100/250 美元额度。

评它一次解决本地会话的三个痛点:共享工作树会抢文件与端口、跑在本机随断电中断、凭据暴露。新方案每任务一台 VM,仓库克隆到独立分支,GitHub token 由代理持有、只发短期凭证——这是智能体并行化的关键基础设施。
源:Anthropic:Claude.dev 开发者博客(RSS)阅读原文
模型发布

DeepMind 开源 EmbeddingGemma 2

基于 Gemma 4、Apache 2.0 开源 740M 参数模型,把文本、代码、图像、视频、音频映射到统一嵌入空间,上下文 8K 为前代 4 倍。

评对端侧开发者最实际的两点:输出向量可从 768 维截断到 128 维,最高省 6 倍存储;Pixel 11 Pro 上纯文本权重仅约 191MB。MTEB Code 从前代 68.76 升至 78.68,开源小模型正把 RAG 拉回设备。
源:Google DeepMind:Blog(RSS)阅读原文
产品发布

Mistral Large 4 公测:1T 参数

Mistral Large 4 在 OpenRouter 公测:1T MoE、原生多模态、1M 上下文;前两周五折,输入 0.68 美元/百万 token。

评把 1M 上下文做成公测默认项,直接对标 Gemini 与 GPT 的长上下文档;前两周五折是典型的抢开发者心智定价。对使用者,MoE 总参 1T 但每次只激活约 50B,长文档与代码库场景的成本结构比参数规模更值得看。
源:Mistral AI:官方博客阅读原文
行业动态

DeepSeek 传融资至少 800 亿元,腾讯宁德时代参与

彭博社援引知情人士称,DeepSeek 融资接近锁定至少 800 亿元,远超原定 500 亿目标;腾讯与宁德时代出资最多,为 2027 年初 IPO 铺路。

评比金额更值得注意的是出资结构:腾讯是模型应用方、宁德时代是制造业,两者同时成为最大出资方,说明这轮钱不只是财务投资,而是算力与场景的产业绑定。原定目标 500 亿、实际接近 800 亿,反映一级市场对国产前沿模型的重新定价。
源:凤凰科技(引彭博社)阅读原文
观点

A16Z:美国仅 4.5% 消费者为 AI 付费订阅

a16z 第七版消费级 AI 报告:截至 8 月仅 4.5% 美国消费者付费订阅 AI 助手,头部 1% 付费者月均花 903 美元、占 19.5% 支出。

评报告落点是广而不深:付费者中位数每月仅 25 美元且几乎不涨,而头部 1% 月均 903 美元、18 个月涨 80%,集中度已超过底部 50% 之和。对做 AI 产品的团队,增长不再来自拉新,而是抓住愿为编程与生产力工具叠加付费的专业用户。
源:a16z:Top 100 Gen AI Apps(第七版)阅读原文
模型发布

DeepSeek V4.1 Flash 公布 ARC 成绩

DeepSeek V4.1 Flash:ARC-AGI-2 得 72.9%、ARC-AGI-1 得 94.5%,每任务成本比 V4 Flash 高约 250%。

评比 V4 Flash 最佳高 11.5 与 5.5 分,但每任务成本涨约 250%;ARC Prize 指出 ARC-AGI-1 上 high 档 88.5% 反低于 low 档 90.5%,档位并非越高越好。采购方按难度分档调度更省钱。
源:ARC Prize:官方成绩页阅读原文
← 2026-10-06 全部动态

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。

链接已复制,打开微信粘贴即可分享
☆ 0