2026-09-23 AI动态

7条精选

微博 RSS
模型发布

Anthropic 发布 Opus 5.5,成本较 Opus 5 低 40%

Anthropic 发布 Opus 5.5:多数工作达 Fable 5.1 水平,典型负载成本较 Opus 5 低 40%,定价 $4/$20 每百万 token。

这是 Amodei 呼吁放缓前沿后的首款新模型,发布前经 METR 等外部机构评估。性能贴近自家旗舰的同时直接降价,与 OpenAI 同日降价形成对垒——头部竞争的焦点已从跑分转向单位成本,直接受益的是高频调用 API 的智能体开发者。
源:Anthropic:Newsroom(网页)阅读原文
产品发布

Claude Code 默认模型改为 Opus 5.5

Claude Code v2.1.280 将 Opus 5.5 设为默认 Opus 模型,支持 1M 上下文;Pro 与 Team Standard 套餐默认模型改为 Opus。

订阅默认模型从 Sonnet 换成 Opus,等于把旗舰能力下放给普通付费用户;1M 上下文加缓存降价组合,明显在为长程编码智能体场景铺路。Claude Code 用户可立即体感差异,是观察 Opus 5.5 实际表现的第一个入口。
源:Claude Code:GitHub Releases(RSS)阅读原文
行业动态

五角大楼审查:过度依赖 Maven AI 是误击伊朗学校诱因

彭博获得的五角大楼审查:2 月 28 日两枚战斧导弹误击伊朗米纳布小学,至少 123 名儿童遇难;情报过时与过度依赖 Palantir Maven 系统是诱因之一。

这是迄今最明确把 AI 目标系统写进误击归因的官方审查。教训不在模型出错,而在操作者默认系统会兜住过期情报——把速度当成了校验。Palantir 否认软件担责。对所有部署智能体的团队:自动化越快,人工异议机制越不能省。
源:Hacker News:AI 热帖阅读原文
模型发布

OpenAI 发布 GPT-6 Sol/Luna,API 价格永久降 50%

OpenAI 发布 GPT-6 Sol/Luna,API 较 GPT-5.6 促销价永久降 50%:Sol $2/$10、Luna $0.10/$0.50 每百万 token。

Anthropic 上午降 Opus,OpenAI 半天后跟低价模型,同日对垒把基调挑明:比单位成本。Luna 定价已低于 DeepSeek-V4.1-Flash 空闲时段价格,轻量智能体的 API 成本进入分币时代,高频场景该重算选型。
源:OpenAI:官网动态(RSS · 排除企业/客户案例)阅读原文
产品发布

LiteParse 更新:文本提取提速 20-25%

LlamaIndex 发布 LiteParse 2.14.6:文本提取耗时降 20-25%,平均 2.76ms/页;新增视觉定位与 is-complex 路由 API。

解析是 RAG 管线里最不起眼也最烧钱的一环,在 PDFium 层面做内存优化比换模型划算。对自建文档管线的团队,2.76ms/页意味着批量入库成本可控;is-complex 路由把简单页走快路径,是解析服务普遍在走的工程化方向。
源:LlamaIndex:产品、工程与评测阅读原文
观点

Claude Opus 5.5 登顶 AA 智能指数

Artificial Analysis:Opus 5.5 以 58 分登顶智能指数,超越 Fable 5.1 与 GPT-6 Astra(均 53 分),十项评估六项居首。

第三方榜单与厂商口径首次同向:Anthropic 官方也引用了 58 分。但 AA 同时发现高推理档位下单任务输出 token 约为 Opus 5 的 1.6 倍,成本未必真降——榜单分数与实际账单的差距,是这轮价格战里最易被忽略的变量。
源:Artificial Analysis 完整文章(网页)阅读原文
行业动态

Claude Opus 5.5 上架 Arena 智能体榜

Arena 宣布 Opus 5.5 进入 Agent Arena,基于数百万真实长程智能体任务评测,可调用搜索、文件系统与终端,另在 4 类 Battle Mode 上榜。

真实任务竞技场与静态基准正在互补:Agent Arena 考长程任务结果而非单轮答题,与 AA 指数形成交叉验证。对选型者,模型在两套口径下同时领先比单榜登顶更有参考价值,众包评测的权重会越来越高。
源:AIHOT:评测基准动态(网页)阅读原文
← 2026-09-22 全部动态

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。

链接已复制,打开微信粘贴即可分享
0