Claude Haiku 5.5 发布:输入价降 90%,轻量模型正面对上 GPT-6 Luna

⚡ TL;DR
Claude Haiku 5.5 与 OpenAI GPT-6 Luna 在 48 小时内先后上线,两款轻量模型把「单位智能成本」压到新低。本文对比 Anthropic 官方跑分与定价,拆解小模型为何成为 Agent 主力,并给出三种预算下的模型选型建议。

OpenAI 在 10 月 8 日把 GPT-6 推给全部 ChatGPT 用户,Anthropic 前一天(10 月 7 日)放出 Claude Haiku 5.5——两款轻量模型 48 小时内正面对上,主打同一件事:把「单位智能成本」压下去。对高频调用模型的 Agent 产品,这比跑分第一更值钱。

Claude Haiku 5.5 到底改了什么?

它是 Anthropic 目前最小、最快、最便宜的模型,定位是「高并发、成本敏感」的重复型任务:摘要、上下文压缩、数据库查询、分类。请求在 10 万 token 以内时,输入 $0.10 / 百万 token、输出 $0.50 / 百万 token,平均运行成本比 Haiku 4.5 低约 75%,输入价格降幅约 90%。

它也是首个支持 effort 档位的 Haiku 模型(Low / Med / High / Xhigh / Max),按任务在「省钱」与「聪明」间切换;官方建议把它当作 Opus 5.5、Sonnet 5.5 的子智能体。同期 Sonnet 5.5 缓存读取价格减半,Anthropic 称多数 agent 负载因此便宜约 20%。

Claude Haiku 5.5 与 GPT-6 Luna 跑分对比

跑分对比:Haiku 5.5 和 GPT-6 Luna 谁更强?

Anthropic 官方页直接把 GPT-6 Luna 列为对照。知识工作 GDPval-AA v2.1 上,Haiku 5.5 拿 1620 Elo,高于 GPT-6 Luna 的 1437;计算机操作 OSWorld 2.1 从上一代 15.7% 跳到 72.4%,GPT-6 Luna 为 48.9%。两项都压过同代 GPT-6 Luna,但仍落后 Sonnet 5.5(1840 / 83.9%)。

编码是它的短板:Terminal-Bench 4.0 只有 39.2%(GPT-6 Luna 16.4%,Sonnet 5.5 70.6%),FrontierCode 1.1 与 GPT-6 Luna 基本同档。客户侧反馈更直接:Asana 称任务完成延迟降了 30% 以上、每轮推理快至 2.5 倍,HubSpot 在 CRM 场景拿到 92.8% 均分。

为什么轻量模型突然成了 Agent 主力?

同一天,OpenAI 把 GPT-6 推向全部用户:付费档用 GPT-6 Sol,免费与 Go 档用 GPT-6 Luna,取代 GPT-5.6 系列。GPT-6 的两处升级都在为高频调用让路——Intelligent UI 让模型自己决定答案形态(文字、图表、按钮、表单,甚至现场生成小工具),推理层面把思考与输出交织,边想边答:GPT-6 Instant 联网搜索的平均开始响应时间比 GPT-5.6 Instant 提前 44%。

一边是价格砍到十分之一的 Haiku 5.5,一边是首字响应更短的 GPT-6 Luna:Agent 完成一个任务要调用模型几十次,决定账单的不是旗舰跑分,而是每次调用花多少钱、多久出第一个字。OpenAI 披露,Codex 与 ChatGPT Work 活跃用户合计已超 4000 万,这类高频工作流正是小模型的主场。

三种预算的模型配置建议

怎么选:三种预算的模型配置

高并发、容错度高的场景(分类、打标、摘要、客服初筛)直接上 Claude Haiku 5.5,用 Low / Med 档位控成本;编码、写作、长文分析等主力环节交给 Sonnet 5.5 或 ChatGPT 的 GPT-6 Sol;最强推理或高价值单次任务再切旗舰层。编码侧搭配 Claude Code 和 OpenAI Codex 更容易把子智能体编排跑通。

数据声明

跑分来自 Anthropic 官方 Haiku 5.5 发布页(2026-10-07)与 OpenAI 官方说明;OSWorld 2.1 为 offline subset 口径,Humanity's Last Exam 为无工具口径。价格为每百万 token 的 API 报价,实际账单随用量与档位浮动。GPT-6 Luna 独立定价官方未单独公布,本文只做能力对照。

❓ 常见问题

Claude Haiku 5.5 的 API 价格是多少?

请求在 10 万 token 以内时,输入 $0.10 / 百万 token、输出 $0.50 / 百万 token;Anthropic 称平均运行成本比 Haiku 4.5 低约 75%,输入价格降幅约 90%。超出 10 万 token 的请求按更高档位计费。

Claude Haiku 5.5 和 GPT-6 Luna 谁更强?

在 Anthropic 官方跑分里,Haiku 5.5 的知识工作 GDPval-AA v2.1 为 1620 Elo,高于 GPT-6 Luna 的 1437;计算机操作 OSWorld 2.1 为 72.4%,高于 GPT-6 Luna 的 48.9%。但编码仍偏弱,Terminal-Bench 4.0 只有 39.2%。

免费用户能用上 GPT-6 吗?

可以。OpenAI 已向全部 ChatGPT 用户开放 GPT-6,免费与 Go 档使用 GPT-6 Luna,Plus、Pro、Business、Enterprise 等付费档使用 GPT-6 Sol,逐步取代 GPT-5.6 Sol 与 GPT-5.6 Luna。

Intelligent UI 具体是什么能力?

它是 GPT-6 的新交互层:模型按任务自主选择文字、图表、地图、按钮、表单等组件,甚至现场生成计算器、账单分摊工具这类可交互小工具。底层是 OpenAI 的原生可流式组件库加编译器,而不是让模型自由生成网页。

轻量模型能替代旗舰模型做生产任务吗?

高并发、容错度高的任务可以,比如分类、打标、摘要、客服初筛;编码、复杂推理等场景仍建议用 Sonnet 5.5、GPT-6 Sol 或旗舰模型,轻量模型更适合当子智能体承担高频的重复调用。

关于作者:本文由 AI工具宝箱编辑组 撰写,团队持续追踪并实测主流 AI 工具,月均订阅支出 $200+,所有评测基于真实长期使用。

数据声明:本文所有数据均标注来源,可溯源核查。发现错误欢迎通过 联系页面 反馈,48 小时内核查修正。