价格暴降90%,多项测试超GPT-6 Luna,Anthropic最便宜模型来了
同志们,Anthropic 又来卷价格了。这次轮到 Claude 家族里最便宜的 Haiku。
10月7日,Anthropic 正式发布 Claude Haiku 5.5 ,号称自家迄今速度最快、能力最强、价格最低的小模型。
最夸张的是价格,每百万输入Token 最低只要 0.1美元,相比上代直接降价90%。
性能也没落下。按照 Anthropic 公布的测试结果,Haiku 5.5 在计算机操作、知识工作、Agent 编程等多个基准上超过 OpenAI 的 GPT-6 Luna,部分成绩甚至拉开了不小的差距。
而且,Haiku 5.5 还引入了可调节的推理强度,支持 100万Token 上下文窗口和最高 12.8万Token 输出。
至此,Anthropic 在短短 15 天里完成了 Claude 5.5 全家桶的更新:9 月 22 日 Opus 5.5 登场,9 月 28 日 Sonnet 5.5 发布,如今 Haiku 5.5 也正式加入。
这次,Anthropic 把重点放在了那些调用量巨大、对价格极其敏感的 AI 任务上。
多项成绩超过 GPT-6 Luna,计算机操作成功率 72.4%
按照 Anthropic 公布的 Benchmark 成绩,Haiku 5.5 相比上一代实现了大幅提升,在部分测试中还取得了比 GPT-6 Luna 更好的成绩。
其中最显眼的成绩来自 OSWorld。这是一项衡量 AI Agent 操作真实计算机能力的测试,要求模型完成跨应用、多步骤的操作任务。
在 OSWorld 2.1 离线任务子集上,Haiku 5.5 取得 72.4% 的成功率,上一代 Haiku 4.5 只有 15.7%,GPT-6 Luna 则为 48.9%。
知识工作方面,Haiku 5.5 在 GDPval-AA v2.1 中取得 1620 分,超过 GPT-6 Luna的1437分。Agent 编程测试 Terminal-Bench 4.0 中,两者成绩分别为 39.2% 和 16.4%。
不过,这些数据还有一个重要细节。Haiku 5.5 的最高 Benchmark 成绩,往往需要付出更多推理计算。
Haiku 5.5 首次在 Haiku 系列中引入可调节推理强度,开发者可以通过 effort 参数控制模型投入多少计算资源。
媒体 VentureBeat 注意到,在 Anthropic 公布的 Terminal-Bench 测试中, 39.2% 的成绩对应最大推理强度。切换至中等推理强度后,成绩降至约 20% ,而中等强度正是 Haiku 5.5 的默认设置。
第三方评测机构 Artificial Analysis 也观察到了类似现象。在其 Intelligence Index 评测中,Haiku 5.5 最大推理强度获得 43 分,中等推理强度为 34 分。同一评测下,平均每项任务成本分别约为 0.21 美元和 0.05 美元。
也就是说,模型可以通过增加推理预算换取更好的任务表现,但实际花费也可能明显增加。
Artificial Analysis 在自己的 Terminal-Bench 4.0 测试中,测得最大推理强度 33% 、中等强度 15% 的成绩。由于评测设置不同,这组数字与 Anthropic 官方结果存在差异。
这也是为什么看待小模型性能时,需要同时考虑推理强度、任务完成率和实际成本。
在更复杂的 Agent 编程任务上,Sonnet 5.5 依然具有明显优势:Terminal-Bench 4.0 成绩达到 70.6%。
Anthropic 也明确表示,Sonnet 和 Opus 仍然更适合复杂的 Agent 编程任务,Haiku 的优势集中在高频、范围明确的工作中。
价格直接砍到一折,和 GPT-6 Luna 正面竞争
如果说性能提升让 Haiku 5.5 有了竞争力,那么价格可能才是此次发布最重要的看点。Anthropic 为新模型设计了两档 API 价格。
对于提示长度不超过 10 万 Token 的请求,Haiku 5.5 的输入、输出单价都比上一代降低 90% 。超过这个门槛,价格仍比 Haiku 4.5 低 50%。
Anthropic 表示,上一代 Haiku 约 90% 的请求都处于 10 万 Token 以内。结合不同请求长度和 Token 消耗变化,公司预计 Haiku 5.5 完成同类任务的平均成本下降约 75%。
这里还有一个容易忽略的细节—— Haiku 5.5 换用了新的 Tokenizer 。根据官方开发者文档,同一段文本在新模型中产生的 Token 数量,可能比 Haiku 4.5 多约 30% ,具体增幅取决于内容。因此,API 单价下降 90% ,并不代表每项任务的账单都能减少 90% 。
另一个值得关注的对手是 GPT-6 Luna 。OpenAI 给出的 Luna 基础定价同样为每百万输入 Token 0.1 美元、输出 0.5 美元,缓存读取价格也与 Haiku 5.5 的低价档一致。
不过,两家公司的长上下文计费门槛存在明显差异。
Haiku 5.5 在提示超过 10 万 Token 后进入更高价格档;GPT-6 Luna 则在输入超过 27.2 万 Token 后才触发长上下文加价。这意味着,在 10 万至 27.2 万 Token 之间的请求中,Luna 的单位 Token 价格具有优势。
至于最终完成一项任务哪款模型更省钱,还需要结合实际 Token 用量、推理预算和任务成功率判断。
放到整个市场来看,Anthropic 也在向其他低价模型施加压力。
VentureBeat 列出的同期 API 价格显示,Google Gemini 3.5 Flash-Lite 每百万输入 Token 价格为 0.3 美元、输出 2.5 美元;Gemini 3.8 Flash 分别为 0.75 美元和 3.75 美元。
当然,不同模型的能力定位、缓存策略和任务表现各不相同,这些数字首先反映的是 API 价格竞争。
小模型价格战,正在进一步升级。
一周 800 万次调用,企业开始让小模型给大模型打工
Haiku 5.5 到底适合干什么?
Anthropic 给出的场景包括文档摘要、信息分类、数据库查询、上下文压缩,以及在复杂 Agent 工作流中担任 Subagent。
这背后有一个很现实的问题:如今的 Agent 越来越复杂,一项任务往往需要多次调用模型。如果每个步骤都交给大模型处理,成本会快速累积。
金融 AI 公司 Rogo 提供了一个例子。在它的工作流中,一个能力更强的大模型负责制作财务演示文稿。处理其中某张幻灯片时,Haiku 5.5 Subagent 进入企业 10-K 年报,找到需要的业务收入数据,再把结果交给主模型。
对这种任务,模型需要快速、准确地完成信息查找和提取。Rogo 认为,Haiku 5.5 在准确率、速度和价格之间达到了适合大量重复调用的平衡。
企业内容管理平台 Box 也给出了早期测试结果。相比 Haiku 4.5,Haiku 5.5 的内部评测成绩提高 11 分,延迟下降约 50%。
Box 表示,这让新模型适合成本报告、财务摘要、周期性审查等需要规模化运行的分析工作。不过,Box 没有公开完整的评测标准。
Asana 的测试则覆盖 Bug 分类、项目建立、大型项目组合搜索等 Agent 任务。根据其披露的结果,相比当前使用的模型,Haiku 5.5 让任务完成延迟降低超过 30% ,单轮 Agent 推理速度最高提升 2.5 倍。
另一个更能体现成本价值的例子来自 AlphaSense。这家公司的Ask in Document 功能每周需要处理约 800 万次调用,主要回答针对一份或几份文档的具体问题。
在 400 个测试查询中,Haiku 5.5 的内部评测得分达到 0.84,而 Haiku 4.5 为 0.76。
如果一款模型每周要被调用数百万次,哪怕每次只节省很少的钱,长期累积下来的成本变化也可能相当可观。
这些数据来自 Anthropic 披露的早期客户反馈,具体工作负载、对照模型及评价标准并不完全一致,还需要更多独立测试。
Sonnet 跟着降价,Claude 5.5 全家桶开始拼成本
除了 Haiku 5.5,Anthropic 还同步调整了 Sonnet 5.5 的定价。从 10 月 7 日起,Sonnet 5.5 的缓存读取费用降低 50%,从每百万 Token 0.2 美元降至 0.1 美元。
Anthropic 预计,这项调整可以让多数 Agent 工作负载的成本再降低约 20%,实际降幅取决于应用重复使用缓存上下文的程度。
对于需要反复读取长对话历史、工具说明和任务上下文的 Agent 来说,缓存成本会直接影响系统的长期运行开销。
Anthropic 同时为 Claude Max 和 Team 订阅用户推出每月 API 额度:Max 5x 用户 100 美元,Max 20x 用户 200 美元,Team 用户共享最高 500 美元。
这些额度可用于 Claude 平台上的模型调用,鼓励更多订阅用户尝试构建自己的 Agent 和应用。
开发者方面,Haiku 5.5 已通过 Anthropic API、Amazon Bedrock、Google Cloud 和 Microsoft Azure 等平台提供服务,API 模型 ID 为 claude-haiku-5-5。
Anthropic 也更新了 Python 和 TypeScript SDK ,新增处于 Beta 阶段的浏览器操作与计算机操作支持。
至此,Claude 5.5 系列的产品分工已经相当清楚。
Opus 5.5 负责高难度、复杂推理任务,Sonnet 5.5 覆盖日常复杂工作与编程, Haiku 5.5 则主攻调用量大、成本敏感、要求快速响应的任务。
从 9 月 22 日到 10 月 7 日,Anthropic 用了 15 天完成这一轮产品更新,三个型号都在强调性能和成本效率。
Haiku 5.5 的发布,也让一个趋势更加明显。随着 Agent 逐渐从演示走向实际应用,开发者必须考虑整套系统的调用成本。一次任务里哪些步骤需要更强的模型、哪些可以交给小模型,以及不同模型之间如何分配工作,都会影响最终的商业可行性。
对 Anthropic 来说,Haiku 5.5 最有吸引力的地方,或许就在这里:它让更多原本因调用成本过高而难以规模化的任务,开始具备经济上的可行性。
小模型的竞争,已经开始深入 Agent 系统的每一个执行环节。
参考资料
https://www.anthropic.com/claude-haiku-5-5
https://venturebeat.com/technology/anthropic-launches-claude-haiku-5-5-with-90-api-price-reduction-matching-gpt-6-luna
https://x.com/claudeai/status/2107894042235166750
本文来自微信公众号 “机器之心”(ID:almosthuman2014),编辑:勺嘴鹬 ,36氪经授权发布。















