Claude 发布新模型,更强了,也更便宜了

科技狐·2026年09月02日 19:29
强是真的强,贵也是真的贵

又一个 “ 地球最强大模型 ” 上线了... 

这次 Anthropic 直接把 用来狙击 “ GPT-6 ” 的大模型端上来了! 

近日,Anthropic 官宣发布 “ 全球最先进的编程与知识工作模型 ” Claude Fable 5.1 ,同时面向 Mythos 用户推出 Mythos 5.1 。

值得一提的是,相比上一代,性能全面升级,使用成本反而降了。

更强也更便宜了

Anthropic 披露的基准测试显示,Fable 5.1 在多个代理式任务和推理基准上刷新了纪录! 

超过了前代 Fable 5 、Opus 5 以及 OpenAI 的 GPT-5.6 Sol 。 

具体跑分如下: 

有意思的是,性能上去了,价格反而下来了。

Fable 5.1 的缓存读取费用从每百万 Token 1 美元降至 0.25 美元,降幅高达 75% 。

根据 Anthropic 基于 8 月实际使用数据的测算...

普通场景下整体成本比 Fable 5 省约 25% ,复杂编码和长时间 Agent 任务最多能省近 45% 。

不过,这里的 “ 便宜 ” 得加个限定词:是跟自己比。

横向来看,Fable 5.1 的价格依然很贵,是 GPT-5.6 Sol 的 2.5 倍,仍处在旗舰模型最贵的一档。

有开发者算过,一次复杂编程任务实际可能要花 20 到 50 美元。

那问题来了:既然这么贵,为什么还要用?因为有些任务,便宜的模型确实做不了。

Anthropic 官方对 Fable 5.1 的定位很明确:专为复杂推理、长周期任务和 Agent 工作流打造。

至于什么时候值得上 Fable 5.1 ,Anthropic 给出的建议反而很简单:日常问答、轻量任务,交给价格便宜一半的 Opus 5 就够了。

也就是说,Anthropic 正在把模型能力做成更清晰的分层:简单任务追求性价比,复杂任务再为更强的能力买单。

进军科研领域

光看榜单多少有点抽象。

所以这次,Anthropic 直接拿出了三个前沿案例,看看 Fable 5.1 和 Mythos 5.1 到底能干什么。

蛋白质结合物设计

研发抗癌或抗病毒药物时,科学家需要为特定靶点 “ 定制 ” 一把能精准结合的蛋白质 “ 钥匙 ” 。

传统流程中,先确定靶点,再用计算机模拟设计数千个候选分子,然后在实验室逐个合成、测试能否结合。

这套流程极其耗时,且失败率很高,行业典型命中率只有 10% 到 15% 。

但是 Mythos 5.1 做到了接近 50% ,在 3 个靶点上,它设计出的分子比竞赛最佳作品结合亲和力高出 10 倍。

目前,所有设计已送往两家外部机构进行实验验证,确认都能结合。

金星高程地图

NASA 在 1990 年代用雷达获取了金星表面数据。

30 年来,这些数据一直存在,但受限于当时的分析能力,人类只完成了约五分之一表面的粗略估算,分辨率只有 10 到 20 公里。

Fable 5.1 重新处理了这些三十年前的旧数据,把分辨率从 10 到 20 公里提升到 2 到 3 公里,高程精度提高了 25% ,覆盖了金星三分之一的表面。

说白了,就是把一批沉睡了几十年的旧数据重新 “ 榨 ” 出了价值。

GPU 内核优化

GPU 内核优化听起来很硬核,但它和科研成本直接相关。

在生物信息学领域,基因组和蛋白质研究经常需要让深度学习模型在 GPU 上重复运行。一次全基因组分析,就可能需要对大量突变进行推理,动辄执行成千上万次。

所以,哪怕单次运行只慢一点,累计成本也会迅速放大。

过去,这类优化通常是顶尖性能工程师的活,一个团队可能需要连续干上几周。

而 Mythos 5.1 只拿着公开的源代码,为 7 个开源深度学习模型编写了自定义 GPU 内核并缓存中间结果,几天就干完了。

速度提升最高 2.5 倍,输出完全相同,GPU 成本降低 30% 到 60% 。

这意味着同样的研究预算,能跑更多的实验。

强是真的强,贵也是真的贵

当然,真正用起来是什么感觉,还得看开发者。

有开发者让 Fable 5.1 “ 一把梭 ” 生成了一款 Mario Kart 风格游戏,直呼这是自己目前见过的最佳结果之一。

另一位开发者则用 Atomic Agent ...

让 Fable 5 和 Fable 5.1 用相同提示词各自生成三个小游戏:

三个游戏都成功跑出来,Fable 5.1 还便宜了约 7% 。

缓存价格从 1 美元降到 0.25 美元后,长任务里的成本优势就出来了。

当然,Fable 5.1 也并非处处碾压。

X 上海外网友做了个对比测试:让 Fable 5.1 和 GPT-5.6 Sol 分别用同一个提示词生成一个完整的 3D 场景:

结果很有意思:Fable 5.1 花了 5.69 美元,GPT 只花了 0.88 美元,差了 6 倍多!

但贵也确实有贵的地方,Fable 生成的场景细节明显更加丰富。

当然,它也翻车了,比如泳池里没水。

GPT 则走的是更加简洁的路线,整体风格统一,泳池有水,但大厅基本只有一段楼梯和一堵墙,水上乐园的规模也小得多。

另一位开发者用 Fable 5.1 和 Kimi K3 重现了同一个游戏,Fable 在 UI 和操作体验上明显更精致,但成本贵了约 60% 。

Kimi 虽然整体稍逊,但性价比确实有竞争力。

此外,还有开发者让它仅凭一个提示词重建出可运行的文档编辑器;甚至有人用它定位了一个困扰团队四五年的罕见 Bug 。

当然,吐槽也不少~

Reddit 上最集中的问题是 Token 消耗太快,有人表示复杂任务 20 到 30 分钟就能用完周限额。

还有人吐槽它太爱直接写代码,经常跳过前期讨论直接冲进实现,反而因为方向不对产生更多缺陷。

还有用户觉得 “ Claude 腔 ” 的问题并没有完全解决,那种刻板的 AI 语气依然存在。

前段时间沸沸扬扬的水印功能也引发反感,社区已经在讨论如何绕过。

写在最后

有意思的是,Anthropic 的每次发布都像一场精心设计的悬疑剧... 

8月24日,claude-marshmallow-eap(棉花糖)和 claude-melon-eap(甜瓜)两个神秘模型 ID 悄然现身!

开发者们疯狂测试几小时后,模型迅速下线。

先放代号、引发讨论,再让真实用户提前 “ 验货 ” ,这套 “ 蒙面发布 ” 已成 Anthropic 的招牌玩法。

这次不同之处在于,Anthropic 除了拿出更强的模型,也开始在性价比上出招。

每次发布,各家都声称自己是最强,但下一次总有新对手出现。当 “ 最强 ” 难以成为长期优势,性价比就变成新战场。

尤其是 DeepSeek 、智谱、通义千问等中国模型,以更低价格提供足够强的性能,正给美国头部 AI 公司带来越来越直接的压力。

而 Anthropic 正处在 IPO 关键期。Fable 5.1 很可能是公开递表前的一次重要亮相,这不仅是模型发布,也是向资本市场交出的成绩单。

模型要卷能力,也要卷价格。接下来,比的可能是谁能把“强”和“值”同时做到极致。

本文来自微信公众号 “科技狐”(ID:kejihutv),作者:老狐,36氪经授权发布。

+1
4

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

比开店扩张更紧要的是“形象修复”。

34分钟前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业