Claude 发布新模型,更强了,也更便宜了
又一个 “ 地球最强大模型 ” 上线了...
这次 Anthropic 直接把 用来狙击 “ GPT-6 ” 的大模型端上来了!
近日,Anthropic 官宣发布 “ 全球最先进的编程与知识工作模型 ” Claude Fable 5.1 ,同时面向 Mythos 用户推出 Mythos 5.1 。
值得一提的是,相比上一代,性能全面升级,使用成本反而降了。
更强也更便宜了
Anthropic 披露的基准测试显示,Fable 5.1 在多个代理式任务和推理基准上刷新了纪录!
超过了前代 Fable 5 、Opus 5 以及 OpenAI 的 GPT-5.6 Sol 。
具体跑分如下:
有意思的是,性能上去了,价格反而下来了。
Fable 5.1 的缓存读取费用从每百万 Token 1 美元降至 0.25 美元,降幅高达 75% 。
根据 Anthropic 基于 8 月实际使用数据的测算...
普通场景下整体成本比 Fable 5 省约 25% ,复杂编码和长时间 Agent 任务最多能省近 45% 。
不过,这里的 “ 便宜 ” 得加个限定词:是跟自己比。
横向来看,Fable 5.1 的价格依然很贵,是 GPT-5.6 Sol 的 2.5 倍,仍处在旗舰模型最贵的一档。
有开发者算过,一次复杂编程任务实际可能要花 20 到 50 美元。
那问题来了:既然这么贵,为什么还要用?因为有些任务,便宜的模型确实做不了。
Anthropic 官方对 Fable 5.1 的定位很明确:专为复杂推理、长周期任务和 Agent 工作流打造。
至于什么时候值得上 Fable 5.1 ,Anthropic 给出的建议反而很简单:日常问答、轻量任务,交给价格便宜一半的 Opus 5 就够了。
也就是说,Anthropic 正在把模型能力做成更清晰的分层:简单任务追求性价比,复杂任务再为更强的能力买单。
进军科研领域
光看榜单多少有点抽象。
所以这次,Anthropic 直接拿出了三个前沿案例,看看 Fable 5.1 和 Mythos 5.1 到底能干什么。
蛋白质结合物设计
研发抗癌或抗病毒药物时,科学家需要为特定靶点 “ 定制 ” 一把能精准结合的蛋白质 “ 钥匙 ” 。
传统流程中,先确定靶点,再用计算机模拟设计数千个候选分子,然后在实验室逐个合成、测试能否结合。
这套流程极其耗时,且失败率很高,行业典型命中率只有 10% 到 15% 。
但是 Mythos 5.1 做到了接近 50% ,在 3 个靶点上,它设计出的分子比竞赛最佳作品结合亲和力高出 10 倍。
目前,所有设计已送往两家外部机构进行实验验证,确认都能结合。
金星高程地图
NASA 在 1990 年代用雷达获取了金星表面数据。
30 年来,这些数据一直存在,但受限于当时的分析能力,人类只完成了约五分之一表面的粗略估算,分辨率只有 10 到 20 公里。
Fable 5.1 重新处理了这些三十年前的旧数据,把分辨率从 10 到 20 公里提升到 2 到 3 公里,高程精度提高了 25% ,覆盖了金星三分之一的表面。
说白了,就是把一批沉睡了几十年的旧数据重新 “ 榨 ” 出了价值。
GPU 内核优化
GPU 内核优化听起来很硬核,但它和科研成本直接相关。
在生物信息学领域,基因组和蛋白质研究经常需要让深度学习模型在 GPU 上重复运行。一次全基因组分析,就可能需要对大量突变进行推理,动辄执行成千上万次。
所以,哪怕单次运行只慢一点,累计成本也会迅速放大。
过去,这类优化通常是顶尖性能工程师的活,一个团队可能需要连续干上几周。
而 Mythos 5.1 只拿着公开的源代码,为 7 个开源深度学习模型编写了自定义 GPU 内核并缓存中间结果,几天就干完了。
速度提升最高 2.5 倍,输出完全相同,GPU 成本降低 30% 到 60% 。
这意味着同样的研究预算,能跑更多的实验。
强是真的强,贵也是真的贵
当然,真正用起来是什么感觉,还得看开发者。
有开发者让 Fable 5.1 “ 一把梭 ” 生成了一款 Mario Kart 风格游戏,直呼这是自己目前见过的最佳结果之一。
另一位开发者则用 Atomic Agent ...
让 Fable 5 和 Fable 5.1 用相同提示词各自生成三个小游戏:
三个游戏都成功跑出来,Fable 5.1 还便宜了约 7% 。
缓存价格从 1 美元降到 0.25 美元后,长任务里的成本优势就出来了。
当然,Fable 5.1 也并非处处碾压。
X 上海外网友做了个对比测试:让 Fable 5.1 和 GPT-5.6 Sol 分别用同一个提示词生成一个完整的 3D 场景:
结果很有意思:Fable 5.1 花了 5.69 美元,GPT 只花了 0.88 美元,差了 6 倍多!
但贵也确实有贵的地方,Fable 生成的场景细节明显更加丰富。
当然,它也翻车了,比如泳池里没水。
GPT 则走的是更加简洁的路线,整体风格统一,泳池有水,但大厅基本只有一段楼梯和一堵墙,水上乐园的规模也小得多。
另一位开发者用 Fable 5.1 和
此外,还有开发者让它仅凭一个提示词重建出可运行的文档编辑器;甚至有人用它定位了一个困扰团队四五年的罕见 Bug 。
当然,吐槽也不少~
Reddit 上最集中的问题是 Token 消耗太快,有人表示复杂任务 20 到 30 分钟就能用完周限额。
还有人吐槽它太爱直接写代码,经常跳过前期讨论直接冲进实现,反而因为方向不对产生更多缺陷。
还有用户觉得 “ Claude 腔 ” 的问题并没有完全解决,那种刻板的 AI 语气依然存在。
前段时间沸沸扬扬的水印功能也引发反感,社区已经在讨论如何绕过。
写在最后
有意思的是,Anthropic 的每次发布都像一场精心设计的悬疑剧...
8月24日,claude-marshmallow-eap(棉花糖)和 claude-melon-eap(甜瓜)两个神秘模型 ID 悄然现身!
开发者们疯狂测试几小时后,模型迅速下线。
先放代号、引发讨论,再让真实用户提前 “ 验货 ” ,这套 “ 蒙面发布 ” 已成 Anthropic 的招牌玩法。
这次不同之处在于,Anthropic 除了拿出更强的模型,也开始在性价比上出招。
每次发布,各家都声称自己是最强,但下一次总有新对手出现。当 “ 最强 ” 难以成为长期优势,性价比就变成新战场。
尤其是
而 Anthropic 正处在 IPO 关键期。Fable 5.1 很可能是公开递表前的一次重要亮相,这不仅是模型发布,也是向资本市场交出的成绩单。
模型要卷能力,也要卷价格。接下来,比的可能是谁能把“强”和“值”同时做到极致。
本文来自微信公众号 “科技狐”(ID:kejihutv),作者:老狐,36氪经授权发布。















