Meta新模型逼平Fable 5,小扎:开源且便宜到你懒得算账

量子位·2026年09月03日 15:47
不到1美元狂跑60次Agent运行

小扎去年撒出去的那些钱,好像终于开始听见响了……

Meta刚刚端出的新模型Muse Spark 1.3,已经和Fable 5掰上手腕了。

Artificial Analysis最新榜单里,Muse Spark 1.3 Max拿到62分。

跟Fable 5、5.1 xhigh打了个平手。

再往细项里扒,Coding和Agent这边Muse Spark 1.3已经开始在综合评分比自己高的Opus5 max面前冒头。

这事儿搁Meta身上,节目效果就不太一样了。

在Llama之后,Meta在顶流大模型赛道沉寂挺久,一度被对手甩开一大截。

就在不久前,小扎去年花重金攒起来的超级智能团队,还经历了余家辉离职的“变故”。

去年还在满硅谷挥着支票薅人,今年先跑了个核心研究员,这支高价攒出来的队伍,不会要高开低走吧?

正当大家继续围观这支天价团队后续剧情时——

新模型先上桌了。

Muse Spark 1.3:能肝,还贼便宜

9月2日,Meta正式发布Muse Spark 1.3

这是Muse Spark今年4月亮相之后,短短几个月里的第四个版本。

4月,初代Muse Spark;7月,1.1;8月,1.2;现在刚进9月,1.3又续上了。

小扎这次也亲自营业,称Muse Spark 1.3是目前整个系列在Coding和Agent工作上幅度最大的一次提升。

还放狠话,性能已经强到——

便宜得几乎都没必要算账了。

按自家给出的内部对比里,Muse Spark 1.3比1.2平均减少了约20%的工具调用和25%的Token消耗,同时会少浪费一些无效轮次,在长程任务里也更能记住一开始的要求。

网友也纷纷开始实测。

比如拿Muse Spark 1.3和1.2做一轮同Prompt对比。

一次性生成一个自包含HTML文件,在里面搓出三件可收藏的3D维京手办,维京头盔、镶钻战斧,以及一艘载着船员的长船。

成本差不多,一个0.08美元,一个0.1美元,但1.3做出来的细节质感明显高出一截。

还有网友直接把Muse Spark 1.3 Ultra Contributor和Fable 5.1 xHigh拉来折腾了差不多两个小时。

两边拿到同一个Prompt,但里面专门塞了一条相当折腾模型的规则:

每次完成之后,都交给独立Judge打分。不到9.5/10不准停,继续自己改。

然后Muse Spark 1.3真就没停……两小时里,它连续跑了20轮自我改进,每一轮又启动3个Agent,算下来就是一共60+次Agent运行。

而且全程花费不到1美元。

总结下来就是:真能肝,真能省

Muse Spark 1.3标准API价格仍然和1.2保持一致:

输入1.25美元/百万Token,输出4.25美元/百万Token,缓存输入0.15美元。

Artificial Analysis算下来,1.3 xhigh每个Intelligence Index任务的成本约0.55美元。

同一档附近的GPT-5.6 Sol Max和Grok 4.6 High分别约0.95美元和0.94美元。

而且,Muse Spark本身还只是Muse系列里更轻量的一条模型线,后面还有更大的模型。

小扎这次发完1.3,也没忘了继续预告两件事:

Muse Spark开放权重,即将到来。

以及那个已经吊了大家不知道多久胃口的。

曾经一度在前沿模型竞争里显得有点安静的Meta,又开始往桌子中央挤了。

Muse Spark这几个月突然加速的另一面,是小扎去年那场轰轰烈烈的抢人大战,也终于到了看成果的时候。

小扎去年薅来的那帮人,开始交作业了

去年夏天,Meta组建超级智能实验室,小扎满硅谷挖牛人。

其中相当受关注的一批研究员,就是从OpenAI过去的赵晟佳、余家辉、任泓宇、毕树超等人。

各种天价package传闻满天飞,所有人都在吃瓜:

这支豪华班子究竟能搞出什么黑科技?

谁料黑科技还没来,剧情先拐了一下,余家辉宣布离开Meta创业。

一位核心研究员离开,自然让外界重新开始打量这支组建时间并不算长的明星团队。

不过现在再看,进度没落下。

而且新版本一出,几位核心研究员也纷纷出来爆料背后改动。

赵晟佳直接把Muse Spark 1.3称为目前Spark模型线里最强的Coding和Agent模型。

他特别提到了三个方向:

更长程的工作、更强的Agent任务能力,以及更可靠地遵循复杂指令。

毕树超披露的东西则更底层一点。

这次团队在训练阶段投入了更多算力做结果评分矫正

针对性解决模型偷懒划水、指令执行偏差、含糊回避作答,还有奖励投机、奖励黑客等问题。

经过这轮处理之后,模型的可用性有了非常明显的提升。

虽然Muse Spark 1.3挺猛,但小扎显然还没准备把牌一次打完。

那个已经预告不知道多少次、到现在还没切开的,到底还能整出多大动静……蹲蹲蹲。

参考链接:

[1]https://x.com/finkd/status/2095232032896946311?s=20

[2]https://x.com/aimlapi/status/2095248072154701847?s=20

[3]https://x.com/SPAC89/status/2095284969614475744?s=20

[4]https://x.com/shengjia_zhao/status/2095233023247880590?s=20

[5]https://x.com/shuchaobi/status/2095234300199543121?s=20

本文来自微信公众号“量子位”,作者:关注前沿科技,36氪经授权发布。

+1
7

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业