DeepSeek刚宣布涨价,小扎立马“拼命”:Meta新模型打出更低骨折价,但要一点“数据税”

AI前线·2026年08月06日 17:29
刚刚,Meta 推出其首款编程智能体 Muse Code,同时发布了针对编程优化的前沿模型 Muse Spark 1.2。

刚刚,Meta 推出其首款编程智能体 Muse Code,同时发布了针对编程优化的前沿模型 Muse Spark 1.2。这可能是该公司迄今为止对 AI 编程工具市场最认真的一次进军。

Meta 首席执行官马克·扎克伯格在社交平台 X 上亲自宣布了这一消息,称目前提供测试版的 Muse Code 能够“在大型代码库中执行完整的软件工程任务”,以此向领先的 AI 实验室 Anthropic 和 OpenAI 发起挑战。

Muse Code 出自 Meta AI 负责人 Alexandr Wang 之手,他领导 Meta 超级智能实验室并统管基础模型研发。Wang 于去年 6 月加入 Meta,是扎克伯格为重振公司陷入困境的 AI 战略而进行的核心人事布局。

据介绍,这款基于终端的新编程工具由 Muse Spark 1.2 提供支持,在“代码生成、复杂调试、代码库理解以及端到端开发者工作流”方面有所改进。

为编程而生,仍逊于 Claude Code 

“在测试中,我们让它同时为一个游戏构建了六个功能,且没有发生冲突。”扎克伯格在帖子中表示,强调其并行处理能力不会干扰开发者的工作副本。

据了解,Muse Code 的核心架构亮点是 Meta 所称的异步后台智能体。与大多数竞品工具为每个任务临时生成辅助智能体的模式不同,Muse Code 会在整个会话期间保持一组专门的后台智能体持续存活。这些智能体“在整个会话期间保持活动状态,而不是为单个任务临时生成,从而避免冗余的信息收集”,它们自行执行后续步骤,并自主选择何时向主智能体汇报。

这一架构带来的实际效果是,更低的延迟和更少的监督:一个已经了解代码库的智能体无需在每次开发者提出新需求时重新探索代码库。当任务规模足够大时,Muse Code 会分发到独立的子智能体进行并行处理,每个子智能体都在自己隔离的 git 工作树中,因此开发者的工作副本永远不会被触及。

第二个值得注意的设计选择,是可审计性。如果 Muse Code 在长时间运行的任务进行 20 小时后崩溃,它会从停止的地方精确恢复,不会丢失工作,也无需重新提示。每个模型调用、工具运行、审批和编辑在执行前都会被追加到本地事件日志中,Meta 称这一单一事实来源使运行时具有“可精确重放和重启安全”的特性。

值得一提的是,最新的 Muse Spark 模型是与 Muse Code 一同开发和训练的,这提升了整体的编程性能。

Meta 发布了基准测试图表,将 Muse Spark 1.2 与其他编程模型进行了比较。在 Terminal-Bench 2.1 上,在 Muse Code 中运行的 Muse Spark 1.2 得分 82.9%,略高于 OpenAI 的 GPT-5.6 Terra(在 Codex 中为 81.8%)和 xAI 的 Grok 4.5(在 Grok Build 中为 81.6%),但落后于 Anthropic 的 Opus 5 在 Claude Code 中的最高努力成绩,后者以 86.7%领先。在 DeepSWE 1.1 上,Muse Spark 1.2 取得了 59.3%,排名第三,落后于 Opus 5(65.0%)和 GPT-5.6 Terra(64.8%)。

最引人注目的是 Meta 自己的内部编程基准,Muse Spark 1.2 的 70.6%轻松击败了 GPT-5.6 Terra(65.4%)和 Gemini 3.6 Flash(63.9%),但仍落后于 Opus 5 的 79.4%近 9 个百分点。即使在 Meta 自己设计的测试中,Anthropic 的模型也获胜。事实上,Claude 在所有三个图表中都位居榜首。

不过,代际提升是实实在在的:Muse Spark 1.2 在 Terminal-Bench 上比 1.1 提高了 6.7 个百分点,在 DeepSWE 上提高了 6.3 个百分点。

Meta 还展示了一个令人印象深刻的长周期案例:让 Muse Spark 1.2 在 NVIDIA Hopper 硬件上运行长达 24 小时、超千次工具调用,进行 GPU 内核优化。智能体在 Triton 中工作且不能封装现有第三方库,最终在 KDA 和 MLA 内核上取得了“实质性改进”,包括非直观的优化如重新中心化门控累积衰减。扎克伯格称,“它在初始探索阶段之后仍在持续发现实质性改进”。

定价取胜?用数据换折扣 

价格亲民似乎是 Meta 希望将 Muse Code 与 Anthropic 和 OpenAI 的热门产品,形成差异化的关键方式。为此,Meta 给其模型 API 提供了两个层级。

首先是标准层级,该工具默认采用与 Muse Spark 相同的按量付费定价,每百万输入 token 1.25 美元,每百万输出 token 4.25 美元。这一价格低于 Anthropic 的 Sonnet 5 模型,后者通常每百万输入 token 收费 3 美元,每百万输出 token 收费 15 美元。Meta 承诺,该层级的提示词和生成内容不会用于训练,速率限制为每分钟每团队 3000 次请求和 400 万 token。

Wang 表示,该智能体还“设有一个贡献者层级,可以以明显更低的成本接入”,“甚至比按量付费层级还要便宜 10 倍以上”。该层级价格为每百万输入 token 0.10 美元,每百万输出 token 0.20 美元。

值得注意的是,这个价格比 DeepSeek-V4-Flash 都更便宜了。该模型在未命中输入缓存时价格为 1 元/百万 tokens,输入命中缓存价格为 0.2 元/百万 tokens,输出价格为 2 元/百万 tokens。而且,DeepSeek 刚刚还发布公告宣布:“计划近期整体上调 API 服务定价,预计涨幅较大。”

作为交换,开发者必须“选择加入以帮助改进模型”,这指的是 Meta 利用第三方数据来增强底层技术。而且,这一层级速率限制严格得多(每分钟 60 次请求),明显面向个人和小型实验。

Meta 在博文中强调,零数据保留选项已向企业开放,这意味着公司不会保留开发者数据来改进模型,但需额外付费。他表示,这代表了“一项对企业客户很重要的重大企业级功能”。

上周,公司发布了令人失望的财报,营收预测疲软且自由现金流萎缩,导致股价大跌。Meta 98%的收入来自在线广告,这是一个它通过基于用户数据定向投放消费者而占据主导地位的市场。这款新的编程智能体是扎克伯格谋求从 AI 中创收的又一途径,与此同时他的公司仍在持续大力投资数据中心和相关计算基础设施。

开源战略彻底转向?小扎留下悬念 

较 Meta 而言,这次的发布中最显著的缺失是对“开源”的提及。

在 X 上回应开发者提问时,扎克伯格表示,“我很快会有更多消息分享”,似乎在暗示未来可能仍有开源计划。

三年来,Meta 凭借 Llama 系列将自己塑造成开放 AI 的旗手:从 2023 年 2 月 LLaMA 泄露掀起消费级 AI 热潮,到 Llama 2 的商业许可,再到 4050 亿参数的 Llama 3.1 及扎克伯格的“开源 AI 是前进之路”宣言,Meta 一直向开发者承诺前沿权重应免费下载、自托管和微调。这一策略成效显著——到 2026 年初 Llama 家族下载约 12 亿次,日均百万,自托管为企业节省高达 88%的成本。

裂痕从 Llama 4 开始。2025 年 4 月推出的 Llama 4 评价平平,最终承认基准结果存在虚报,而 DeepSeek、阿里巴巴、智谱 AI 等中国开源模型迅速崛起,到 2025 年底已占 Hugging Face 下载量的约 41%,侵蚀了 Llama 的领导地位。这一挫折促使扎克伯格在 2025 年夏季重组 AI 业务为 Meta 超级智能实验室(MSL),并挖来 Scale AI 联合创始人 Alexandr Wang。

今年 4 月 8 日,Llama 时代实质终结。MSL 发布了首个专有模型 Muse Spark,无可下载权重,无自托管,仅限云端 API。当时,Meta 发言人仅称“当前 Llama 模型将继续开源”,对未来模型保持沉默;Wang 虽表示“计划开源未来版本”。但四个月后的今天,Muse Code 的发布没有任何开源承诺,既无权重也无许可证,发布博文和扎克伯格的帖子中也从未出现“开源”一词。

这一转向尤为尖锐,因为竞争对手正朝相反方向移动。OpenAI 在 Apache 2.0 许可下开源了 Codex CLI,并推出 gpt-oss 开放权重模型;Google 的 Gemini CLI 同样采用 Apache 许可证。Meta 如今更接近 Anthropic 的专有姿态,而曾经高呼开源是前进之路的公司,现在要求开发者按 token 付费使用模型。

新推出的贡献者层级在某种程度上成为 Llama 策略的继承者:不再以免费权重换取市场份额,而是以廉价 token 换取训练数据,用户需以自身数据“补贴”模型。

参考链接:https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2

本文来自微信公众号“AI前线”,整理:华卫 ,36氪经授权发布。

+1
21

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

现在最高兴的,应该是其他国产大模型厂商。

1小时前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业