最像DeepSeek的Kimi K3,没有复制关键一击
K3突然成了关注的焦点。
先是马斯克。
北京时间7月17日凌晨,马斯克在Artificial Analysis一条
随后,月之暗面
微博截图
为什么是“2万亿+俱乐部”?
7月16日晚,月之暗面发布新一代大模型
Arena联合创始人兼CEO Anastasios Angelopoulos接受媒体采访时称,这可能是今年最大的一次模型发布。与此同时,K3登上Frontend Code Arena第一,在Artificial Analysis智能指数发布时排到第三。
而算力紧缺,又为K3的出圈添了一把火。
7月19日晚间,月之暗面旗下AI助手
气氛的烘托中,K3的讨论中带上了“下一次
但如果把两者放到同一张账单上,差异随即出现。Artificial Analysis测得K3完成一项加权评测任务平均花费0.94美元,同一口径下
1
确实看起来像2025年的DeepSeek
K3制造的冲击,更多来自它的比较对象突然变了。
据月之暗面公布,K3拥有2.8万亿总参数、原生视觉和100万token上下文,每个token从896个专家中激活16个。Artificial Analysis给出57分,发布时位列第三;在现实知识工作评测GDPval-AA v2中,它获得1668 Elo,高于Claude Opus 4.8和GPT-5.5,低于Claude Fable 5;在AA-Briefcase长程知识工作评测中,发布时仅次于Fable 5。
x截图
“虽然其整体性能仍然落后于最强大的专有型号Claude Fable 5和GPT 5.6 Sol,但
这些名次都有边界。
截至7月21日,K3已由发布时的第三移至第四。而Frontend Code Arena测量的是前端页面的视觉、交互和用户偏好,并不等于全部代码能力。
但,这些变化,也无法否认kimi完成了一次身份切换:K3不再只是“国产模型里表现不错”,而是直接进入Fable、GPT和Opus构成的全球比较。
一个直观的变化是,关注度从K3转向杨植麟本人。
K3发布后,杨植麟的导师Russ Salakhutdinov在X上公开祝贺;不少媒体先后刊发其人物侧写,海外科技媒体甚至单独写了一篇月之暗面会议室的命名方式。
x截图
2015年从清华大学毕业后,他前往卡内基梅隆大学攻读博士,参与Transformer-XL和XLNet等研究,直到2019年毕业。有媒体写道,杨植麟在卡内基梅隆大学读博期间,就以喜欢Pink Floyd等摇滚乐队闻名。这种个人趣味后来也进入公司命名:“月之暗面”取自Pink Floyd的同名专辑,
Pink Floyd,翻译过来为“平克·弗洛伊德”,这支乐队在1973年发布了一张名为《The Dark Side of the Moon》的专辑。专辑名翻译过来,就是“月之暗面”。
这种种很容易唤起
但相似的出场方式,并不等于相同的商业动作。
3月25日,杨植麟在2026中关村论坛年会全体会议上,以《开源AI:加速探索智能上限》为题发表演讲,提出大模型发展核心判断,并系统披露
不到四个月后,K3几乎就是这三个判断的实体化。
2
Kimi的目标,沿着一条线程工作下去
Token效率解决成本,长上下文解决容量,Agent集群突破顺序执行瓶颈。杨植麟对月之暗面规划的方向,共同指向了一个目的地:模型竞争正在从“一次回答”,转向“一条持续运行的任务线程”。
盒饭财经此前相关的文章《腾讯、阿里、字节,重做一遍Office》《OpenAI给Codex找了份新工作》《“前浪”WPS,争夺交付权》中,都谈到了这一趋势——AI竞争要从“问答”,转为“任务执行和交付”。
聊天的终点是一段回复,工作的终点则是一个能够继续使用的结果。这个曾经承载“咨询”“搜索”功能的助手,要进一步上岗干活了。
那自然就会对他有新的要求。比如,要完成任务时,他得记住目标,还要阅读文件和网页,过程中自然也要调用终端及浏览器,保存中间产物。相对过去,这个流程就变长变复杂了。
如果这个助手中途某一步出错,它需要知道从哪里恢复,而不是让用户从头再来。如果它在工作时忘掉一句重要要求或限制条件,过去或许只是体验瑕疵,现在却可能意味着全部返工。
而100万token上下文并不等于长线程。更长的上下文窗口,像一张足够大的工作台,决定一次能摊开多少资料;而长线程则是一项持续推进的项目,还取决于状态保存、工具反馈、任务拆解和错误恢复。
K3的厉害之处,是和
比如,KDA先处理长任务为什么越来越贵。
2025年10月,
这当然不是K3实测,却说明如果读取和保存历史的成本无法下降,线程越长,产品越难成立。
而Attention Residuals处理网络深度上的信息稀释问题。
相关论文显示,模型可以根据输入选择此前层的表示,而不是固定地逐层相加。验证同样来自48B模型,不能据此声称“Agent不会忘记目标”,只能说明它为超深模型提供了更稳定的内部信息流。
还有,Stable LatentMoE。
它能让每个token只激活896个专家中的16个,把总容量与单次计算拆开。月之暗面称,这些架构和训练配方合计将扩展效率提高到K2的约2.5倍。截至发稿前,技术报告尚未发布,暂时无法拆分各项贡献。
然而,单模型变得更能装,并没有消除顺序执行的限制。
产品也沿着同一方向展开。
6月3日上线Beta的
K3又同时进入
3
K3与DeepSeek,在这里分岔
进入前沿牌桌不等于改变牌桌规则,
2024年5月6日,
这个判断在2025年1月20日变成了一个完整动作。
R1和R1-Zero发布当天,
到2026年4月24日发布V4 Pro时,这套动作仍然连贯。
V4 Pro拥有1.6万亿总参数、49B激活参数和100万token上下文,发布时同步开放MIT许可权重,并兼容OpenAI Chat Completions与Anthropic接口。截至7月21日,官方未缓存输入价为0.435美元、输出价为0.87美元/百万token。
R1发布一周后的2025年1月27日,英伟达市值在一个交易日内蒸发约5930亿美元,创下当时美国上市公司单日市值损失纪录。当然,这不能代表算力不再重要,但足以记录这次市场的恐惧:如果接近前沿的能力可以低价获得、立即下载,还能被压进不同尺寸的模型,围绕稀缺智能建立的价格和资本开支叙事就必须重算。
“
截至7月21日,K3已经进入
月之暗面称,编程负载缓存命中率超过90%,命中后的输入价会降到0.30美元,这能降低实际调用成本,却仍没有把K3放进
制作:盒饭财经
Artificial Analysis的同口径结果把分岔显示得更直接。
K3完成一项加权评测任务平均花费0.94美元,V4 Pro约为0.04美元,相差约23.5倍。当然,这一指标包含评测中的输入、缓存、推理和输出token,并不等于企业真实项目的总成本。如果模型可以把工程师一周的工作压缩到一天,昂贵的token依然可能是便宜的劳动力。
但这也意味着,K3的溢价不能再靠参数和榜单解释,只能靠结果解释——更少的重试、更少的人工接管、更低的返工概率,以及更高的最终交付成功率。
4
选择长线程,Kimi必须回答的问题
K3押注的是,用户愿意为更高的任务完成概率付费。
而这意味着,
用户付费,不是为了2.8万亿参数本身,而是希望模型可以解决实际的问题。比如,某程序员用AI产品连续工作数小时,读完代码库,调用终端与浏览器,处理数千页材料,他的目的是有一个能继续使用的结果。但如果无法交付这样可继续使用的结果,那么再低的token单价也没有意义。
K3的技术选择都在服务这场赌博。
制作:盒饭财经
比如,价格方面。
K3没有必要在token标价上击败
比如,运行方面。
7月9日,OpenAI推出ChatGPT Work,并披露Codex周活跃用户超过500万,其中100万以上已经用于非软件工作。Codex已经把沙箱、越界操作审批、diff和测试闭环做成基础能力。而Anthropic也为Claude Code提供文件和网络隔离、修改前检查点与恢复能力。竞争已经从模型能否完成任务,推进到模型出错之后系统能否限制损失、验证结果并恢复现场。
比如,入口方面。
7月15日发布的WPS灵犀专业版可以直接调用WPS文档内核与原生API,生成可编辑、可审阅的文档、表格和演示文稿。微软则在4月把Word、Excel和PowerPoint中的Agent能力推向全面可用。它们未必始终拥有最强底模,却掌握文件对象、格式、版本、企业权限和协作关系。
还有,来自K3自身。
7月19日的公告称,过去48小时的用户请求量已经逼近现有推理集群承载上限。
这证明了关注度,也直接暴露了长线程的供给账单。一次聊天可能只调用模型几轮,一项持续数小时的编程、研究或多Agent任务却会反复推理、读写上下文、调用工具。而K3官方又建议采用64个以上加速器组成的supernode。
热度越高,月之暗面越需要同时维持服务质量、单位任务成本和毛利。如果扩容只能换来更多昂贵推理,长线程会成为一张不断增长的成本表。
巧合的是,
K3没有重复这一击。杨植麟选择把模型送进更长的任务,让它读取更多材料、调动更多工具、组织更多Agent,最终拿走更多工作价值。它试图改变的不是一单位智能的价格,而是模型参与工作的长度。
参考资料:
1.《
2.《月之暗面杨植麟专访:AI不是接下来一两年找到PMF,而是接下来十到二十年如何改变世界》,腾讯科技《潜望》
3.《算力紧缺!
4.《
5.《月之暗面杨植麟:未来每个研究员将配海量Token,AI研发将进入AI 主导时代》,每日经济新闻
6.《Copilot’s agentic capabilities in Word, Excel, and PowerPoint are generally available》,微软官网
7.《揭秘
8.
9.《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》
10.《金山办公推出 AI 办公智能体灵犀专业版,支持专业 Office 操作》,it之家
11.《Kimi Linear: An Expressive, Efficient Attention Architecture》,arXiv论文和GitHub仓库
12.《The Meeting Rooms At Moonshot, Company Behind Kimi 3, Are All Named After US Rock Bands》,OfficeChai
13.《Attention Residuals》,arXiv论文和GitHub仓库
14.《Agent Swarm能力》,Kimi官网
15.《Kimi Work Overview》,Kimi官网
16.《Kimi Code Overview》,Kimi官网
17.《ChatGPT 现已成为你攻坚克难的得力伙伴》,OpenAI官网
18.《在OpenAI内部安全运行Codex》,OpenAI官网
19.《Beyond permission prompts: making Claude Code more secure and autonomous》,Anthropic官网
20.《Enabling Claude Code to work more autonomously》,Anthropic官网
本文来自微信公众号“盒饭财经”,作者:许有阳,36氪经授权发布。















