涨价是DeepSeek的原罪?
“我能接受
这次涨价动摇了这份默契。
8月17日,
一条评论在社区流传:“
“原罪”是一种情绪化说法,却准确点出了
上游价格调整之后,最先做出反应的已经是模型订阅平台。
OpenCode披露,一次典型V4 Flash请求包含410个新增输入Token、7.13万个缓存Token和310个输出Token。按此计算,调价前每次请求约需0.000344美元;新价格机制下,谷时约0.000794美元,峰时约0.001588美元,分别变为原来的2.31倍和4.62倍。
OpenCode Go的五小时额度仍为12美元。假设请求结构不变,调价前理论上可完成约3.49万次请求,峰时新价格下约为7600次,减少约78%。
社区里还出现过“从6.33万次减少到3800次、缩水94%”的说法。这个口径同时采用了临时双倍促销额度和平台早期显示值,会夸大常态额度的变化。但按照3.165万次和最新7600次计算,约减少四分之三,冲击依然足够明显。
从价格传导的角度来看,上游价格表的改动,会逐渐影响下游重新分配模型、额度和毛利。
图:惊涛骇浪中半潜的鲸 由AI生成
01 同一个DeepSeek,五种价格
要理解这次涨价的影响,首先要厘清
最直接的渠道是官方API,用户按照缓存命中、普通输入和输出Token付费,并接受峰、谷价格。
第二类渠道是OpenRouter等模型聚合平台。OpenRouter将同一个模型接入多家推理服务商,用户可以在价格、生成速度和可用性之间选择,平台也可以自动路由。
第三类是云平台。这里可能同时存在原厂API转售、云厂商自行部署、区域节点、企业折扣、包量套餐和积分计划。
第四类是OpenCode Go一类的订阅服务。用户支付固定月费,平台在后台承担模型采购、路由和成本波动。
第五类是自行部署开放权重。此时用户不再按Token向
这些渠道共同造成了一个看似矛盾的现象:
截至8月18日,Deepseek V4 Pro 0813已经接入11家服务商。多数线路的普通输入和输出价格集中在每百万Token 1.32美元和3.96美元,GMICloud折后最低为1.218美元和2.436美元,阿里云国际最高为1.452美元和4.356美元。相比普通输入和输出,缓存价格差异更大,从0.044美元到0.44美元,相差10倍。各线路的典型生成速度差异明显,中位数从每秒约28个Token到97个Token不等。
新版模型上线数日内,服务商数量从早期的三家迅速增加至12家,说明第三方推理供给正在快速跟进。不过,目前大多数线路的普通输入和输出价格已经向
这也是第三方托管可能出现短期套利空间的原因。官方价格调整后,自建算力的服务商可以暂时维持旧价格,也可以通过量化和提高GPU利用率压低报价。
问题在于,低价线路仍要接受四项检验:生成速度是否稳定、峰值流量下是否可用、量化后能力是否下降,以及它提供的究竟是不是最新模型版本。
02 DeepSeek还有性价比吗?
单看Token价格,
到了谷时,V4 Flash普通输入为0.22美元,只比Luna高10%;输出为0.66美元,比Luna低45%;缓存读取为0.007美元,比Luna低65%。
这意味着,缓存较少、输入内容经常变化的应用,在峰时使用Luna可能更便宜;大量复用上下文的代码Agent,V4 Flash仍有机会保留优势。
按照OpenCode披露的典型Flash请求计算,每次请求包含410个新增输入Token、7.13万个缓存Token和310个输出Token。调价前,这次请求约需0.000344美元;调价后谷时约需0.000794美元,变为原来的2.31倍;峰时约需0.001588美元,变为4.62倍。
如果让Luna处理完全相同数量的Token,成本约为0.00188美元。在这个缓存量远高于新增输入的例子中,V4 Flash峰时仍比Luna便宜约15.5%。
临界条件也可以计算出来:V4 Flash要在峰时保持成本低于Luna,缓存Token数量需要大于“新增输入的40倍,加上输出的20倍”。一旦达不到这个比例,Luna的Token成本更低。
不过,固定Token结构只能回答一次调用的账单,无法判断完成同一项工作需要消耗多少Token、调用多少次工具或者经历多少次重试。
开源软件工程任务评测项目DRadar提供了另一层观察。它将Sol、Terra、Luna、
涨价前,V4 Flash的低推理档和V4 Pro High仍占据部分性价比前沿,其中V4 Pro High能够以明显低于Sol和Terra的成本,取得接近高能力档位的结果。
按照DRadar这组真实软件工程任务的结果,
V4 Pro面临的压力更直接。无论峰时还是谷时,其普通输入、缓存输入和输出价格都高于Luna。它需要依靠更高的任务成功率、更少的重试和更稳定的工具执行,证明自己在每次成功任务上的投入仍然合理。
图:DRadar开源项目测算的涨价前后综合成本对比
03 谁最先为DeepSeek涨价买单?
涨价最先会影响到谁?Token Plan运营商已经成为这次涨价最直接的传导层。
这类平台通常向用户收取固定月费,再通过批量采购、包销GPU、缓存优化和用户使用率差异,把10美元订阅封装成价值数十美元的模型用量。
OpenCode Go每月订阅价格为10美元,平台希望通过批量折扣和预留GPU容量,为用户提供最高约60美元、相当于订阅费六倍的模型用量。但这一倍率并不适用于所有模型。对于暂时无法获得采购折扣、也难以通过自行托管降低成本的模型,OpenCode只能压低相应的使用价值。
作为参照,同一计划中,GPT-5.6 Luna每五小时约可完成2050次请求,
它们能够说明的是,在固定订阅模式下,平台会根据采购价格和托管成本重新分配模型额度,
图:在OpenCode社区,一名用户以“Bye bye OpenCode Go”为题讨论Flash价格变化,评论中有人提醒取消订阅,也有人表示“已经不值得”。
面向多模型重度用户、规模相对较小的Cola Token Plan也表示,按照自身流量结构测算,
第二批承受压力的是薄毛利AI应用。写作、翻译、客服和知识库产品通常采用固定订阅,很难在上游涨价当天同步向用户提价。模型路由、上下文压缩、峰谷调度和限制重度用户,都会成为维持毛利率的工具。
第三批是Agent平台。Agent需要重复读取上下文、调用工具、检查结果和处理失败。一次看似简单的任务可能产生数十轮模型调用。只要其中一个环节不稳定,Token价格优势就可能被重试成本抵消。
今年5月,
社区由此如此形容
但是8月17日之后,这条线被
在价格优势之外,
04 “运行时”竞争
模型、工具、技能、会话、沙箱、存储、Agent循环、任务调度和用户界面,都能被加载、卸载或替换。开发者可以增加工具、更换模型供应商、重写记忆方式,也可以改造整个Agent循环。模型在这套架构中只是一个组件。
推出Harness之后,
截至8月18日,
这些项目的质量仍然参差不齐,至少说明“一切皆插件”降低了参与门槛。对
与此同时,也出现了不少批判性评价。
一名开发者评价:“一个没有在市场上打磨的Harness,很难效果好,不是针对
社区已经发现了一些具体问题。
一名开发者发现,Harness极简模式执行pwd、ls等毫秒级命令时,启动需要约3.5秒,第一条命令有时要等待7秒。检查代码后,最终发现底层终端等待的是dsh>提示符,上层持久化Shell插件却使用了另一个字符串。两层程序无法确认Shell已经准备完成,只能等到超时。
修改两处代码后,该开发者称命令延迟从约3600毫秒降至158毫秒,并向官方提交了修复分支。这个案例说明了一个普遍问题:Agent的成本还包括工具等待、失败重试和额外上下文。一个很小的运行时错误,就可能消耗掉模型在Token价格上节省的成本。
还有开发者认为,如果
甚至有人提出,能否在
在一个“一切皆插件”的世界里,每个入口,也都是出口。Harness可以把更多任务带给
因此,deepseek harness的生态意义已经出现,商业价值还要打个问号。
有人猜测是算力趋紧,有人认为它在结束推广期定价,也有人把这看作
涨价之后的
本文来自微信公众号“腾讯科技”,作者:值得关注的,36氪经授权发布。















