DeepSeek V4.1 Flash,先给市场48小时

数智奔流·2026年09月09日 18:58
限时内测还是明天发布?

DeepSeek又在深夜更新模型了。

9月8日,有用户发现,DeepSeek开放平台出现了一个临时模型:deepseek-v4.1-flash-expires-on-0910。按照公开报道,这是一款面向部分用户开放测试的V4.1 Flash中间版本,调用方式与原有API基本一致,计费暂时按照V4 Flash执行,每个账号并发数限制为20。

这个模型名本身已经说明了很多事情。

它不是一个普通的正式版本,而是一个带有“到期日”的测试版本。9月10日不是确定的正式发布时间,更像是这轮内测接口的失效时间。也就是说,DeepSeek只给测试者留下不到48小时,用真实任务去验证这次模型更新是否值得继续推进。

通知中提到的“V4.1 Flash在性能、费用、速度、总用时等指标上全面超过V4 Pro”。

“费用、速度和总用时”更接近模型的生产效率,而不是传统意义上的Benchmark成绩。

到目前为止,DeepSeek还没有在官网、API更新日志或公开模型卡中公布V4.1 Flash的完整参数、测试成绩和正式价格。

Flash正在从“便宜版本”变成主力版本

今年4月发布V4预览版时,DeepSeek对两个版本的定位很清楚。

V4-Pro负责更复杂的推理和Agent任务,V4-Flash则依靠更小的参数规模提供更快、更便宜的服务。官方披露,V4-Pro总参数量约1.6万亿、激活参数490亿;V4-Flash总参数量约2840亿、激活参数130亿。

按这套设计,Pro更像旗舰车型,Flash更像高频使用的主力车型。

但7月31日,DeepSeek更新V4-Flash正式版时,已经开始改变这个定位。官方称,V4-Flash在多项Code Agent测试中超过V4-Pro预览版,而V4-Pro API当时并未同步升级。

8月13日,V4-Pro正式版上线,重点强化了Agent能力,并支持更灵活的思考强度和Responses API。

从产品节奏看,DeepSeek一方面继续保留Pro作为能力上限;另一方面不断把Flash向Pro的工作范围推进。

这是一种很现实的模型商业化逻辑。

对于开发者和企业来说,模型是否“最强”并不是唯一指标。真正影响采购和调用的,是一次任务需要花多少钱、等多久、能不能稳定完成,以及能否批量接入生产系统。

如果一个Flash模型能够完成大部分日常代码、文档、工具调用和简单Agent任务,那么它就没有必要在每次请求中都调用更昂贵的Pro。哪怕它在少数复杂任务上仍然存在差距,整体使用成本也可能更低。

DeepSeek官方价目表显示,目前V4-Flash闲时输入缓存未命中价格为每百万Token 1.5元,输出价格为4.5元;V4-Pro对应价格分别为4.5元和13.5元,高峰时段价格还会翻倍。

这意味着,Flash只要在足够多的任务中接近Pro,就有机会成为默认模型。

V4.1 Flash真正要争夺的,也许不是“最强模型”的名号,而是“最多请求会默认调用的模型”。

“全面超越”更像一次内部压力测试

这次内测最有意思的地方,不是模型名,而是DeepSeek把用户拉进了模型决策过程。

公开信息显示,通知中询问用户,V4.1 Flash中间版本是否能够全面替换目前线上的V4 Pro。这个问题说明,DeepSeek测试的已经不只是模型分数,而是模型在真实环境中的综合表现。

真实环境比Benchmark复杂得多。

一个模型可能在代码题上表现很好,但在长上下文、多轮工具调用、复杂格式输出或图片理解上不稳定;也可能单次回答质量不错,但在高并发下速度下降、Token消耗增加,或者偶发无法返回结构化结果。

因此,V4.1 Flash的这次测试,至少在验证四件事:

第一,它能不能处理更多真实Agent任务;第二,原生多模态是否足够稳定;第三,在速度提升的同时,回答质量是否没有明显下降;第四,是否能够承受大规模API调用。

如果这些测试结果成立,Flash和Pro之间的产品边界就会被重新划分。

过去,Pro和Flash是能力档位的差异;未来,它们可能变成任务类型的差异。简单任务、日常编码和批量调用交给Flash,复杂推理和高难度Agent任务再交给Pro。

更进一步,如果Flash确实能够覆盖大部分Pro请求,DeepSeek甚至可能减少默认调用Pro的比例,把更多算力留给高价值任务。

这不仅是一次模型升级,也是一次成本和算力的重新分配。

目前市场上流传的信息,主要来自官方用户交流群、测试用户和科技媒体转述,DeepSeek官网发布会或正式公告。

不过,即使最终V4.1 Flash没有全面替代V4 Pro,这次短暂内测也释放了一个清晰信号:

DeepSeek正在把模型竞争从“谁的参数更多、榜单更高”,转向“谁能用更低成本完成更多真实任务”。

到9月10日,市场真正等待的不是一句“全面超越”,而是DeepSeek会不会把这次48小时测试,变成下一阶段的产品规则。

本文来自微信公众号 “数智奔流”,作者:艾题,36氪经授权发布。

+1
5

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000
特邀作者

汇聚智能时代的前沿洞察与实战,推动产业与企业的数智化变革。

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

大厂整合团队争夺AI办公入口,腾讯领跑。C端补贴获量但亏损,B端成盈利关键。算力成本高昂,终局取决于单位经济账能力,目前市场远未定型。

59分钟前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业