DeepSeek终于长出“眼睛”,V4 Flash视觉模型上线
8月21日下午,
从官方页面披露的信息看,这是
V4 Flash Vision Exp目前显示的API价格与Flash完全一致:缓存命中价格在空闲和高峰时段分别为0.05元和0.10元/百万Token,缓存未命中分别为1.5元和3元,输出分别为4.5元和9元。
从时间上来看,在
01 一周前,DeepSeek还“看不见”图片
4月下旬,
8月13日,
但一个非常实际的问题很快暴露出来:
过去一周,在
有开发者上传图片时,Harness会直接返回:MODEL_DOES_NOT_SUPPORT_IMAGES
原因是V4 Flash和V4 Pro在模型目录里都被声明为纯文本模型,输入模态只有text。图片甚至无法进入会话,后续Agent自然也无法调用工具处理图片。
于是社区开始自己给
一种方案是在
过去几天,GitHub上已经出现多个类似的vision bridge插件。开发者甚至专门做出了dsh-deepseek-vision:图片先交给其他视觉语言模型理解,再把描述传给
这形成了一个略显尴尬的局面。
DeepSeek刚刚发布了一套高度插件化的Agent Harness,Agent已经能够调用终端、文件、代码和外部工具,但面对最常见的截图、网页图片和报错界面时,仍需要借用其他公司的模型。
V4 Flash Vision Exp的出现,开始补上视觉能力。
02 先改Harness,再放出模型
回头看,
与此同时,/goal、/plan等命令开始支持图文输入,@菜单能够引用文件和会话;官方还修复了图片尺寸过大、历史图片载荷过高导致模型请求失败等问题。
这个变化刚出现时,很多开发者首先想到的是:
8月21日下午,开发者在Harness相关代码和配置中发现了deepseek-v4-flash-vision-exp这一模型名称。
03 一个和V4 Flash同价的视觉模型
目前公开信息还不足以判断V4 Flash Vision Exp究竟采用什么模型架构。
当天稍早的开发者实测也留下了一个有意思的细节:deepseek-v4-flash-vision-exp最初接收image_url时仍返回expected 'text',随后官方模型表和视觉接口才陆续更新。这至少说明,视觉能力与V4 Flash现有API体系之间经历了明显的适配过程。
不过,这些现象都只能作为线索,不能直接证明底层架构。
但从产品设计中,已经能够看出几个值得注意的信号。
首先,它被放进了V4 Flash产品线,而不是V4 Pro。这意味着
V4 Flash本身只有284B总参数、13B激活参数,定位就是高吞吐、低成本。如果Vision版本延续这一定位,它瞄准的很可能不是单纯的图片聊天,而是大量发生在Agent里的视觉任务。
例如读网页截图、识别报错界面、分析图表、查看软件UI、读取设计稿,再根据图片继续操作电脑或者修改代码。
这些任务对“单次图片理解达到最强”未必有极端要求,却非常在意速度、价格以及能否连续运行。
第二个信号来自定价。
根据
高峰时段,缓存未命中输入仍为3元/百万Token,输出9元;空闲时段则分别只有1.5元和4.5元。图片不会采用单独的“每张图片”收费方式,而是根据尺寸转换成Token,再与文本Token统一计费。
这与
如果正式版继续维持这一策略,视觉理解可能再次进入
但现在还不能简单比较“看一张图多少钱”。真正的成本取决于
第三个信号是它仍然带有明确的 Exp 后缀。
2025年9月,
Vision Exp很可能承担类似角色:先把模型交给开发者,在真实图片和Agent工作流中寻找问题,再决定最终版本。
本文来自微信公众号“腾讯科技”,作者:值得关注的,36氪经授权发布。















