8月21日,DeepSeek 在 API 开放平台上线了 deepseek-v4-flash-vision-exp。名字带 exp,说明官方自己也认这是实验版,但它补的那块位置一点也不实验——V4 系列到今天为止都是纯文本,图进不来。
先说能力。官方给的说法是,这个模型在文本侧跟 V4-Flash 打平,智能体、逻辑推理、世界知识三块都没有因为塞进视觉能力而掉队。真正拉开差距的是多模态智能体基准,V4-Flash-Vision-Exp 相比 V4-Flash 是跨了一大步,被形容成”逼近 Opus-4.8″。这个对标很有意思,Opus 系列一直是这条赛道的天花板参照物。
调用方式给了三种格式:Chat Completions、Messages、Responses。指定 model=’deepseek-v4-flash-vision-exp’ 就能用。能力覆盖描述图片、识别截图里的文字、分析图表这几类最高频的活。
价格是这次最值得看的一栏。百万 tokens 输入缓存命中 0.05 元起,缓存未命中 1.5 元起,输出 4.5 元起。做过成本核算的人应该明白这个数字意味着什么——识图这件事在过去很长一段时间里是按”贵”来定价的,现在被拉到了一个可以随手调用的区间。缓存命中 0.05 元这一档,基本等于鼓励你把同一张图反复问。
同一天,DeepSeek Harness 升到了 0.1.1,直接支持这个新模型。往前翻一天的 v0.1.0-rc.8,Harness 已经把多模态输入打通到了 /goal、/plan 这些核心指令上,配置原生图片请求之后,可以截个图连需求一起丢进去。
这事的关键其实不在模型本身,在工具链。网页端识图 DeepSeek 早就有,体验也不差,但那是给人用的。把视觉塞进 Harness 这种给 Agent 用的框架里,含义完全不同:智能体在调工具的过程中能”看见”了,原来必须拆成”人看图→人转述→Agent 干活”的流程,可以合成一步。
目前还是 exp 版,稳定性和边界能力肯定还要观察一段。但从发布节奏看,DeepSeek 这次是先把接口铺出去让开发者试,而不是憋一个大版本。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






DeepSeek 给 V4-Flash 装上眼睛:多模态智能体这块拼图补完了