DeepSeek-V4-Flash-Vision-Exp 放出来了,权重在 Hugging Face,API 同步上线,官网文档和定价当天下午就更新完了。
名字里的 Exp 是实验性的意思,这是 V4 系列第一个多模态模型。做法不是重新训一个,而是在现成的 V4-Flash 架构上挂视觉模块继续训,总参数 3050 亿。
官方给的对比数据里,多模态 agent 那一栏的提升最明显:ApexBench 从 26.2 涨到 36.5。纯文本 agent 任务的表现跟之前的 V4-Flash-0731 基本持平——也就是说加视觉没把文本能力吃掉,这在”缝视觉模块”这条路上算是过关了。
许可证给的是 MIT。这个选择比模型本身更值得说一句:MIT 意味着商业集成、二次开发、闭源再分发都不设障碍,比一堆带附加条款的”开源”宽松得多。
能看图之后,模型可以直接读图表、截图、界面,再配合外部工具去完成 Agent 任务,而不是只能处理纯文本指令。对做自动化流程的人来说,少了一层 OCR 或者图像描述的中转。
标着 Exp,说明 DeepSeek 自己也没把它当成终态。V4 系列的正式多模态版本大概还在后面。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






DeepSeek开源了V4系列第一个能看图的模型,3050亿参数,MIT协议