DeepSeek 终于发布多模态模型 DeepSeek-V4-Flash-Vision-Exp,可以真正识图了。
对于我来说,未来将正式使用 DeepSeek Chat 了(手机和电脑 APP),过去我在元宝中使用 DeepSeek 模型的,原因之一就是 DeepSeek 只是文本模型, DeepSeek Chat 在识别图片上做的没有元宝优秀。
很多人说 DeepSeek Chat 上不是能上传图片呢?实际上它是先从图片识别文字,然后再让文字模型处理。但如果你上传的图片没有任何文字,它是不会处理的,小伙伴们应该都遇到过这种情况。
从现在开始 DeepSeek Chat 将支持三种模式,如下图:

而未来 DeepSeek 的模型将正式成为多模态模型。
DeepSeek-V4-Flash-Vision-Exp 和 DeepSeek-V4-Flash 从外面看来几乎一样:

价格方面,DeepSeek-V4-Flash-Vision-Exp 和 DeepSeek-V4-Flash 完全一样,图片也会解析为 token,每张图片最多 384 tokens。另外 DeepSeek 还发布了 Files API,可以在 Chat API 中复用图片,一个优化 Token 使用的小技巧。
性能方面呢,在四个 Agent 基准上,相比 DeepSeek-V4-Flash 都提升了,比如 ApexBench 从 26.2 提高到了 36.5,如下图:

此外 DeepSeek-V4-Flash-Vision-Exp 虽然加上了图片处理,但文字处理能力也没有减弱,比如 Toolathlon 的 75.9 追平了 Opus 4.8。
那为什么原生多模态模型如此重要呢?
过去 DeepSeek Chat 的做法是外部将图片处理成文字再丢给模型,不代表模型理解了图片,而现在模型本身就能理解图片,就算图片没有内容,也能理解其上下文。而现在各种 Agent,不仅仅要理解文字,更是通过图片去理解用户真正的需求。
对于 DeepSeek API 调用者来说,是时候将 DeepSeek-V4-Flash 替换为了 DeepSeek-V4-Flash-Vision-Exp,价格不变、核心功能引入、能力提升,为什么不换呢?
对于我来说,拜拜了元宝,因为到现在它内嵌的 DeepSeek 模型还是 3.0。
夜雨聆风