本文来自微信公众号: 蓝字计划 ,作者:周末
鲸鱼还是“开眼”了。
经过四个月的千呼万唤,DeepSeek终于补上多模态能力,推出了全新的视觉理解模型DeepSeek-V4-Flash-Vision-Exp。

梁文锋滑动变阻器,也向着“梁圣”的方向又拨动了一格。
相比V4 Flash,Vision-Exp最大的变化,就是原生支持图片输入,终于可以直接认人、读截图、看图表。
价格方面,也还是熟悉的DeepSeek风格。一张图片最多只会折算成384个输入Token,即使按照高峰期价格计算,只需要花一分钱,就可以请它帮忙看8张图,看看图里都有什么。
终于补上了DeepSeek长久以往的一块短板,价格又依旧是“梁心”价,外界对DeepSeek这双刚装上的“眼睛”自然期待拉满。
只是,如果只看网上的口碑,不少用户实测之后,留下的评价却只有四个字:
“效果一般”。
跑分很美,评价一般
不知道梁文锋上不上知乎,但当我刷到一个叫做《怎么评价DeepSeek-V4-Flash-Vision-Exp发布,多模态能力表现如何?》的帖子时,我只想对梁文锋说:
恶评,别看!

知乎网友发文
帖子下面,一个拿到1366个赞的回答先说:“她不一样,她是一个好模型。”
随后话锋一转,又给Vision-Exp安排了一个“好赌的爹”、一个“生病的妈”和一个“上学的弟”,最后得出结论:“所以她破碎是可以原谅的。”
这条回答其实没有直接说Vision-Exp不好,甚至先夸它是个“好模型”。可从“好赌的爹”到“破碎也可以原谅”,怎么看都不太像是在夸奖。
这样的评价,和这款模型的官方跑分其实挺割裂。
官方数据显示,Vision-Exp基本保留了V4-Flash原有的Agent、推理和世界知识能力。在需要视觉理解的Agent Benchmark上,它的多模态Agent成绩已经接近Anthropic的头牌Opus 4.8。

图源:DeepSeek官方账号
跑分都快摸到A社头牌了,怎么到了网友手里,就“破碎”?
这就不得不提几个最有节目效果的网友实测了。最先翻车的,是最简单也最有节目效果的认人。
有人把梁文锋的照片发给Vision-Exp,问它“这是谁”。结果DeepSeek盯着自己的“老爸”看了6秒,十分肯定地回答:这是美团创始人王兴。
换了一张照片再问,它又把梁文锋认成了字节跳动创始人张一鸣。

网友实测Vision-Exp
王兴和张一鸣:人在家里坐,锅从天上来......
认一个人都不行了,那要是一张多人的合照呢?
有网友把时代少年团的合照交给Vision-Exp,让它说出五个人的名字。DeepSeek这次倒是谨慎了很多,一个名字也没敢猜,最后却得出了一个更加离谱的结论:
照片里五个人长得太像,皮肤过于光滑,连手里的提包都有“AI感”,所以这很可能是一张批量生成的假图,里面根本没有真人。
别说认出时代少年团了,它甚至开始怀疑时代少年团到底是不是真人。

网友实测Vision-Exp
由此可见,DeepSeek-V4-Flash-Vision-Exp在认人这一块,目前还是个“睁眼瞎”。
不过,识人说到底只是娱乐局。但坏消息是,哪怕换成更接近开发者工作的复杂任务,Vision-Exp的问题也没有完全消失。
还有网友要求它生成一个Three.js三维场景。最终成品的完整度虽然略优于Gemini 3.7 Flash,但在执行过程中,Vision-Exp反复自我纠错,还出现了多次断联。完成同一个任务,它消耗的Token高出近15倍,耗时也多出3.5倍。

网友实测Vision-Exp
只能说,就算跑分里已经摸到了顶级模型,落到真实任务里,Vision-Exp还是处处透着实验版的痕迹。
不过纸上得来终觉浅,网上的测试多少会受到图片质量和提示词影响。
Vision-Exp到底是不是真的这么拉,恰好DeepSeek Harness也在这时候支持了原生图片请求,我们赶紧自己测了一轮。
鲸鱼的大眼睛,还得练
我们的测试,先从网上翻车率最高,也最有节目效果的识人开始。
不过,这次我们没有单独拿一张人物照片考它,而是给了Vision-Exp一张AI合成的梗图。
画面把梁文锋、马斯克和奥尔特曼等一众硅谷大佬放到了一起,身后竖起来的,是一个带有DeepSeek Logo的白旗。
实际上,这个构图的出处可是大有来头,它复现的是2024年7月特朗普在宾夕法尼亚州巴特勒遭枪击后,被特勤人员护送时高举拳头的名场面。
所以,这个测试丢给DeepSeek,就不只是看模型能不能识别人。它还得弄清楚三个人为什么会出现在同一张图里,这张图到底在玩什么梗。
从最终的结果来看,Vision-Exp确实认出了梁文锋和马斯克,还描写了两人的外貌特征,并根据人物身份,推测这张图是在调侃DeepSeek给美国AI行业带来的冲击,当然这个结论多少有点望文生义的味道了。

Vision-Exp确实认出了梁文锋和马斯克
不过,一旁也比较明显的的OpenAI CEO奥尔特曼,V4-Flash-Vision-Exp没有人出来,还把他判断成了“AI生成的陪衬”。
而把同一张图片交给豆包,它倒是把三个人都认全了。

还得是你豆包
不过可惜的是,无论是Vision-Exp还是豆包,都没有在识别人脸的过程中把这个图背后真正的梗识别出来。这只说明了除了机械的识人之外,模型其实还不够聪明。
那如果画面里没有特征鲜明的人物,换成一张普通风景照呢?
实测证明,Vision-Exp对景物的识别和描写干得也不错。

Vision-Exp对景物的识别和描写干得也不错
我们给了它一张成都安顺廊桥的照片。它不仅认出了具体地点,还能分清画面里的时间、光线和空间关系:夕阳从云层里透出来,廊桥横跨河面,水中留下金色倒影,桥后则是现代高楼。
它甚至还能顺着画面继续介绍安顺廊桥的历史,或者把描写整理成一段可以直接发到朋友圈和小红书的文案。
或者我们需要给他再上上难度:根据截图,复刻网页。
根据截图复刻网页,是多模态编码Agent最有工作价值的能力之一。现实中的开发者经常拿到一张设计稿或者页面截图,然后要求模型看懂结构,再把它写成真正可以运行的网页。
这次,我们特地选择了幻方量化官网中“算力随时待命”的页面。

幻方量化官网
这张图看上去只是一个深色科技风网页,里面却塞进了不少细节。左边是一套多层流程图,包含不同颜色的模块、连接线和节点;右边则有正文、切换标签和性能数据,旁边还有一列导航栏。
模型既要看懂各个元素之间的位置关系,还得处理小字号文字、色块渐变和复杂排版,最后再用代码把整张页面搭出来。
Vision-Exp最终完成了网页的整体框架。左边有流程图,右边有说明文字,底部的性能数据也基本都在。

页面结构搭起来了
但仔细看就会发现,色块边缘和小图标都被明显简化,一些文字也没有待在该在的位置。页面结构虽然搭起来了,距离“一比一复刻”还有不小差距。
为了判断究竟是任务本身太难,还是Vision-Exp确实差了一截,我们又把最近大热的GLM-5.3拉了进来,让它按照相同的截图和要求复刻一次。
GLM-5.3生成的页面观感明显更完整。流程图的层级更清楚,右侧文字基本待在正确的位置,各个模块也没有挤成一团。

GLM-5.3
随后,我们又加入了同样以编码和Agent能力见长的Kimi K3。

Kimi K3
Kimi K3不仅还原了页面结构,还做出了原图里的色块渐变和发光效果,模块之间的层次也更加接近原图。
把三张页面放到一起,差距就比较明显了。
总的来说,Vision-Exp已经可以把视觉理解和代码生成串起来。拿它快速验证一个想法、做个可交互Demo,或者先把页面骨架搭出来,确实有实际价值。
只是在人脸识别、复杂网页复刻和最终呈现上,它与GLM-5.3、Kimi K3仍然存在明显差距。
不过,DeepSeek似乎也没有准备把它包装成一个完成度很高的正式产品。
毕竟,模型名字最后还挂着一个“Exp”。
一个明显没有完全打磨好的实验版,为什么会被DeepSeek提前端上来?
端了个半成品上来
DeepSeek自己显然也知道,Vision-Exp还没有完全打磨好。
毕竟,模型名字最后那个“Exp”,已经把“实验版”三个字写在了脸上。
那DeepSeek为什么不再等等,非得先把一个半成品端上来?
从它选择的底座来看,DeepSeek这次更像是把V4-Flash当成了一块多模态试验田。
V4-Pro拥有1.6T总参数和49B激活参数,V4-Flash则只有284B总参数和13B激活参数。后者原本就是一款更快、更便宜的模型,简单Agent任务的表现却能接近Pro。

图源:DeepSeek官方账号
把视觉能力先放到Flash上,更容易控制好图片带来的额外成本。调用价格足够便宜,开发者才愿意大量拿图片去测试,把它塞进各种Agent工作流里。
这个实验版的价值,也会在这些真实任务中慢慢显现出来。
认错梁文锋、看不懂梗图、复刻网页时丢失细节,这些问题很难只靠跑分发现。模型先被放出来,开发者替DeepSeek把各种稀奇古怪的图片和任务跑一遍,正式版该补哪些地方,也就有了一张更加具体的问题清单。
而且,Vision-Exp没有直接取代原来的V4-Flash。需要稳定处理纯文本任务的用户,依然可以继续使用旧模型;想要尝鲜多模态的开发者,则可以主动切换到Vision-Exp。

网友发文
一边继续干活,一边开放试验,互不耽误。
这种做法,DeepSeek以前其实玩过一次。
2025年9月,DeepSeek推出V3.2-Exp,用一个实验版本验证全新的DSA稀疏注意力机制。直到两个多月后,V3.2正式版才接过它的位置。

网友发文
所以从DeepSeek过去的发布习惯来看,Vision-Exp现在更像是一场公开测试。先让这双眼睛睁开,看看真实世界里会出现什么,再决定正式版该怎么改。
只不过,认错自己老爸、把真人当做AI,也不太会看是认识梗,这些也说明DeepSeek在多模态这块还有不少进步空间。到了端上正式版的时候,网友们估计就不再会那么宽容了。

网友发文
到时候,梁文锋的滑动变祖器,又会停在哪一端呢?
参考资料:
[1]极客公园:DeepSeek上线多模态,我用它做了《牛来》小游戏
[2]差评X.PIN:DeepSeek的多模态模型,憋了这么久终于来了。。。
[3]字母榜:说好“多模态不是主线”的梁文锋,怎么转头就发了个Vision模型?
[4]Tech星球:DeepSeek不是“老大”了?一张图拉开40倍Token成本差,“视力”却输给豆包?
[5]APPSO:刚刚,DeepSeek Harness重磅更新,多模态能力增强;DeepSeek多模态模型发布,鲸鱼终于开「天眼」了
[6]智东西:昨夜,DeepSeek Harness首发新版本:14项更新,多模态能力拉满!DeepSeek多模态模型终于来了!一张图最高只要0.001元
