**DeepSeek发布首个多模态模型V4-Flash-Vision-Exp,跑分接近顶级模型但实测识人和网页复刻能力明显不足;该模型以“实验版”形式低价开放,旨在通过公开测试收集真实任务中的问题清单。** **要点** **1. 补上多模态短板,价格延续低价策略** V4-Flash-Vision-Exp原生支持图片输入,每张图最多折算384个输入Token,高峰期约一分钱可处理8张图,延续了DeepSeek一贯的低价风格。 **2. 官方跑分亮眼,网友实测翻车** 官方数据显示其多模态Agent成绩接近Anthropic的Opus 4.8,但用户实测中认人能力差:将梁文锋认成王兴或张一鸣,把时代少年团合照判定为AI生成的假图。 **3. 复杂任务执行存在明显差距** 复刻网页时虽能搭出整体框架,但细节丢失严重;完成同一Three.js任务,Token消耗比Gemini 3.7 Flash高出近15倍,耗时多出3.5倍,明显逊于GLM-5.3和Kimi K3。 **4. 挂“Exp”后缀,定位公开测试** DeepSeek选择将Vision能力先放在更轻量的V4-Flash上,且未取代原纯文本模型,与之前V3.2-Exp验证稀疏注意力机制的策略一致,本质是先靠开发者跑量收集问题,为正式版迭代提供依据。
实测“开了眼”的DeepSeek:认得马斯克,认不出梁文锋
2026-08-25 17:33

实测“开了眼”的DeepSeek:认得马斯克,认不出梁文锋

本文来自微信公众号: 蓝字计划 ,作者:周末


鲸鱼还是“开眼”了。


经过四个月的千呼万唤,DeepSeek终于补上多模态能力,推出了全新的视觉理解模型DeepSeek-V4-Flash-Vision-Exp。


梁文锋滑动变阻器,也向着“梁圣”的方向又拨动了一格。


相比V4 Flash,Vision-Exp最大的变化,就是原生支持图片输入,终于可以直接认人、读截图、看图表。


价格方面,也还是熟悉的DeepSeek风格。一张图片最多只会折算成384个输入Token,即使按照高峰期价格计算,只需要花一分钱,就可以请它帮忙看8张图,看看图里都有什么。


终于补上了DeepSeek长久以往的一块短板,价格又依旧是“梁心”价,外界对DeepSeek这双刚装上的“眼睛”自然期待拉满。


只是,如果只看网上的口碑,不少用户实测之后,留下的评价却只有四个字:


“效果一般”。


跑分很美,评价一般


不知道梁文锋上不上知乎,但当我刷到一个叫做《怎么评价DeepSeek-V4-Flash-Vision-Exp发布,多模态能力表现如何?》的帖子时,我只想对梁文锋说:


恶评,别看!


知乎网友发文


帖子下面,一个拿到1366个赞的回答先说:“她不一样,她是一个好模型。”


随后话锋一转,又给Vision-Exp安排了一个“好赌的爹”、一个“生病的妈”和一个“上学的弟”,最后得出结论:“所以她破碎是可以原谅的。”


这条回答其实没有直接说Vision-Exp不好,甚至先夸它是个“好模型”。可从“好赌的爹”到“破碎也可以原谅”,怎么看都不太像是在夸奖。


这样的评价,和这款模型的官方跑分其实挺割裂。


官方数据显示,Vision-Exp基本保留了V4-Flash原有的Agent、推理和世界知识能力。在需要视觉理解的Agent Benchmark上,它的多模态Agent成绩已经接近Anthropic的头牌Opus 4.8。


图源:DeepSeek官方账号


跑分都快摸到A社头牌了,怎么到了网友手里,就“破碎”?


这就不得不提几个最有节目效果的网友实测了。最先翻车的,是最简单也最有节目效果的认人。


有人把梁文锋的照片发给Vision-Exp,问它“这是谁”。结果DeepSeek盯着自己的“老爸”看了6秒,十分肯定地回答:这是美团创始人王兴。


换了一张照片再问,它又把梁文锋认成了字节跳动创始人张一鸣。


网友实测Vision-Exp


王兴和张一鸣:人在家里坐,锅从天上来......


认一个人都不行了,那要是一张多人的合照呢?


有网友把时代少年团的合照交给Vision-Exp,让它说出五个人的名字。DeepSeek这次倒是谨慎了很多,一个名字也没敢猜,最后却得出了一个更加离谱的结论:


照片里五个人长得太像,皮肤过于光滑,连手里的提包都有“AI感”,所以这很可能是一张批量生成的假图,里面根本没有真人。


别说认出时代少年团了,它甚至开始怀疑时代少年团到底是不是真人。


网友实测Vision-Exp


由此可见,DeepSeek-V4-Flash-Vision-Exp在认人这一块,目前还是个“睁眼瞎”。


不过,识人说到底只是娱乐局。但坏消息是,哪怕换成更接近开发者工作的复杂任务,Vision-Exp的问题也没有完全消失。


还有网友要求它生成一个Three.js三维场景。最终成品的完整度虽然略优于Gemini 3.7 Flash,但在执行过程中,Vision-Exp反复自我纠错,还出现了多次断联。完成同一个任务,它消耗的Token高出近15倍,耗时也多出3.5倍。


网友实测Vision-Exp


只能说,就算跑分里已经摸到了顶级模型,落到真实任务里,Vision-Exp还是处处透着实验版的痕迹。


不过纸上得来终觉浅,网上的测试多少会受到图片质量和提示词影响。


Vision-Exp到底是不是真的这么拉,恰好DeepSeek Harness也在这时候支持了原生图片请求,我们赶紧自己测了一轮。


鲸鱼的大眼睛,还得练


我们的测试,先从网上翻车率最高,也最有节目效果的识人开始。


不过,这次我们没有单独拿一张人物照片考它,而是给了Vision-Exp一张AI合成的梗图。


画面把梁文锋、马斯克和奥尔特曼等一众硅谷大佬放到了一起,身后竖起来的,是一个带有DeepSeek Logo的白旗。


实际上,这个构图的出处可是大有来头,它复现的是2024年7月特朗普在宾夕法尼亚州巴特勒遭枪击后,被特勤人员护送时高举拳头的名场面。


所以,这个测试丢给DeepSeek,就不只是看模型能不能识别人。它还得弄清楚三个人为什么会出现在同一张图里,这张图到底在玩什么梗。


从最终的结果来看,Vision-Exp确实认出了梁文锋和马斯克,还描写了两人的外貌特征,并根据人物身份,推测这张图是在调侃DeepSeek给美国AI行业带来的冲击,当然这个结论多少有点望文生义的味道了。


Vision-Exp确实认出了梁文锋和马斯克


不过,一旁也比较明显的的OpenAI CEO奥尔特曼,V4-Flash-Vision-Exp没有人出来,还把他判断成了“AI生成的陪衬”。


而把同一张图片交给豆包,它倒是把三个人都认全了。


还得是你豆包


不过可惜的是,无论是Vision-Exp还是豆包,都没有在识别人脸的过程中把这个图背后真正的梗识别出来。这只说明了除了机械的识人之外,模型其实还不够聪明。


那如果画面里没有特征鲜明的人物,换成一张普通风景照呢?


实测证明,Vision-Exp对景物的识别和描写干得也不错。


Vision-Exp对景物的识别和描写干得也不错


我们给了它一张成都安顺廊桥的照片。它不仅认出了具体地点,还能分清画面里的时间、光线和空间关系:夕阳从云层里透出来,廊桥横跨河面,水中留下金色倒影,桥后则是现代高楼。


它甚至还能顺着画面继续介绍安顺廊桥的历史,或者把描写整理成一段可以直接发到朋友圈和小红书的文案。


或者我们需要给他再上上难度:根据截图,复刻网页。


根据截图复刻网页,是多模态编码Agent最有工作价值的能力之一。现实中的开发者经常拿到一张设计稿或者页面截图,然后要求模型看懂结构,再把它写成真正可以运行的网页。


这次,我们特地选择了幻方量化官网中“算力随时待命”的页面。


幻方量化官网


这张图看上去只是一个深色科技风网页,里面却塞进了不少细节。左边是一套多层流程图,包含不同颜色的模块、连接线和节点;右边则有正文、切换标签和性能数据,旁边还有一列导航栏。


模型既要看懂各个元素之间的位置关系,还得处理小字号文字、色块渐变和复杂排版,最后再用代码把整张页面搭出来。


Vision-Exp最终完成了网页的整体框架。左边有流程图,右边有说明文字,底部的性能数据也基本都在。


页面结构搭起来了


但仔细看就会发现,色块边缘和小图标都被明显简化,一些文字也没有待在该在的位置。页面结构虽然搭起来了,距离“一比一复刻”还有不小差距。


为了判断究竟是任务本身太难,还是Vision-Exp确实差了一截,我们又把最近大热的GLM-5.3拉了进来,让它按照相同的截图和要求复刻一次。


GLM-5.3生成的页面观感明显更完整。流程图的层级更清楚,右侧文字基本待在正确的位置,各个模块也没有挤成一团。


GLM-5.3


随后,我们又加入了同样以编码和Agent能力见长的Kimi K3。


Kimi K3


Kimi K3不仅还原了页面结构,还做出了原图里的色块渐变和发光效果,模块之间的层次也更加接近原图。


把三张页面放到一起,差距就比较明显了。


总的来说,Vision-Exp已经可以把视觉理解和代码生成串起来。拿它快速验证一个想法、做个可交互Demo,或者先把页面骨架搭出来,确实有实际价值。


只是在人脸识别、复杂网页复刻和最终呈现上,它与GLM-5.3、Kimi K3仍然存在明显差距。


不过,DeepSeek似乎也没有准备把它包装成一个完成度很高的正式产品。


毕竟,模型名字最后还挂着一个“Exp”。


一个明显没有完全打磨好的实验版,为什么会被DeepSeek提前端上来?


端了个半成品上来


DeepSeek自己显然也知道,Vision-Exp还没有完全打磨好。


毕竟,模型名字最后那个“Exp”,已经把“实验版”三个字写在了脸上。


那DeepSeek为什么不再等等,非得先把一个半成品端上来?


从它选择的底座来看,DeepSeek这次更像是把V4-Flash当成了一块多模态试验田。


V4-Pro拥有1.6T总参数和49B激活参数,V4-Flash则只有284B总参数和13B激活参数。后者原本就是一款更快、更便宜的模型,简单Agent任务的表现却能接近Pro。


图源:DeepSeek官方账号


把视觉能力先放到Flash上,更容易控制好图片带来的额外成本。调用价格足够便宜,开发者才愿意大量拿图片去测试,把它塞进各种Agent工作流里。


这个实验版的价值,也会在这些真实任务中慢慢显现出来。


认错梁文锋、看不懂梗图、复刻网页时丢失细节,这些问题很难只靠跑分发现。模型先被放出来,开发者替DeepSeek把各种稀奇古怪的图片和任务跑一遍,正式版该补哪些地方,也就有了一张更加具体的问题清单。


而且,Vision-Exp没有直接取代原来的V4-Flash。需要稳定处理纯文本任务的用户,依然可以继续使用旧模型;想要尝鲜多模态的开发者,则可以主动切换到Vision-Exp。


网友发文


一边继续干活,一边开放试验,互不耽误。


这种做法,DeepSeek以前其实玩过一次。


2025年9月,DeepSeek推出V3.2-Exp,用一个实验版本验证全新的DSA稀疏注意力机制。直到两个多月后,V3.2正式版才接过它的位置。


网友发文


所以从DeepSeek过去的发布习惯来看,Vision-Exp现在更像是一场公开测试。先让这双眼睛睁开,看看真实世界里会出现什么,再决定正式版该怎么改。


只不过,认错自己老爸、把真人当做AI,也不太会看是认识梗,这些也说明DeepSeek在多模态这块还有不少进步空间。到了端上正式版的时候,网友们估计就不再会那么宽容了。


网友发文


到时候,梁文锋的滑动变祖器,又会停在哪一端呢?


参考资料:


[1]极客公园:DeepSeek上线多模态,我用它做了《牛来》小游戏


[2]差评X.PIN:DeepSeek的多模态模型,憋了这么久终于来了。。。


[3]字母榜:说好“多模态不是主线”的梁文锋,怎么转头就发了个Vision模型?


[4]Tech星球:DeepSeek不是“老大”了?一张图拉开40倍Token成本差,“视力”却输给豆包?


[5]APPSO:刚刚,DeepSeek Harness重磅更新,多模态能力增强;DeepSeek多模态模型发布,鲸鱼终于开「天眼」了


[6]智东西:昨夜,DeepSeek Harness首发新版本:14项更新,多模态能力拉满!DeepSeek多模态模型终于来了!一张图最高只要0.001元

AI行业信号频道: 前沿科技
本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
正在改变与想要改变世界的人,都在 虎嗅APP