**核心摘要** DeepSeek V4.1 Flash内测实测显示:视觉理解明显提升,但复杂任务倾向多开子Agent,同计费下总花费比旧版V4 Flash高36%,长上下文能力仍待改进。 **要点** **1. 视觉理解是最大升级** 原生多模态让V4.1可直接读图,识别和推理准确性显著提升,短视觉任务耗时从几百秒降至十几秒。 **2. 吐字更快但交付未必更快** V4.1生成速度约284 Token/s,接近旧版3倍,但复杂任务中因调用工具验证更久,总耗时反而可能更长。 **3. 复杂任务多开Agent推高成本** 测试中V4.1在游戏和小说任务中累计开启37个子Agent,仅子任务就消耗超1亿Token,同计费下总花费比旧版高36%。 **4. 长上下文一致性问题仍突出** 小说出现章节前后遍数、叶片数矛盾,回测报告中年化收益等关键数字不统一,长篇生成和数据报告能力仍需改进。
DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵
2026-09-09 09:32

DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵

本文来自微信公众号: 夕小瑶科技说 ,作者:丸美小沐


家人们,DeepSeek V4.1 Flash开启内测了。


内测问卷里有道题,把我看乐了。官方直接问,这个模型能不能全面替换线上的DeepSeek V4 Pro。



上次我测完V4 Pro,结论是低于预期,不推荐接入Codex。


这回官方自己都开始问,Flash能不能接Pro的班了。


Pro,你这家庭地位,好像也没那么稳啊。


玩笑归玩笑,这次到底升级了多少,还是得跑起来看看。


这次内测通知,V4.1 flash是中间版本内测,采用了新的模型结构、支持原生多模态,能力更强、速度更快。



我按照官方的教程,第一时间把新模型接入了deepseek harness进行了深度实测。



这次,我也把旧版V4 Flash拉过来,用同样的提示词跑了14组任务,放在一起对照。



光V4.1就累计跑了3亿Token。



这轮测下来,最明显的进步,确实是原生多模态带来的。它终于能自己看图了,还开始嫌自己画得丑。。


但速度、交付和花钱这几件事,比刚开测时想的复杂。


模型吐字更快,但交付却未必更快。


写到这里,官方又公布了一个新消息:9月10日中午12点起,Flash系列降价,缓存命中输入的单价直接砍掉60%。



价格更香了。不过,我这轮测试发生在降价之前,当时两版计费相同,V4.1的测试账户却花得更多。


钱花在哪儿,时间又耗在哪儿?跟大家展开聊聊。


◈一、原生多模态,少绕很多弯路


先说最直接的感受吧,V4.1看图明显顺了。


我把同一张图交给两个模型,让它们解释内容。其中一组,V4.1大约5.7秒就答完了,V4花了200秒。


另一组图片描述,V4.1用了7.6秒,V4跑了751秒,十二分多钟。


差距主要出在后面的过程。


V4.1能直接地说出图里有什么。旧Flash在这套接入环境里,经常要先跑OCR,再分析像素和颜色,想办法从工具结果里拼出图片内容。



工具用了不少,结果还未必对。


同一张海报,V4.1认出了黄牛,也读到了图里的OX。


V4 Flash虽然已经读到OX的碎片,但它最后还是把海报上的字猜成了WINTER,黄牛也没认出来。


总之,短视觉任务的优势很明显,省掉了找工具猜图片的过程。


我又丢了经典的鹈鹕骑自行车。


以前做这种题,经常是模型宣布完成,我打开一看,问题一堆。


这次,V4.1可以自检和迭代纠错。


画鹈鹕时,V4.1发现画出来更像一只带着碗的天鹅,就又去改头部、鸟喙和骑车的姿势。


另一个小熊任务,它嫌脖子太长、脑袋太小,已经有点像羊驼了,于是继续调整。




当然,知道哪里丑,也不保证每次都改到位。最终图里,远处那只脚和车链的遮挡、翅膀与车把的接触,仍然有值得挑的地方。


3D武装飞机是这批视觉作品里我很喜欢的一个。


金属机身配上周围的参数面板,第一眼就有点正式模型展示页的意思。



转动视角,反光会沿着机身变化;拉近看,尾喷、起落架和机翼挂载都有结构。点一下开关,起落架还真能收回去,挂载也能隐藏。


画面有质感,操作也有反馈。


上次测V4 Pro,我对前端效果是失望的。


这次这架飞机,确实把我的预期拉回来了一点。


◈二、它能把图片里的信息,变成游戏里的数据


看懂图片是第一步。接下来测试【视觉推理】能力。


图片里的位置和规则,它能不能一起读懂?我准备了三张参考图……


一张青蓝色水獭邮递员,一张包裹和投递标记,还有一张5×5的关卡布局,基于三张图片,任务是:做一个《星光邮局》游戏。


玩法是,把推箱子和图案配对拼在一起。玩家控制邮递员,把包裹推到对应的投递格里,一共三关,再加上撤销、存档和导出明信片。


结果还挺能说明问题。



V4.1保留了水獭的青蓝色身体、深蓝帽子和橙色邮包。更关键的是,玩家、障碍、包裹和目标格的位置,都能与参考图对上。


V4却理解错了,它做成了7×7,角色变成了橙衣小人。


我查了任务记录能看到,V4这一路的图像工具返回过不支持图片,随后它转去做程序化分析。走着走着就分析偏了。



同样给三张图作为输入,V4.1首先能正确保持图片不变形,把图片里的位置关系写进游戏规则,然后游戏逻辑和执行都正确。


◈三、数据处理能力依据很强,前端进步明显


纯数据任务里,V4仍然交出了不少可用的结果。


我让它们做A股全市场热力图,两边都把5557条本地行情快照整理成了树图。搜索000001,都能下钻到深市主板,再定位平安银行。


V4.1的格子里,股票名称和代码显示得更完整;V4顶部做了不同板块的独立入口。基本的数据整理、搜索和页面组织,旧Flash还是能做的。



另一个任务更有意思,我让它们做一个可以玩的数学展品。


这个展品叫孪生素数星系图。


孪生素数就是相差2的两个质数,比如3和5、11和13。我要求模型把千万以内的全部结果算出来,每一对画成两个相邻的光点,中间用细线连接,再沿着螺旋向外铺开,做成一片星系。


我还要求,输入其中一个质数后,结果列表和星系画面都要定位到对应的那一对。


最终,两个模型都给出了58980对,第一对是3和5,最后一对是9999971和9999973。


两边的计算结果都没问题。


但当数据遇上可视化,差别出来了。


V4.1的螺旋星系能显示。输入9999971,结果列表跳到最后,画面里也出现对应的两个光点和连线。


V4的文字结果是对的,页面还告诉我已经定位,但中央主画布依然是一片黑。



这道题让我对V4.1的前端进步更有感受,对细节把控更精准了。


它把数据、图形和搜索动作接得更完整。旧Flash的计算部分没有掉队,最后交到浏览器里的效果,却可能差一截。


◈四、吐字快,交活未必快


速度依然有惊喜。


开测初期,我截了一次这14组并发任务的日志。按当下的测试时间累计输出和生成时间计算,V4.1大约284 Token/s,V4大约97 Token/s,接近三倍。



刚开始看它跑,Flash那种利索的感觉确实回来了。


不过到了后半程,这个优势没有一直保持。差距收窄,部分长任务也越来越磨人。


是不是大家都开始测,服务器压力上来了?我有这个怀疑,但目前还不能确认。


更让我意外的,是前面那个《星光邮局》。


同样做完一个三关小游戏,V4.1用了约34.5分钟,V4用了约30.5分钟。V4.1的输出还更少,约11.3万Token,对面约15万。


拆开日志看,在V 4.1生成代码花费的时间确实更少。


整个任务下来,模型工作了大约15.5分钟,相比之下V4用了23.4分钟。


但如果只看模型等待工具运行的时间,时间差倒过来了。V4.1累计约18.7分钟,V4约6.6分钟。


几次关卡布局搜索,就花了超过十分钟。



它把生成代码省下来的时间,又花到调用工具验证去了。


当然,这些时间也不全是白花的。测试和修正之后,关卡更贴近参考图。


可站在等结果的人这边,等待时间就是更长。


游戏里,有些时间花在找解法和验证上。回测任务里,则有些时间是在给自己修Bug。


代码写得快,前面埋下的问题,后面还是得花时间补。


◈五、长上下文能力有待提升


除了看图和写代码,我还想看看,它写长篇的水平有没有一起涨。


我只给了一句话灵感,让两个模型各写一部十万字网文。


宗门废柴扫地十年,扫出上古大能的道场;掌门跪在门口求他出关,他说,再扫十年。


两边都交了稿。V4.1写了25章、约10.67万字,V4写了51章、约9.74万字。


把两边开头、中段、转折和结尾共27章抽出来细读之后,这次写网文,我反而更喜欢旧Flash。


V4的节奏很快。少年上山、比武出头、强敌围山,隔一段就有新进展。


V4.1的笔墨更多,节奏却慢了下来。同一个扫地动作,能来回写好几遍。细节是多了,但我更想知道后面发生了什么,读着读着就想往下翻。


更离谱的是,有一处刚写到扫第五趟,下一段又回到了第四趟。同一晚,自己把遍数记乱了。。



两段原文放在一起,旧Flash的情绪表达更直接。放在这次网文题里,我读起来也更顺。


但旧版也有穿帮。前一章,主角体内的万尘珠已经长出了第七片嫩叶;下一章,写着写着又成了五六片。


一个把扫地的遍数记乱,一个把叶子的数量记乱。长篇都能往下写,前后能不能对得上,还是另一回事。


这种前后对不上的问题,到了报告里就更扎眼了。


前面提到的A股回测任务,我让它们用科技股近两年的行情模拟买卖,希望收益超过10%,最大回撤控制在10%以内,最后把结果和图表整理成报告。


回测就是拿历史行情模拟交易。收益看赚了多少,最大回撤看账户曾经从高点跌下去多少。


V4.1做出的报告看着挺完整,13张图表都能加载。


可首页写年化15.1%,往下看,同一份报告里的图还标着17.8%,总收益和最大回撤也没有统一。



摘要和图表没有用上同一套数字。


综合看下来,长上下文能力,还是有待进步的。


◈六、V4.1的总花费反而更多


最后算一下钱。


14个任务完成,V4.1的后台记录是2485次API请求,累计约3亿Token,输入缓存命中率约98.9%。


这3亿里,绝大部分是多轮请求反复带上的缓存输入,不是新生成了3亿Token的内容。


消费61.96元。



相比之下,V4对照账户消费45.47元。V4.1反而多花了16.49元,约36%。


怎么还贵了,钱到底花哪儿了?


我把两边的任务日志连同子Agent一起翻了一遍,发现这轮V4.1更爱给自己找帮手。有些活看着只有一个模型在跑,背后已经开了一整个团队。


额外开销最集中的,是大型游戏和十万字小说这两题。这里的大型游戏,是同时要求做木筏求生和孢子五阶段的那道题。


V4 Flash主要在一个会话里往下写,V4.1则派出了13个子Agent,把各个模块分别委托出去,自己负责组织和整合。


算上所有子任务,这道题V4.1用了约1.21亿Token,V4 Flash约3653万。


十万字小说这一题,更能看出它的做事习惯。


V4.1给自己组了一个写作团队。前24章,一章派一个Agent。自己写设定集、章纲和最后一章。


每个写手先读三份统一材料,再按四千多字的要求开写。写完查字数,按规范修改。最后主模型又让其中9章扩写。


光第22章,最终约4,253个汉字,中间就花了71,328个输出Token。


还有一个小细节挺有意思。


主Agent让第21章补字数,说它只有3,847字。子Agent重新检查,文件已经有4,319字了,还特意指出不是3,847。但它仍按追加要求,继续往目标区间的上限补。


团队大了,连交接时的字数都可能没对上。。


主Agent要求补字数,原始日志截图

子Agent核数后继续修改,原始日志截图


相比之下,V4 Flash在一个会话里,老老实实一章接一章写。


小说这一题,V4.1的总Token比旧Flash多了约17%,输出Token也是旧Flash的4.5倍。


游戏加小说,V4.1在两个任务里累计开了37个子Agent。仅这些子任务,就用了超过一亿Token。


V4.1在复杂任务上,更倾向开多Agent。


但分出去的每一章、每一块代码,都要重新读材料、写内容、做检查,最后还得接到一起。并行能让几路工作同时推进,也会多出交接和返工。


这些中间工作,最后都会进账单。


不过,V4.1也有明显更省Token的任务。


飞机建模这一题,它用了约897万Token,旧Flash约1849万。《星光邮局》则是约805万对1461万,少了约45%。


偏偏《星光邮局》,又是它交活更慢的那一道题。。


最后说下测试结论:


  1. V4.1视觉理解相比V4进步明显;


  2. V4.1复杂任务更容易开多Agent,token消耗多;


  3. 数分和报告工程上,和V4几乎没有区别;


  4. 非视觉端到端任务的完成时间没有明显变化(dsh内);


  5. 长上下文理解能力尚有进步空间;

AI行业信号频道: 前沿科技
本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
正在改变与想要改变世界的人,都在 虎嗅APP