DeepSeek更新V4 Pro(版本号0813)性能跑分亮眼,但第三方和实测翻车,其发布后全球AI模型普遍降价,推测解码、静态知识剥离等技术正持续拉低模型成本。 ## **1. V4 Pro更新跑分亮眼但实测翻车** DeepSeek深夜悄悄更新V4 Pro 0813版,官方跑分显示性能接近最强模型Claude Fable 5,但第三方评测分数远低于宣传,鹈鹕等实测效果甚至不如V4 Flash,猜测该版本可能只是占位符,并未正式上线完整新模型。 ## **2. V4发布后全球AI模型普遍降价** DeepSeek V4凭借能力够用、价格低两个数量级形成价格斩杀线,逼迫OpenAI、Anthropic、谷歌及国内多家AI厂商纷纷降价,只有头部顶级旗舰模型仍维持高价溢价。 ## **3. 斩杀线未来会持续向下移动** 推测解码、Engram静态知识剥离两项技术逐渐成熟,可分别通过小模型打草稿、剥离事实性知识释放模型算力,持续降低模型推理成本,会推动价格斩杀线不断下移。 ## **4. Agent测试框架或带来新价格档位** 此前DeepSeek V4 Flash的基准高分是模型加自研DeepSeek Harness框架的组合成绩,并非纯模型裸分,待框架和V4 Pro正式组合上线后,有望催生新的高性价比价格斩杀档位,国内厂商已跟进同类产品研发。
DeepSeek V4 Pro正式版“V5”,但鹈鹕测试翻车了
2026-08-13 16:01

DeepSeek V4 Pro正式版“V5”,但鹈鹕测试翻车了

作者:苗正,编辑:王靖,原文标题:《V4Pro正式版“V5”,但鹈鹕测试翻车了》,题图来自:AI生成


8月12日深夜,DeepSeek官网的API文档页面悄然完成了一次更新。Pro模型的版本号更换成了DeepSeek-V4-Pro-0813。



与此同时,根据第一财经报道,DeepSeek官方群放出了一组评分数据,表格中显示DeepSeek V4 Pro的性能远远超过了预览版,甚至在Terminal Bench 2.1这个Agent领域影响极大的测试集上,性能比肩当下最强的模型Claude Fable 5。



另一方面,在DeepSWE测试集上,预览版仅得12.8分,基本属于“不会做”的水平;正式版直接飙到62.7分,涨幅接近5倍。


这个测试集是衡量代码Agent能力的核心基准。同样翻倍的还有DSBench-Hard,从31.1冲到67.2;DSBench-FullStack从41.8提升到71.1。


如此这般的性能提升,将其称之为DeepSeek V5 Pro都不为过。


硬件规格上,V4 Pro延续了MoE架构设计,总参数规模1.6万亿,每次推理激活约490亿参数。接口侧提供100万 token上下文和最高38.4万 Token 输出,这两个数字对普通聊天可能意义不大,但对长任务Agent却是硬刚需。


尤其是大型代码库、长时间运行的日志以及连续工具调用,都会快速吃掉上下文。窗口不够大,Agent就只能不断压缩记忆,压着压着,前面做过什么也忘了。


调用方式保持不变,模型名仍然是deepseek-v4-pro,老用户的代码一行不用改,后端就自动切换到了新版本。


价格方面,0813版每百万token缓存未命中输入3元、输出6元,和预览版时期一致,并没有随模型转正而同步上调。


而就在不久前,DeepSeek官方曾表示价格将要上涨。


一、DeepSeek V4引发全球降价


自DeepSeek V4发布以后行业内有个怪现象,几乎所有大厂都在降价。但大背景却是只要跟AI相关的,一定都在涨价。最开始是GPU、内存,现在连硬盘、电,甚至陶瓷都涨了。


就好像西红柿涨价、鸡蛋涨价、糖涨价,结果西红柿炒鸡蛋反而比以前更便宜了。


2025年的时候,DeepSeek R1虽然引发了DeepSeek时刻,可当时由于行业重点在于输出内容的质量,所以OpenAI、Anthropic还能用“我们更聪明”来维持溢价。


但是现在今年7月31日V4 Flash正式版上线以后,行业叙事改成了“每任务/单位智能的价格”,DeepSeek V4 Flash正式版凭借“能力够用+价格便宜两个数量级”形成了一道独有的斩杀线。


根据Artificial Analysis的测试,在完成相同水平任务的前提下,DeepSeek V4 Flash的价格低于市面上70%的模型,而那些处于这70%分水岭内的模型,称之为被DeepSeek“斩杀”。


落在斩杀线上的竞品,只剩两条出路,要不然主动大幅下调定价,或者干脆放弃普惠开发者市场,收缩到预算充足的高端企业客户。


于是各家厂商的处境变得很微妙。短期内没办法提高智能水平,又舍不得开发者市场,降价就成了唯一能立刻执行的防御手段。


OpenAI是最典型的例子。GPT-5.6 Luna 7月9日才上线,7月30日就宣布降价80%,输入价从每百万token 1美元砍到0.2美元,输出价从6美元砍到1.2美元。一款刚发布的新旗舰,上市不到一个月就打两折,这也是无可奈何的事情。


OpenAI在降价当天同步发了一篇技术博客,称GPT-5.6 Sol自己重写并优化了部分生产推理内核,把端到端模型服务成本压低了约20%,token生成效率提升了15%以上。


这就使得它能把省下来的钱,直接变成给用户的降价补贴。换句话说,OpenAI这波降价,是被自己模型写代码省下的成本托起来的。


不过成本降低20%和提升15%生成效率这两个数字,似乎跟降价80%匹配不上。


根据OpenAI的投资人披露,该企业单季营收57亿美元,同比增长约3倍;经营性亏损93亿美元,当期现金消耗(实际烧掉的现金)37亿美元,相当于每赚1美元收入就要烧掉约0.65美元现金。当季研发支出高达86亿美元,整体毛利率仅39%。


并且市场预测,OpenAI在2026年的全年经营性亏损约为140亿美元。


因此,无论如何OpenAI发布的技术报告内容如何,如果没这条斩杀线,这笔效率红利大概率会先进利润表,而不是变成用户账单上的折扣。


Anthropic也有相似的反应。Claude Opus 5发布后,其定价改为了5美元/25美元,正好是Fable 5的半价。Sonnet 5首发优惠价2美元/10美元,比标准定价低了三分之一,优惠期一路延到8月31日。


随着DeepSeek斩杀线的发酵,Anthropic在8月10日宣布,将Sonnet 5的优惠价格变为永久价格,再也不会恢复成为原价格。


谷歌7月21日一口气发三款 Gemini Flash 轻量模型,主力款3.6 Flash当天宣布输出价永久下调17%。


国内更是放血式促销,8月11日,智谱把GLM Coding Plan全员额度重置回满,再叠1.5倍限时加成;火山引擎给 GLM-5.2开出四倍折扣系数,49元的套餐能换到五千多万token;OpenRouter上GLM-5.2的三家供应商互相压价,从60%打到80%,再到95%。


二、反直觉,斩杀线其实会越来越低


逃避斩杀线的路有两条:一条往下走,一条往上走。


往下走是防御,是承认自己在这个区间和DeepSeek没有本质区别,只能拼价格。往上走是进攻,是只要能力足够强、DeepSeek够不到,就根本不在斩杀线的杀伤范围内。


在DeepSeek的斩杀线之上可以继续收溢价,因此,诸如GPT-5.6 Sol、Kimi K3、Claude Fable 5,这些真正站在金字塔尖的旗舰模型,一个都没降价。


以Kimi K3为例,于2026年7月16日正式上线,本身就发布在DeepSeek V4 Flash之后,其 API 定价为:国际版输入3美元/百万token、输出15美元/百万token;国内版输入20元/百万token、输出100元/百万token。


对比上一代旗舰K2.6,K3国内版的输入价格上涨了208%,输出价格上涨270%


但是有个事得提前说明白,如今已经2026年过半了。DeepSeek V4 Flash的总参数量为284B,这在当下其实是一个非常轻量的模型,它的定位是“高效率地完成大多数任务”。


Artificial Analysis的智能指数里,V4 Flash只得了50分,明显低于 Kimi K3、GPT-5.6和Claude Fable 5。


这就使得在复杂推理、长链路任务、多步规划、需要深度领域知识的判断,这些超级硬核的任务上,DeepSeek V4 Flash的完成率和可靠性,远不如头部模型。


斩杀线扫过的是“够用就好”的那片海,在“必须万无一失”的那片土地上,DeepSeek暂时还过不去。


不过这个斩杀线其实也维持不了多久,因为“推测解码”越来越成为了主流。这也是为什么,所有大厂都要研发旗舰模型的同时,开发一款极其便宜的小模型。


所谓推测解码,是指2022年时,谷歌Research团队的亚尼夫·利维坦(Yaniv Leviathan)、马坦·卡尔曼(Matan Kalman)和约西·马蒂亚斯(Yossi Matias)曾在论文《通过推测解码实现Transformer的快速推理》(Fast Inference from Transformers via Speculative Decoding)中提出,用一个小模型快速出草稿,大模型只负责并行验证和修正,草稿命中率一旦稳定在80%以上,旗舰模型的有效推理成本就能降到原来的1/3到1/5。


但以前这项技术不太能降低成本,原因在于以前给旗舰模型配草稿,用的是7B、13B的通用超小模型,命中率上不去,所以价格就打不下来。


可推测解码仍然是业内公认最可行的方向,这才使得大家都备有一款小模型。


现在来看,推测解码逐渐走向成熟。2026年6月DeepSeek发布了DSpark推测解码模块,并部署到V4 Flash和V4 Pro的线上流量,在相同吞吐下单用户生成速度提升了60%到85%,这也直接造成了DeepSeek的大幅降价。


随着DSpark的成功,势必会有越来越多的厂商部署推测解码,以实现更快更便宜的效果。


除了推测解码外,还有一个技术也可能会降低模型成本,那就是静态知识剥离。


这个技术其实起源更早,它是Meta AI的帕特里克·刘易斯(Patrick Lewis)等人在2020年论文《面向知识密集型NLP任务的检索增强生成》(Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks)中提出的。


简单来讲,它就是让模型在思考的过程中,把事实性知识从参数中拆出去,只靠外部检索补充。这样整个思考过程就会更快,成本因此更低,并且由于外部引入知识,还能让输出结果幻觉更少。


不过真正把这个技术发扬光大的依然是DeepSeek。2026年1月,DeepSeek联合北大发表论文《通过可扩展查找实现条件记忆》(Conditional Memory via Scalable Lookup)


论文的观点是,语言建模本质上包含两类完全不同的任务,一类是需要深度动态计算的组合推理,另一类是检索静态知识,但Transformer把这两件事混在一起做了。


于是论文就依照静态知识剥离的逻辑提出了一个叫做Engram的技术。


打个比方,在考试的时候,让大模型背下所有公式、历史年份、名人身份、地理常识。然而这就导致大模型只能用一部分的脑容量来解题。背得越多,能用来思考的脑容量就越少。


Engram干的事就是把闭卷考试改成开卷考试。它在模型中间插了一本“速查手册”,遇到 “戴安娜王妃是谁”、“张仲景是什么朝代的”这种事实性问题,不用现场一层层推导,直接翻手册,一秒查到。


这样,模型的脑容量就可以全部用来做真正需要动脑筋的事,比如解数学题、写代码、做逻辑推理。


Engram一旦成熟,也将大幅减少模型成本。


三、DeepSeek V4 Pro真的发布了吗?


随着DeepSeek V4 Pro的更新,网上最大的声音便是质疑。因为这次更新和DeepSeek V4 Flash正式版的更新方式截然不同,V4 Flash正式版有完整的官方更新日志,明确标题“DeepSeek-V4-Flash更新”,列出了9项基准测试的具体分数。最关键的是,DeepSeek会注明“模型结构、尺寸和Preview保持一致,仅重新进行了后训练”这些细节。


可截止发稿,DeepSeek V4 Pro正式版相关的发布痕迹也只有三处:官网的“模型 & 价格”页面、官网首页出现一句简短的滚动公告、一张跑分表。


甚至就连官方的更新日志,也停留在DeepSeek V4 Flash正式版上。



除了这些迹象外,权威评测机构Artificial Analysis上线了V4 Pro 0813(最大推理强度)的独立评测页,综合智能指数为53 分。相比预览版的45分确有提升,和GLM-5.2齐平。


但问题在于,53分这个档位和Fable 5差了很远,无法匹配跑分表中的“接近甚至超过Fable 5”。


作为参照,同一天发布的Grok 4.6还拿到了61分。



不只是Artificial Analysis,在比较模型数学能力的Proof Bench上,作为靠数学能力而声名鹊起的DeepSeek,其V4 Pro正式版甚至连前10都没有挤进去。



更有一些个人评测者对V4 Pro正式版进行了深度的测试,均表示实测效果皆不尽人意。


AI博主牙医就发文表示“刚发的DeepSeek-V4-Pro-0813好像的确有问题。reasoning_effort=max的时候模型在长程 AgenticCoding 任务下更倾向于早停。”


他进一步表示,“我这个测试总计50轮,让模型不断优化代码, 结果他在3次测试中,2次都在42-43轮左右的情况下停止了。并未用完全部机会。而且目前成绩来看,甚至没打过 GLM-5.1 (仅我这一个case, 我不对其它case负责)。”



以最常见的“鹈鹕测试”为例,提示词为“Generate an animated looping SVG of a pelican riding a bicycle. Wheels spin, pedals move, pelican’s legs pedal correctly, smooth infinite loop, no javascript, use native SVG animateTransform only.”(生成一个循环动画SVG:鹈鹕骑自行车。轮子旋转、踏板转动、鹈鹕的腿正确踩踏板,平滑无限循环,不要JS,只用SVG原生animateTransform动画。)


我将相同的提示词分别发给DeepSeek V4 Pro正式版和Flash正式版,结果发现,反而Flash做的效果远远超过了V4 Pro,无论是鹈鹕的动作还是背景中的云彩,V4 Flash正式版均比Pro正式版更好。


V4 Pro正式版



V4 Flash正式版



0813这个版本号本身可能只是一个“占位符”。


换句话说,DeepSeek可能并没有直接上线新模型,或者是有意去压制新模型的能力,先把坑占上了,等后续做好准备再上线,这样就不用担心一瞬间超高并发挤爆服务器了。


此前,DeepSeek Harness负责人崔添翼曾透露,DeepSeek V4 Pro的正式版将和DeepSeek Harness同时上线。而8月13日这天,是DeepSeek Harness的最后一次测试。


在DeepSeek Harness内测群中就有这样一条消息,0813版本计划发布DeepSeek Harness的公测版。



目前看来该Harness产品还未发布,并且DeepSeek V4 Flash之前的测试中,就有很多成绩是DeepSeek Harness上跑出来的。那么结合官方群里的跑分表,尤其是在Terminal Bench这样的测试集上,使用的可能就是传说中的DeepSeek Harness。


模型的斩杀线会下降,但DeepSeek Harness可能会带来新的斩杀线。


2026年5月,DeepSeek Harness内部立项,独立组建专项核心团队,由崔添翼负责。8月2日,崔添翼面向全球公开征集Harness内测用户,优先筛选具备Agent Harness开源项目经验的开发者。8月11日,“DeepSeek Harness团队”微信公众号完成注册,认证主体是深度求索北京分公司。


在V4 Flash正式版的API文档中有这么一段内容,对于公开基准测试中的Code Agent任务,正式版用的是DeepSeek Harness极简模式作为框架进行测试。


也就是说,V4 Flash能拿下Terminal Bench 2.1的82.7分,严格来说是“DeepSeek模型+DeepSeek Harness测试框架”的组合成绩,不是纯模型裸分。


V4 Flash预览版在Terminal Bench 2.1上是61.8分,同期V4 Pro预览版是72.1分。显然,DeepSeek Harness在Agent任务上,给DeepSeek模型带来了质的飞跃。


82.7分其实是一个非常高的分数。Terminal Bench 2.1目前的SOTA是GPT-5.6 Sol的88.8分,Kimi K3是88.3分,Claude Opus 5是84.3分,所有参评模型的平均分是77.3分。


正如前文提到的,V4 Flash是一个轻量模型,和Fable 5、GPT-5.6 Sol对比的应该是旗舰模型V4 Pro。那么可想而知,一旦DeepSeek Harness和V4 Pro正式版上线,势必会迎来一个新的斩杀档位。


更值得注意的是,国内玩家已经全部挤进了这条赛道。


除了DeepSeek外,智谱的ZCode也是一款Coding Harness,只不过它针对的是智谱自家的GLM,8月11日一口气上线了Goal、Subagents、Remote Control、闲时任务四大功能。


在智谱自研的Code Bench中,在复杂跨文件任务上,GLM-5.2配合ZCode,要比GLM-5.2配合Claude Code,整体通过率高出2.39 %,缓存命中率超过98%,有效 token 量提升约30%。


西红柿在涨价、鸡蛋在涨价、糖在涨价,结果西红柿炒鸡蛋反而便宜了。可是我们都清楚,这个逻辑是有问题的,至于它会持续多久,没人说得明白。

AI行业信号频道: 前沿科技
本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。
正在改变与想要改变世界的人,都在 虎嗅APP