近期Kimi K3、Qwen3.8-Max、DeepSeek V4 Pro、Meta Muse Glimmer、英伟达Nemotron 3.5 Lightning五款开源模型同台测评,国产大模型综合表现优于美国开源小模型,当前开源模型路线选择更丰富。 ## **1. 逻辑推理测试:DeepSeek性价比最优** 五款模型在多步推理测试中,K3、Qwen补测后全对,DeepSeek一轮全对五道推理题仅花费4美分,成本远低于其他模型,两个美国小模型遇到难题易因输出超限失败,大参数模型推理能力优势明显。 ## **2. 代码可视化:K3整体完成度最高** SVG画图、地铁网页、成绩单可视化三项测试中,K3拿满分次数最多,DeepSeek在成绩单可视化测试中获最高分,Qwen补测后完成度高,美国两款模型输出效果较差。 ## **3. Agent工具能力:三家国产模型全部满分** 修bug任务中,五款模型均完成全部测试,DeepSeek单轮调用仅需0.3美分成本最低;脏账单清洗任务中,K3、Qwen、DeepSeek全部满分,Muse全程未解决编码问题,Nemotron仅拿到部分分数。 ## **4. Blender建模与写作:K3表现最优** Blender中式庭院建模测试中,仅K3两份脚本全部一次跑通出图;写作测试中,Kimi K3是唯一在两道高难度写作题都拿到3分的模型,DeepSeek仅简单题拿满分,难题仅得2分。 ## **5. 开源模型分化明显,选择更丰富** 国产模型中K3冲能力上限、表现全面但成本偏高,Qwen稳定全能但思考耗时较长,DeepSeek能力不弱且性价比突出;美国小模型在简单任务上快且便宜,复杂任务表现远不及大参数模型。
中美开源模型大会师:Kimi、Qwen、DeepSeek、Meta和英伟达五模大横评
2026-08-13 21:05

中美开源模型大会师:Kimi、Qwen、DeepSeek、Meta和英伟达五模大横评

本文来自微信公众号: 硅星GenAI ,作者:周一笑


开源模型最近密集到有点不讲道理。七月底到八月中,Kimi K3、Qwen3.8-Max先后放出权重、DeepSeek V4 Pro正式版也刚刚上线。与此同时,沉寂了一年多的美国开源也回来了,Meta拿出Muse Glimmer,英伟达跟上Nemotron 3.5 Lightning。


如此盛况,那可就必须把五个模型接进同一个测试环境测一测,是骡子是马拉出来遛遛。


这次的测试中,每道题额外设了统一的输出上限(输出长度),思考和作答共用这个额度,超了就算没交卷,同时超过额度的任务会重新放开上限单独完整跑一遍作为对照,所有结果由脚本+真人盲评判分。


先直接上成绩:绿格最多的是K3,十项里六项满分,DeepSeek排第二。需要注意的是表里的0分,部分是因为模型思考太长被截断,没有完整输出,后文有具体解释。


模型测试成绩


接下来我们来看看这几个开源模型的具体表现。


1


逻辑推理:两个小模型交了白卷


第一组题是24点和五位数密码锁。


24点是用给定的四个数字加减乘除凑出24;密码锁是根据几条"哪些数字对、位置对不对"的线索倒推一个五位密码,都是考多步推理的经典题型。题目全部新生成,里面还埋了一组无解的24点,看谁会硬编一个假解出来。


无解陷阱骗到了一家。K3、Qwen、Nemotron都识破了,Muse主测没答到这题,后来放开上限补跑时它上了当,硬编了一个把10用了两次的假解。


真正的意外在密码锁上,K3和Qwen全对,两个美国小模型却交了白卷,回答里一个字都没有。DeepSeek密码锁三次里有两次同样在思考撞上上限后交了白卷。


查看运行日志,两个小模型把推理题跑成了马拉松,思考写到一半就被输出上限截断了,托管商返回的结束原因写的就是超长,后面的补跑实验也印证了这一点。托管平台给这两个模型的单次输出额度本来也紧,一个只放16K token,一个只放24K。


Nemotron被上限截断的原始记录


按规则放开上限补跑。Muse Glimmer密码锁两次全对。Nemotron烧掉六万token,最后信心十足地交出错误答案。DeepSeek放开上限后,密码锁同样全对。


顺着这组题我们加了一个加时赛。


每个模型30美分,题型不变换一套新题,解不出可以重试,直到把预算花完。


Nemotron十轮花了不到10美分,24点全拿下,但密码锁还是十次都没成。


Muse密码锁前三次失败,第四次解出,15美分拿下五题全解。


K3一次认真的思考就要35美分,Qwen也要将近20美分,预算只够试一两轮。单独放开预算后K3把题解了,花费35美分,比预算线多出5美分。


这里表现突出的是DeepSeek。同一套题,它一轮全对,五题全解只花了4美分,比Muse靠重试磨出来的还便宜四倍。


2


代码画图能力:画熊猫、画地铁图、做网页,三道看得见的题


在代码呈现方面,我们先让五个模型用SVG代码画同样的画:一只白头鹰坐在共享单车前座蹬车,一只大熊猫坐后座撑伞。


SVG是用代码描述图形的格式,模型看不到画布,全凭想象在代码里摆坐标。


在这一轮,完成的最好的K3和Qwen都是能看图的多模态模型。K3的两张图都能一眼认出剧情,Qwen一张画得最满、一张没画完。


Nemotron和Muse的作品需要观众自带想象力,有点惨不忍睹。DeepSeek一张能认出剧情(鹰趴在车把上没蹬车),另一张直接没有产出。


第二道是做一个能用的网页。


我们编了一座虚构城市的地铁数据,四条线26个站,要求模型写一个单文件网页,画出规整的线路图,用户选好起点和终点后,网页要算出正确路线,再播放一段换乘动画。判分表有十项,路线算错直接判低分。


K3两次都拿满分,线路、换乘提示、动画一个不缺。Muse画出了图但路线算错,Nemotron的功能缺了一大半,Qwen在上限内没写完,页面打不开。放开上限补跑后,Qwen补交了一版完成度很高的。DeepSeek排第二。


K3寻路动画

五家地铁对比

放开上限后Qwen补交的地铁图


第三道测试把这次横评的真实数据喂给每个模型,让它们给自己的成绩单做可视化网页。


这道题输出量最大,Muse Glimmer两次都在上限内完成,拿下第二。K3一次满分,一次超限被截断。Qwen两次都没写完,放开上限补跑后完成。DeepSeek两次都在上限内完成,拿了这道题的最高分。



成绩单网页对比

DeepSeek生成的单页面

Kimi K3生成单页


3


Agent能力:接上工具修代码、洗账单,看谁能独立干完活


这个环节让模型自己动手,读文件,跑命令,改代码,一直干到收工。


agent的表现和运行环境有关,同一个模型装进不同的工具框架,成绩可能不一样。我们用最简单的循环,是为了让五家在完全相同的规则下比。


第一题是修一个埋了三个bug的小项目,要求把十二个测试全部修绿。中途我们伪造了一次工具超时,五家没有被假故障带偏,全都修到了全绿。最后的差别只在花费上,两个30B模型一次不到1美分,两个万亿参数的贵上几倍,而DeepSeek一次只要0.3美分。


看来只要是算账,就是DeepSeek赢。


修bug任务的轮次时间线


第二题是真实的脏活。


两份账单导出文件,一份藏着GBK编码,一份顶着二十多行说明文字,中间混着重复交易和该剔除的记录,要求清洗合并成一张干净的表。


K3、Qwen和DeepSeek全部满分,Muse十五轮全耗在编码问题上,Nemotron只拿到部分分数。另外我们第一次测试时托管商还不支持Nemotron的原生工具调用,这两道题它走的是纯文本协议。后面DeepInfra把支持补了上来,我们用原生工具重测了一遍,修bug依旧满分,账单题依旧没能通过。


4


写Blender脚本:建一座中式庭院


最后一个测试让模型给Blender写脚本,从零建一座低多边形的中式庭院,院墙、月亮门、松树、石灯笼、拱桥、水面都要有,脚本必须一次跑通并渲染出图。Blender的Python接口在版本之间变动很大,一个接口名写错,整个脚本就跑不起来。


K3两份脚本全部一次跑通,庭院像模像样。Qwen放开上限后也出了图。Muse的脚本一跑就报错。Nemotron先是被上限截断,放开后又把渲染引擎的接口名写错,还是没出图。


DeepSeek一份出图,另一份倒在一个早已废弃的接口参数上。



5


写作:谁更会说人话


很多人抱怨模型写东西一股AI味,我们出了四道改写题。


最简单的一道是把物业的官腔停水通知改成业主群消息,配了一道英文场景做对照。难的两道,一道是给已经吵起来的业主群写涨价说明,一道是把年度工作总结改成群里唠嗑的年终盘点。所有答卷打乱顺序,由真人盲评打分。


盲评工具


简单的题模型之间差距不大,每篇改写的关键信息倒是都没丢事实,分数差距主要在文风上。难的两道没有一个模型摸到4分,八股结构和口号频繁。DeepSeek简单题4分,难题也只有2分。K3是唯一在两道难题里都拿到3分的。不过需要说明的是,这轮测的文本都不长,结果仅供参考。


“说人话”题的高分与低分答卷

五模型核心对比(成绩、速度与价格)


6


开源模型路线更热闹了


五个模型测下来,最明显的感觉是,大模型和小模型的差距还在,但各自的长处也越来越明显。如果只看中国这三个模型,K3在冲能力上限,Qwen走稳和全能,DeepSeek则在拉升性价比。


K3的表现基本和最近几个公开benchmark的结果对得上,已经可以和最前沿闭源大模型放在一起比。这次测试里,它也是五个模型里做得最全面的一个,推理、写代码、Agent、Blender都很能打。缺点也很简单,相对贵,也偏慢。


Qwen的表现也很稳,难题基本都能做,但经常需要想很久。给它足够的时间和额度,很多事情都能做出来,只是花的时间多一些。


DeepSeek则是这次最让人意外的一个。能力不弱,价格还特别低。加时赛里五道题全做对,花费和两个小参数模型属于同一梯队。至少从这次实际花费看,它确实做到了又强又便宜。


如果这个价格还能保持下去,后面模型继续变强,DeepSeek带来的优势就不只是来自能力,而是性价比。它可能会把大家对“一个足够强模型到底该卖多少钱”的预期再往下拉一截。


小模型也没有失去意义。Muse和Nemotron在简单任务上又快又便宜,很多工作不需要上万亿参数的模型。但任务一旦变难,需要长时间推理、写复杂代码或者连续调用工具,大模型的优势还是很明显。


Meta预告旗舰Muse Spark 1.2的权重未来几周放出,阿里已经把Qwen3.8大杯的权重传上了Hugging Face。半个月里同时这么多开源模型出来的景象,一年前很难想象。不管怎么说,有了更多选择,对用模型的人来说总是一件好事。


(本次测试通过OpenRouter接入各家托管商的通道,文中的花费都按托管商标价结算,与官方API的价目表不完全匹配)

AI创投日报频道: 前沿科技
本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
正在改变与想要改变世界的人,都在 虎嗅APP