**我们设计了一个“你画我猜”式Benchmark:让九款模型用SVG作画、再由其他模型猜图,1350张图、11961次猜测后,GPT-6 Astra以75.5分险胜,但前三名置信区间重叠,且反常识题、堆元素量、思考成本与成绩均无稳定正相关。** **要点** **1. 总榜前三紧咬,国产模型紧随其后** GPT-6 Astra 75.5分,Gemini 3.8 Flash 74.6分,Claude Fable 5.1 74.3分,三者置信区间相互重叠。Kimi K3 71.7分,Qwen3.8-Max 71.3分,GLM-5.3-Flash 68.9分,MiniMax-M3和DeepSeek分别为61.9和60.9分。参考组Gemma总分38.2。 **2. 反常识题和热梗让模型集体“翻车”** 常规词得分70-87,反常识区最高仅34分。“猫给人铲屎”零命中,“老鼠追猫”多数猜错,“特种兵旅游”清一色画成迷彩服士兵。模型在常识偏见面前难以突破,画面稍有含糊就滑回默认答案。 **3. 思考越多、花得越贵,并不等于得分更高** Astra作画思考token中位数仅232,用时41秒,作画得分排第一;DeepSeek和Qwen分别想了1.9万和1.8万token,成绩反而靠后。Gemini花费约82元拿到74.6分,而最贵的Claude约304元成绩与之持平。GLM因猜图超时40次被记错,实际吃了“想太久”的亏。 **4. 堆砌元素并未提升猜中率,简单画作反而更有效** 元素最少和最多两档被猜中率仅差4.4个百分点。DeepSeek用222个元素画“掩耳盗铃”七家全错,Gemini用简单元素画同一成语七家全中。Astra画的“苹果”仅用8个元素即被七家猜中。 **5. 头部模型自猜能力强,部分模型“画完不认”** Astra、Gemini、Claude自猜正确率约83%,而MiniMax自猜仅53.3%(比他人猜自己还低13个百分点),DeepSeek自猜49.3%。这说明模型在作画时可能缺乏对自己输出的一致性理解。
我们做了个“你画我猜Benchmark” :1350张图后,GPT-6险胜
2026-09-05 19:44

我们做了个“你画我猜Benchmark” :1350张图后,GPT-6险胜

本文来自微信公众号: 硅星人Pro ,作者:周一笑 王兆洋,原文标题:《Eval丨 我们做了个“你画我猜 Benchmark” :1350 张图后,GPT-6 险胜》


每逢新模型发布,总有人先让它画张SVG。


这“传统”源自开发者Simon Willison,他从2024年起反复用同一道题测模型,那就是著名的“自行车鹈鹕”。


这个原本带着玩笑意味的测试,后来成了观察新模型能力的保留节目,甚至有人认真查过,模型公司是不是已经开始针对这只鹈鹕优化。


而这个测试也不只测SVG,它其实可以覆盖从推理、思考、到画图、对抽象概念的理解等不同关键能力的考查。



受这个启发,我们也决定做一个Benchmark,让模型画SVG,以及升级一下,我们把一张图变成了一场你画我猜。


也就是模型画完不交给人打分,渲染成图片后交给其他模型猜,猜中,才算把意思画明白。


词库里除了常规名词,还有动作、热梗、AI术语和反常识组合。


第一期,八个参评模型,一个参考组,150个词,1350次画图,11961次猜测。


在目睹了各个模型或是让人惊艳或是让人哭笑不得的表现后,最终结果可以先公布给大家:


Astra总分最高,不过也没有遥遥领先,前三家还没有真正拉开差距。


更有意思的还是在测试过程里:有些模型连自己的画都认不出来,碰上反常识题,画的和猜的都会被常识带跑偏,而且你会发现,想得更多、花得更贵的模型,并没有稳定换来更高分。


图2·GLM画「鱼钓人」,七个模型怎么猜


比如上面这个图就是其中一个回合。GLM画了一条鱼坐在船上钓起一个人,其余七个参评模型里四家答鱼钓人,三家答钓鱼。


1


规则只有两步


在第一期,我们选择了八款模型,包括最近一周疯狂密集上线的几个明星模型,包括今儿刚全量可用的GPT-6。


八个参评模型分别是各家支持图片输入的最新型号,不都是旗舰。海外三家,GPT-6 Astra、Gemini 3.8 Flash、Claude Fable 5.1。国内五家,Kimi K3、Qwen3.8-Max、GLM-5.3-Flash、MiniMax-M3、DeepSeek-V4-Flash-Vision-Exp,其中DeepSeek参评的是它的视觉实验版。


我们设计了一个参考组,Gemma 4 26B,它完成全部画图和猜图任务,但不参与排名,也不计入其他模型的得分。所有模型都按厂商默认API参数调用,图里禁止文字元素,超时和截断记犯规。


在规则方面,每个词由九个模型各画一张SVG,每张画渲染成PNG后交给九个模型看图猜词。猜手拿不到代码,代码注释和元素命名里藏不了答案。答案由词库和匹配规则自动判定,做基础规范化后只认预先登记的标准词和同义词,没有审美打分,也没有第三方大模型裁判。


我们把一个模型的画被其他参评模型猜中的比例,记为作画得分;把它猜中其他模型画作的比例,记为猜图得分。两项各占一半。为了估计成绩可能有多大波动,我们按词重复抽样2000次,计算95%置信区间。


词库150个词,常规词70个,动作情境20个,热梗、AI自指、反常识组合各10个,另有30个不公开的锚定词,用于跨季对照,也降低针对公开词库优化的影响。


图3·一个词是怎么变成分数的


1


GPT-6 Astra险胜,有些模型认不出自己的画


还是先看看最终结果得分:


宣称已经AGI了的GPT-6 Astra得了最高的75.5分,Gemini 3.8 Flash 74.6,Claude Fable 5.1 74.3。三家的置信区间彼此重叠,第一梯队是这三家。


随后是五个国产模型。Kimi K3 71.7,Qwen3.8-Max 71.3,GLM-5.3-Flash 68.9,MiniMax-M3和DeepSeek分别为61.9和60.9。


参考组Gemma总分38.2,猜常规词尚有一半左右的正确率,生成的画却只有约两成能被其他模型认出。


图4·总榜,黑色横线是95%置信区间


从结果看,同一个模型会画和会猜的表现并不一致,Astra和Claude偏会画,作画得分79.8和79.1排前两位。Gemini偏会猜,猜图得分76.1第一,作画得分排第五。GLM作画74.7,猜图63.1,两项差距在八家里最大。


图5·作画得分对猜图得分,对角线之下画得比猜得好


这里还有一个很有趣的测试,就是画手也会猜自己的作品,只是自猜不计入成绩。


结果也能体现一些模型能够提高的地方,MiniMax自猜正确率53.3%,比别人猜它还低13个百分点。DeepSeek自猜49.3%,也低了近10个百分点。


换句话说,有些模型画完,连自己都没认出来。画的时候胸有成竹,猜的时候六亲不认。头部三家反过来,Astra、Gemini、Claude自猜都在83%上下。


把不同画手和猜手带来的影响分别校正后,名次没有变化。


1


AGI来之前,AI还是先得弄懂各种梗


测试中另一个现象是,常规词大家都会,一到反常识区,全场一起掉线。


在常规词中,八个参评模型的得分都在70到87之间。反常识区,最高34,最低21。参考组Gemma画的反常识图没有一张被认出,它自己猜图时,正确率也只有17.5%。


图6·六个分区,同一批模型换一类词就变样


比如:猫给人铲屎。


八个参评模型的画一共接受了56次计入成绩的猜测,零命中。


猫拿着铲子,人蹲在猫砂盆边,画面已经很努力了。可猜手一看到猫和铲子,还是条件反射地答出铲屎官。


图7·九个模型怎么画「猫给人铲屎」


还有“老鼠追猫”,这个好一点。


Kimi和Claude的版本各有四家猜中,猫惊恐回头,老鼠在后面追。猜错的三家答的仍是猫和老鼠、猫捉老鼠。猫都已经在前面逃了,模型还是更愿意相信猫捉老鼠。DeepSeek和Gemini的版本七家全错。


图8·同一道「老鼠追猫」,Kimi与DeepSeek画出了什么


这类题两头都难。画手得把动作方向画清楚,猜手还得压住第一反应。画面稍有含糊,答案就滑回常识。


我们还特地为模型们设计了“AI黑话”,而各位天天被创造黑话的模型,却立刻被打回字典本义。


“蒸馏”这个概念,模型还不如人痴迷。一下子都回到了化学实验室,九张蒸馏全是烧瓶、冷凝管和酒精灯。


图9·九个模型怎么画「蒸馏」


你画我猜这个词本身也在词库里。


结果,九个画手有八个画成了画板前有人在画,其中五个画的是猫。各家模型对猫有种奇怪的痴迷……


结果,猜手看见画里的东西就答画里的东西,没了大局观。


Gemini那张画的是苹果,六家答苹果,Astra和GLM的两张画,都被七家答成了猫。这个词56次猜测只中5次,唯一一次从苹果里认出你画我猜的,是Astra。模型看见了画,却没看见画画这件事。


图10·当模型被要求画出「你画我猜」


热梗区也有类似的字面陷阱。


我们出了特种兵旅游,结果九家清一色画了迷彩服士兵,只有Astra加上行李箱和景点图钉,拿到6/7,其余最高4/7。


图11·九个模型怎么画「特种兵旅游」


1


想得最多的没赢,花得最多的也没赢


今天已经是推理为王的时代,但越来越久的思考对最终结果到底有多大帮助,已经开始有不少质疑。


在这个测试里同样有这个问题,同样画一张图,有的模型抬笔就画,有的先在脑子里开了半天会。八个参评模型中,Astra每次画图使用的思考token最少,中位数只有232,用时41秒,作画得分却排第一。DeepSeek和Qwen有点夸张,分别想了1.9万和1.8万token,成绩反而落在后半段。


Claude会自行调整思考量,简单词零思考,成语题几千token。看起来,这个思考本身就更聪明一些。


图12·成本对分数,气泡越大想得越多


不过,这还不能推出少想反而更好。各家接口记录思考token的方式并不统一,跨模型比较只能作为参考。真要判断多想有没有用,还得让同一个模型开、关思考各跑一遍。


GLM还实际吃到了想太久的亏。猜图限时十分钟,它有40次没来得及交卷,全部记错,Qwen有5次,GLM另有1次画图超时。


然后我们进一步统计了一下性价比,发现“便宜模型”真的有很多时候是个伪概念。


Kimi和Qwen整期分别花了约288元和246元,成绩71.7和71.3。Gemini花了约82元,拿到74.6。GLM只花约9元,拿到68.9。最贵的Claude约304元,成绩与Gemini基本持平。


折到单张,Claude画一张约1.73元,Kimi 1.30元,Astra 0.94元,Qwen 0.73元,Gemini 0.36元,GLM约4分钱。


在这项任务中,GLM花钱最少,Gemini是第一梯队里最省的一家。费用根据调用记录和公开价目表估算,海外通道用平台回传的计费,GLM用的是海外通道的国际价目。


本来完整跑完一期我们花了约1200元,但Astra又来了,于是我们又花了300块去补测。


但这300块确实“值”。Astra的画有多稳,看一组就够。公开的120个词里,它有60张被七家全员猜中。对于“选择困难”这个抽象词,它画了一个抱头的人,头顶三条箭头指向汉堡、冰淇淋和披萨,七家全中,其余八个画手跟它没法比。


图13·Astra的十二张全中


所以,OpenAI强调的定价贵但完成任务更高效其实最终反而便宜,是真的成立。只看定价的阶段应该要很快彻底过去了。


1


堆更多元素,没有稳定换来更高猜中率


严肃的分数之外,更有意思的地方都在参赛选手交上来的卷子里。


图14·几笔就够


把1194幅有效画作按SVG元素数量分成四档,元素最少和最多的两档,被猜中率分别为71.0%和75.4%。元素数量相差近十倍,被猜中率只差了4.4个百分点。


不过,两档对应的词并不完全相同,所以这还不能证明画得越简单越好。能确定的只是,多堆元素没有稳定带来更高的猜中率。37幅不足20个元素的画,被猜中率达到78.8%,其中苹果只用了8个元素,七家全中。


放到同一道题里看,差别更直观。“掩耳盗铃”这个成语,Gemini画出偷铃人捂着耳朵的表情,七家全中。DeepSeek用222个元素画了一台像机械鼓手的东西,七家全错,错答从圣甲虫到摇钱树。


图15·同一道「掩耳盗铃」,7比0


抽象词也能画出共识。


对于孤独这个词,八个参评模型里六个不约而同画了深夜长椅上的一个人,其中五张还配了同一盏路灯,Qwen画的那张七家全中。


所以这就是AI理解的人类的孤独的意象么。


图16·九个模型怎么画「孤独」


在这个测试里,虽然没出现OpenAI和Anthropic的那种“越狱”,但模型也在开始尝试钻空子了。


比如,禁文字拦的是SVG里的文字元素,DeepSeek画过拟合时干脆用线条把过拟合三个字写了出来,歪歪扭扭,七家里还真有两家认出来了。


但按现行规则,它的确不算犯规,下一季会补一道看图识字的检查。


图17·DeepSeek直接把字写了出来


这是我们“你画我猜benchmark”的第一期,后续我们会继续把更多主流模型纳入进来,也欢迎大家一起来挑错,欢迎交流,欢迎一起来出题。


1


你也来猜猜


在我们看了模型的各种答卷后,也选了一些供大家来品鉴。


(以上这个图足够抽象,各位可以来猜猜,答案在这段最后)


有意思的六张

画得好的六张,八个参评模型各有入选

低分不等于没节目效果:参考组Gemma的六张

上面那张图里的答案如下:

A甲方需求,Kimi K3画,七家全错。

B剁手,Gemini画,七家全中。

C神经网络,Kimi K3画,七家全中。


D键盘侠,GPT-6 Astra画,七家全中。


E狐假虎威,Kimi K3画,七家全中。


F指鹿为马,Claude画,七家全中。


这个benchmark我们会继续做下去,它会和我们此前Agent Tank,Demo Agent等一起构成一个更完整的评测体系,更多的细节,评测方法,评测表现分析等,会定期发布。


接下来也会有各个评测系列的对应网站上线,有更多互动方式也在构建中,也欢迎有想法的朋友一起来参与建设,评测,和讨论。


敬请期待后续更新。

AI行业信号频道: 前沿科技
本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
正在改变与想要改变世界的人,都在 虎嗅APP