受训练目标、评测体系与商业利益影响,当前大模型并非均匀膨胀为通用智能,而是长成定向突出的尖刺形态,能力不均衡暗藏风险,需关注能力边界。 ## **1. 大模型实际成长形态为尖刺而非均匀球体** 代码、数学推理等易量化、好打分的能力增长极快,而模糊判断、任务一致性等难量化的能力基本停滞,整体呈不规则尖刺状。 ## **2. 目标函数与商业利益共同决定尖刺方向** 模型能力方向由人类设定的优化信号决定,同时商业利益驱动资源向可快速变现的能力倾斜,形成自我强化的增长循环。 ## **3. 尖刺化是厂商竞争的最优策略,用户决策逻辑已改变** 厂商会选择放大自有核心尖刺构建差异化优势,行业呈现分岔而非趋同,用户选型已从单一采购决策变为按任务匹配工具的架构决策。 ## **4. 能力不均衡暗藏安全风险,最弱环节决定系统天花板** 人们习惯用局部能力推断整体水平,会将模型的演示优势误推为全场景可靠,在Agent应用场景中,未被强化的薄弱环节更易引发无预警的严重事故。 ## **5. 行业需求正从追逐能力上限转向经营能力边界** 过去企业选型核心关注模型能力强度,未来会转向关注系统可靠性与错误管控,模型负责突破能力边界,配套系统负责守住安全边界。
2026-07-29 23:11

大模型越来越强,还是越来越尖?

本文来自微信公众号: HavenlonLabs ,作者:Havenlon Labs


当训练目标、评测体系和商业利益共同雕刻智能的形状,我们得到的可能不是一颗不断膨胀的球,而是一束越来越锋利的尖刺。


一、一个被反复验证的直觉


过去几年,行业内部形成了一种近乎共识的叙事:参数规模持续扩大,训练数据持续增加,推理链条持续加长,人工智能正沿着一条清晰的斜坡,稳步逼近通用智能。


这种直觉并非空穴来风。语言理解、代码生成、数学推理、长文本处理、工具调用、图像与视频生成——几乎每一个方向,都在以季度为单位刷新上限。曾经需要一个专业团队工作数周的任务,今天一个模型在几分钟内就能交付一份可用的初稿。基准测试一个接一个被刷满,然后被废弃,然后被更难的测试取代。


于是一个推论被自然地接受下来:如果所有能力都在增长,那么它们最终一定会汇聚成完整的智能。


问题在于,这个推论中藏着一个未经检验的前提——所有能力都在增长,并不等于所有能力都在以同样的速度增长。


二、球体,还是尖刺


如果把一个智能系统的全部能力想象成一个球体,那么"通用智能"意味着球体从各个方向均匀膨胀:写代码的能力、判断歧义的能力、承认不知道的能力、在长任务中不跑偏的能力,同步变强。


但过去三年的实际轨迹更像另一种形状。


代码能力增长极快,因为它可编译、可测试、可自动打分。数学推理增长极快,因为答案唯一,反馈信号干净。工具调用日趋成熟,因为它直接对应可交付的产品形态。多模态迅速扩张,因为它带来最直观的演示效果。


与此同时,另一些老问题几乎原地踏步。模型仍然会在没有依据时给出流畅而自信的错误答案;仍然会在多条件任务中悄悄丢掉一个约束;仍然会被上下文里一句无关的话带偏;仍然会在一条二十步的执行链中,从第七步开始缓慢偏离原本的目标,而每一步看起来都合理。


这些能力不属于同一个增长曲线。它们不好量化,不好打分,因此也不好优化。


结果不是一个越来越大的球,而是一个越来越不规则的形状:某几个方向被剧烈拉长,其余部分基本保持原样。


三、谁在决定尖刺的方向


问"是什么在推动能力增长",最常见的回答是技术。更准确的回答是:目标函数。


今天的模型不是自由生长的生物,它没有自己的兴趣。它的每一个能力方向,都来自人类设定的优化信号——训练什么、奖励什么、评测什么、在排行榜上比什么。


一个每天接受代码测评的模型,会越来越擅长写代码。一个持续因正确解题而获得奖励的模型,会越来越擅长解题。一个不断在Agent基准上被打分的模型,会越来越擅长调用工具。


反过来说也成立:一个从未被奖励"说我不知道"的模型,不会主动学会克制。


模型不会自己选择成长方向,它只是把我们的评价标准,翻译成了能力的形状。


四、商业引力:市场正在雕刻智能


在目标函数之上,还有一股更强的力量在起作用——收入。


前沿模型公司不是研究所。它们要付电费、买芯片、招工程师、面对投资人的下一轮估值。在这样的约束下,"哪些能力最值得投入算力"这个问题,答案往往非常现实:


企业客户愿意付费的能力;能转化为订阅的能力;能嵌入办公流程的能力;能提高开发者效率的能力;能支撑自动化Agent的能力。


这些方向拿到了最多的算力、最强的团队、最精细的数据标注、最完整的评测体系。于是它们增长得更快。而增长得更快,又会带来更多收入,进而拿到更多资源。这是一个自我强化的循环。


那些短期内无法直接变现的能力——对模糊问题的判断力、对自身边界的诚实、在开放世界中保持稳定的一致性——则长期停留在优先级列表的下半部分。


市场不只是在决定产品形态,它同时也在决定智能本身的形状。


五、尖刺经济学


对单个厂商来说,长出尖刺不是失误,而是最优策略。


在一个高度同质化的竞争市场里,"全面均衡"是一种昂贵且难以传达的定位。没有人会因为一个模型"各方面都还不错"而更换供应商,但会因为它在某一件事上明显更强而迁移。于是每一家公司都在寻找并放大自己最锋利的那一根:这家的代码智能体,那家的检索与信息整合,另一家的视频生成,还有一家的超长上下文。


竞争的结果,是模型之间的差异不断扩大,而不是收敛。


行业看起来在赛跑,实际上在分岔。


对使用者而言,这意味着"用哪个模型"正在从一个采购决策,变成一个架构决策。你不再是选一个更聪明的大脑,而是在为一组具体任务,挑选一组形状匹配的工具。


六、能力不会自动迁移


真正的风险不在尖刺本身,而在人类对尖刺的解读。


我们习惯于用局部能力推断整体水平,因为在人类身上这个推断大致成立:一个能读懂复杂论文的人,通常也能读懂合同。但在模型身上,这条经验并不可靠。


一个围棋冠军不会自动成为数学家。一个顶级程序员不会自动成为心理咨询师。同样,一个能解出国际数学竞赛题目的模型,并不因此就能可靠地管理一套企业审批流程;一个能写出优秀代码的模型,并不因此就能承担临床诊断中的责任链条。


能力不会自动迁移,但人们对能力的信任会。


这正是最危险的地方:模型在演示中展现的极限表现,会被无声地推广成对它全部行为的预期。当那个预期被写进流程、写进权限、写进无人复核的自动化环节,误差就不再是误差,而是事故。


七、Agent时代:最弱一环定义天花板


这个问题在生成内容的时代还可以忍受。写错一段文案,成本是人工重写。


但模型正在离开对话框。它开始调用API、查询和修改数据库、变更配置、发起交易、管理基础设施、控制物理设备。能力越强,被授予的权限越大;权限越大,一次偏离的代价越高。


而现实世界并不按照模型最擅长的方向运行。它由例外、异常、过期文档、口头约定和边界条件构成。在这样的环境里,决定系统安全性的从来不是最强的那项能力。


一个系统的可靠性,由它最弱的一环定义,而不是最锋利的那根尖刺。


一个在标准任务上表现优异、但在遇到未见过的异常时倾向于"编一个合理答案继续执行"的智能体,恰恰是最难防的一类:它的失败不表现为报错和中断,而表现为流畅、自信、格式正确地把错误推进到下一步。


八、企业的问题正在改变


过去两年,企业技术选型的核心问题是:哪个模型最强?谁排行榜第一?哪个版本的分数更高?


未来两年,这个问题很可能被替换掉。


哪个系统最可靠?哪个系统的输出最容易被验证?哪个系统能在模型犯错时,把错误拦在它进入现实世界之前?出问题以后,我们能不能定位、回滚、解释?


这是一种范式转移:从追逐能力上限,转向经营能力边界。


具体地说,它意味着几件不那么性感但更值钱的工作——为每一类高风险动作设置人工确认点;把不可逆操作与可逆操作分离;为智能体设定最小必要权限而非最大可用权限;建立独立于模型自身判断的校验层;以及,把"模型说不知道"当作一个成功输出,而不是一次失败。


模型负责突破边界,系统负责守住边界。这两件事不会由同一方完成。


结语:风险在空白处


必须说清楚的是,专业化本身不是问题。技术史上几乎所有成熟领域都走过同一条路:从粗糙的通用,走向精细的分工。尖刺意味着效率,意味着某些真实问题第一次被彻底解决。这是好事。


真正需要修正的,是认知。


不要把一项能力的极致表现,误读成整体智能的成熟。不要因为一个系统在你测试过的场景里表现完美,就假设它在你没测试过的场景里同样可靠。当AI从"能说"走向"能做",值得关注的重点也必须从"它能做到什么",转向"它在哪些地方仍然存在边界"。


因为决定未来系统安全性的,往往不是那根最锋利的尖刺。


而是尖刺之间,那些还没有被人看见的空白。

AI创投日报频道: 前沿科技
本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。
正在改变与想要改变世界的人,都在 虎嗅APP