本文来自微信公众号: HavenlonLabs ,作者:Havenlon Labs
当训练目标、评测体系和商业利益共同雕刻智能的形状,我们得到的可能不是一颗不断膨胀的球,而是一束越来越锋利的尖刺。
一、一个被反复验证的直觉
过去几年,行业内部形成了一种近乎共识的叙事:参数规模持续扩大,训练数据持续增加,推理链条持续加长,人工智能正沿着一条清晰的斜坡,稳步逼近通用智能。
这种直觉并非空穴来风。语言理解、代码生成、数学推理、长文本处理、工具调用、图像与视频生成——几乎每一个方向,都在以季度为单位刷新上限。曾经需要一个专业团队工作数周的任务,今天一个模型在几分钟内就能交付一份可用的初稿。基准测试一个接一个被刷满,然后被废弃,然后被更难的测试取代。
于是一个推论被自然地接受下来:如果所有能力都在增长,那么它们最终一定会汇聚成完整的智能。
问题在于,这个推论中藏着一个未经检验的前提——所有能力都在增长,并不等于所有能力都在以同样的速度增长。
二、球体,还是尖刺
如果把一个智能系统的全部能力想象成一个球体,那么"通用智能"意味着球体从各个方向均匀膨胀:写代码的能力、判断歧义的能力、承认不知道的能力、在长任务中不跑偏的能力,同步变强。
但过去三年的实际轨迹更像另一种形状。
代码能力增长极快,因为它可编译、可测试、可自动打分。数学推理增长极快,因为答案唯一,反馈信号干净。工具调用日趋成熟,因为它直接对应可交付的产品形态。多模态迅速扩张,因为它带来最直观的演示效果。
与此同时,另一些老问题几乎原地踏步。模型仍然会在没有依据时给出流畅而自信的错误答案;仍然会在多条件任务中悄悄丢掉一个约束;仍然会被上下文里一句无关的话带偏;仍然会在一条二十步的执行链中,从第七步开始缓慢偏离原本的目标,而每一步看起来都合理。
这些能力不属于同一个增长曲线。它们不好量化,不好打分,因此也不好优化。
结果不是一个越来越大的球,而是一个越来越不规则的形状:某几个方向被剧烈拉长,其余部分基本保持原样。
三、谁在决定尖刺的方向
问"是什么在推动能力增长",最常见的回答是技术。更准确的回答是:目标函数。
今天的模型不是自由生长的生物,它没有自己的兴趣。它的每一个能力方向,都来自人类设定的优化信号——训练什么、奖励什么、评测什么、在排行榜上比什么。
一个每天接受代码测评的模型,会越来越擅长写代码。一个持续因正确解题而获得奖励的模型,会越来越擅长解题。一个不断在Agent基准上被打分的模型,会越来越擅长调用工具。
反过来说也成立:一个从未被奖励"说我不知道"的模型,不会主动学会克制。
模型不会自己选择成长方向,它只是把我们的评价标准,翻译成了能力的形状。
四、商业引力:市场正在雕刻智能
在目标函数之上,还有一股更强的力量在起作用——收入。
前沿模型公司不是研究所。它们要付电费、买芯片、招工程师、面对投资人的下一轮估值。在这样的约束下,"哪些能力最值得投入算力"这个问题,答案往往非常现实:
企业客户愿意付费的能力;能转化为订阅的能力;能嵌入办公流程的能力;能提高开发者效率的能力;能支撑自动化Agent的能力。
这些方向拿到了最多的算力、最强的团队、最精细的数据标注、最完整的评测体系。于是它们增长得更快。而增长得更快,又会带来更多收入,进而拿到更多资源。这是一个自我强化的循环。
那些短期内无法直接变现的能力——对模糊问题的判断力、对自身边界的诚实、在开放世界中保持稳定的一致性——则长期停留在优先级列表的下半部分。
市场不只是在决定产品形态,它同时也在决定智能本身的形状。
五、尖刺经济学
对单个厂商来说,长出尖刺不是失误,而是最优策略。
在一个高度同质化的竞争市场里,"全面均衡"是一种昂贵且难以传达的定位。没有人会因为一个模型"各方面都还不错"而更换供应商,但会因为它在某一件事上明显更强而迁移。于是每一家公司都在寻找并放大自己最锋利的那一根:这家的代码智能体,那家的检索与信息整合,另一家的视频生成,还有一家的超长上下文。
竞争的结果,是模型之间的差异不断扩大,而不是收敛。
行业看起来在赛跑,实际上在分岔。
对使用者而言,这意味着"用哪个模型"正在从一个采购决策,变成一个架构决策。你不再是选一个更聪明的大脑,而是在为一组具体任务,挑选一组形状匹配的工具。
六、能力不会自动迁移
真正的风险不在尖刺本身,而在人类对尖刺的解读。
我们习惯于用局部能力推断整体水平,因为在人类身上这个推断大致成立:一个能读懂复杂论文的人,通常也能读懂合同。但在模型身上,这条经验并不可靠。
一个围棋冠军不会自动成为数学家。一个顶级程序员不会自动成为心理咨询师。同样,一个能解出国际数学竞赛题目的模型,并不因此就能可靠地管理一套企业审批流程;一个能写出优秀代码的模型,并不因此就能承担临床诊断中的责任链条。
能力不会自动迁移,但人们对能力的信任会。
这正是最危险的地方:模型在演示中展现的极限表现,会被无声地推广成对它全部行为的预期。当那个预期被写进流程、写进权限、写进无人复核的自动化环节,误差就不再是误差,而是事故。
七、Agent时代:最弱一环定义天花板
这个问题在生成内容的时代还可以忍受。写错一段文案,成本是人工重写。
但模型正在离开对话框。它开始调用API、查询和修改数据库、变更配置、发起交易、管理基础设施、控制物理设备。能力越强,被授予的权限越大;权限越大,一次偏离的代价越高。
而现实世界并不按照模型最擅长的方向运行。它由例外、异常、过期文档、口头约定和边界条件构成。在这样的环境里,决定系统安全性的从来不是最强的那项能力。
一个系统的可靠性,由它最弱的一环定义,而不是最锋利的那根尖刺。
一个在标准任务上表现优异、但在遇到未见过的异常时倾向于"编一个合理答案继续执行"的智能体,恰恰是最难防的一类:它的失败不表现为报错和中断,而表现为流畅、自信、格式正确地把错误推进到下一步。
八、企业的问题正在改变
过去两年,企业技术选型的核心问题是:哪个模型最强?谁排行榜第一?哪个版本的分数更高?
未来两年,这个问题很可能被替换掉。
哪个系统最可靠?哪个系统的输出最容易被验证?哪个系统能在模型犯错时,把错误拦在它进入现实世界之前?出问题以后,我们能不能定位、回滚、解释?
这是一种范式转移:从追逐能力上限,转向经营能力边界。
具体地说,它意味着几件不那么性感但更值钱的工作——为每一类高风险动作设置人工确认点;把不可逆操作与可逆操作分离;为智能体设定最小必要权限而非最大可用权限;建立独立于模型自身判断的校验层;以及,把"模型说不知道"当作一个成功输出,而不是一次失败。
模型负责突破边界,系统负责守住边界。这两件事不会由同一方完成。
结语:风险在空白处
必须说清楚的是,专业化本身不是问题。技术史上几乎所有成熟领域都走过同一条路:从粗糙的通用,走向精细的分工。尖刺意味着效率,意味着某些真实问题第一次被彻底解决。这是好事。
真正需要修正的,是认知。
不要把一项能力的极致表现,误读成整体智能的成熟。不要因为一个系统在你测试过的场景里表现完美,就假设它在你没测试过的场景里同样可靠。当AI从"能说"走向"能做",值得关注的重点也必须从"它能做到什么",转向"它在哪些地方仍然存在边界"。
因为决定未来系统安全性的,往往不是那根最锋利的尖刺。
而是尖刺之间,那些还没有被人看见的空白。