本文来自微信公众号: AIGC从0到1 ,作者:王零壹,原文标题:《生成式 AI 的中局范式:从 Harness 到 Experience Loop》
过去几年,生成式AI行业一直在寻找下一个足以改写叙事的大词。
有人说是更大的模型,有人说是推理,有人说是Agent,有人说是世界模型,也有人已经把目光投向“自我改进”“递归自我提升”。
但如果把这些概念拆开,会发现:2026年的行业未必已经出现了“Transformer 2.0”式的新底座;真正逐渐收敛的,是一套比“模型能力”更完整的系统观。
它大致包括三个层面的变化:
在产品上,AI正从“帮你用软件”,走向“替你交付工作”;
在系统上,模型不再独自构成产品,模型之外需要一个持续运行、可行动、可验证的Runtime;
在学习上,行业开始从“依赖人类数据训练模型”,走向“让系统在环境中积累经验,并把经验转化为能力”。
如果一定要写成一个公式,今天越来越多AI系统接近的是:
AI System=Model+Persistent Runtime+Environment+State/Memory+Verification+Learning Loop
或者更直白一点:
Goal→Act→World→Feedback→Update→Act Again
ChatGPT时代的基本链路是:提示词,生成答案。
成熟Agent系统的链路则变成:目标,执行,进入环境,获得结果,接受评估,沉淀经验,再次行动。
讨论的是:AI如何从一次性推理,变成一个持续存在于真实世界里的系统。
一、先别把五层问题混成一场路线之争
今天关于Agent、Harness、Agent OS、Continual Learning、World Model的争论,常常显得混乱。原因不复杂:大家讨论的根本不是同一层问题。
| 层级 | 讨论的问题 | 代表性方向 |
|---|---|---|
| 模型层 | 智能从哪里来 | Scaling、推理、多模态、世界模型 |
| 系统层 | 模型如何真正行动 | Model+Harness/Runtime |
| 学习层 | 系统如何变得更好 | 经验、记忆、技能、持续学习 |
| 产品层 | 用户究竟买到什么 | Copilot、Agent、AI Worker |
| 产业层 | AI在经济中扮演什么角色 | 软件工具、数字员工、软件即劳动力 |
这五层会相互影响,但不能互相替代。
例如,腾讯WorkBuddy、阿里QwenWork、Grok Bot等产品的意义,在于它们把AI产品的交付单位,从“回答”推进到了“任务成果”。
微软对Copilot的表达也经历了类似变化:从“帮我找到”,到“帮我选择”,再到“替我完成”。
这是一种很重要的产品迁移:软件开始从工具,走向劳动力。
但“软件即劳动力”不是模型自动出现的结果。模型能思考、能生成,不等于它拥有身份、权限、记忆、工作现场、操作记录与责任边界。那些问题,属于运行时。
二、Agent的关键,不只是模型,而是它运行在哪个世界里
DeepSeek在DSH中给出了一个非常清晰的表达:
Agent=Model+Harness
其中,模型负责智能;Harness负责让智能能够完成任务。
DeepSeek的做法尤其值得注意:模型、工具、技能、会话、沙箱、存储、循环、调度和UI,都可以被视为可替换的插件。核心保持很薄,外围不断替换和组合。
这意味着,Harness不是一个写死的Agent工作流。
它更像一个可以持续被检验、替换、重放、恢复、分叉和优化的运行环境。Agent不只是“调用几个工具”,而是在一个可观察的系统中工作:它有轨迹,有日志,有状态,也需要面对失败。
Anthropic在其面向托管Agent的实践中,也提出了一个很现实的判断:许多Harness本质上编码了“模型做不到什么”的旧假设。模型变强后,这些经验性补丁可能反而成为约束。
这正是当下系统设计最微妙的地方。
模型能力增强,会吞掉一部分Harness。
但它不会吞掉全部Harness。
会被模型逐渐吞掉的,是认知层的脚手架:
硬编码的规划逻辑;
提示词技巧;
固定决策树;
简单的工具路由;
机械式重试;
为弱模型设计的大量上下文补丁。
模型越强,越不需要人类替它规定“应该先想什么、再想什么”。
但另一部分东西,不会因为模型更聪明而消失:
身份与权限;
沙箱与隔离;
长期状态;
外部记忆;
工具契约;
审计日志;
成本控制;
验证机制;
安全与治理边界。
这些不是认知问题,而是现实世界的问题。
模型可以决定“下一步应该做什么”;但模型不能自己决定“它是否有资格做这一步”。
所以,未来更可能发生的变化是:
认知脚手架会逐渐消失,行动基础设施会越来越厚。
也可以写成一句更短的话:
Cognitive Harness变薄,Operational Runtime变厚。
很多所谓Agent OS,最后未必会成为“AI的Windows”或“AI的Android”。它更可能变成非人类行动者的运行环境:管理状态、身份、权限、资源、工具、沟通、记录和评估。
它不是智能本身,但它决定智能能否被安全、稳定、长期地使用。
三、Harness是今天最成熟的答案,但它还不是终局
如果只看2026年已经被证明有效的部分,Model+Harness几乎是最清晰的系统范式。
因为模型再强,也需要被接入环境。
一个能完成复杂工作的Agent,至少需要回答这些问题:
它能看见什么?
它可以调用哪些工具?
它有没有权限修改数据、发邮件、下单或部署代码?
中途失败后,能否恢复?
多轮任务结束后,是否还记得此前发生过什么?
它的动作能否被追溯?
谁来判定它完成得对不对?
这些问题的答案,构成了Runtime。
所以,今天的Agent成熟度,不只看模型benchmark,也要看运行时是否具备“持续工作的条件”。
一个较完整的Agent系统,可以写成:
Agent=Model+Runtime+Environment+Memory+Verifier+Learning Loop
其中:
Model提供通用智能与推理能力;
Runtime提供编排、身份、权限和持久状态;
Environment提供任务、工具、资源与现实反馈;
Memory保存可复用的信息;
Verifier判断结果是否可靠;
Learning Loop把一次次执行转化为系统能力。
前四项,已经逐渐成为工业实践。
真正仍未定型的,是最后一项:Learning Loop。
也就是,AI获得经验之后,到底改变什么?

四、真正的问题是“经验更新哪里”
在传统模型叙事里,能力提升的路径相对清楚:更多数据,更多算力,更长训练,更强模型。
但Agent进入环境后,系统开始产生另一类数据:不是人类提前写好的语料,而是行动产生的经验。
它完成一次任务,失败一次操作,收到一次用户纠正,通过一次评估,都会留下轨迹。
问题是,这些轨迹最终应该流向哪里?
一个很有解释力的更新栈是:
Experience→Memory→Skill→Context Strategy→Harness→Model Weights
这条链路把许多看似不同的技术路线放回了同一张图里。
一次经验,最轻量的处理方式,是进入记忆。
再进一步,经验可以被提炼为技能:下次遇到类似任务,不必从零开始。
继续往上,它可以改变上下文策略:什么信息应被优先召回,什么历史应被压缩,什么证据必须在行动前出现。
再往上,它可能改变Harness:工具如何组合、任务如何分解、失败后如何恢复、哪些步骤必须经过验证。
最重的一层,才是更新模型权重。
因此,“Harness会不会自我进化”“技能会不会自动优化”“记忆是不是下一代壁垒”,其实都是同一个更根本问题的不同回答:
AI获得经验以后,究竟应该修改系统的哪一层?
这也解释了为什么不少所谓“自我进化Agent”,并不一定真的在训练模型。
有些系统在更新技能文件,有些在优化提示词,有些在重写工作流,有些在调整工具策略,有些则从历史轨迹中抽取下一轮可执行的规则。
它们的共同点不是“已经实现通用自我进化”,而是开始把经验视为可被处理的生产资料。
不过,这条路的门槛很高。
微软关于Agent演化的研究综述提出了一个很务实的结论:如果缺少确定、独立的验证器,系统依赖模糊的自我评价,反而可能越优化越差。
这很符合工程直觉。
让AI自动改进一段代码、一个工作流或一个技能,本质上是在让它修改生产系统。没有稳定的测试、评估和回滚机制,所谓“学习”很容易退化成随机漂移。
因此,自我优化最先适合的领域,往往不是最开放的任务,而是结果可验证的任务。
例如:
能否通过测试;
是否完成表单;
价格、库存或字段是否正确;
代码是否运行;
任务是否在约束内完成;
输出是否满足明确标准。
先有验证,才可能有可靠的改进。
五、经验和环境,可能成为下一条能力曲线
关于下一代AI,最值得重视的变化:“经验”开始被当作独立变量讨论。
DeepMind与强化学习路线的长期判断一直很明确:如果系统不能在长期环境中积累、保留和迁移经验,它很难拥有真正持续的能力增长。
Demis Hassabis多次强调,持续学习、长期记忆和长周期推理仍是关键缺口。Agent的重要性,不在于它是一种产品皮肤,而在于它让模型真正进入环境。
模型只有进入环境,才能获得后果。
有后果,才有反馈。
有反馈,才可能形成经验。
字节Seed发布的EdgeBench,是这类讨论中很有代表性的信号。该基准包含134个真实任务、约3.8万小时Agent与环境交互;单个任务通常要求持续操作12小时以上,部分任务延续到72小时。
报告中最值得注意的,是其提出的观察:在特定任务集合中,Agent的表现曲线呈现较稳定的增长趋势;团队还观察到,Agent在部分任务上的学习速度似乎正以大约每三个月翻倍的速度提升。
但它提出了一个值得严肃对待的问题:
过去,行业主要讨论参数、算力和token。
未来,能力曲线会不会多出一个横轴:
Environment Interaction Time
也就是,系统究竟在真实环境中经历了多少次行动、失败、纠正、验证与再尝试。
如果这个变量成立,环境就不再只是模型部署的终点,而会成为能力生产的一部分。
世界不只是供AI使用的工具集合,它也可能是AI获取新数据、形成新策略、积累新技能的训练场。
六、OpenAI的RSI,意味着什么?
围绕“递归自我改进”的讨论,很容易滑向戏剧化叙事:AI开始自己造AI,然后能力爆炸。
现实版本要克制得多。
OpenAI组建RSI团队,重点并不是宣布“我们已经拥有AGI”,而是尝试自动化高质量研究工作:让系统参与研究流程、构建评估、处理反馈、发现缺失能力、生成数据,并帮助改进下一代模型。
这更像一个AI研发飞轮:
研究任务→Agent执行→产生轨迹与反馈→评估→数据与方法改进→更好的模型与系统→更复杂的研究任务
字节Seed等团队也在让模型参与评估、数据、训练、研究和基础设施工作,并探索小时级、天级的长任务。
这里真正值得观察的指标,
是:
AI对AI研发的有效贡献,占整个研发流程的比例是否越过某个临界点。
当AI只能辅助写代码、总结论文时,它是工具。
当AI能持续完成可验证的研究与工程任务,并把结果重新送回训练、评估和系统优化链路时,它才开始成为研发能力的一部分。
这距离“递归自我提升”仍然很远,但方向已经很具体。前两天,山姆奥特曼宣称在年底之前可以内部实现。
七、未来三到五年,分歧会落在哪儿?
如果把今天看作生成式AI的“中局”,未来不会只剩一条路线。
较大的共识是,2026—2027年,持久化Agent Runtime会继续普及。更多系统会拥有工具、权限、长任务状态、日志、记忆与可恢复能力。
2027—2029年,外部学习机制可能成为标准配置:记忆更有效,技能会优化,工作流会重写,上下文策略会调整,Harness会逐渐适应环境,验证器会参与改进。
更远一点的分歧,才是模型权重是否需要持续在线更新。
一条路线是:底层模型相对稳定,但外部Runtime、记忆、技能和环境策略持续适应。
另一条路线是:模型本身也进入更高频、更连续的学习过程。
前者的工程可控性更强,后者的想象空间更大,但安全、遗忘、能力漂移和评估难度也更高。
因此,未来几年最值得追踪的,是几个更朴素的问题:
什么样的经验,真正能转化为能力?
什么样的反馈,足以驱动可靠优化?
经验应该写入记忆、技能、Harness,还是模型权重?
新能力能否长期保留,并迁移到别的环境?
谁有能力提供高质量、可验证、可持续的环境?
当AI获得更多权限时,验证、审计和治理如何同步变厚?
八、Harness是今天的答案,Experience Loop可能才是明天的范式
今天,最成熟的系统答案已经相当清楚:
Model+Harness
模型负责理解与推理,Harness让它拥有工具、状态、权限、记忆、日志和工作能力。
但如果把时间拉长,真正决定系统上限的,是Harness能否把行动转化为经验,又能否把经验转化为下一轮更好的行动。
所以,生成式AI的中局,不是模型和Agent的二选一。
更像是一场从“预训练模型”走向“持续运行系统”的迁移:
Intelligence=Model×Environment×Experience Loop
模型提供潜力,环境提供后果,经验闭环决定潜力能否持续变成能力。
Harness是今天的答案。
Experience Loop,可能才是明天的范式。