**8月19日至27日九天之内,Generalist、Skild AI、蚂蚁灵波相继发布基于ICL(上下文学习)路线的机器人模型,均实现少样本演示即执行未见任务的能力,表明ICL正成为具身智能通往物理世界交互的主流共识。** **要点** **1. 三大机器人模型九天密集发布,ICL路线形成共识** Generalist发布Gen1.5,Skild AI展示四场景机器人演示,蚂蚁灵波推出Zero-WAM框架。三者在九天密集发布并非偶然,均采用上下文学习策略,指向具身智能领域的某种相似性共识。 **2. ICL让机器人“看一遍就学会”,零样本执行未见任务** 三款模型均可从单样本或少量演示中通过上下文学习,在未经训练的场景中表现出通用物理交互能力。例如Gen 1.5在未训练新任务中平均成功率达59%,Skild AI在10万小时训练基准上未见任务成功率达66%,远超VLA路线的9%。 **3. ICL的智能涌现已初步显现** Gen 1.5在给定新工具(簸箕)时能零组合全新接触序列;Skild AI可快速习得挖土、翻煎饼等动作;Zero-WAM在长程未见任务中成功率从0提升至9%。各团队普遍认为这与上下文演示中的学习模式有关。 **4. ICL相对VLA更具泛用性优势** 语言提示的VLA在长程复杂任务和长上下文中退化明显,而ICL能将视频、因果等丰富空间数据编码进行预训练。Skild AI预估,上下文中的一个演示约相当于380个VLA后训练样本,在30k小时以上训练规模时ICL路线将表现出明显优越性。 **5. ICL的“经验”路线基于长期技术积累** 该路线可追溯至2017年单样本学习、2018年DAML人类视频训练,以及2022年Chan等人发现的Transformer上下文学习三大数据分布性质。ICL试图将人类经验规模化,使机器人具备随机应变的基础智力,但仍有训练稳定性不足、过拟合等局限。
2026-09-04 19:23

三大机器人模型、同一条路线,直指ICL 与“经验”的猜想

本文来自微信公众号: 42号电波 ,作者:Starc,编辑:James,原文标题:《三大机器人模型、同一条路线,直指 ICL 与「经验」的猜想》


    8月可谓具身智能连续发布各自产品的密集时期,多重AI机器人朝着相似的路线前进。



    8月19日,Generalist发布Gen1.5通用多模态模型。Gen-0版本首次发布后,该模型是与1.0版本并行迭代的最新成果,经过了长达8个月的预训练。在其博客中,技术团队提到了在持续预训练的过程中,Gen1.5表现出了持续的智能涌现规律,即从单样本或者少量演示中,机器人即可通过上下文学习,在未经训练的场景中表现出通用的物理交互能力。


    无独有偶。就在一周后,北美人工智能初创公司Skild AI发布的机器人种植盆栽、翻烤煎饼、制作咖啡、组装工具共四种多元场景的演示与学习视频。其同样使用ICL策略和VLA架构进行对照,发现其在长程未知任务的复杂场景中,能够抵抗干扰、纠正错误,还能够在未经预训练的情况下基于演示而组合动作、掌握新的技能。



    紧随其后的是蚂蚁灵波的Zero-WAM。8月27日,蚂蚁灵波通过新的因果视频—动作建模路线,以人类演示视频ICL的方式,同样让人工智能迈入物理世界的焦点集中在可规模化的上下文任务学习。



    它的特点在于通过引入专门为零样本任务学习设计的上下文世界动作预训练框架Zero-WAM,使单一的因果视频—动作策略能够同时支持语义提示和视频演示,将任务采样的机器人轨迹转换为语义对齐的人类视频指令,来产生更高质量的人—机ICL对。


    九天之内,三场密集的发布绝非偶然。似乎机器人正以一条更加具象的路线,通往同真实物理世界的交互。它们指向的是具身智能前沿的某种相似性,某种共识,更指向了数十年前的某个猜想——人工智能的「经验」,从何而来?


    聚光灯下的ICL


    共识凝聚之前,ICL(In-Context Learning)曾走过一条漫长的演化路径。让机器获得「看一遍就学会」的智能是一个被学界以不同形式反复捡起、提出、落空、再捡起的命题。


    2017年,单样本学习(One shot limitation Learning)在Yan Duan、Pieter Abbeel等人的成果下进入机器学习的视野。彼时,要完成任务学习,只能够通过预先示范、训练,并在网络上测试新的实例。无论是任务上的设计,还是真实世界的物理交互,通往更高智能的技术路线和训练范式远未成型。2018年,DAML将人类视频放入演示训练,通过给机器人看一段人类第一视角的视频,让机器人去执行放置、推、抓取等面向物理场景的动作。不同之处在于,DAML需要对策略参数做梯度下降。


    虽然人类演示视频为核心的训练方式第一次跨过了人与机器之间的具身边界,但受限于彼时的科技,演示进入机器之后却未能作为记忆保留下来。最根本的原因还是缺乏让机器通过数据来理解「经验」的一种形式。此后的很长一段时间内,上下文演示与具身智能还看不到具象的十字路口。


    直到大模型出现前夜。



    2022年,Chan等人在Transformer机制中发现,上下文学习的智能涌现取决于训练数据的三条分布性质:成簇性、大量长尾稀有类别以及条目含义可变。


    这三种性质指向的是早期通过数据训练展现智能的特点。成簇性指的是同一类样本成簇出现,而不是均匀铺开大量长尾稀有类别:分布是齐夫式的,而不是平坦的;在不同上下文里,同一个词的意思可以不同。


    这带来了新的疑问:上下文学习的涌现究竟取决于架构,还是取决于数据的形态?如果把数据造成成簇、齐夫式长尾、含义随上下文可变的样子,智力会不会自行出现?无人知晓答案。


    Algorithm Distillation(ICLR 2023)则发现,如果只用专家轨迹做序列建模,模型不会在上下文里进步。只有把强化学习的整段学习历史当成训练序列放入,模型才会在上下文中自我改进,且不更新任何参数。


    原来,数据的形态在于机器学习的历史和轨迹。原来,促使机器习得智能的正确答案不是成功,也不是失败,而是从失败到成功的某种轨迹,某种「经验」。所谓的Context,可以非常丰富。


    于是,ICL早期的训练序列的共识形成,示范开始进入上下文。



    2023年,「自我改进通用机器人智能体」RoboCat问世。为了支持机器人快速学会新任务,技术团队需要先采集100–1,000条遥操作示范,然后对通用模型做微调,再用微调后的策略自主产数据、回填数据集、训练下一代。


    次年8月,Letian Fu、Huang Huang、Ken Goldberg等作者在一项研究中提出把图像观测、动作、状态拼成sensorimotor轨迹,做自回归的next-token prediction。当进行测试时,人类遥操作轨迹演示即可在不更新策略参数的情况下,支持机械臂执行新任务。


    为什么ICL变得如此重要?


    机器学习的任务和动作,曾经是割裂的。指令和数据进入同一个地址空间中,程序可以像数据一样被读写、传递和生成。但任务的目标图像、损失函数标签以及动作策略等等关乎实际执行的动作,发生在数据以外的空间中。随着人工智能与Token的出现显著提升了计算效率与工程实践的协同性,这种架构为机器与物理世界的交互带来新的可能性,也带来了新的疑问:对于具身智能来说,百万小时、海量数据运算是否一定是必要的?这种技术路线与机器人的通用智能是否存在着必然成立的联系?可否仅凭一两条示范即可实现机器对新任务的即时学习?


    ICL便是利用图表示引入归纳偏置,将上下文模仿学习建模为图生成与扩散过程的结合。相较于把语义提示压缩token去做后训练,ICL能把视频上下文、因果上下文等更丰富的空间数据编码来进行预训练。并且,借助仿真环境中自动生成的「伪示范」,还可以构建近乎无限的训练数据池。这种方式很快被应用于诸如Zero-WAM的模型中。


    此后,Vid2Robot、R+X等利用视频特征进行训练,或通过「检索+上下文学习」的机器人竞相出现。但RICL认为,仅靠上下文学习通常无法使模型掌握远超基础VLA能力范围的任务。


    LocoFormer(CoRL 2025,Skild AI)正是其中一项关键成果。作为运动控制领域的上下文学习方法,LocoFormer使通用模型能够控制足式及轮式机器人,在测试阶段适应形态与动力学变化,且无需梯度更新。对程序化生成的约十万种机器人进行大规模强化学习并施加激进的域随机化,将上下文长度扩展数个数量级,以跨越Episode边界。


    研究数据显示,相较于ICL,通过语义上下文来让机器理解物理交互的训练方式存在着明显的不足。因为物理世界的交互不仅仅通过语言完成,也不单纯依靠所谓的「眼睛」,而是大脑。面对长程复杂任务和长上下文时,语言提示VLA的退化程度极其明显。这意味着,一旦需要变换动作、变换应用场景,原来的运动方式会失效,需要重新训练,或者微调。但物理世界是一个充满变化的世界,如果不存在这样的泛用性,反复微调的意义是什么?如果每一次变化都需要反复进行数据收集、策略微调和验证,机器人将永远无法抵达人类的所在。


    正是这样的问题,促使ICL方向变得越发引人关注。处在人工智能领域前沿的研究者和科学家认为,这将让机器人翻越GPT 3.0的那个时刻。


    智能涌现


    大模型的GPT时刻启发了具身智能的训练架构,将发出指令的大脑与执行动作的身体通过经验联系在了一起。要翻越GPT 3.0,寻求智能的涌现是必要的一步。


    它指的是机器人在个体或局部简单规则的基础上,通过复杂的交互和系统规模的扩大,自发产生出个体原本不具备的、全新的智能或行为。当训练规模、参数等达到临界点时,机器人会产生超出设计者预期的新能力或行为,通常无法通过单纯分析局部的代码或者行为来完全预测。


    Skild AI、Generalist、蚂蚁灵波采用了不同方式对ICL训练进行设计,彼此之间有着细微差异,却不约而同地发现了零样本/少样本演示会带来即兴的任务执行能力。这或许正是智能涌现最早出现的地方。



    Generalist的逐渐训练过程中,Gen 1.5的机器动作已随着训练样本的扩大变得越来越精准。而出乎意料的是,当提示进入上下文后,Gen 1.5面对未经训练的新任务时,在处理拉链、打开罐子、从钱包中取钱等不同场景中的平均成功率达到59%。


    例如,当Gen 1.5被给予一段将方块扫入碗的演示、再新增一个簸箕后,模型在没有语言指导的情况下,从零组合了一个全新的接触序列来完成任务——它用簸箕把方块铲了起来,放入了碗里。


    同样的涌现案例也发生在了SKild AI和蚂蚁灵波的测试中。



    同样仅靠一段视觉演示,S1超越了数据集,在种植盆栽任务中快速习得了先挖掉部分土壤为植物根茎腾出空间的动作,或是把咖啡滤纸按进滤杯、在锅中给煎饼翻个面。在10万小时的训练基准上,未见任务的平均成功率高达66%(对比VLA仅9%);而在蚂蚁灵波,Zero-WAM在贴邮票、打开邮箱、移动物体等多项任务中的成功率明显超出其他模型,其视频动作建模帮助双臂机器人在形如堆叠方块的长程未见任务的成功率不再为0(9.00±2.16%)。



    这或许说明ICL让机器人面对意外的情况具有随机应变的某种基础智力。这种能力不仅表现在行为的即兴或技能的组合上,还能够抵抗意外情况的干扰,比如物体的变换、场景的迁移、人为的干扰等等。这些都与真实世界的运转状态非常接近。


    对此,技术团队普遍难以归因。Generalist团队提到,Gen 1.5表现出的即兴能力与物理观测和演示中的上下文学习有关,并且,模型学会了如何检测和扩展这种学习模式;蚂蚁灵波团队的论文则指出,人类视频指令和任务均衡机器人预训练共同提升了模型执行未见任务动力学的能力。Skild AI在研究中总结VLA与ICL的路线差异时讨论道,相对于VLA,机器人在长程任务中表现出的优越性可能来自于ICL提供了一种更为具体的演示说明。



    在8月31日清华大学团队发布的最新研究成果《Zeva:In-Context Causal Learning for Generalizable Embodied Manipulation》中,我们也看到了将视觉状态、动作编码、观察到的状态变化归结为因果关系的映射结构,并进一步用于Zeva模型的因果上下文学习。在取、拿、放置物品等场景中,均随着里程碑的变化而表现出越来越高的精确度。


    一个普遍的共识在于,ICL是更有可能实现通用物理智能的潜在路线,它将人类经验的规模化摆在具身智能的门扉之前。已有多个团队在研究结尾共同提到了有关ICL的Scaling Law与智能涌现的关系,并认为尽管ICL的小规模训练与VLA海量数据形成的效果仍有差距,但有必要扩展ICL的训练规模。特别地,Skild AI预估,上下文中的一个演示大约相当于380个VLA后训练样本,且随着预训练的规模扩大,ICL路线下的具身智能的多项指标优势也可能指数级拉大,在1-3万小时的规模间即出现模型性能的反超,并在30 k小时以上的训练规模表现出明显的优越性。这些来自业界的共同发现令人兴奋。


    「经验」的猜想



    当上下文的学习不再止于人类的文字,成为视频、成为行动、成为人类与机器世界间的桥梁,这对具身智能来说究竟意味着什么?我们或许可以判断,人类关于「经验」的猜想正化作训练路线,以不同的形态促使机器人迈入Prompt时代。曾经难以被量化、被理解的真实世界的经验和因果关系正与人工智能的Scaling Law悄然交织,成为可以被机器习得和理解的形式,丰富着机器人的心智。


    当然,ICL仍有较长的路要走。比如,ICL在较少规模训练中由于过拟合而导致任务精确度不足的局限,相较于后训练+微调的技术路线,通过预训练习得的部分技能以及新技能的稳定性稍加脆弱。为了形成更多「经验」,训练规模需要扩展,这对技术团队设计ICL演示对、数据集质量和算力规模都提出了更高的要求,存在着诸多改进的空间。


    人工智能仍在剧烈变化。目前仍然无法预估,涌现规律将模型在物理世界的基础性能带向何方。这条曲线会趋于平稳,还是突破众人所求的终极目标?旧的猜想逐渐过去,新的设想滚滚而来。


    涌现仍非终点。人类,或许离AGI更近一步。

      AI行业信号频道: 前沿科技
      本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
      如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
      正在改变与想要改变世界的人,都在 虎嗅APP