本文来自微信公众号: 奇异AI丨Xsignal ,作者:X 博士
2026年9月28日,AMD宣布与李飞飞创办的World Labs达成最终收购协议,交易价值约82亿美元,采用全股票方式,预计在满足监管审批等条件后于年底前完成。交易完成后,李飞飞将加入AMD,担任执行副总裁兼首席科学家。AMD给出的收购逻辑并不局限于3D生成,而是明确指向机器人、Simulation和Physical AI等下一代AI Workload。
这笔交易距离World Labs发布Atlas只有27天。9月1日,World Labs刚刚发布新一代世界模型Atlas。它把大语言模型的Autoregressive、图像和视频模型的Diffusion、多模态理解以及3D Spatial Context放进同一套基础架构,目标也不再只是生成视觉内容,而是生成、重建和模拟一个可以被机器理解和使用的世界。World Labs同时明确表示,Atlas的表现会随着训练Compute增加而提升。
把两件事放在一起看,真正值得讨论的不是“世界模型突然值82亿美元”,而是AI产业正在出现一个更深的变化:Scaling的对象正在从Information向World迁移。


前一条技术轴告诉我们,具身智能的能力从哪里来;后一条产业轴决定,它最终能不能成为一个足够大的产业。
Information已经Scale
27.72亿用户之后,AI开始寻找“任务增量”
为什么Physical AI会在2026年突然成为焦点?一个重要背景是,生成式AI本身已经完成了第一轮大规模用户普及。
根据Xsignal AI Holo(AI全息)数据显示,2026年8月,中国AI应用活跃用户规模达到86,639.68万,海外达到190,601.22万,全球合计约27.72亿。同期,ChatGPT的APP+WEB合计活跃用户达到13.24亿。

这个数量级已经足以说明,第一代生成式AI完成了从科技人群尝鲜到大众应用的跨越。当全球AI用户达到27亿级、单一头部产品达到13亿级之后,产业增长逻辑会自然发生变化。过去首先要解决的是“还有多少人没有使用AI”;下一阶段更重要的问题则是:这些已经进入AI生态的用户,会把多少时间、多少流程和多少任务进一步交给AI。
从Xsignal AI Holo(AI全息)数据观察到的产品结构变化也能看到类似趋势。增长活跃的方向已经不只集中在通用Chatbot,AI设计、AI视频编辑、AI PPT以及专业工作流工具持续扩展。这不能直接证明机器人市场已经启动,但它反映出AI创造价值的单位正在变化——从“一次回答”“一次生成”,逐渐转向“一项任务”。
第一阶段的生成式AI主要生产Content;Agent和专业工作流开始调用工具、处理文件、操作软件和执行流程,AI由Information Generation进入Digital Action。具身智能则继续向前一步:把Action带入真实世界。

这也是为什么27.72亿AI用户对具身智能研究有意义。它并不证明机器人即将爆发,而是说明Information Scaling已经完成第一轮市场验证,AI下一阶段必须寻找更深的任务价值。过去市场关心AI能够生成什么;下一阶段,更重要的问题会逐渐变成:AI究竟能够替这27亿级用户规模完成什么?
World能不能Scale
Atlas之后,AI开始从学习信息转向学习世界
从语言模型进入真实世界,首先遇到的问题是:语言并不是世界本身。
李飞飞此前把World Model划分为三类功能:Renderer负责输出Observation,即机器看到什么;Simulator负责描述State,即世界实际处于什么状态、接下来怎样变化;Planner负责Action,也就是机器下一步应该做什么。三者共同组成Agent与现实世界不断循环的“观察—状态—行动”闭环。
过去几年,Renderer发展最快。图像和视频模型已经能够生成高度逼真的视觉世界;Planner也在快速发展,LLM负责规划,VLM理解环境,VLA进一步将视觉、语言和动作连接起来。真正困难的是中间的Simulator。
机器人需要的不是一个“看起来真实”的世界,而是一个“物理上成立”的世界。一个杯子可以在生成视频中非常逼真,但如果模型不知道它的尺寸、质量、重心、摩擦力和接触关系,机器人仍然无法判断从哪里抓最稳定、施加多大力量,或者动作之后杯子会发生什么变化。
Atlas的重要性正在于此。它不再只生成新的视觉Observation,还试图从有限信息中恢复稳定的3D结构,并将Simulation纳入世界模型能力范围。World Labs将Atlas直接定义为能够生成、重建和模拟世界的omni world model。

这个判断并不是World Labs一家公司的孤立选择。Jensen Huang正在从基础设施侧推进相似方向:NVIDIA把Cosmos World Foundation Model、Isaac Simulation和GR00T机器人基础模型放进同一套Physical AI技术栈。背后的逻辑是,Digital Agent可以在软件系统里调用工具,而Physical Agent必须先理解真实环境、预测行动后果,再控制机器人或车辆。
Yann LeCun虽然选择了不同的技术路线,却从反面指出了同一个问题:Next Token Prediction擅长学习语言结构,但不足以建立一个稳定、可用于行动预测的现实世界模型。他因此长期强调World Model和基于潜在表征的预测,而不是把语言生成能力简单外推到Physical Intelligence。李飞飞则从Spatial Intelligence和Simulation出发,试图把视觉理解、三维空间与行动所需要的内部世界连接起来。
三人的具体方法并不相同,但这里真正值得保留的共同判断只有一个:从语言进入物理世界以后,AI必须从学习“信息之间的关系”,进一步学习“行动与世界状态变化之间的关系”。
这也解释了为什么AI下一阶段的Scaling对象开始变化。语言模型Scaling的是Token和Knowledge,视频模型Scaling的是视觉与时间数据,而World Model开始尝试Scaling空间、Dynamics和可预测的世界状态。Information Scaling之后,下一道门槛就是World Scaling。
但即便World能够Scale,机器人也不会自然学会工作。一个可以模拟的世界,只是提供了训练环境;真正决定机器人能力的,是它在这个世界中获得多少有效交互经验。于是问题自然进入下一层:机器人从哪里获得足够多的Experience?这正是1000万小时真实场景视频数据值得讨论的原因。
Experience能不能Scale
机器人真正缺的不是更多视频,而是自己的“互联网”
即使机器已经拥有一个很好的World Model,它仍然不会自然学会工作。原因很简单:机器人没有自己的互联网。
语言模型可以直接利用海量互联网文本,图像和视频模型同样拥有庞大的公开数据。机器人真正需要学习的却不是“这个世界看起来是什么样”,而是“在这个世界中做了什么,以及做完之后发生了什么”。

这也是2026年9月9日JDDiscovery-2026京东全球科技探索者大会上披露的一个数字值得关注的原因:京东提出未来两年累计采集超过1000万小时真实场景视频数据,首批数据已经开始开放。
这里真正有产业意义的,不是京东自身的业务布局,也不是1000万这个数字看起来有多大,而是具身数据的入口正在从Robot向Human扩展。1000万小时人类视频当然不能等同于1000万小时Robot Trajectory,普通视频不包含完整的机器人关节状态、控制信号、力觉和触觉,因此不能直接替代高质量机器人操作数据。但它提供了一个新的数据入口。
过去,高质量机器人数据高度依赖真机和遥操作,每增加一小时都需要真实设备、人员、场地和时间。现在,物流分拣、物体取放、维修、整理等本来已经存在的人类劳动行为,也开始被视为可以转化的Physical Experience。
这会改变机器人行业的数据竞争方式。未来单纯公布“拥有多少小时数据”,分析意义会越来越有限。机器人在同一个工位重复1000小时,并不会产生1000小时同等价值的新知识。真正稀缺的是新任务、新环境、新物体,以及失败、异常和恢复过程。

World Model和Simulation真正可能产生巨大杠杆的地方,就在这里。如果一个真实工位能够被重建进Simulation,模型就可以不断改变物体位置、相机视角、机器人姿态、障碍物、光照甚至部分物理条件。一次真实Experience,不再只能被使用一次,而能够扩展成大量Simulation Experience。

这就是Experience Scaling。从这个角度看,1000万小时真实场景视频真正释放的信号,不是机器人也开始“大数据化”,而是行业开始寻找Physical AI自己的互联网。
Experience怎样变成Action
机器人基础模型开始进入第二阶段
World和Experience最终都要转化成Action。目前最直接承担这一任务的是VLA。
RT-2把机器人动作表示成类似Token的形式,使视觉语言模型可以像生成文本一样输出动作;Diffusion Policy把扩散模型带入机器人控制;π0则进一步采用Flow Matching生成连续动作。
这并不是简单把生成式AI的热门方法移植到机器人。现实中的机器人任务本身就是多解问题。同一个杯子可以有多个合理抓取路径,同一个整理任务也可能存在多个合理顺序。传统回归容易把多个可行方案平均掉,而生成式模型擅长学习的正是这种高维、多模态分布。

所以“具身智能正在吃掉生成式AI全部果实”并不是一句修辞。过去分别用于文字、图片和视频生成的方法,正在被重新组织成感知、World Model和Action Model。
但真正意义上的Action Scaling不能只证明模型能完成更多动作。更关键的问题是:模型能不能跨任务、跨场景、跨Embodiment复用经验。
宇树近期产品变化很有代表性。H2 Plus已经明显不只围绕Motion Performance定义产品。它搭载Jetson T5000,提供多视角视觉和可选触觉灵巧手,并明确支持Isaac GR00T及从数据到部署的机器人开发工作流。真正值得关注的,不是2070TFLOPS或者75个自由度本身,而是机器人产品的定义正在被基础模型反向改变。
过去是先把机器人造出来,再考虑怎样加入AI;现在,模型需要什么摄像头、需要多少机载算力、怎样采集示范、是否需要触觉、怎样接入Simulation,已经开始进入机器人最初的硬件设计。机器人正在从Motion Machine变成Physical AI Terminal。
H2-D一类轮式双臂平台又提出了另一个很重要的问题:Physical AI并不等于Humanoid。真实产业最终寻找的是最合适的Embodiment,而不是最像人的外形。因此,未来真正需要标准化的可能不是Body,而是Model和Policy。
如果每换一种机器人都需要重新训练一套模型,VLA仍然更接近先进的项目制软件;只有当Experience能够跨任务、跨场景和跨机器人身体复用时,Action Scaling才真正成立。
最后一道门槛不是Action,而是Productivity
这也是整篇文章最容易被技术讨论掩盖的一点:机器人会做一件事情,并不等于这件事情值得交给机器人。
过去两年,人形机器人首先需要证明自己能站、能跑、能跳,这是本体发展的必要阶段。但随着Motion能力提高,这些指标对商业价值的解释力会越来越弱。真正决定商业价值的,不再是机器人百米跑多快,而是一天能够自主工作多少小时;不是一次抓取成功率多高,而是一万次操作需要多少人工介入;不是Demo展示多少动作,而是增加一个任务需要多少重新训练和现场调试。

Capability回答“机器人能不能做”,Productivity回答“企业值不值得让它做”。因此,Physical AI真正的核心指标最终会回到几个非常传统的商业数字:有效自主工作时间、人工接管率、平均故障间隔、异常恢复时间、任务迁移成本和单位任务成本。
这也是为什么近期最现实的商业化仍然会首先集中于工业、仓储、巡检和部分标准化服务。结构化场景的价值并不是技术要求低,而是能够首先压缩环境的不确定性,把模型能力转化成可计算的ROI。
真正有意义的Productivity Scaling应该表现为:部署规模增加,Experience增加;Experience增加,模型能力提高;模型能力提高,人工接管下降、有效工作时间增长、单位任务成本下降。
如果机器人只是卖得更多,那仍然是制造业规模扩张;如果部署越多,模型越强,而下一次部署反而越来越便宜,那才开始具备AI平台的经济属性。
结语
82亿美元真正买的是“Scaling进入现实世界”的期权
回到AMD与World Labs的交易。如果只从World Labs当前产品和收入看,82亿美元很难用传统软件估值逻辑解释。但如果把它放到更长的AI产业链上,逻辑会清晰很多。
过去一轮AI基础设施建设的核心,是Information Scaling。更多Token、更大的模型、更高推理量,创造了巨大的GPU、HBM和数据中心需求。如果World Scaling成立,未来增加的将是3D Reconstruction、World Simulation和多模态空间推理;如果Experience Scaling成立,Simulation和Synthetic Experience会进一步扩大机器人训练Compute;如果Action Scaling成立,大规模Policy Training和Real-time Inference又会形成新的Workload;最终,如果Productivity Scaling成立,Physical AI就不再只是一个模型市场,而会真正进入制造、物流、交通和服务业的资本开支体系。
真正需要思考的,不是“World Labs值不值82亿美元”,也不是“人形机器人什么时候爆发”。真正的问题只有一个:生成式AI已经在数字世界证明过的Scaling范式,能不能继续穿越现实世界。
Information Scaling已经通过十亿级用户和大规模AI基础设施完成第一轮验证。现在行业正在依次测试剩下的四道门槛:World能不能Scale,Experience能不能Scale,Action能不能Scale,最终Productivity能不能Scale。
如果答案是肯定的,那么具身智能就不只是生成式AI之后出现的另一个垂直赛道。它更可能代表生成式AI下一阶段最大的一次价值迁移:从Content Economy走向Physical Economy。
