**“把‘世界模型’遮住,只看干活能力”——在具身智能赛道,判断机器人是否拥有真正“大脑”的关键不是概念,而是预测、决策与在真机上闭环的能力;GPT-6语言再强,也无法替代物理智能所需的视觉、触觉和动作协同。** **要点** **1. 判断机器人大脑的“实”,需要遮住概念看三项能力** 判断一个项目是否真有价值,不应只看它是否自称“世界模型”,而应拆解其是否具备三项能力:能否预测未来世界和因果推演,预测结果能否辅助决策,以及决策能否在真机上稳定闭环。能生成漂亮视频但无法驱动真实动作的,距离真正的大脑仍很远。 **2. GPT-6逻辑强,但语言无法直接长出物理智能** GPT-6展现了极强的语言推理、指令泛化和长程任务拆解能力,但它在实际机器人测试中存在明显局限:实时性差,无法做到快速反应;且一旦摄像头被遮挡,任务表现便会大幅下降。语言模型适合承担高层次的System 2,而具身动作层仍需由VLA或World Action Model等Quick System 1来完成。 **3. 从Demo到真实部署,大脑必须在物理交互中“自进化”** 漂亮的Demo只能证明机器人在特定条件下“曾成功”一次,而无法应对真实世界中的长尾、开放和不确定环境。真正的机器人大脑需要在物理交互中持续学习(自进化):利用成功和失败信号不断修正自身,而非等到模型完美才投入部署。数据与Infra必须先做对,Scaling才能成立。 **4. 越接近真实世界,大脑越不能脱离身体独立存在** 纯做“大脑”行不通,因为硬件批次差异、执行器误差、视觉噪声和运动控制等问题无法单靠上层模型解决。大脑与硬件必须进行协同设计。虽然通用能力可以跨本体迁移,但要让机器人操作足够自然流畅并真正进入商业场景,大脑必须与硬件适配优化。 **5. 通往通用能力的两条路径尚未统一,估值之争待解** 行业对如何走向通用存在路径分歧:一派主张先做大模型“智商”,等待能力跨过临界点后自然催生应用;另一派主张先把现有模型(哪怕只有40分)送入可控的真实场景,通过人机协同、数据回收和自进化逐步提升。资本已经开始为通用大脑的终局定价,但由于下游高价值“应用场景”尚未明确(即具身智能的“Coding”时刻尚未到来),当前的高估值面临过热回调风险。
具身智能凭什么跑出比OpenAI更贵的公司?|AI100闭门会
原创2026-09-24 12:18

具身智能凭什么跑出比OpenAI更贵的公司?|AI100闭门会

“把‘世界模型’四个字遮住,然后具体说,你到底在做什么。”


GPT-6、世界模型、VLA、自进化都在争夺机器人的“大脑”。但一颗真正能干活的大脑,到底靠什么长出来?


世界模型,正在成为具身智能最热的几个词之一。


做视频预测、仿真、机器人动作生成的都在谈世界模型。


另一边,GPT-6直接接上机器人做真机测试,大家开始讨论:

既然语言模型已经拥有很强的推理、记忆和规划能力,它能不能直接接管机器人的“大脑”?


投资人邱谆提了一个判断项目真正“含金量”的简单方法:


“把‘世界模型’四个字遮住,然后具体看,它到底在做什么。”


能不能看懂物理世界、预测一个动作的结果?能不能做决策,并在真机上跑通?第一次失败以后,下一次能不能做得更好?


机器人大脑究竟怎样才算成立?


本期虎嗅AI100闭门会,我们邀请了:

章鱼动力世界模型合伙人 陈文科
华映资本海外合伙人 邱谆
域变换联合创始人、南京大学特聘研究员 吴昊
墨奇智能世界模型负责人、复旦大学可信具身智能研究院助理教授 吴桐


和主持人宋思杭,从模型研发、资本、自进化和学术前沿四个视角展开了一场讨论。

整场下来,有5个判断值得继续追踪:


1. 别只看“世界模型”名字,机器人大脑最终比的是干活能力。


2. GPT-6证明语言智能很强,但物理智能不能只靠语言长出来。


3. 比起Demo,预测、决策、真机闭环,才是大脑的三道真考试。


4. 越接近真实部署,大脑越离不开身体:模型、本体、控制必须协同。


5. 下一家高估值公司,可能来自现有玩家,也可能来自一条新路线。


一、先遮住“世界模型”四个字


讨论一开始,第一个问题就是:世界模型到底是什么?


陈文科给出的定义相对底层。


在他看来,世界模型首先要和“世界”真正发生关系:它需要能够预测未来世界,同时对时间上的因果关系进行推演。


比如:机器人推一个杯子,接下来杯子会往哪里移动;夹爪改变力度之后,物体状态会如何变化。


吴昊进一步把这件事提炼成三个问题:


1、能不能预测未来?

2、预测结果能不能帮助决策?

3、决策最后能不能在真机上闭环?


如果只能生成一段漂亮的视频,却不能帮助机器人做下一步决定;或者模型能输出一个判断,却无法在真实机器上执行和验证,那么至少从具身智能角度,它距离大家真正期待的那颗“大脑”还有很长距离。


而邱谆的视角更加务实:在投资中,他并不太关心一家公司的技术是不是被归类为世界模型。


VLA、预测视频、预测行为、做因果建模都各是一条路线。


在今天行业里有人把世界模型当作技术手段,有人把它直接当作最终目标,语境很容易混淆。


于是他提出:先把“世界模型”四个字遮住。


近十年前看“元宇宙”也是类似逻辑。


一个宏大概念越试图覆盖所有东西,它本身提供的信息反而可能越少。


把这个大词拿掉,看下面究竟是在做 VR、游戏,还是区块链,才真正清楚。


世界模型也是一样。


吴桐从技术上补充,今天具身行业真正讨论的,更多是视觉世界模型,它大致分成两条路:

  • 一类用视频预测动作对世界状态产生的变化、帮助训练和评估机器人的策略;

  • 另一类让视觉预测直接参与动作生成。


但广义上来看,语言模型也可以被认为是一种世界模型。


所以更准确的问题是:世界模型,到底给机器人大脑增加了什么能力,以及一颗机器人大脑到底需要什么?



二、GPT-6很强,但机器人大脑不能只靠语言长出来


GPT-6让这个问题变得更加尖锐。


过去,大语言模型和机器人之间还有一道相对清楚的边界:语言模型负责理解和推理,具身模型负责动作。


但当通用大模型开始直接接入机器人以后,问题出现了:


Language已经这么强了,还需要单独做具身大脑吗?


陈文科的回答,从底层出发:语言到底离Action有多远?


他用三个字母拆机器人大脑:L、V、T。

L是Language,语言;

V是Vision,视觉;

T是Tactile,触觉。


经历过语言模型和视频生成模型的Scaling后,在他看来,GPT-6最重要的意义之一,是再次说明了一件事:


当模型Scale到一定程度,确实可能自然涌现出新的能力。


但这并不等于:Language Scaling可以直接换成Action能力。

(Scaling,指通过扩大模型、数据与计算等规模持续提升能力)


他举例:一个人伸手拿起水杯,不需要先在脑子里用语言描述一遍:“我要把手移动到杯子旁边,再抓住它。”


很多物理动作,本身不以语言作为最直接的中介。


因此,他判断,L更适合理解、规划和长程任务拆解;真正直接连接物理世界和机器人动作的,是V和T。


机器人首先得“看见”。


物体在哪里、姿态如何、动作以后环境发生了什么变化,都需要视觉持续反馈。


但只有视觉不够。抓一个水瓶时,力是不是太小、瓶子是不是正在往下滑、接触面发生了什么变化,这些都和触觉、力反馈有关。


所以真正进入物理世界以后,机器人大脑需要解决的不是一个单纯的“语言推理”问题,而是:


L、V、T最终怎样共同作用于Action(动作)。


吴桐团队对GPT-6的真机测试,恰好给这个判断提供了另一侧的观察。


在她的体验里,GPT-6确实表现出了一些过去VLA或World Action Model很难获得的能力:


更强的指令泛化、In Context Learning,以及长程任务中的理解和交互。


它可以把一个复杂目标拆成若干步骤,做完一步之后重新观察,再继续判断下一步。


这是GPT-6非常强的地方。


但它的局限也同样明显。


第一是实时性。


云端大模型可以慢慢推理,但机器人在现实中需要快速反应,不可能每执行一步都停下来长时间思考。


第二是视觉反馈仍然不可替代。


吴桐在真机测试中观察到,当摄像头被部分遮挡,相当于把模型的“眼睛”蒙住以后,任务表现会明显下降。


GPT-6能够理解自己想做什么,却不意味着它有一个完整的“动作之后世界会如何变化”的物理模型。


因此,她认为,一个现实方向可能是:


大语言模型承担更高层、更低频的System 2;

VLA或者World Action Model承担更快、更贴近动作执行的System 1。


这也让GPT-6真正带来的变化变得更加清楚。


它推进行业重新回答:


一颗机器人大脑里的理解、规划、视觉、触觉和动作,究竟应该怎样分工。


语言智能可以帮助机器人想明白。


但物理智能最终还得让它看见、感受到,并真正把事情做完。



三、从Demo到部署,“大脑”要自进化,也要数据和Infra


今天判断一个机器人是不是“聪明”,最直观的方法仍然是看Demo。


但最多证明:它在这个环境里,曾经把这件事做成过。


但是在真实环境中,换一张桌子、材质、灯光,甚至本体之后还能不能做,Demo回答不了。


吴桐给出的技术标准很直接:如果是World Action Model(世界动作模型),就要看生成的策略能否在真实环境里稳定、安全、高成功率地运行;如果是世界仿真器,就看它有没有真正让后续的策略训练变得更好。


而吴昊提出真实世界非常长尾和开放,大脑在真实环境中的交互,难以通过单纯的模型预训练来解决。


大脑若想真的走向真实环境中的部署,需要在物理交互中持续进化。


吴昊所在团队做具身自进化,想解决的正是Demo和真实部署之间的断层。


他现场用了一个很直观的假设:


如果一个模型今天只有40分,不一定要把它关在实验室里等到90分再部署。


更理想的状态,是让它进入环境,通过真实交互,从成功和失败中不断学习,让能力继续往上爬。


机器人大脑真正重要的,不只是“出厂时会多少”。


而是:进到真实世界以后,它还能不能继续变强。


陈文科从Scaling角度给出了另一个补充。


在他的观察里,模型规模和数据规模继续提升,确实能够带来动作表现的变化;而且世界预测得越准确,模型输出的动作也可能随之变得更准确。


但Scaling能够成立的前提,是:数据和Infra先做对。


如果训练数据、基础设施都没有准备好,就急着讨论Scaling Law是否存在,本身可能还太早。


所以最终,判断一颗机器人大脑的标准变得更简单:


不是生成得多像。也不是Demo有多炫。


而是模型进入系统以后,机器人有没有真的变得更会干活。



四、越接近真实世界,越没有一颗悬空的“大脑”


当一颗“大脑”开始真正驱动机器人,另一个问题随即出现:它能不能像今天的大模型API一样,完全独立于身体存在?


陈文科的答案很直接:“纯做大脑肯定是不行的。”


原因很简单:同一种机器人,不同批次的硬件会有差异;硬件有寿命;执行器存在误差;视觉有噪声;接触瞬间需要高频反馈;一个真实动作背后,还有运动学、动力学、控制和力反馈。


这些问题不会因为上层模型更加聪明就自动消失。


所以在他看来,如果最终目标是让机器人真正进入生产力系统,大脑和硬件就不能彼此孤立,需要进行Co-Design。


但这也不等于“做大脑就必须从第一天自研全部本体”。


吴桐对此有进一步的保留。


她的判断是:“一个通用大脑可以相对独立,但一个真正好用的机器人仍然需要软硬耦合。”


她举了自己团队的测试。


拿到GPT接口之后,他们先在商业机械臂上尝试,随后把模型部署到自己的本体上。


模型没有见过这款本体自己的训练数据,也能完成导航、握手、举起玩偶等动作。


这说明,一些能力——任务理解、空间认知、行为认知——完全可以跨越本体。


但她也承认:如果目标不是“勉强能做”,而是要让操作足够自然、流畅,真正进入商业场景,那么大脑和硬件之间肯定需要进一步适配。


两种观点的侧重点不同,但共同指向一个现实:


大脑能力能不能跨本体迁移?


可以。


一个商业机器人能不能完全无视本体差异?


很难。


机器人大脑越接近真实世界,讨论就越不像一个纯模型问题。


模型、控制、本体、传感器、数据、Infra重新被绑到了一起。


现实的问题是:谁能把模型能力与真实身体之间的最后一段距离补上。



五、上限可以很高,但具身智能的“AI Coding”还没出现


也正因为如此,具身大脑的估值问题显得有点“抽象”。


一边,是极高的技术难度和尚未完成的真实闭环。


另一边,是资本已经对这颗未来的大脑给予较高想象。


邱谆并不否认这种长期价值。


在他的投资逻辑里,世界模型可以只是具身大脑的一条路线。


真正重要的问题是:未来会不会出现一个类似基础模型的平台级机器人大脑。


如果这个能力真的成立,它的价值上限可以非常高。


邱谆用OpenAI这类基础模型公司的价值逻辑去理解这种长期可能性。


但问题是:现在还不知道谁会做到,甚至不知道最先在哪个场景做到。


他在现场强调一个投资原则:“高认知,低判断。”


做投资需要深入理解前沿技术。但理解得足够深,并不意味着投资人就有能力替科学家判断:


哪一种世界模型定义一定正确;哪条技术路线一定成为终局;或者某个公司未来一定领先。


具身智能仍然处在一个高度不确定的阶段。


最重要的商业问题之一,也没有答案:具身智能的“AI Coding”场景到底是什么?


大语言模型已经逐渐找到Coding这样一个高价值、高频、能够持续吸收模型能力的场景。


但具身智能呢?工厂?物流?家庭?康养?


邱谆的判断是:现在就回答,太早。


他拿大语言模型做类比:即使GPT Moment真正出现以后,行业也花了很长时间,才逐渐看清真正高价值的应用会落在哪里。


而具身智能还没有出现属于自己的涌现时刻。


他也指出:资本周期本身也不会一直向上。当前行业存在过热。


VC会在过热和过冷之间波动。资本集中进入,随后又退出,过程中即便是不错的公司也可能遭遇融资困难,需要穿越周期。


至于未来真正跑出高估值公司的,会不会就是今天已经在牌桌上的玩家,邱谆同样没有下判断。


他拿NLP的发展做类比:行业曾围绕BERT一类路线反复探索,后来又出现了GPT这样的新范式。


具身智能今天的技术路线同样没有完全收敛,未来的突破者可能来自现有公司,也可能来自一家新公司、甚至一条现在还没有成为主流的新路线。


而且,第一个提出新方法的人,也未必是最后真正把它做出来的人。


吴昊对此提供了另一层观察:资本周期和技术进步,其实是两条线。


资本有自己的目标回报率和风险偏好,但技术仍然会继续往前走。


最终真正改变资本判断的是:


把人拉到一个真实现场,让机器人在足够开放的环境里把事情真的做出来。


于是,一个错位出现了:


资本已经开始为通用机器人大脑的终局定价,技术却仍在寻找自己的“Coding”。


而当终局还不清楚时,真正的分歧出现:


今天到底应该先把模型继续做聪明,还是先把它送进真实世界?



六、通往通用的两条路:先把大脑做聪明,还是先把一个场景跑通?


到最后,嘉宾对于“今天应该怎样走向通用”没有相同的答案。


吴昊强调真实环境里的闭环进化。陈文科强调模型能力本身。


一个更接近:Deployment first。另一个更接近:Scaling first。


陈文科的判断来自他过去做大语言模型和视频生成的经验。


技术刚出现时,大家总会急着追问:能不能商业化?能不能先找一个垂类?能不能赶紧产生收入?


但在他的观察里,很多时候真正决定后续应用爆发的,并不是最早找到了一个场景,而是模型的基础能力先跨过了临界点。


早期LLM能力很有限时,商业化空间同样有限;等模型开始拥有更强的Coding、Agent和工具调用能力以后,应用才迅速自然扩展开来。


所以他的优先级是:先继续提高模型“智商”。


吴昊则给出了另一条路径。


他的出发点是:模型不需要等到100分再进入真实世界。


甚至可能恰恰相反。


如果一个模型现在只有40分,可以先把它送进一个相对可控的环境。


让它工作;让人提供必要接管;让它暴露失败;把成功和失败转成新的学习信号;再一点点把40分往60分、80分、90分推。


所以吴昊提出:“先别追求真的把世界模型搞成一个‘世界模型’,你先搞个‘场景模型’。”


物理世界太复杂。


工厂、物流、实验室、家庭,每一个场景都有不同的物体、空间、流程和物理约束。


试图一步理解整个世界,是一个极高的目标。


但机器人真正进入商业环境时,并不需要第一天就拥有完整世界知识。


它可以先进入一个半结构化场景。先把这里的物理规则和因果关系吃透;先真正干一点活;做不到的地方由人接管;运行过程中产生数据,再继续训练和修正;随着模型能力提高,再逐渐减少人工介入。


先人机协同,再逐渐提升自主程度。


在这条路线里,真实场景不只是产品最终落地的地方,也是训练场。


这是“自进化”的核心:机器人不是训练完成以后才进入世界,而是进入世界以后继续训练。


吴昊也强调了这条路线的边界。


在一个工厂跑通,不意味着换一个工厂还能跑——今天行业还没有充分证明真正意义上的跨场景泛化。


所以“场景模型”并不是说通用不重要。


它回答的是:通用还没到的时候,怎么先往前走。


吴桐的判断则提供了第三个坐标。


对她而言,无论采用哪种路线,世界模型首先都是一个工具。


最后真正拿出来工作的,是机器人的执行策略:够不够稳定、快、低成本?任务能不能持续做完?


从这个角度看,扩大模型能力和进入真实场景并不是永远对立的两条路。


真正的问题可能是:通用能力究竟主要从哪里长出来?


是更多预训练、更大的模型、更好的数据和训练基础设施?还是进入现实环境之后,通过失败、反馈和持续交互一点点长出来?今天还没有答案。


但这或许是接下来机器人大脑值得追踪的一场竞争。


结语:模型要变聪明,也要接上真实世界


两个多小时的讨论里,四位嘉宾没有给“机器人大脑”一个统一技术答案。


但把一层层热门名词拆掉以后,一套更具体的判断尺度开始出现:


  • 比起叫什么,更要看它增加了什么能力。

  • 语言推理再强,干活也需要真正连接视觉、触觉和动作。

  • Demo只是起点,要看预测能进入决策、决策能在真机上闭环。


至于通往通用的路,现在不存在唯一答案。


也许需要把模型继续Scale到一个新的智能临界点。


也许需要更早进入工厂、物流、实验室这些真实环境,让机器人从一次次成功和失败中继续学习。


更可能的情况是:这两件事最终需要同时发生。


模型能力决定机器人能走多远;真实世界则不断告诉模型,哪里还不够聪明。


所以,真正的分水岭,也许既不是谁先把模型做得最大,也不是谁先把机器人送进最多场景。


而是谁最早把这两条线真正接起来:一边让大脑持续变聪明,一边让真实世界持续给它反馈。


直到机器人不只是“会做一次”,而是第一次做错以后,下一次真的做得更好。


本场嘉宾:

陈文科|章鱼动力 世界模型合伙人

邱谆|华映资本 海外合伙人

吴昊|域变换 联合创始人、南京大学特聘研究员

吴桐|墨奇智能 世界模型负责人、复旦大学可信具身智能研究院助理教授

主持人:宋思杭|虎嗅科技组 AI 编辑


本文基于2026年9月22日虎嗅AI100第12期闭门会直播,观点来自嘉宾本人发言。

扫码加入虎嗅AI100闭门会社群

参与系列直播


文章标题:具身智能凭什么跑出比OpenAI更贵的公司?|AI100闭门会

文章链接:https://www.huxiu.com/article/4893699.html

阅读原文:具身智能凭什么跑出比OpenAI更贵的公司?|AI100闭门会_虎嗅网
AI行业信号频道: 前沿科技
本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。
正在改变与想要改变世界的人,都在 虎嗅APP