**GPT-6 Astra控制机械臂完成绘画、模仿、抓取等多类任务,成功率在简单任务达95%,但精细嵌入仅10%。这引发“机器人领域的OpenAI可能就是OpenAI自己”的讨论,而非Physical Intelligence等专门公司。** **要点** **1. Astra展示通用模型控制机器人的惊人能力** 无需专门机器人训练,GPT-6 Astra通过摄像头视觉和自身推理,即可控制约150美元机械臂画出金门大桥,也能根据人类演示视频一次学会新任务,甚至能构建真实到仿真的完整环境。 **2. 简单任务成功率高达95%,精确任务仍困难** 在“将红色积木放进碗里”的20次测试中,Astra成功19次;但“将圆形拼图嵌入凹槽”的同样测试,仅成功2次,暴露了模型在精细接触和力控制上的短板。 **3. 机器人“大脑”不必从头训练,但需与低层控制结合** Astra负责理解环境、规划动作并输出末端执行器位置,底层逆运动学负责关节控制。这种分工可行,但直接以50Hz接管四足机器人行走时因推理速度不足仅跑5秒。 **4. OpenAI重新入局机器人领域,路线与行业不同** OpenAI曾因机器人数据昂贵而关闭团队,如今通过通用AI模型Astra绕回,计划做人形机器人但强调“大脑”关键。这挑战了Physical Intelligence、Skild等专门训练机器人基础模型的公司。
机器人领域的OpenAI,竟然是OpenAI自己?
2026-09-20 12:34

机器人领域的OpenAI,竟然是OpenAI自己?

本文来自微信公众号: 机器之心 ,作者:机器之心


拿GPT-6 Astra当机器人「大脑」?


好像还真行!


最近,一台售价约150美元的SO-101机械臂,在GPT-6 Astra的控制下,画出了一幅金门大桥。


这可不是照着预设轨迹画的,Astra先规划从哪里落笔,再通过摄像头边画边看,最终完成了一幅红蓝相间的金门大桥。


这段视频迅速爆火,Sam Altman直接转发:给我也来一个!


视频链接:https://x.com/cdngdev/status/2097339677128982873


最近几年,机器人圈一直在讨论一个问题:「谁会成为机器人领域的OpenAI?」


如今看来,这个问题的答案,有可能是OpenAI自己。


Astra的「动手能力」究竟如何?


画金门大桥看起来唬人,但这还不是最厉害的那个。


CMU Robotics的Wenli Xiao做了一个很直观的实验。


他们先录下一段人类完成新任务的视频,把录像丢进Codex,再让GPT-6 Astra控制机械臂,用同样的方式完成任务。


竟然一次就跑通了!


视频链接:https://x.com/_wenlixiao/status/2097801944119349455


Wenli Xiao把它称为「physical ICL」——过去大模型可以从上下文里的文字、代码示例中临时学会一个新任务,现在的人们发现,这种能力搬到物理世界里也行得通。


另一批人则干脆让Astra开始当「机器人工程师」。


Lingxiao Guo把真实机器人演示的多视角画面和动作数据交给Astra,让它自己处理相机标定、场景重建和物理参数,再把真实环境搬进MuJoCo。


最终得到的不只是一个看起来相似的3D场景,而是一套可以继续进行接触仿真和动作回放的real2sim环境。


视频链接:https://x.com/Lingxiao234/status/2096992059731443923


X上还有人把Astra接到更复杂的机器人身体上。


Dmytro Hrybov在MuJoCo中给Astra配了一台Kinova Gen3机械臂和Shadow Hand五指机械手,让它握住铅笔,画出毕加索那只著名的鸽子。


为了让笔真正落到纸面上,机械手还需要同时处理握笔姿态、手指与铅笔之间的摩擦,以及笔尖与纸面的接触。


视频链接:https://x.com/dimentary/status/2097141042214797801


如果说以上这些还比较像网友整活,下面这个就真能说明一些问题了。


RoboCurve把GPT-6 Astra接到两只真实的I2RT YAM机械臂上。


每一步行动,Astra都能看到顶部和两只手腕上的三个相机视角,以及机械臂自身的状态。随后,它直接给出两只机械臂末端执行器的x、y、z、yaw、pitch、roll和夹爪状态,再由底层IK转换成具体关节动作。


测试任务很简单:把桌上的红色积木抓起来,放进旁边的碗里。一共20次,Astra成功了19次,成功率95%。同样的测试里,Fable 5.1只成功了8次。



谁都没想到,一个并没有专门为机器人训练的通用模型,竟然能做到这种程度。


而这个问题,恰好撞上了过去几年机器人行业最热的一条路线——专门给机器人训练一颗自己的「基础模型大脑」。


「机器人大脑」不必从头训练


过去几年,随着大模型能力一路向视觉、语音和Agent扩展,机器人行业也在反复追问同一个问题:如果语言领域已经出现了GPT,机器人什么时候才能拥有自己的「GPT」?


Physical Intelligence和Skild,正是在这样的期待中迅速成为明星公司。


Physical Intelligence希望训练一个真正跨任务、跨场景、跨机器人本体的通用机器人基础模型。它的π系列模型把视觉、语言和动作放进同一套模型里,希望机器人能够像大模型理解文本一样,从大量具身经验中学会如何操作真实世界。


Skild的目标更直接——「Any task,any robot,one brain」。无论是四足机器人、人形机器人,还是桌面机械臂和移动操作平台,都由同一个通用「大脑」来理解任务、规划动作。


两家公司代表的其实是过去几年机器人基础模型最典型的一条思路:既然语言有自己的foundation model,那么机器人也需要在海量机器人数据上,训练出一套真正理解身体和动作的基础模型。


也因此,「谁会成为机器人领域的OpenAI?」一直是这条赛道绕不开的问题。


但Astra出现后,这个问题突然有了一个有点出人意料的答案。


Amazon Alexa Principal Scientist、Retrocausal联合创始人Zeeshan Zia有一个判断:「机器人领域的OpenAI,看来可能就是OpenAI,而不是Physical Intelligence或Skild。」


这句话听起来有些挑衅,因为Astra并没有沿着机器人公司的传统路线来。


它没有先收集大量机器人轨迹,再专门训练一套从视觉到动作的基础模型,Astra带来了另一种可能:如果通用AI本身已经足够强,还需不需要再从头造一颗机器人的大脑?


这个问题放在OpenAI身上尤其微妙,因为它其实很早就做过机器人。


2018年,OpenAI推出了Dactyl,让Shadow Dexterous Hand在真实世界里旋转物体;随后又进一步让灵巧手完成魔方操作。


那时OpenAI已经在研究今天机器人行业仍然绕不开的问题:如何在模拟中训练,再把能力迁移到真实世界,如何处理摩擦、遮挡、传感器噪声,以及复杂的多自由度控制。


但几年后,OpenAI关闭了机器人团队。Wojciech Zaremba当时谈到过一个很现实的限制:机器人缺少像互联网文本那样可以大规模获取的数据。相比可以直接从互联网获得海量文本和图像,机器人数据昂贵、缓慢,也很难覆盖足够丰富的真实世界。


有意思的是,OpenAI当年因为数据问题暂时离开机器人,如今却可能从另一条路绕了回来。


过去几年,OpenAI先把模型在语言、代码、视觉和Agent上一路做大,让模型积累了关于物体、空间、因果关系和人类行为的大量知识。接下来,机器人需要的是把这些已有的知识,稳定地变成身体动作。


OpenAI自己显然也重新盯上了这个方向。Sam Altman最近已经明确表示,OpenAI会做人形机器人,也会探索其他机器人形态。在他的表述里,真正关键的部分仍然是让机器人工作的「大脑」。


Astra怎么控制机器人的「身体」?


目前的答案不是让Astra直接控制每一台电机。


以RoboCurve的实机测试为例,Astra每一步会看到三个相机视角和机械臂自身的状态,然后直接给出末端执行器应该到达的位置和姿态,包括x、y、z、yaw、pitch、roll以及夹爪状态;再由底层的逆运动学系统,把这些目标转换成各个关节的具体动作。


这其实是一种很典型的分工:Astra负责判断「手应该去哪里」,传统机器人控制栈负责解决「每个关节具体怎么动」。


英伟达前研究科学家Yu Xiang也提出,机器人学接下来一个值得关注的方向,可能就是如何把最先进的AI模型真正接进manipulation。相比只让大模型停留在最上层,负责拆解任务、调用工具,Astra已经开始更直接地介入机器人的动作决策。


链接:https://x.com/YuXiang_IRVL/status/2096074174091362388


但接着往下走,问题也逐渐显现。


有人甚至让Astra直接输出Unitree Go1的joint targets,尝试像强化学习policy一样,以50Hz控制四足机器人行走。实验确实跑了起来,但因为Astra的推理速度跟不上实时控制,物理模拟必须在每次模型调用之间暂停。最终,250次推理只换来了约5秒钟的行走。


链接:https://x.com/sri299792458/status/2097349207795335424


显然,Astra已经能够决定机器人「下一步该怎么动」,但要让它直接接管毫秒级的底层控制,还不太现实。


所以,未来更现实的形态可能不是让一个大模型从头管到脚,而是让不同层级继续分工:Astra负责理解环境、推理和规划,低层policy与控制器负责把这些意图快速、稳定地变成动作。


最后一毫米


会规划动作,距离真正把动作做好,其实还有不小的距离。


还是RoboCurve的那组测试。


在「把红色积木放进碗里」的任务中,Astra 20次成功19次,成功率达到95%;可当任务换成把一块圆形拼图准确嵌进对应凹槽时,成功率立刻跌到了10%,20次只完成了2次。


同一套实机测试中,Astra在积木入碗任务上的成功率达到95%,但面对需要精确嵌入的拼图任务,成功率降至10%。图源:RoboCurve


很多距离成功仅一步之遥。Astra已经找到拼图、抓住旋钮,并且能把它移动到目标凹槽附近,却很难完成最后的精确插入。


这最后几毫米的距离,展现了机器人最棘手的一些问题:位置和角度稍有偏差,零件就无法对准;真正接触受硬件误差干扰,下一步动作也因此无法完成。


这也是为什么Physical Intelligence最近会专门研究「最后一毫米」。


在他们的实验中,让一个通用机器人模型拿起螺丝刀很简单,但想要快速、准确地对准一颗很小的M3螺丝,仍然需要通过在线强化学习继续优化;网线插入、电源线插入、扎带固定等任务,也都卡在类似的精细接触阶段。


Astra目前最明显的优势集中在理解环境、判断目标和规划动作这些「头脑」擅长的部分,而一旦进入高频反馈、精细接触和力控制,机器人自己的身体经验仍然很重要。


这也给前面的「机器人领域的OpenAI」之争留下了一个很关键的悬念。


机器人当然可以用最强模型当「大脑」,但能与之匹配的物理身体,还没有出现。

AI创投日报频道: 前沿科技
本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
正在改变与想要改变世界的人,都在 虎嗅APP