本文来自微信公众号: 机器之心 ,作者:机器之心
拿GPT-6 Astra当机器人「大脑」?
好像还真行!
最近,一台售价约150美元的SO-101机械臂,在GPT-6 Astra的控制下,画出了一幅金门大桥。
这可不是照着预设轨迹画的,Astra先规划从哪里落笔,再通过摄像头边画边看,最终完成了一幅红蓝相间的金门大桥。
这段视频迅速爆火,Sam Altman直接转发:给我也来一个!

视频链接:https://x.com/cdngdev/status/2097339677128982873
最近几年,机器人圈一直在讨论一个问题:「谁会成为机器人领域的OpenAI?」
如今看来,这个问题的答案,有可能是OpenAI自己。
Astra的「动手能力」究竟如何?
画金门大桥看起来唬人,但这还不是最厉害的那个。
CMU Robotics的Wenli Xiao做了一个很直观的实验。
他们先录下一段人类完成新任务的视频,把录像丢进Codex,再让GPT-6 Astra控制机械臂,用同样的方式完成任务。
竟然一次就跑通了!
视频链接:https://x.com/_wenlixiao/status/2097801944119349455
Wenli Xiao把它称为「physical ICL」——过去大模型可以从上下文里的文字、代码示例中临时学会一个新任务,现在的人们发现,这种能力搬到物理世界里也行得通。
另一批人则干脆让Astra开始当「机器人工程师」。
Lingxiao Guo把真实机器人演示的多视角画面和动作数据交给Astra,让它自己处理相机标定、场景重建和物理参数,再把真实环境搬进MuJoCo。
最终得到的不只是一个看起来相似的3D场景,而是一套可以继续进行接触仿真和动作回放的real2sim环境。
视频链接:https://x.com/Lingxiao234/status/2096992059731443923
X上还有人把Astra接到更复杂的机器人身体上。
Dmytro Hrybov在MuJoCo中给Astra配了一台Kinova Gen3机械臂和Shadow Hand五指机械手,让它握住铅笔,画出毕加索那只著名的鸽子。
为了让笔真正落到纸面上,机械手还需要同时处理握笔姿态、手指与铅笔之间的摩擦,以及笔尖与纸面的接触。
视频链接:https://x.com/dimentary/status/2097141042214797801
如果说以上这些还比较像网友整活,下面这个就真能说明一些问题了。
RoboCurve把GPT-6 Astra接到两只真实的I2RT YAM机械臂上。
每一步行动,Astra都能看到顶部和两只手腕上的三个相机视角,以及机械臂自身的状态。随后,它直接给出两只机械臂末端执行器的x、y、z、yaw、pitch、roll和夹爪状态,再由底层IK转换成具体关节动作。
测试任务很简单:把桌上的红色积木抓起来,放进旁边的碗里。一共20次,Astra成功了19次,成功率95%。同样的测试里,Fable 5.1只成功了8次。

谁都没想到,一个并没有专门为机器人训练的通用模型,竟然能做到这种程度。
而这个问题,恰好撞上了过去几年机器人行业最热的一条路线——专门给机器人训练一颗自己的「基础模型大脑」。
「机器人大脑」不必从头训练
过去几年,随着大模型能力一路向视觉、语音和Agent扩展,机器人行业也在反复追问同一个问题:如果语言领域已经出现了GPT,机器人什么时候才能拥有自己的「GPT」?
Physical Intelligence和Skild,正是在这样的期待中迅速成为明星公司。
Physical Intelligence希望训练一个真正跨任务、跨场景、跨机器人本体的通用机器人基础模型。它的π系列模型把视觉、语言和动作放进同一套模型里,希望机器人能够像大模型理解文本一样,从大量具身经验中学会如何操作真实世界。
Skild的目标更直接——「Any task,any robot,one brain」。无论是四足机器人、人形机器人,还是桌面机械臂和移动操作平台,都由同一个通用「大脑」来理解任务、规划动作。
两家公司代表的其实是过去几年机器人基础模型最典型的一条思路:既然语言有自己的foundation model,那么机器人也需要在海量机器人数据上,训练出一套真正理解身体和动作的基础模型。
也因此,「谁会成为机器人领域的OpenAI?」一直是这条赛道绕不开的问题。
但Astra出现后,这个问题突然有了一个有点出人意料的答案。
Amazon Alexa Principal Scientist、Retrocausal联合创始人Zeeshan Zia有一个判断:「机器人领域的OpenAI,看来可能就是OpenAI,而不是Physical Intelligence或Skild。」
这句话听起来有些挑衅,因为Astra并没有沿着机器人公司的传统路线来。
它没有先收集大量机器人轨迹,再专门训练一套从视觉到动作的基础模型,Astra带来了另一种可能:如果通用AI本身已经足够强,还需不需要再从头造一颗机器人的大脑?
这个问题放在OpenAI身上尤其微妙,因为它其实很早就做过机器人。
2018年,OpenAI推出了Dactyl,让Shadow Dexterous Hand在真实世界里旋转物体;随后又进一步让灵巧手完成魔方操作。
那时OpenAI已经在研究今天机器人行业仍然绕不开的问题:如何在模拟中训练,再把能力迁移到真实世界,如何处理摩擦、遮挡、传感器噪声,以及复杂的多自由度控制。
但几年后,OpenAI关闭了机器人团队。Wojciech Zaremba当时谈到过一个很现实的限制:机器人缺少像互联网文本那样可以大规模获取的数据。相比可以直接从互联网获得海量文本和图像,机器人数据昂贵、缓慢,也很难覆盖足够丰富的真实世界。
有意思的是,OpenAI当年因为数据问题暂时离开机器人,如今却可能从另一条路绕了回来。
过去几年,OpenAI先把模型在语言、代码、视觉和Agent上一路做大,让模型积累了关于物体、空间、因果关系和人类行为的大量知识。接下来,机器人需要的是把这些已有的知识,稳定地变成身体动作。
OpenAI自己显然也重新盯上了这个方向。Sam Altman最近已经明确表示,OpenAI会做人形机器人,也会探索其他机器人形态。在他的表述里,真正关键的部分仍然是让机器人工作的「大脑」。
Astra怎么控制机器人的「身体」?
目前的答案不是让Astra直接控制每一台电机。
以RoboCurve的实机测试为例,Astra每一步会看到三个相机视角和机械臂自身的状态,然后直接给出末端执行器应该到达的位置和姿态,包括x、y、z、yaw、pitch、roll以及夹爪状态;再由底层的逆运动学系统,把这些目标转换成各个关节的具体动作。
这其实是一种很典型的分工:Astra负责判断「手应该去哪里」,传统机器人控制栈负责解决「每个关节具体怎么动」。
英伟达前研究科学家Yu Xiang也提出,机器人学接下来一个值得关注的方向,可能就是如何把最先进的AI模型真正接进manipulation。相比只让大模型停留在最上层,负责拆解任务、调用工具,Astra已经开始更直接地介入机器人的动作决策。

链接:https://x.com/YuXiang_IRVL/status/2096074174091362388
但接着往下走,问题也逐渐显现。
有人甚至让Astra直接输出Unitree Go1的joint targets,尝试像强化学习policy一样,以50Hz控制四足机器人行走。实验确实跑了起来,但因为Astra的推理速度跟不上实时控制,物理模拟必须在每次模型调用之间暂停。最终,250次推理只换来了约5秒钟的行走。

链接:https://x.com/sri299792458/status/2097349207795335424
显然,Astra已经能够决定机器人「下一步该怎么动」,但要让它直接接管毫秒级的底层控制,还不太现实。
所以,未来更现实的形态可能不是让一个大模型从头管到脚,而是让不同层级继续分工:Astra负责理解环境、推理和规划,低层policy与控制器负责把这些意图快速、稳定地变成动作。
最后一毫米
会规划动作,距离真正把动作做好,其实还有不小的距离。
还是RoboCurve的那组测试。
在「把红色积木放进碗里」的任务中,Astra 20次成功19次,成功率达到95%;可当任务换成把一块圆形拼图准确嵌进对应凹槽时,成功率立刻跌到了10%,20次只完成了2次。

同一套实机测试中,Astra在积木入碗任务上的成功率达到95%,但面对需要精确嵌入的拼图任务,成功率降至10%。图源:RoboCurve
很多距离成功仅一步之遥。Astra已经找到拼图、抓住旋钮,并且能把它移动到目标凹槽附近,却很难完成最后的精确插入。
这最后几毫米的距离,展现了机器人最棘手的一些问题:位置和角度稍有偏差,零件就无法对准;真正接触受硬件误差干扰,下一步动作也因此无法完成。
这也是为什么Physical Intelligence最近会专门研究「最后一毫米」。
在他们的实验中,让一个通用机器人模型拿起螺丝刀很简单,但想要快速、准确地对准一颗很小的M3螺丝,仍然需要通过在线强化学习继续优化;网线插入、电源线插入、扎带固定等任务,也都卡在类似的精细接触阶段。
Astra目前最明显的优势集中在理解环境、判断目标和规划动作这些「头脑」擅长的部分,而一旦进入高频反馈、精细接触和力控制,机器人自己的身体经验仍然很重要。
这也给前面的「机器人领域的OpenAI」之争留下了一个很关键的悬念。
机器人当然可以用最强模型当「大脑」,但能与之匹配的物理身体,还没有出现。
