本文来自微信公众号: 快刀青衣 ,作者:快刀青衣
一场关于AI下一站的下注。
这两天AI圈最大的一条新闻,莫过于一场收购。
著名芯片巨头AMD宣布签署协议,拟收购李飞飞创办的World Labs,全股票交易,交易金额约82亿美元。交割完成后,李飞飞将出任AMD执行副总裁兼首席科学家,直接向CEO苏姿丰汇报。
对于李飞飞教授和她的世界模型,不少朋友都不陌生了。但咱们今天这篇重点不是收购新闻。
82亿美元虽然非常多,但毕竟和咱们没什么关系。剩下的,例如全股票、尚待监管批准,这些信息随便搜一下就有了。
我想聊的,是李飞飞在同一天发出的那封公开信里,藏着的一个判断。
这个判断的核心,就是最近一年很火的一个方向——「世界模型」。我觉得世界模型就跟自迭代模型一样,是现在全球AI圈关注的焦点。
李飞飞在公开信里写了一句话:
❝
创办这家公司时,我们有一个最基本的信念:仅靠语言,并不足以支撑模型的发展。宇宙并不是由文字组成的,而是由真实存在的事物组成的。
啥叫世界模型?我尽量用大白话跟你说一下。你站在自己家客厅里,面前是沙发和茶几。你闭上眼睛,能不能想象出客厅后面是什么?
大概率是厨房或者餐厅。往左走可能是卧室,往右走可能是卫生间。你甚至能想象出,如果你现在把茶几上那个杯子推到边缘,它会掉下去,砸到地上,碎了。
你从来没有专门学过这些。没有人给你上过一门课,教你杯子从桌子边缘掉下去会碎。你也没有读过一段文字,才理解客厅后面大概率是厨房。
你是从小到大,用眼睛看、用手摸、用身体在空间里走来走去,慢慢建立起了对物理世界的理解。
这种理解,就是世界模型要做的事。
我们过去熟悉的大语言模型,核心能力主要是在海量语言和数字内容上训练出来的。即便现在很多模型已经能看图、听声音,它们依然缺少三维世界里的空间经验。
你问它杯子从桌上掉下来会怎样,它能答得很好,但这主要来自它训练时接触过的大量材料,而不是像人一样,靠在真实世界里反复观察和行动建立起来的。
世界模型要做的,是让AI不仅「读到」这个世界,更是真正理解这个世界,理解三维空间里的结构,理解物理世界的因果关系:
一个球被踢了之后会往哪个方向滚,一栋建筑从哪个角度看结构不稳定,一个机器人进入一个从没去过的房间该怎么走。
这些能力,光靠读文字是学不全的,你还得让模型大量去看、去体验三维世界。
在这个场景下,我觉得「见见世面」这个词一下子具象化了,就连AI都需要见见世面。
World Labs最近发布了一个叫Atlas的模型,李飞飞在公开信里专门提到了它。这个模型做的事情很有意思:你给它几张2D照片,它能预测出你从另一个角度看过去会看到什么。
李飞飞用了一个类比,我觉得这是她整封信里最精准的一句。她说,就像大语言模型能从一段文字预测下一个词一样,Atlas能从一组图像预测下一个视角。
你看,一个活在文字里,一个活在空间里。
这听起来有点儿抽象,可能有些同学无法理解它能干嘛用。我再和你分享一下我做测试时用的案例,我一共做了两个。
第一个案例,是给了这个模型一段咱们非常熟悉的文言文,也就是《桃花源记》里的「林尽水源,便得一山,山有小口,仿佛若有光。便舍船,从口入。初极狭,才通人。复行数十步,豁然开朗。」
世界模型给我生成了一个交互式页面,我可以用键盘控制视角,从山洞里进去,直到看到刺眼的阳光,看到一片桃源。这就是模型理解了文字里面表达的意象,然后呈现出一个想象中的世界。
我做的第二个案例,是拿一张我当年上大学时最熟悉的游戏《反恐精英》的「沙漠2」地图截图扔进去,然后它直接给我生成了一个可以互动的游戏世界。
从这两个场景就可以看出来,世界模型不管是在教育还是娱乐上,其实都有非常多的使用场景。
而且Atlas不只是能生成好看的3D画面。在公开信里,李飞飞提到,它实际上解决了计算机视觉里一个长期存在的难题,叫稀疏重建。
啥意思呢?就是能从很少的几张照片里,还原出完整的三维结构。这件事在工程设计、建筑施工、科学研究、机器人导航里都有直接用途。
值得注意的是,World Labs自己虽然是家创业公司,但还收购了一家叫SceniX的公司,他们是做机器人仿真的,也就是让AI在虚拟的三维环境里学习怎么在真实世界里行动。
说到这个,我就忍不住想再聊几句李飞飞这个人。
我之前在我的快刀广播站里推荐过她的自传《我看见的世界》。当时读完,我甚至拿出书里的一些片段念给我女儿听。
因为李飞飞写到自己在美国,15岁刚接触物理时的手足无措,而我女儿当时也正处在为物理发愁的阶段,所以我拿李飞飞的故事激励我女儿。
如果你把李飞飞的经历拉成一条线,你会发现,她做的事情始终围绕一个方向:教机器看见世界,然后理解世界。
她的成名之举,就是2009年正式发表的ImageNet。
这个项目前后花了约两年半时间,动用了来自167个国家的近5万人参与标注,从近10亿张候选图片里筛选整理出1500万张图片,建成了ImageNet数据集。
这相当于给AI出了一套超大题库,让算法来看看能不能认出图里面什么是猫、什么是狗。
后来我们熟悉的AI教父辛顿,他的团队就是在ImageNet挑战赛里脱颖而出,成为现在这波AI爆发的重要推动力之一。
李飞飞当年搞ImageNet,是让机器学会看一张图里有什么。现在做World Labs,是往前走了一步,让机器从一张图里走进去,理解图里面的三维空间结构。
而选择现在加入AMD,按她公开信里的说法,是因为World Labs下一步要扩大投入、拓展影响,而且必须更靠近硬件。说白了,就是要在更大规模的计算基础设施上推动空间智能。
好,现在回到标题的问题:AMD花82亿美元买的,到底是什么?
先看一个背景。World Labs上一轮融资的估值约54亿美元,AMD出价82亿,溢价非常多。而且说实话,李飞飞这家公司就成立两年多,模型产品也只出了第一版,不少效果能跑,但还很粗糙。
那为什么值这么多钱?
你要先理解AMD现在的处境。AMD做芯片,在AI芯片市场上跟英伟达追了好几年,MI系列一代一代在进步,但在软件生态上一直差一口气。
英伟达的CUDA生态已经是行业默认标准,开发者习惯了,要迁移过来成本很高。光靠硬件参数往上堆,很难真正改变格局。
所以我的判断是,苏姿丰想要的,不是在英伟达的赛道上继续追,而是找到一条新赛道,让AMD的芯片变得不可替代。
其实苏姿丰和李飞飞的合作不是突然发生的。李飞飞在公开信里说,苏姿丰是World Labs的早期投资人,从一开始就相信她们的方向。
2025年两个团队就开始了深度的技术合作,在AMD的GPU上做模型训练和推理优化。合作到后来,双方都觉得把AI的软件生态和硬件生态合在一起,是一件顺理成章的事。
这就要回到世界模型和大语言模型的区别了。大语言模型处理的是文字序列,一个词接一个词,本质上是一维的。
这类任务,英伟达的GPU已经优化得非常成熟了。但世界模型要处理的是三维空间和物理模拟。
你要让AI理解一个房间的空间结构、预测一个物体运动的轨迹、实时生成可以走进去的3D场景,这对芯片提出的要求跟处理文字工作显然不一样。
李飞飞在公开信里有一句话说得特别直接,她说,没有专注的硬件支持,AI在效率和规模上都是受限的,而且,会被困在数字世界里。
「被困在数字世界里」,这句话敲一下黑板。
现在的AI能写文章、能画图、能写代码,但它的输出基本全停留在屏幕上。世界模型的目标,是让AI走出屏幕,真正进入物理世界,去驱动机器人、去辅助工程设计、去做科学实验。
要实现这个,模型和硬件必须深度绑定,这不是买几块GPU显卡就能解决的。三维空间的计算涉及大量几何运算、物理仿真、实时渲染。这些任务对内存带宽、并行计算架构,以及芯片和软件栈的协同优化,都有不同的要求。
如果AMD能围绕世界模型去定义它的芯片架构和软件生态,这就不是在英伟达已经统治的赛道上追赶,而是在一个新的赛道上率先建立标准。
李飞飞在宣布收购时也提到了这一点。她说,推进下一代人工智能技术,需要模型研究、系统架构与计算基础设施之间的紧密协同。加入AMD,将为团队提供更强大的资源支持和工程化能力。
简单粗暴点儿说,就是世界模型做到这个阶段,需要的已经不只是几个聪明的科学家,而是巨大的算力、硬件和工程资源。创业公司自己要不断去找算力、找硬件资源,倒不如直接被芯片公司收购了,那资源肯定管够。
所以,在我看来,AMD花82亿美元买的,也不是一家公司的营收或者用户数。它买的是世界模型这条路线上的先发位置,以及李飞飞和她的顶级创业团队。
1.李飞飞《To Seek a Newer World》
https://drfeifei.substack.com/p/worldlabs-joining-amd
2.AMD官网公告
https://newsroom.amd.com/news/amd-acquire-world-labs/
