**云端Agent的爆发正在重塑算力需求结构,CPU取代GPU成为新的增长瓶颈。AMD已将2030年服务器CPU市场预测上调至2200亿美元,Intel则表示CPU需求过高只能向半数客户供货,Agentic CPU正成为独立的算力品类。** **要点** **1. 云端Agent成为主流形态** 以Claude Tag、Grok Bot、Muse为代表的云端Agent兴起,优势在于不受本地设备开关机限制、可持续后台工作、支持跨设备协作。持久云电脑模式正取代临时沙箱,Agent能在固定环境中连续执行长程任务。 **2. Agent工作流大幅推高CPU需求** Chatbot时代是“提问→GPU推理→返回”的单次往返,而Agent时代是“思考→调工具→执行→更新状态”的循环,可能重复几十上百次。模型推理靠GPU,但调用工具、操作文件、执行代码、访问网络都依赖CPU,算力瓶颈从GPU外溢。 **3. AMD大幅上调CPU市场预测** AMD今年5月预测2030年服务器CPU市场超1200亿美元,7月23日上调至2200亿美元,仅隔两个半月。9月14日Intel CEO表示“CPU需求太高,只能向一半客户供货”,9月21日AMD股价上涨约10%、迈入万亿市值俱乐部。 **4. CPU承担两类分化角色** Host CPU是GPU的“贴身助理”,负责喂数据、协调传输,看重单核性能和高速互连;Agentic CPU是“执行团队”,负责跑代码、操作浏览器等落地任务,可独立集群部署,是未来CPU增长最主要的类别。 **5. 硬件多样化催生软件调度层机会** 数据中心配置将按工作负载定制,Intel已推出P-rack(重单核性能)和E-rack(重并发规模)两类机架方案。Gimlet Labs正构建异构推理云,在GPU和CPU之间做任务调度,9月获a16z领投3亿美元B轮融资。
为什么CPU 重新变得重要?
2026-09-23 18:11

为什么CPU 重新变得重要?

本文来自微信公众号: 海外独角兽 ,编译:Celia,编辑:Siqi,作者:Celia、Siqi,原文标题:《为什么 CPU 重新变得重要?》


过去三个月,以Claude Tag、Grok Bot、Muse、Instinct为代表的各种云端agent开始起来。


我们相信,未来会有数十亿agent在云端持续工作,这会让算力瓶颈不仅仅局限于GPU,而会同时带动CPU的爆发,甚至催生出一层独立的算力品类:Agentic CPU。


我们最近发现一期播客Grok Bots and How CPUs are used in Agentic AI,对这个趋势拆解得非常清楚,两位主播都是资深半导体从业者。


以下结合我们自己的理解,做了一期编译。希望能粗略梳理一下这个问题:Agent的爆发,到底会怎样改变CPU的需求?


/


01.


云端Background Agent成为一个大趋势


过去一年,Agent的主流形态还是Claude Code、Codex这种本地agent,但现在,以Claude Tag、Grok Bot、Muse为代表的各种云端agent开始起来,并且这一定会在未来成为更主流的趋势。


云端的优势很直接,比如:


•云端任务可以不受个人电脑开关机的影响;


•Agent可以在独立环境里操作浏览器、运行软件,不需要和用户抢资源;


•天然支持跨设备使用、团队协作和更好的安全隔离。


未来,一个人一定需要很多agent在后台7×24h持续工作,所以上云会是一个必然的趋势。


OpenAI和Anthropic从6月开始发布的每一个新产品/功能,也都是默认在云端完成。


Anthropic这边是Claude Tag、Cowork(7月起改成云端默认)、还有9月重做的Claude Code Projects,它会为每个子任务单独开一台云端虚拟机。OpenAI则在7月推出ChatGPT Work,为每个用户提供云端工作区,9月10日发布Agents API,直接提供托管沙箱。


不过,上云也分两种模式:


第一种是临时起沙箱。每来一个任务,就临时拉起一个沙箱,让Agent在里面运行代码、使用工具,任务做完就将环境收回。Claude Tag就采用了这种方式。


第二种是给用户一台持久的云电脑。可以把它理解成一台放在数据中心的虚拟电脑,有操作系统、有浏览器、有文件夹,Agent会长久住在里面。


以Grok Bot为例,本地客户端只是一个交互外壳,真正执行工作的是云端虚拟机。所有工具、所有登录态都装在云端虚拟机里,当你跟Agent说"帮我订下周去日本的酒店",agent会在那台机器上打开浏览器、比价、填表。当你关上笔记本,它也可以在后台持续工作。



对Personal Agent来说,持久环境的价值尤其明显,因为它的工作天然是连续的。


拿旅行规划来说,今天要研究目的地,明天可能要等酒店回复,后天又要根据新的航班调整行程。Agent每次回来,都需要接上之前的工作。


如果账号还保持登录,之前比较过的酒店资料还在,行程表也保留着,它就能直接往下做。


如果说临时沙箱是个一次性的共享工位,自己的云电脑则相当于让它有了一个固定的办公室,不必每次任务完成都重新收拾书桌,省去下次登录账号、搬运资料等等的麻烦。一个用户同时用几个Agent,它们也能在这里很方便地交换资料、接手彼此的工作。同时与其他用户保持隔离,保障隐私和安全。


随着工作跨越更多应用、持续更长时间,这种环境的连续性会越来越重要。


对Personal Agent来说,产品形态已经在向这一派收敛,Grok Bot、Muse、Instinct就都不约而同地采用了这种架构。


02.


算力瓶颈从GPU外溢到CPU


云端Agent的爆发也会让算力需求发生一些变化。


过去的AI Infra,核心矛盾一直是GPU,但未来,CPU的需求也会显著增大。


•Chatbot时代,典型的工作流程是:


用户提问→GPU推理→返回答案。


基本是一次往返,主要依靠GPU。


•Agent时代,流程变成了:


思考→调工具→读取结果→更新状态→再思考,循环几十甚至上百次。


这其中,模型推理主要依赖GPU,而其它的调用工具、操作文件、执行代码、访问网络、管理状态等等,都依赖CPU。因此,Agent不仅会拉动GPU,也会极大带动对CPU的需求。


Source:Agents Are the New Users of CPUs|Coatue


今年上半年,Agent的增长还主要集中在Claude Code、Codex这类本地Agent上,所需的CPU资源可以由用户已有的笔记本提供。


而随着云端Agent起来,CPU的需求会被真正带动起来。


这个需求逻辑包含两部分。


一部分是迁移:原本在用户笔记本上运行的程序,会转移到云端的数据中心。


另一部分是扩张:部署变简单,更多人可以使用Agent;用户离线,Agent会在后台持续工作;一个人,也会同时调动越来越多Agent。使用人数、执行时长和任务并发,会一起推高云端的CPU负载。


这个需求的爆发性有多强呢?


AMD本来在今年5月的Q1财报会上预测,到2030年,整个服务器CPU市场会超过1200亿美元。


紧接着,在7月23日的年度大会上,苏姿丰将预测上调到2200亿美元。她表示,过去六到八个月,AMD已经反复修改这个数字,但仍然大大低估了需求的增长速度。


从1200亿又上调到2200亿,中间只间隔了两个半月。


Source:Advancing AI 2026 Keynote|AMD


供给端,CPU已经开始供不应求。9月14日,Intel CEO陈立武在一场活动上表示:“CPU需求太高,我们只能向一半的客户供货。”


最近,Muse登上App Store免费榜首,又让市场对消费级Agent的普及多了几分信心,也抬高了对CPU需求的预期。9月21日,AMD股价上涨约10%,正式迈入万亿市值俱乐部。


03.


Agent时代,CPU的两种角色


接下来更值得关注的是:增长的CPU,究竟在做什么?新时代需要什么类型的CPU?


如果把一套AI系统想成一家公司,运行大模型的GPU就像一个身价很高的天才,负责思考和判断。为了让这个天才高效工作,公司还需要两类人:贴身助理和执行团队,对应CPU的两种分工:


•Host CPU是天才的贴身助理,最重要的工作是不断给GPU喂活。


天才刚处理完手上的问题,下一份材料就应该递到面前。准备数据、安排计算、协调数据传输,都由这个助理负责。如果材料没有准备好,或者传递得太慢,昂贵的GPU就只能等待。


因此,这个岗位特别看重反应速度,以及与天才之间的沟通效率。这对应Host CPU的单核性能、CPU与GPU之间的高速互连,以及更紧密的内存协作。


•Agentic CPU是负责把事情做完的执行团队。


比如天才提出“去找这些公司的财报”,“把这段代码跑一下”,接下来就需要有人打开浏览器、下载文件、运行程序、整理结果。


这些工作贴身助理也能做,但会占用他们大量的时间,影响它继续为GPU服务。所以,当执行量上来,就更适合单独配置一批CPU,成集群、成机架地部署。GPU提出任务,这支团队负责执行,再把结果交回来。


这就多出了一层可以独立扩容的CPU需求。随着Agent未来完成的工作越来越长程,这会是未来CPU增长最主要的类别。



接下来的问题是,这支团队应该怎么配。


一颗CPU有很多Core,我们可以把它想成一间有很多工位的办公室。核心的数量对应工位数量,单核性能对应每个员工的干活速度。对于一个任务,可能要给资料检索分4个工位,给数据处理再分4个工位。


但具体一个公司要招多少人、每个人能力需要多强,要看具体任务。


•如果大量独立任务可以同时推进,更需要并行算力,也就是扩大核数;


•如果某一步计算容易拖慢整个流程,需要更强的单核性能;


•如果主要在等网络、读文件,就要先看网络、存储和内存,换更快的CPU未必有明显帮助。


所以,Agentic CPU其实没有唯一的正确答案,需要按具体的workload定制。


未来,数据中心的配置会越来越像组织设计:工作不同,人员配置就不同。


今年夏天,Intel就面向Agentic AI推出了两类CPU机架方案:P-rack和E-rack。前者更看重performance,强调单核性能,后者更看重efficiency,强调并发规模和成本。不同机架可以放不同配置的CPU,再把合适的任务分过去。



不过,未来硬件越来越多样之后,怎样把它们用好,也会成为一个瓶颈。


这会给软件调度层带来一些机会,比如Gimlet Labs就在探索类似的方向。它搭建的是一种异构推理云,让不同类型的芯片分工完成AI工作。


Agent工作时,会不断在GPU推理、CPU执行之间往返。有的环节对速度敏感,有的更需要控制成本。Gimlet目前更多是在GPU和其他加速器之间做推理调度;随着Agent执行的任务越来越多,CPU这一侧的调度也会变得更重要。系统需要按任务需求分配硬件资源,再协调各环节之间的数据传递,减少彼此等待。


今年9月,a16z领投了Gimlet的3亿美元B轮融资。它看中的也是异构推理的效率提升:电力有限,但如果任务分配得更合理、硬件配合得更好,同样的电就能支撑更快的推理和更大的处理量。


和一线研究员的闭门讨论:蒸馏变难后,下一步的重点是什么?


Latent Labs:Alphafold 3发布两年,AI药物设计进展到了哪一步?


Astra的Computer Use能力是如何实现的?


2万亿美元的Anthropic值不值得买?


DeepSeek Harness是自进化Agent的基石


AI创投日报频道: 前沿科技
本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
正在改变与想要改变世界的人,都在 虎嗅APP