**智能体AI系统大量调用CPU处理工具调用、安全护栏和分词等任务,导致CPU需求激增,英特尔服务器CPU已无余量,AMD上调出货量预测,CPU市场可能面临缺货涨价。** **要点** **1. 智能体AI推动CPU需求激增** 智能体AI系统允许模型自主生成子智能体并调用API,这些操作大量依赖CPU而非GPU。分析师预测2026年CPU需求将急剧攀升,主要增量来自智能体AI。 **2. CPU承担工具调用、安全护栏和分词等非GPU任务** 大模型推理在GPU上执行,但工具调用、结果解析、安全策略校验以及分词等串行操作都交由CPU处理。智能体每次工具调用都需要重新分词,显著增加CPU负载。 **3. 增加CPU核心可显著降低大模型响应延迟** 研究发现,在长序列测试场景下,增加CPU核心数量可将首词元时延降低至原来的1/7。随着智能体AI推动上下文序列长度增长至50万甚至100万词元,CPU瓶颈将愈发严重。 **4. CPU市场库存告急,厂商调整策略** 英特尔服务器CPU已无对外可售余量,至少到2026年底不再向新客户供货;AMD将服务器CPU预测出货量翻倍;ARM、高通及英伟达均针对智能体AI推出或规划新型CPU,市场可能面临缺货与价格上涨。
CPU在智能体AI时代迎来复兴?
2026-09-01 21:09

CPU在智能体AI时代迎来复兴?

本文来自微信公众号: 世界科学 ,作者:编译 莫庄非


今年5月,亚马逊旗下子公司,亚马逊网络服务公司(AWS)的管理层向工程师下达一项新指令:不惜一切代价节省中央处理器(CPU)周期。


据报道,由于AI工作负载给公司的云基础设施带来巨大压力,AWS的CPU服务器资源排队等待时间激增。此问题似乎令AWS措手不及,而这不无原因。


要知道,AI热潮带动图形处理器(GPU)需求暴涨,随后内存需求也水涨船高,但CPU却几乎身处局外,因为它们的并行化程度相对不足,不适用于推理,即AI模型收到提问后生成答案的过程。


但智能体AI(agentic AI)系统的崛起正改变局面。这类系统允许AI模型自主运行,并调用子智能体。


马特·金博尔(Matt Kimball)现为美国摩尔洞察与战略咨询公司(Moor Insights&Strategy)的副总裁兼首席数据中心分析师。金博尔表示,2026年CPU需求急剧攀升,其中很大一部分增量来自智能体AI。AI智能体(AI agent)要调用计算机,计算机则离不开CPU。


“设想有一个智能体工作负载,能生成一百个智能体。如果企业大规模部署该系统,一百个智能体就能变出数万、数十万乃至上百万个智能体。智能体会不断生成子智能体,调用应用程序编程接口(API),并通过Anthropic公司的模型上下文协议与更多智能体进行交互。”


——马特·金博尔


那么,AI是如何调用计算机的?这就涉及一系列“工具调用”操作了……


AI智能体要用计算机,而计算机要用CPU


所谓工具调用,是指大语言模型(LLM)访问互联网、打开桌面本地文件以及使用各类软件完成任务的能力。


大语言模型经过工具调用专项训练,能学会调用其他软件。而它们发起的工具调用任务通常交由CPU处理——尽管其推理过程主要在GPU或类似AI加速器上完成。


英特尔高级首席研究科学家苏维克·昆杜(Souvik Kundu)解释道:“智能体AI任务的诸多组成部分,本质上就是基于CPU的任务。CPU负责解析输出、判断调用哪项工具、发起API调用或运行代码、收集结果,再把结果反馈给大模型。”


举例来说,一个被指派了软件编写任务的LLM,可能发起工具调用——把代码写入文件、移动或替换文件、下载所需软件包,以及在LLM认定前置准备工作已完成后构建该软件。


昆杜曾与佐治亚理工学院的研究人员合著了一篇关于智能体AI优化的论文。团队发现,当大语言模型的推理在GPU上执行时,CPU常处于空闲状态;反过来,当CPU处理工具调用任务时,GPU又往往无事可做。


针对该问题,昆杜等人提出调度优化方案。该方案可在持续负载下,将端到端延迟,即智能体任务从开始到结束的时间,最多降低到原来的5/9。


上述成果只是行业在新方向上发力的初始尝试,但我们也要知道,性能提升的进度落后于日新月异的现实。智能体系统以机器的速度生成任务,任务量持续倍增。OpenAI曾经历失控调用Hugging Face的事故:模型每小时发起多达300次操作,单个智能体还会衍生子智能体,子智能体再发起自己的工具调用……


随着模型变得越发复杂,另一项关键因素可能增加CPU的工作负载,那就是安全护栏(safety guardrails)。


昆杜介绍,针对智能体行为的安全与策略校验,大多是用于检查语法、日志文件的特定规则。安全护栏也会使用参数量小于10亿的小型模型来分析任务复杂度或模型意图。这些检查任务理论上可由GPU处理,但通常都留在CPU上执行,一方面是因为模型规模小,另一方面原因则是需求尽可能降低延迟。


“分词”任务将CPU推向性能瓶颈


佐治亚理工学院博士生郑义俊(音译,Euijun Chung)近期参与撰写了另一篇论文,其结论和昆杜的成果互为补充。


郑义俊等人发现:当服务器的CPU核心数量过少时,它会来不及向GPU派发任务,这导致GPU因等待指令而陷入空闲停滞。


除此之外,论文还探讨了大语言模型工作负载的另一核心环节,即分词(tokenization)。


分词是大语言模型推理的首个关键步骤。它把文本转换成可供模型运算的整数型词元ID(token ID)。不同于大语言模型推理中所需的大部分矩阵运算,分词是分支繁多、依赖数据的串行字符串操作。虽然可通过文本分块(chunking)实现一定程度的并行化,但它不像LLM推理的主体部分那样具备大规模并行性。


针对简短提示词的分词任务相对简单,即便是入门级CPU也能轻松应对。但一个会发起工具调用的智能体模型,必须对调用返回的结果进行解析和分词,如此工作量对CPU而言可谓繁重。


“智能体的每一次工具调用,都要求执行一次分词。举例来说,假设有个已增长到10万词元长度的上下文序列,而某次工具调用的返回结果新增了1000个词元,由此,分词器必须再对全部序列重新分词。”


——郑义俊


显然,这既提高了分词操作的执行频次,也增加了所涉及词元的数量。未来分词技术或可寻得解题之法,但当前这道难题确实阻碍着LLM推理的发展。


郑义俊团队在论文中指出:首词元时延(TTFT),即从用户提出问题到模型回复第一个词的时间,会随着序列长度增加而大大延长;针对该问题的解决方案之一,就是提高CPU芯片的核心数量。在长序列测试场景下,通过增加CPU核心,可将TTFT降低至原来的大约2/3到1/7。


如图所示,增加可用CPU核心的数量可显著降低大模型Llama-8B在较长序列长度下的响应延迟


受硬件条件限制,团队仅测试了规模较小的模型,例如阿里通义千问系列的Qwen3‑30B和Meta公司的Llama 3.1‑70B。他们推测:更大规模模型的GPU需求更高,CPU瓶颈带来的影响反倒会减弱;不过与此同时,智能体AI会把上下文序列长度(总词元数)推升至远超他们此前测试达到的长度上限。


“以Anthropic公司的Claude模型为例,序列长度轻松达到50万乃至100万个词元。在智能体AI时代,平均序列长度只会不断增长。因此我预计,面对未来的工作负载,CPU瓶颈问题将愈发严重。”


——郑义俊


CPU市场库存告急


亚马逊严控CPU资源使用,只是现实世界里CPU资源紧张的信号之一,昆杜与郑义俊的工作也表明,该问题极具现实意义。


英特尔方面,其服务器CPU目前已无对外可售余量,至少到2026年底前,都不再向新客户供货。


美国超威半导体公司则上调业绩预期,将服务器CPU的预测出货量翻倍。


两家芯片设计巨头,ARM与高通均发布了专为加速智能体AI而设计的新型CPU。


值得一提的是,连英伟达也已将Vera列为重点发展项目;Vera是一款基于ARM架构(由ARM公司开发)、面向智能体AI的CPU,隶属于英伟达Vera Rubin平台。


金博尔表示,各种动向都表明AI行业越发重视CPU性能,相关需求激增可视作某种“绝对信号”,CPU已成为智能体AI系统的核心组成部分。


另一方面,正如此前GPU和内存所遭遇的,CPU市场也很可能出现大范围缺货与价格上涨。


“从某种意义上说,现在的CPU资源已经告急了。看看市场上的各种供给限制吧!库存紧缺甚至已蔓延至消费级市场。英特尔全新的18A制程工艺带动了客户端产品线的业务营收增长,但该企业仍在削减客户端CPU产能,以优先保障服务器CPU生产。我们知道,CPU厂商的投入重心,即是大需求与大利润所在。”


——马特·金博尔


资料来源:


The CPU Comeback Is Upon Us

AI行业信号频道: 前沿科技
本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
正在改变与想要改变世界的人,都在 虎嗅APP