2026年AI Agent时代来临,云产业迎来架构升级,云厂商向支撑Agent规模化落地的Agent云进化,衡量标准也发生变革。 ## 1. 云计算的三代演进:从互联网云到GPU云再到Agent云 互联网云诞生于2006年亚马逊推出EC2,形成IaaS、PaaS、SaaS三层能力栈,核心是降低应用开发部署成本,服务对象是各类应用,由人使用应用消耗算力。 2022年底ChatGPT上线后云产业进入GPU云时代,服务对象转向大模型,核心满足模型训练推理需求:GPU成为核心生产资料,科技巨头开启史无前例的资本开支扩张,各大云厂商先后推出AI平台封装AI能力,方便企业使用。 2025年下半年后,随着Agent产品落地需求激增,云产业进入全新的Agent云阶段,核心要解决成千上万个Agent稳定运行、协同部署、安全接入企业系统的问题。 ## 2. Agent云的底层架构升级:新三层架构重构能力栈 Agent的核心目标从Chatbot的“快速给答案”变为“高质量完成任务”,需要多轮推理、更长上下文,要求云提供包含推理、存储、工具、记忆、沙箱、安全的完整运行环境。 Agent云形成**AI Infra+Agent Infra+智能体应用**的新三层架构,核心是位于模型和应用之间的Agent Harness(运行底座),负责组织模型、支持工具调用、记忆管理、工作流运行和安全隔离,存在明显木桶效应,任一环节短板都会降低Agent执行效果。 底层算力体系也随之升级:从大模型时代单一GPU核心,扩展为“GPU+CPU+HBM+光互联”协同体系,CPU因任务调度、工具调用等需求重新成为市场焦点,HBM、光通信模块等环节成为新稀缺品。 ## 3. Agent云时代的产业格局变化 全球市场中,CoreWeave、Nebius等NeoCloud(新云)快速崛起,Nebius2024年10月复牌后股价涨幅超10倍,2026年6月被纳入纳斯达克100,获得资本市场和产业需求的双重认可。 中国市场和美国不同,并未催生独立NeoCloud赛道,百度智能云、阿里云等头部云厂商直接在现有平台基础上完成AI原生升级,产业依托现有玩家完成升级。 全球头部云厂商2026年集体发力Agent云:微软提出Agent将取代“App+操作系统”旧范式,推出全栈标准化Agent云服务;谷歌停用Vertex AI,推出全新Gemini Enterprise Agent Platform,AI云竞争转向“支撑Agent稳定运行和规模化交付”能力的竞争。 ## 4. Agent云的“度量衡革命”:价值衡量从投入转向产出 大模型阶段云的核心衡量指标是Token/$、Token/Watt、Token/Second,关注生成Token的成本、能耗和速度,核心优化目标是让模型跑得更快、更便宜、更稳定。 Agent时代原有指标已无法满足需求,**单位Token的智能水平成为更核心的衡量标准**,即相同资源消耗下,让每个Token承载更高智能、完成更高效任务。 Agent云要求云厂商具备从底层算力到Agent运行再到企业业务的全链路打通能力,企业可在同一云体系中,根据自身发展阶段灵活选择GPU算力、Agent平台能力或成品Agent应用,逐步升级。
算力革命与云厂商三重进化:Agent云的架构升级与“度量衡革命”
2026-07-22 16:14

算力革命与云厂商三重进化:Agent云的架构升级与“度量衡革命”

本文来自微信公众号: 硅谷101 ,作者:硅谷101


2026年过了一半,云,成为了AI产业里最确定的机会。


随着Agent开始走进各大企业“干活”,AI时代的算力服务,正在变成竞争最激烈的领域。存储、光模块、高速互联等AI基础设施板块持续走强。前几年一度被边缘化的CPU,又重新成为了市场关注的焦点。CoreWeave、Nebius等一批NeoCloud公司快速崛起。微软、谷歌、亚马逊等云巨头都在疯狂加码AI投资。



2026年上半年,前沿大模型竞赛还在持续。Agent时代来临之后,各大企业对于Agent进入真实业务,并能够稳定运行和规模部署的需求激增,token经费也在燃烧。


因此,对于提供算力服务的云厂商们来说,这是绝佳的机遇。但基础设施上,无论是AI Infra还是Agent Infra都需要技术快速跟上。可以说,整个云产业正在迎来过去二十年来最大的一次架构升级。


那么AI Agent时代的“云”,到底是朵什么样的云?当AI从“回答问题”走向“执行任务”,云的底层逻辑发生了什么改变?云厂商如何能真正打通最后一公里?这篇文章,我们就来看看,2026年上半年,AI时代的那朵“云”,正在发生着什么样的变革。

本文为视频改写,欢迎大家收看以下视频



▍互联网云:按需获取计算资源


要理解“云”变了什么,我们先看看以前的云是什么样的。


21世纪初,Google、Facebook、百度、淘宝等一大批互联网公司快速崛起,用户数量爆发式增长。当时,互联网企业的业务增长速度,远远超过了IT基础设施的建设速度。


企业想要支撑业务上线和增长,通常需要自己采购服务器、建设机房、组建运维团队。为了应对未来几年的业务增长,很多公司甚至需要一次性投入大量资金购买设备。


但问题在于,没有人能够准确预测未来会有多少用户。买少了,业务爆发时服务器可能瞬间瘫痪。买多了,又意味着大量设备长期闲置,造成巨大的资源浪费。



2006年,亚马逊推出EC2(Elastic Compute Cloud,弹性计算云),第一次将计算资源变成了一种可以像电力一样按需获取、按需付费的服务,拉开了云计算时代的大幕。


随后,微软、谷歌以及百度、腾讯、阿里等科技巨头纷纷入场,云产业逐渐形成了一套完整的能力栈:IaaS(基础设施即服务)、PaaS(平台即服务)和SaaS(软件即服务)。


其中,IaaS负责提供服务器、存储和网络等基础资源。PaaS提供数据库、中间件和开发平台等能力,让用户不用操心底层硬件,专注于业务逻辑的开发。SaaS则直接向用户交付软件服务,直接订阅使用。


这个阶段云解决的核心问题,是让软件能够更低成本、更高效率地开发、部署和运行。云的服务对象是网站、社交平台和企业软件。人使用应用,而应用去消耗计算资源。



2022年底,ChatGPT的上线改变了市场对算力的需求。AI时代来了,而云产业,也迎来了新的时代:GPU云。


▍GPU云:服务模型训练


在AI时代,云产业的服务对象开始从应用转向模型。云的能力,开始围绕着AI模型的训练需求而变化。


郑然

百度杰出架构师、百度智能云技术委员会联席主席


大模型时代最开始,云更多关注的是训练和推理的效率。尤其是在模型高速发展的阶段,更多客户的重点,聚焦在怎样实现更高效的大规模模型训练。在那个阶段,云所承载的,更多是帮助模型训练业务实现更复杂的异构计算能力。


首先,云运行的硬件基座变了。


互联网时代,云厂商建设数据中心时采购的核心设备是CPU服务器,因为网站、数据库、CRM等传统应用,本质上都是CPU密集型工作负载。但大模型的训练和推理依赖大规模并行计算,CPU所擅长的串行逻辑处理并不适用,这让GPU从过去数据中心里的“辅助角色”,一跃变成了最核心的生产资料。



而这种底层算力的变化,直接指数级推高了基础设施的建设成本。从2023年开始,科技巨头们开启了史无前例的资本开支扩张。模型规模每向前迈进一步,背后都意味着更多GPU、更大的数据中心以及更高的电力消耗。


其次,平台层的逻辑也随之发生了变化。


互联网云时代的云平台主要提供数据库、容器平台、中间件和开发工具,帮助开发者更高效地构建软件。但当服务对象从应用变成了模型之后,开发者面临的新问题变成了模型的训练、部署、推理加速、向量数据库、RAG以及模型管理平台等等。


于是我们看到,Google升级Vertex AI集成生成式AI能力、微软推出了Azure AI Foundry、AWS推出了Bedrock,国内的百度智能云推出了千帆平台、阿里云推出了百炼平台等等。


这些新的AI平台,其实都是在尝试把模型训练、推理、微调和应用开发过程封装起来,让企业能够像使用云服务一样使用AI能力。而软件层面,则涌现出类似于ChatGPT、Copilot等一系列AI原生应用。


但进入到2025年下半年之后,随着一系列Agent产品、底层协议的出现,以及OpenClaw等开源框架的爆红,企业开始尝试把强大的模型能力转变成生产力。云也由此进入了一个全新的阶段:“Agent云”。


比如在具身智能领域,Agent的核心不仅是把大模型接到机器人上,更是要让Agent具备可靠的长程规划、Skill调用和记忆能力,并在真实物理环境中尽可能提高一次性成功率。


我们在2024年底就已经立项去做“慧思开物”具身智能体。


在整个“大脑”层面,我们很强调Agent的能力,包括长程任务、记忆检索,以及工具调用的准确性,都有非常高的要求。同时,相比互联网的智能体,我们的要求还要更高一些。第一,我们是强物理交互的,所以不能有幻觉,包括不能幻觉出机器人完全不具备的技能,也不能幻觉出环境中并不存在的物体。另外,现在很多Agent可以做反思、做重新规划,但人类对机器人的要求特别高。如果用户发现机器人长时间地执行一个任务,大家会很不耐烦。所以在这个时候,我们追求的是Pass 1的成功率,就是一定要一次性尽量把任务完成。


所以卖算力、卖Token、卖模型调用,相对来说都只是基础能力。真正困难和具有挑战的地方,是如何让成千上万个Agent稳定运行、协同工作,安全地接入企业系统,并持续创造价值。


那么,云的能力需要怎么变化呢?



过去几年,大模型的能力实现了跨越式的进步。模型能写代码、分析数据、撰写报告,甚至在很多专业测试中都超过了人类水平。


但具体到应用落地环节,企业却发现,拥有一个聪明的问答模型,并不等于拥有能真正干活的员工。最新研究数据显示,有90%的企业都表示Agent在实际工作中会掉链子。



这背后的原因是:Chatbot和Agent看上去都是在对话,但“快速给出答案”和“高质量完成任务”却是完全不同的技术问题。所以,Agent Infra上怎么能把这个链子给缝起来呢?


郑然


百度杰出架构师、百度智能云技术委员会联席主席


原来的Chatbot,用户的诉求,或者说用户对它的预期,有点像搜索一样:你提交一个问题,它需要很快速地回应。


而在Agent时代,核心目标不是快速地完成任务,而是高质量地完成任务,这会是完全不一样的预期。对底层系统来说,模型需要有更多轮的推理过程,整个上下文的长度和Chatbot阶段也完全不在一个数量级的水平。这就要求整个大规模分布式推理,包括像KV Cache这样的存储基础设施,能够更好地支持大规模分布式推理的高效执行。


也就是说,大模型阶段,云的优化目标是速度优先,如果AI回应得慢,用户体验就崩了。因此AI建设的目的就是让模型跑得更快、更便宜、更稳定。


但随着模型的“智商”已经基本够用、Agent开始进入真实生产环境之后,云便不再只是“卖算力”,而是要同时提供包括推理、存储、工具、记忆、沙箱、安全在内的完整Agent运行环境,解决的是智能体如何能够稳定运行、如何大规模部署的问题。


而在这个过程中,Agent需要一套全新的“操作系统”:Agent Harness。关注AI进展的小伙伴们对“Harness”这个词肯定不陌生,我们之前的内容也提到过。


我们可以把Harness理解为Agent的“运行底座”,它位于模型之上、应用之下,负责把模型真正组织起来,让Agent能够调用MCP、使用各种工具、管理长期记忆、运行工作流,并在一个安全、隔离的环境中稳定执行任务。


也就是说,未来决定Agent是否能真正走向落地的,就是Harness这一整套工程能力。而在这个系统中,存在着显著的“木桶效应”,每一个环节都不能有短板,木桶最短的那块板,决定了整个系统的能力。


郑然


百度杰出架构师、百度智能云技术委员会联席主席


为了完成任务,还需要给Harness一个执行的环境。它需要存储一些临时文件,需要调用工具,比如下载一些网页,需要用Skill,需要调用MCP。这些都需要一个环境,同时有工具、有记忆,再加上安全,帮助Agent的任务具备隔离性和稳定性。所以这背后,就对整个工程层面提出了完全不一样的要求。


我们理解Agent是一个系统化的工程,某种意义上说,它存在着一定的木桶效应。整个Agent Harness依赖很多配套的能力,需要一个系统化的优化,才能让Agent更高效地执行。某一方面出现短板,就容易造成Agent执行效果的下降。


所以从“一次推理给答案”到“多轮推理、调用工具、管理记忆、执行任务”,这背后对云提出了一整套全新的工程要求。


在这样的背景下,过去智能云三大层级的内涵和能力,也需要围绕着Agent的落地部署来重新架构:从IaaS、PaaS和SaaS,演变成一种“AI Infra+Agent Infra+智能体应用”的新架构。


郑然

百度杰出架构师、百度智能云技术委员会联席主席


这种底层逻辑的变化,今年也直接传导到了整个产业链上。


Agent要部署落地,GPU之间需要高速大规模互联,KV Cache和Agent记忆需要超高带宽存储,推理过程需要超低延迟网络,向量数据库需要海量并发读写。于是,HBM(高带宽内存)、光通信模块、先进封装,每一个环节都变成了新的稀缺品。


与此同时,CPU也重新变得重要起来。模型推理由GPU完成,而任务调度、工具调用、跨系统协作等大量执行工作则重新回到了CPU。



因此,云的核心生产资料,从大模型时代单一的GPU,扩展到了“GPU+CPU+HBM+光互联”协同运转的新体系。于是我们也看到,这些板块的公司们今年的股价一路暴涨。


而在这一轮需求爆发中,还有一个难以忽视的部分,是今年NeoCloud(新云)的快速崛起。


一方面,NeoCloud能够更加灵活地提供包括GPU资源、裸金属服务等在内的基础设施能力,快速响应企业不同场景下的定制化需求。


另一方面,随着全球AI需求持续爆发,大量训练和推理订单开始向外溢出,也给CoreWeave、Nebius等“新云”带来了快速成长的机会。


Nebius自2024年10月复牌上市以来,股价已经涨了超过10倍,还在今年6月22日被正式纳入纳斯达克100指数。这说明无论是资本市场还是真正的产业需求,都在押注AI云业务。



不过,中国的情况有点不同。与美国已经形成比较明显的NeoCloud(新云)赛道不同,中国目前还没有发展出这一独立的产业类别。


这背后的主要原因可能在于,百度智能云、火山云、阿里云等超大云厂商正在快速向AI Native Cloud(AI原生云)演进,已经将AI算力、模型训练、推理服务等能力整合进自身平台。相比催生新的云厂商,中国更多是在现有云平台基础上直接完成AI升级。


随着AI工作负载的演进,云服务产业正在形成更加多元的能力分工。围绕算力、推理、Agent运行和企业落地等不同环节,不同类型的云厂商正基于各自的优势,构建自己的核心能力。



正是看到了企业大规模部署Agent的真实需求,以及落地过程中遇到的种种挑战,全球头部云厂商在2026年集体做出了同一个动作:牵头重构云的能力栈,搭建一套服务于Agent运行和部署的云服务。



比如微软就在今年的Build 2026上提出,Agent将取代“App+操作系统”的旧范式,并判断这将是一次可以和“大型机到PC、PC到智能手机”相提并论的平台级转移。围绕这个判断,微软推出了一整套Agent全栈架构,从感知、运行、治理到分发,整条链路被打包成一项标准化云服务。


谷歌则在4月的Cloud Next 2026上,宣告服务了5年的Vertex AI退役,取而代之的是全新的Gemini Enterprise Agent Platform,并同步发布了“Agentic Data Cloud”、第八代TPU以及覆盖Workspace的智能体应用层。


这些动作都说明,AI云的竞争正在从“谁能提供模型和算力”,走向“谁能支撑Agent稳定运行和规模化交付”。


郑然

百度杰出架构师、百度智能云技术委员会联席主席


可以说,怎么“更高效”地去烧Token,已经是行业追求的共识目标了。所以在今年上半年,我们看到大家喊出的口号,是要把指标定成Token/$、Token/Watt、Token/Second这些。但说回来,这些指标本质上衡量的是性能、效率和成本,也就是“AI规模化落地的基础”。


但在Agent时代,这些指标已经不够了。


相较于“生成更多Token”或者“Token的成本更低”,“单位Token的智能水平”就变得更加重要,也就是在相同的资源消耗下,让每一个Token承载更高的智能、完成更高效的任务。


所以云服务接下来需要提供的不再是单一模型能力,而是一套“全栈AI云”。



这样的变化,其实对于所有云厂商来说,都是一场全新的考验。它要求的是从底层算力、到Agent运行、再到企业真实业务场景的全链路打通能力。起点是最难的全栈技术,终点是最难的客户价值,两头都做到,才算真正具备下一代AI云的能力。


鞠笑竹


北京人形机器人创新中心大模型负责人


Agent落地本身是一个系统工程。只做算力,解决不了任务执行的稳定性。只做模型,解决不了企业场景里的工具、数据、权限和流程。只做应用,又很难反向优化底层推理成本和运行效率。因此,“芯、云、模、体”的协同,本质上是在用系统工程的方法,来解决Agent大规模落地这件最难的事。



具体的做法是:


第三层,对模型进行重构。从过去更多在看模型的参数规模和跑分,到现在更看重模型能不能真正融入客户业务、解决实际问题,去“赋能千行百业”。


第四层,对研发范式进行重构。从人写代码、人验证,转向AI自主完成开发任务,让Agent能够直接调用云产品的服务和接口。



更重要的是,这四层需要协同打通上下游,形成闭环。


郑然


百度杰出架构师、百度智能云技术委员会联席主席


而对于大型云厂商来说,这种全栈的能力,也意味着能够覆盖企业不同阶段、不同层次的AI需求。比如有的企业还停留在模型训练和推理阶段,只需要GPU算力。有的企业已经开始开发自己的Agent,需要Agent Runtime、工作流、记忆管理等平台能力。还有一些企业并不希望自己开发,而是希望直接购买开箱即用的Agent应用。企业可以根据自身需求,在同一套云体系中灵活选择、逐步升级。


鞠笑竹

北京人形机器人创新中心大模型负责人


所以,当AI开始从模型训练走向企业应用,越来越多的云厂商开始重新定义AI基础设施的边界。



因此从全行业来看,从GPU云到Agent云,变化的不只是云的技术架构,也包括价值衡量方式的变化:从看投入,到看产出。


这一篇文章,我们主要聊了智能云产业发生了什么变化、为什么会变。接下来关于AI Infra,我们也会很快推出系列内容,更加详细地拆解整个AI基础设施产业链,以及每一个关键环节正在发生的技术变化和优化方向。

AI创投日报频道: 前沿科技
本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
正在改变与想要改变世界的人,都在 虎嗅APP