智谱正三线布局全自主国产AI算力体系,加速去英伟达化,应对算力压力,独立大模型企业已开始向产业链上游延伸。 ## 1. 智谱三线布局全自主国产AI算力体系 - 底层物理算力:完成1GW级国产芯片数据中心建设并部分投运,跻身国内独立模型企业最大型算力基础设施之列,可提供大规模稳定长期算力资源池,目前智谱还运营多个万颗芯片级计算集群。 - 中间算力软件:斥资数亿元收购源自中科院计算所的中科加禾,其核心能力覆盖编译器、推理引擎等,可降低大模型在不同国产芯片间迁移调优成本,转化有效算力,其SigInfer推理引擎测试中最高可降推理时延74倍。 - 上游芯片设计:正与国内芯片设计公司接触,评估合作开发适配GLM模型的定制AI芯片,项目处于早期阶段,目标是针对性优化长期推理成本。 ## 2. 算力承压倒逼上游布局 - 大模型业务增长快速推高算力需求:GLM-5的Coding Agent日调用量达数亿次,GLM-5.2上线首周日均Token使用量增长27倍,同类大模型Kimi、通义千问也遭遇用户请求量逼近集群承载极限的问题。 - 高负载直接影响用户体验:高并发场景下,推理系统的缓存、调度微小问题就会引发模型输出异常,模型体验不只取决于参数规模,也依赖推理系统性能。 ## 3. 上游布局是商业模式的必然选择 - 大模型边际成本随调用量同步增长:智谱2025年收入同比增长131.9%至7.24亿元,云端部署收入增长292.6%,但销售成本同比增长213.3%至4.28亿元,全年净亏损47.18亿元,成本增速明显快于收入,计算服务费是成本增长核心原因。 - 长期依赖外部算力会制约业务扩张,自建算力可在供应确定性、软硬件协同、成本间获得更优平衡,匹配大规模调用需求。 ## 4. 产业与政策形成双向推动 - 除智谱外,DeepSeek等独立大模型企业也在布局自建算力中心、自研推理芯片,独立模型企业正从算力购买者转变为算力运营者、改造者,逐步参与定义下一代算力。 - 政策支持明确:未来五年约2万亿元的全国AI算力基础设施方案有望落地,全国一体化算力网被列为“十五五”国家级重大工程,新建获国家资金支持的数据中心要求仅使用国产AI芯片,国产芯片将进入成规模长期采购体系。
智谱的算力野望浮出水面,自建1GW机房、数亿收购中科系Infra企业、布局自研芯片,加速去“英伟达化”
2026-07-21 12:42

智谱的算力野望浮出水面,自建1GW机房、数亿收购中科系Infra企业、布局自研芯片,加速去“英伟达化”

本文来自微信公众号: AI前线 ,作者:四月,原文标题:《智谱的算力野望浮出水面!自建1GW机房、数亿收购中科系Infra企业、布局自研芯片,加速去“英伟达化”》


被美国限制高端GPU算力多年,快速迭代的国产模型究竟在靠什么持续训练?


彭博社最新披露,智谱已经完成一座1GW级别的数据中心建设,并开始部分投入运营。该中心全部采用国产AI芯片,主要用于GLM系列模型研发。智谱目前还运营着多个万卡计算集群,单个集群搭载的芯片均超过1万颗。


1GW的供电规模,大致可以同时满足75万户家庭的用电需求。以此计算,这座数据中心已经跻身中国AI实验室/独立模型企业建设的最大型算力基础设施之列。该消息来自一名匿名知情人士,具体芯片型号、供应商和设备总量暂未披露,智谱方面暂未对此置评。


近期,智谱在算力上下游布局频频。


据多家媒体报道,智谱已斥资数亿元收购国产异构算力软件公司“中科加禾”。后者源自中科院计算所编译实验室,核心能力覆盖编译器、虚拟指令集、Runtime和推理引擎。据悉,智谱已经完成这笔收购,但截至目前,交易双方尚未发布正式公告。



更早前,The Information披露,智谱正在与国内芯片设计公司接触,评估合作开发定制AI芯片的可能性。该项目仍处于早期讨论阶段。


结合上述消息观察,智谱正试图构建一套**完全脱离英伟达体系的算力基础设施:**自建1GW国产数据中心,解决的是稳定的算力资源从哪里来;收购中科加禾,解决的是不同国产芯片如何更高效地运行GLM;自研定制AI芯片,则进一步指向按照自身模型负载,来优化长期推理成本。


与此同时,DeepSeek也在推进类似布局,包括组建算力运营团队支持乌兰察布自建的算力中心,增设芯片设计人员,布局面向推理场景的自有AI芯片。


可以看到,独立模型企业正在从算力的购买者,逐步变成算力的运营者、改造者,并试图参与定义下一代算力。


三线并进


智谱此次曝光的三个动作,分别落在算力产业链的不同位置。


最底层是物理算力供给。


过去,独立模型公司主要通过云厂商、运营商或第三方算力服务商获得GPU资源。好处是前期投入较轻,可以根据模型训练和推理需求灵活采购;问题则是芯片供应、集群排期、服务价格和扩容速度,始终掌握在外部平台手中。


1GW国产数据中心开始部分投运,意味着智谱正在获得更大规模、更稳定的长期资源池。相比一次性租用几千张卡,它更接近一套能够持续服务模型预训练、后训练和大规模推理的基础设施。


第二层是算力软件。


国产芯片不是简单地插进服务器,就能直接承接原本运行在英伟达平台上的模型。不同厂商的芯片架构、编程环境、算子库、内存管理和通信机制并不相同,同一款模型迁移到不同硬件上,往往需要重新适配和调优。


中科加禾的核心价值,恰好位于模型和芯片之间。


公开资料显示,其团队曾参与龙芯、神威、寒武纪、华为昇腾等国产芯片的编译器研发,试图通过虚拟指令集、编译器和Runtime,为不同硬件提供较为统一的软件接口。



当然,这并不意味着不同品牌的芯片就可以毫无障碍地混装在同一个大规模训练任务中。跨芯片协同还涉及集合通信、精度一致性、网络拓扑和容错等复杂问题。


更准确地说,中科加禾希望降低同一个模型在不同国产芯片之间迁移、部署和性能优化的成本,把分散在不同硬件平台上的理论算力,尽量转化成模型真正能够调用的有效算力。


其SigInfer推理引擎宣称,在特定测试场景中可将推理时延最高降低74倍、吞吐率最高提升3倍、能效比提升1.46倍。上述数字目前主要来自公司测试,尚不能直接等同于智谱生产环境中的实际效果,但哪怕其中一部分能够兑现,也会极大程度优化智谱的Token算力成本。


第三层则是芯片设计。


与训练相比,推理工作负载通常更加稳定。模型结构、参数规模、内存访问方式和计算精度相对确定,因此更适合通过定制芯片进行专项优化。


据了解,智谱目前只是评估与国内芯片公司合作阶段,暂无披露合作方、芯片架构、流片时间和量产计划。而真正值得关注的是,智谱已经开始思考一个更上游的问题:与其让GLM长期适应市场上已有的芯片,能否让未来的芯片架构反过来适应GLM?


算力承压


智谱密集补齐底层算力设施能力,直接原因并不神秘:模型调用量增长得太快,基础设施已经多次接近承载上限。


今年1月,随着GLM Coding Plan用户快速增长,智谱宣布暂时限量销售该产品,每日新增购买额度被压缩到此前的20%。智谱当时明确表示,部分用户在工作日下午的调用高峰期遭遇并发限流、模型速度下降等问题,需要优先为老用户腾出算力资源。


到了3月,GLM-5上线后,Coding Agent每日调用量已经达到数亿次。与普通聊天相比,Coding Agent往往需要读取更长的代码上下文,持续生成大量Token,并反复调用搜索、执行和调试工具,对推理系统的压力高出一个量级。


压力很快从“速度变慢”,蔓延到了模型输出质量。



一些用户发现,GLM-5在复杂任务中偶尔会出现乱码、复读和生僻字,看起来像是模型突然“变笨”。但智谱反复回放相同请求后发现,这些异常无法稳定复现,模型权重本身并没有发生变化。


经过数周排查,问题最终被定位到高负载下的推理状态管理。智谱在博客《Scaling Pain:超大规模Coding Agent推理实践》中详述了KV Cache错配、竞态冲突等成因,以及缓存分层与调度修复方案。


这次故障也暴露了一个容易被忽视的事实:模型能力不只由参数规模决定,也受模型的推理系统性能影响。


同一组模型权重,在低负载环境中可能输出正常;一旦进入高并发、长上下文和长任务场景,缓存、调度和通信系统的细小错误,也能让用户感知到模型质量下降。


GLM-5.2上线后,这种压力继续放大。The Information报道称,该模型上线Vercel平台首周,日均Token使用量增长27倍。与此同时,智谱还在与更多国产硬件平台进行适配,以满足持续上升的算力需求。


类似的高并发挑战也发生在近期推新的Kimi和Qwen身上。



Kimi K3发布后,用户请求量在48小时内大幅超过预期,逼近现有集群的承载极限。月之暗面随即暂停C端新用户订阅,将现有算力优先分配给已付费用户,并计划随着新增资源到位,分批恢复订阅名额。公司还准备将通用会员与Coding会员拆分,以便根据不同任务的算力消耗,更精细地分配资源。


刚刚亮相的Qwen3.8-Max总参数达到2.4万亿,多名开发者表示在Token Plan、Qoder等入口均提示访问受限。官方解释主要因为触发了API平台的并发限流(Rate Limit)或配额不足。


链条上探


算力压力之所以越来越难以回避,与大模型公司的商业模式有关。


传统软件产品完成研发后,新增一名用户的边际成本通常很低。但大模型每回答一次问题,都要消耗真实的芯片、电力和内存资源。


用户越多,Token调用量越大,推理成本也会同步上升。模型公司收入增长,并不意味着利润率会随之改善。


智谱2025年的收入由3.12亿元增长至7.24亿元,同比增长131.9%;其中,云端API等部署收入增长292.6%,达到1.9亿元。2026年第一季度,智谱的API调用量又增长约400%,公司随后将API价格提高83%。


但另一面是,智谱2025年销售成本由1.37亿元增至4.28亿元,同比增长213.3%,明显快于收入增速。公司在财报中明确表示,成本上升主要来自业务扩张带来的计算服务费增加。



同期,智谱研发支出达到31.8亿元,全年净亏损47.18亿元,高于2024年的29.58亿元。研发支出增长的原因之一,同样是向第三方算力供应商支付的计算服务费用增加,以及对更先进模型训练基础设施的投入。


这也解释了智谱为什么要向算力上游走。


如果长期完全依赖外部算力供应商,模型公司每一次业务增长,都会同时增加采购成本,并受到资源排期和外部价格变化影响。


自建数据中心当然不是免费的午餐。


它意味着公司需要承担芯片采购、电力、冷却、网络、设备折旧和长期运维成本。如果模型需求低于预期,或者芯片迭代速度过快,巨额基础设施也可能变成沉没成本。


但当模型调用量达到足够大的规模后,自建基础设施的价值便不只是“更便宜”,而是在算力供应的确定性、软硬件协同、成本三者之间寻求一个更大的平衡。


买算力解决的是眼前需求,控制算力决定的是模型公司未来能不能持续扩大规模。有理由相信,在智谱、DeepSeek之后将会有更多的模型独立企业投入重点资源与资金在算力设施领域。


政策层面,相关补贴也正在从芯片研发,进一步深入到算力项目的实际采购环节。


此前有媒体报道,获得国家资金的新建数据中心,被要求只使用国产AI芯片。彭博社透露,一项未来五年约2万亿元的全国AI算力基础设施方案有望落地。


当前,算力一张网被纳入到“十五五”开局之年的重要方向。在《“十五五”规划纲要》中,“全国一体化算力网”被列为国家级重大工程,强调要深入推进东数西算工程,构建多层次算力设施体系和全国一体化算力网,让算力像“水电”一样随取随用,从而全面支撑人工智能与数字经济的高质量发展。


这意味着国产芯片不再只依赖零散试点,而是将进入长期、成规模的基础设施采购体系。

AI创投日报频道: 前沿科技
本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
正在改变与想要改变世界的人,都在 虎嗅APP