**腾讯混元4(Hy4)发布,770B参数架构直接复用DeepSeek的DSA稀疏注意力和智谱的IndexCache,并吸纳GLM-5核心研究员白雨石,表明大模型技术壁垒因开源和人才流动已迅速瓦解。** **要点** **1. 混元4架构对齐行业共识** 混元4的主干网络(隐藏维度6144、78层、64头)直接对标智谱GLM-5的700B量级最优解,注意力模块采用DeepSeek的DSA稀疏注意力,叠加智谱的IndexCache跨层索引复用,避免重复踩坑。 **2. 技术迁徙周期缩短至数月** DSA于2025年9月由DeepSeek开源,次年被智谱用于GLM-5并迭代出IndexCache,2026年8月混元4直接纳入,不到一年完成从概念到旗舰标配的闭环。 **3. 核心人才流动带动隐性经验迁移** GLM-5架构负责人白雨石(清华姚班毕业)从智谱转入腾讯,参与混元4研发,其个人主页确认“Prev@Zai_org,currently scaling@TencentHunyuan”,实现工程经验的物理嫁接。 **4. 开源社区成果被广泛复用** 混元4在残差侧采用源自知乎热帖的恒等超连接(iHC),而非DeepSeek的mHC,表明从顶会论文、开源代码到社交讨论的前沿技术传播路径已彻底扁平化。
2026-08-31 20:05

大模型没有秘笈:腾讯混元4背后站着GLM-5核心研究员

本文来自微信公众号: AI前线 ,作者:四月,原文标题:《独家|大模型没有秘笈:腾讯混元4背后站着GLM-5核心研究员》


“做大模型其实并没有什么秘密。”


两个月前,从OpenAI空降腾讯的姚顺雨,在谈及大模型竞争时这样说道。当时很少有人真正在意这个论断。毕竟,此话由一位顶级研究员口中说出,未免有凡尔赛之嫌。


但只要看清他接手的战局,就知道此话未必是谦辞。


过去半年,智谱、月之暗面、DeepSeek、千问……群狼环伺,开源旗舰的更新周期被压到几个月,甚至数周;而腾讯,急缺一款能在行业里站稳脚跟的旗舰模型。


这位不到30岁的空降少帅,接手的从来都不是一摊慢工出细活的研究课题,而是一场容不得半点迟疑的前线救火。他要做的,是在最短时间内重组团队、更新血液,拿出一个稳站第一梯队的答案。


上周,混元交出了这份答卷。



这是混元大语言与多模态两大部门合并重组后的首次大考,混元4(Hy4 preview)各项指标直逼第一梯队,参数规模770B,支持百万上下文,距离上一代大版本发布不到四个月。


细品这份README,你会猛然回过味来:姚顺雨说的是大实话。


从官方坦诚架构设计“受到DeepSeek和GLM启发”,到注意力模块借鉴DeepSeek的DSA与智谱的IndexCache机制,再到GLM-5的核心研究员数月前出现在混元论文作者栏……


原来大模型所谓的“独门秘笈”,早已被顶尖人才的高速流动、极度透明的开源机制迅速瓦解。


一套熟悉的骨架


要看清混元4的底牌,最直接的方法,是翻开它的底层配置文件(Config)。


当模型参数来到700B(7000亿)这一中大规模档位,各家模型厂面对的其实是同一道算力极限题。在混元4交卷之前,国内在这个体量上真正跑通万卡训练、并立住口碑的,是智谱在今年2月发布的GLM-5(744B)。


相隔半年,同处700B的量级,把两代旗舰的底层骨架并排摊开,重合之处一目了然:



这里的前四项基本决定了一款Transformer主干网络的深度、宽度和注意力并行结构;后四项则进一步还原了模型的稀疏注意力内部,涉及Query如何压缩、负责筛选Token的索引器开多少个头,以及每次最终保留多少Token。


当模型主干与稀疏注意力内部同时对齐,可以看出,同一个量级的大模型工程最优解,正在收敛。


隐藏维度6144、78层、64个注意力头——这是智谱用真金白银砸出来的‘700B最优解’,而开源,让它成了全行业公认的共识底座。对于急需突围的混元来说,没有理由绕开它重新踩一遍坑。


技术沿路迁移


具体到架构,Hy4架构最核心的注意力模块,主干来自DeepSeek的稀疏注意力机制,同时叠加了智谱团队最新验证的跨层索引复用。最后,连同GLM-5核心贡献者白雨石一起,移植到了腾讯混元。


先从源头DeepSeek说起。


2025年9月,DeepSeek在V3.2-Exp中首次公开DeepSeek稀疏注意力(DeepSeek Sparse Attention,DSA),名字里的"D",毫不掩饰地标注着它的原创归属。


它针对的是超长上下文越来越昂贵的注意力计算:先增加一个轻量级索引器,从漫长上下文里筛出真正值得关注的Top-K Token,再进行核心注意力计算,避免每一次都遍历全部历史信息。


两个月后,DSA进入V3.2正式版,并被DeepSeek列为当代模型的核心技术突破之一。长文本的行业基准,就此改写。


很快,接力棒到了智谱手里。


今年2月,744B参数的GLM-5直接采用了DSA。但真正把这套稀疏注意力做到超大规模后,智谱团队很快发现另一个隐藏的成本黑洞:注意力虽然稀疏了,负责筛选Top-K Token的索引器却仍然要在不同网络层反复运行,无疑是巨大的浪费。


一个月后,IndexCache给出了解法。



智谱AI联合清华团队发表研究称,相邻Transformer层最终筛出的Top-K Token高度重合。既然上一层刚算过,下一层何必重新找一遍?于是,IndexCache让大量网络层直接复用已有索引结果。


这个四两拨千斤的改动,最高可以砍掉75%的索引器计算量。更关键的是,它没有停留在小模型实验,而是在744B的GLM-5上完成了生产级验证:削减50%索引器计算后,端到端仍取得约1.2倍提速。


从中不难看出,在开源生态下,大模型技术的迁徙周期已被压缩到以月计。


2025年9月,DeepSeek将DSA推向开源;次年2月,智谱将其部署进GLM-5;到了3月,智谱继续将其向前推演,迭代出IndexCache;2026年8月,这套组合拳已经赫然出现在770B的混元4身上。


不到一年时间,一项针对算力瓶颈的底层创新,就完成了从概念提出、工程降本到全行业旗舰标配的完整闭环。


论文背后的人


技术接力只是故事的一半。另一半,藏在论文的作者栏里。


在大模型这场智力密集的角逐中,任何一项能改变行业走向的底层优化,背后都站着极其稀缺的顶尖大脑。


混元能在四个月里把长文本架构拉满(从295B的Hy3到770B的Hy4),靠的不只是公开的论文,更是那个亲手把积木严丝合缝嵌进混元底座的研究员。



白雨石,清华姚班2022届本科毕业生,随后留清华计算机系读博,师从清华大学人工智能研究院知识智能中心主任李涓子;在此期间,他先后赴斯坦福、哈佛做访问研究,并参与了唐杰、刘知远、Jure Leskovec、Ariel Procaccia等知名学者的研究项目。


在入职腾讯之前,白雨石是智谱GLM-5这条架构线上的关键人物。



今年2月GLM-5发布时,白雨石在个人主页上介绍:“GLM-5新模型架构(DSA)、架构改进以及强化学习适配的负责人”。GLM-5的技术论文里也能看到他的署名。



一个月后,他又以第一作者身份发布IndexCache,把GLM-5刚刚采用的全新DSA继续往前推进。不过,他当时在智谱的身份还是实习生。


有意思的是,腾讯和他的交集,其实开始得更早。


今年1月,白雨石入选首届腾讯青云奖学金(Tencent Project Up Scholarship)——这是腾讯面向AI前沿在校硕博设立的顶尖人才项目,全国仅15人,每人20万元现金加30万元云算力,并明确提供进入腾讯实习、就业的通道。而为他颁奖的,正是刚接掌腾讯AI体系不久的“姚班”师兄,姚顺雨。


再往后,时间线突然加速。


7月3日,腾讯混元发布HiLS-Attention,一篇研究“无限上下文”的新型稀疏注意力论文。作者名单里,已经出现了Yushi Bai;论文归属机构包括Tencent HY Team。



一个多月后,Hy4发布。白雨石的个人简介同步更新:“Prev@Zai_org,currently scaling at@TencentHunyuan.”


如果说,论文完成了显性技术的公开,那么跳槽的天才们,则推进了隐性工程经验的物理迁徙。


大模型没有独家秘笈


今天,任何能够被论文、代码和实验数据完整表达出来的技术优势,独占期都在急剧缩短。


DeepSeek的DSA发布即成为行业标准模块,智谱的IndexCache不到五个月也被旗舰模型验证。更有意思的是,连一篇实验论证的知乎热帖,也在半年后并入了大厂的Model Card。


在残差侧优化上,Hy4并没有沿用DeepSeek复杂的mHC(流形约束超连接),而是选择了更简单的恒等超连接(identity Hyper-Connections,iHC)。而这项技术的参考链接,甚至都不能称之为正式研究,而是一篇在社交平台公开讨论的知乎热帖。




从顶会论文,到开源代码,再到社区讨论……前沿架构的传播路径已经彻底扁平化。


据笔者了解,那位质疑mHC、提出iHC方案的作者“涮月亮的谪仙人”(微软亚洲研究院研究员谢天),近期也从微软加入了阿里千问。


顶尖人才的高速流动,正在迅速填平领先大模型的护城河。

AI行业信号频道: 前沿科技
本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
正在改变与想要改变世界的人,都在 虎嗅APP