OpenAI O1推出后,大模型训练中后训练与强化学习的权重持续提升,基础模型的角色从知识压缩载体变为能力基底,大模型训练逻辑发生系统性变革。 ## **1. 大模型训练算力分配发生转变** GPT-3时代预训练是模型能力的核心决定因素,后训练仅做行为调整,强化学习作用有限;目前已有企业预训练与后训练的算力投入大致相等,后训练直接决定模型最终能力。 ## **2. 基础模型角色转变为原子能力载体** 当前基础模型不需要在预训练阶段掌握完整复杂任务能力,只需提前储备代码语法、工具调用等原子基础能力,复杂任务的能力组合交由后续强化学习完成。 ## **3. 预训练数据分布和目的性大幅调整** GPT-3时代网页与维基百科数据占预训练数据的85%,当前这类数据占比已降至15%,代码成为占比最高的预训练数据,合成数据的重要性也随针对性数据需求提升。 ## **4. 新增中训练环节衔接预训练与后训练** 预训练与后训练的数据分布差异较大,直接跳转可能影响模型尤其是MoE模型的专家负载平衡,中训练作为过渡阶段,可让模型提前适配后续任务的数据分布。
The Base Model Is Dead。
2026-08-16 16:36

The Base Model Is Dead。

本文来自微信公众号: 小盖fun ,作者:小盖


The Base Model Is Dead,这是我刚看完的一期分享,来自美国开源模型创业公司Arcee AI的预训练负责人Varun Singh。标题有点唬人,但这哥们的观点非常扎实。


他认为,过去Base Model的任务,是尽可能吸收人类已有的知识。


GPT-3那个时代,预训练的逻辑很简单,就是抓取大量互联网文本、Wikipedia、书籍,把尽可能多的人类知识压缩进模型参数里。


在GPT-3的训练数据里,来自网页和Wikipedia的数据大概占到了85%。


那个时候大家的默认逻辑就是,模型到底有多强,很大程度上取决于预训练做得好不好。


后训练更多是在这个基础上做最后的行为调整,比如让模型更会聊天、更会遵循指令。RL在当时的作用也比较有限。


但是O1之后,整个行业都发现了RL的重要性。


大家开始发现,只要RL做得足够好,模型在预训练结束之后,能力还可以继续明显提升。于是就不断加后训练的投入。


我记得之前罗福莉在一个访谈里提过,他们在预训练和后训练上的算力投入已经大致接近。


这也就是说,模型在预训练结束之后并没有定型。后训练已经不只是把模型调得更好用,它开始真正影响模型的最终能力。


Base Model的角色也因此发生了变化。它越来越像是在给后面的RL准备一些原子能力,也就是Atomic Skills。


举个例子,如果希望通过RL训练出一个非常强的Coding Agent,那Base Model在预训练结束的时候,不一定已经能够独立完成十个小时的软件工程任务。


但它最好已经掌握了Python、代码结构、API、函数调用、Git、文件系统这些基础能力。


这些就是Atomic Skills。


进入更复杂的任务和环境之后,再通过RL学习怎么把这些基础能力组合起来,这样就可以涌现出复杂Agent任务的能力。


所以,如果Base Model的目标变了,预训练的数据自然也会变。


前面说过,GPT-3时代网页文本占了训练数据的85%。而现在一些新模型里,这个比例已经降到了15%左右,代码反而成了占比最大的数据来源。


背后的逻辑其实很好理解。


现在模型公司已经非常清楚模型需要的关键能力,诸如Coding、长程任务等等,那在预训练阶段,就可以有意识地提前给它准备这些能力需要的数据。


所以训练数据开始越来越有目的性。一些过去主要在后训练阶段才会出现的问答、对话,以及更接近Agent任务的数据,也开始提前进入预训练。


这种训练逻辑下,合成数据的重要性也开始上升。因为当大家越来越清楚模型未来需要什么能力,然后就可以围绕这些能力,主动去准备更合适的训练数据。


比如我们已经知道,未来模型需要很强的Coding、Reasoning和Agent能力,那就可以围绕这些目标,主动生成更接近真实任务的数据。


原来只是一段代码,现在可以把它变成找Bug、修改代码、调用工具、连续完成任务的训练样本。


这样模型在预训练阶段接触到的,就不只是知识本身,也开始包含未来真正要用到的能力。


模型未来需要什么能力,预训练阶段就可以围绕这些能力去设计和生成数据。


这些变化,也催生了现在经常听到的Mid-training。


原因也很好理解。


预训练阶段模型看到的,过去主要是网页文本、书籍、代码。但到了后训练阶段,它突然要面对Reasoning Trace、Agent交互记录、多轮工具调用、长上下文任务。


前后两个阶段的数据分布差别可能非常大。


如果直接从一个阶段跳到另外一个阶段,模型就需要突然适应一套完全不同的数据。


对MoE模型来说,这个问题会更加明显,因为预训练过程中不同Expert已经逐渐形成了自己的分工,数据分布突然变化,可能会影响原有的负载平衡。


所以Mid-training可以理解成一个过渡阶段。


在正式进入后训练之前,提前让模型适应更长的Context、更接近Reasoning和Agent的数据,以及未来真正会遇到的任务分布。


这样Pre-training和Post-training之间就不会切得那么生硬。


所以整体来看,Pre-training、Mid-training、Post-training、RL这几个阶段之间的界限,确实已经越来越模糊了。


或者换一种理解方式,现在看待模型训练,可以粗略简化成两个大的范式:Supervised Learning和Reinforcement Learning。


前者帮助模型建立知识、表征和各种基础能力,后者再让模型进入环境,通过不断探索、试错和反馈,把这些能力组合起来。


回到开头那个标题。The Base Model Is Dead当然是个有点夸张的说法。


Base Model没有死,真正变化的是它在整个模型训练体系里的角色。


过去我们希望Base Model尽可能把人类知识学进去,然后在这个基础上做一些后训练。现在它越来越像一个为Reasoning和Agent准备的底子。


先把Atomic Skills准备好,再把更多复杂能力留给后面的RL。


Base Model依然重要,只是它越来越像一个起点。

AI创投日报频道: 前沿科技
本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。
正在改变与想要改变世界的人,都在 虎嗅APP