据报道字节跳动计划预训练最高10万亿参数超级大模型,同步将分散的数据团队整合升格为一级部门,凸显大模型训练中高质量数据的战略价值。 ## **1. 字节整合数据团队并升格为一级部门** 原分散在多条业务线的大模型相关数据团队被收拢,组建成新的“AI数据与安全”一级部门,和Seed、Flow、抖音平行,负责人更换为王赢磊。 ## **2. 字节计划预训练最高10万亿参数超级大模型** 据金融时报援引知情人士消息,该模型目前处于早期阶段,最终规模尚未确定,若落地将成为全球参数规模最大的AI模型之一。 ## **3. 字节坚持自研拒绝通过蒸馏外部模型追赶** 张一鸣在Seed全员会上明确表态,字节愿意为长期目标牺牲短期利益,即使阶段性落后也不依靠蒸馏竞争对手模型补差距,需独立准备训练数据。 ## **4. 大模型规模扩张正在面临高质量数据短缺问题** 按Chinchilla经验规律,模型参数翻倍需同步增加训练数据,而公开人类文本存量有限,按当前增长速度预计2026-2032年将被用尽。 ## **5. 行业普遍通过多种方式获取稀缺高质量数据** 大厂通过付费采购内容授权、雇佣专业人员生产数据,甚至批量扫描实体书获取文本,为获取数据愿意支付高额成本,也伴随版权风险。
10万亿参数大模型还没影,字节先造了个一级部门
2026-08-12 10:18

10万亿参数大模型还没影,字节先造了个一级部门

本文来自微信公众号: 超聚焦foci ,作者:肖恩


字节想在大模型上后来居上,光堆GPU可能已经不够了。


据智能涌现报道,字节跳动近期成立新的一级部门“AI数据与安全”,与Seed、Flow、抖音等部门平行。与此同时,原AI数据与安全负责人傅越将于近期离职,其位置由原TikTok平台责任团队负责人王赢磊接任。


单看这件事,像是字节又一次普通的组织调整,但时间点有点巧。


近日,金融时报援引三位知情人士报道称,字节正在预训练一个参数规模最高可能达到10万亿的超级AI模型,目前仍处于早期阶段,最终模型规模将在后续训练阶段才能确定。如果最终做到这一规模,它将成为全球参数量最大的AI模型之一。


相比目前主流大模型,这已经不是简单地把模型“做大一点”,而是在继续往Scaling的极限上下注。


模型越大,需要填进去的就不只是GPU了。


01


模型还没到10万亿


数据先“升官”了


字节这次成立的“AI数据与安全”,并不是凭空多出来一个部门。


智能涌现消息称,新部门的前身之一,是傅越在2023年成立的Global Data。这个百人左右的团队最早服务Dola、TikTok等国际业务,后来逐渐开始承担Seed模型训练的数据采购和质量管控。


后来,随着字节大模型业务越铺越开,围绕数据的团队也越来越多。


除了Global Data,集团数据中台DMC、Flow旗下AI数据平台AIDP,以及Seed内部不同模型方向,都陆续建立起自己的数据团队。它们服务的对象不同,做的事情却越来越接近:采购数据、组织标注、搭建数据集,再负责模型训练后的评测和质量控制。


结果就是,同样是给大模型准备数据,字节内部却逐渐长出了好几套班子。


今年以来,字节开始重新整理这套体系。原本分散在不同业务线的数据团队被陆续收拢,最终组成新的“AI数据与安全”部门,并直接升格为一级部门,与Seed、Flow、抖音等平行。


但从字节在数据上堆的人和钱来看,这次升格也不算突然。智能涌现此前披露,仅Seedance的数据评测团队就有上千人,一名算法工程师背后,往往对应十余名数据人员;今年字节在世界模型和Coding等方向的数据预算也已经达到千万美元级,而且还可以继续追加。


这已经不是过去找几家外包公司做标注的生意了。从数据采购、清洗、合成,到模型评测、质量控制,数据正在变成和算法、算力一样需要单独组织、持续投入的一套工程。


更关键的是,字节还主动给自己堵上了一条近路。


8月5日,据The Information报道称,张一鸣在约一个月前举行的Seed全员会上明确反对通过蒸馏外部模型来追赶。报道援引知情人士称,张一鸣认为,字节应该愿意“为长期目标牺牲一些短期利益”,即使Seed阶段性落后,也不应依靠蒸馏竞争对手模型来补差距。


一边奔着5万亿甚至10万亿参数去,一边又不想直接抄别人模型的答案,字节只能自己准备更多“教材”。


而现在,找教材这件事已经不只是字节自己的麻烦了。


02


模型越来越大


好数据却快不够吃了


字节遇到的问题,其实也是所有还想继续Scaling的大模型公司正在面对的问题。


过去几年,大模型变强的办法简单粗暴:更多参数、更多算力,再喂进去更多数据,但这三样东西并不是无限的。


2022年DeepMind在著名的Chinchilla论文中发现,如果希望在既定算力下把模型训得更充分,模型参数和训练Token不能只涨一个。按照其当时给出的经验规律,参数规模翻倍,训练数据量也应该同步增加。


问题是参数可以继续堆,GPU也可以继续买,互联网上人类写出来的好东西却是有限的。


研究机构Epoch AI曾估算,在考虑质量和重复利用之后,全球公开的人类文本大约相当于300万亿Token。


按照大模型训练数据规模过去的增长速度,这批数据可能在2026年至2032年之间被充分利用;如果模型为了降低推理成本而进行更长时间的“过度训练”,这个时间还可能提前。


公开互联网不够吃,大模型公司只能开始往围墙外面找。


最先被盯上的,是那些过去很难被大规模抓取、或者压根不免费的内容。论坛、新闻网站、付费出版物、专业数据库,甚至没有数字版本的实体书,都开始被重新标上价格。于是,过去靠爬虫解决的数据问题,越来越变成了一门采购生意。


2024年,Google与Reddit签下每年约6000万美元的内容授权协议,用于AI模型训练;同年,OpenAI又与News Corp达成多年合作,将华尔街日报、泰晤士报等旗下媒体的历史和实时内容纳入可使用范围。


但花钱买现成数据还只是第一步。


当新闻、论坛这些相对标准化的内容也被大厂瓜分后,更专业、更稀缺的数据开始需要专门找人生产。代码、数学、科学等领域,大模型公司开始直接雇佣工程师、博士和行业专家参与训练数据生产与评测。


再往下,甚至连“买”都买不到了,Anthropic最后干脆把手伸向了实体书……


今年1月,华盛顿邮报根据法院解封文件披露,Anthropic早在2024年就启动了一个内部代号为“Project Panama”的项目。而Project Panama干的事情也非常简单粗暴:买书、切书、扫描。


Anthropic批量采购了数百万册实体书,再用液压切割设备直接切掉书脊,把散开的书页送进高速扫描仪,数字化之后再将原书回收处理。项目启动大约一年时间,Anthropic为此花掉了数千万美元。内部文件甚至把目标写成了,要“破坏性扫描全世界所有的书”。


更夸张的是,在Project Panama之前,Anthropic还曾从LibGen等影子图书馆下载数百万册盗版书籍,这也成了后来Anthropic被送上法庭的直接原因。


2025年,法院认定使用书籍训练AI本身可以构成合理使用,但Anthropic保存超过700万册盗版书籍建立“中央图书馆”的行为面临侵权风险。为了结束集体诉讼,Anthropic最终同意支付15亿美元和解;今年7月,美国联邦法院正式批准了这笔协议,它也成为已知规模最大的美国版权诉讼和解之一。


从这个角度看,Anthropic那15亿美元的和解金,反而像是给高质量数据标了一个极其夸张的价格。毕竟,书可以买,版权可以买,专家也可以花钱请,但真正没被模型吃过、又足够好的数据,并不会随着参数一起凭空长出来。


这也是字节现在最麻烦的地方。一边是最高10万亿参数的模型计划,一边是不靠蒸馏走捷径,模型要继续往上Scale,最后还是得回到一个最朴素的问题:拿什么数据去喂。


哪怕10万亿参数还只是计划,但数据已经先成了字节必须单独下注的一门生意。


-END-

AI创投日报频道: 前沿科技
本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。
正在改变与想要改变世界的人,都在 虎嗅APP