本文来自微信公众号: 未尽研究 ,作者:未尽研究
三季度已经进入尾声。中国日均Token调用数据又将迎来一次更新。
今年,中国官方已经两次披露了全国日均token消耗,均为季末数据,6月底为500万亿token,相较去年年底增长了5倍,是去年同期的16倍。
但这个数字,可能还没有反映中国AI需求最新一轮的变化。在7月至今,中国模型迎来了一段“好用”时刻;以GPT-6 Astra为代表的新一代模型,进一步证明了Computer Use在复杂任务完成上的价值,国内模型或快速跟进,开启一条新的token调用跃升的路径。它们究竟会把三季度的Token调用量推到哪里,可能是接下来最值得关注的数据。

(来源:国家数据局等;“年初”“年末”等表述统一简化为Q1、Q4。WorkBuddy制图)
但是,且慢,我们最好在该数据披露前,搞清楚以下几个问题,至少把它们先写在案头:
当前的500万亿Token,到底统计了什么?
中国的Token消耗真的超过美国了吗?
如果超过了,为什么中国AI收入仍比美国低一个数量级?
背后的国产算力,以及token出口
统计口径
粗略地看,Token的一生并不复杂。某地用户通过某款应用发起请求,应用调用某个模型,模型运行在某地的算力基础设施上,最终生成Token并返回结果。同一个请求,可能在不同环节留下不同的Token统计数字。
Token正在成为AI经济学的新尺度,但我们还不会统计它
2026/08/28完整阅读>
2026年5月IDC发布的最新报告显示,2025年全年火山引擎以49.5%的Token份额,领跑中国大模型公有云市场,用的就是MaaS(模型即服务)厂商的口径,剔除了自有业务调用;而在今年的火山引擎FORCE大会上,火山引擎总裁谭待向媒体确认,豆包大模型日均token调用量,既包括内部、外部,也包括豆包App本身。因此,我们无法简单据此倒推整个中国市场的Token调用量。
而对于云厂商的口径而言,它披露的token调用量,既包含自研模型的token,也包含第三方模型的token。在最近的财报电话会议上,阿里巴巴分析近期MaaS业务时,明确提到该业务由两大块模型来源,自研模型占大部分,三方开源模型也不小。如果两套统计同时进入更上层的汇总口径,就可能存在重复计算的可能。OpenAI与Anthropic此前也曾就云厂商托管销售的收入应如何计入ARR发生争议。Token可能面临完全类似的问题。
当然也有可能漏算。模型厂商自己租用IaaS搭建推理服务对外销售,甚至自建数据中心,这部分Token就不会出现在云厂商的Token统计口径里;云厂商在IaaS层体现的,则是对应的算力租赁收入,而不是Token调用量。而应用厂商私有化部署,乃至仍处于早期阶段的端侧AI,也不会出现在云厂商或模型厂商的口径里。
中国token调用规模,超过美国了吗?
正因为如此,由于美国缺乏全市场尺度的Token统计,在汇总不同来源的数据时,既可能存在重复计算,也可能存在遗漏。这也将导致中美Token日均调用量的比较,存在较大的统计误差。
今年4月,OpenAI曾披露,其API每分钟处理超过150亿Token,折算下来约为日均22万亿Token。谷歌在7月披露的最新数据,则对应日均约32万亿Token。但这些并不能覆盖两家公司庞大生态中的自有应用及其他内部业务所产生的Token。即使不算Anthropic,很多中国开源模型也部署在美国的新兴AI云上;如果按推理算力所在地统计,这部分Token的生产与调用,显然也应计入美国的供给侧口径。
人们有时候会选择某种代理指标。最常见的就是OpenRouter。这是世界上最大、最受信任的token路由引擎。但是,它更偏向中小开发者的用户结构,无法简单映射到整个美国AI市场。这也使得中国模型霸榜,无法简单对应中国模型token调用规模,就一定大于美国模型。
支付公司Ramp的统计,提供了另一个维度的代理指标。它观察到,此类模型服务平台在其客户中的渗透率虽然持续上升,但截至6月仍然只有5.8%,绝大多数客户仍然选择直接调用OpenAI或Anthropic的API。而在使用这些平台的企业中,85.8%同时使用OpenAI,93.2%同时使用Anthropic。

算力也是另一个代理指标。不过,在装机量上,美国倾向于用GW描述,中国则更多以EFLOPS衡量,这又加大了对比难度。而从算力转化为token调用,事实上还存在推理/训练占比、以及高吞吐/低时延负载权衡的问题。
按照分析机构Epoch AI的估算,截至今年一季度,美国AI算力基础设施的电力规模约13.7GW,中国约0.72GW,差距悬殊。但按照工信部公布的数据,截至上半年中国智算规模2,185 EFLOPS(FP16)。如果极端地假设,这些算力全部由CloudMatrix 384这样的系统提供,而据SemiAnalysis分析,该超节点可提供约300 PFLOPS的BF16稠密算力、系统功耗约600kW,那么按此折算约合4.4GW的等效功耗。差距仍然不小。

因此,在中国模型美国市场渗透率仍然不高、算力装机规模也存在较大差距的情况下,认为中国日均500万亿Token调用量已经超过美国,至少还不能算是一个高确定性的结论。
中国token为什么廉价?
市场往往将OpenRouter上某个时间截面的模型份额,直接视为中美Token日均调用量的份额,再据此追问,为什么中国在消耗了如此庞大的Token之后,AI厂商的ARR却与美国相差数量级?
这是一个“有价值”的伪问题。伪问题,是因为Token统计口径的问题,中美Token日均调用量至今无法简单对比。不同的代理统计指标,也存在各自的缺陷。有价值,是因为它确实触及了一个重要现象:中国的Token调用量正在快速增长,四处传来中国模型token用量碾压美国的消息,而模型厂商的收入与美国头部厂商之间仍存在巨大差距,OpenAI与Anthropic两家的ARR即超过千亿美元,比中国科技大厂之外AI企业ARR收入高了两个数量级。
不同国家之间的电力生产成本不同;同样一度电,在不同的生产活动中创造的经济价值也可以相差甚远。Token也是相似的道理。对于成本端而言,它对应着模型研发成本、算力基础设施的建设、运营与折旧,以及针对不同工作负载所做的模型与系统选择;而输出了token之后,智能的质量如何,以及是否真正解决了问题,解决的问题是否足够有价值都可能比token数量更能决定智能的价值。
黄仁勋新近的AI叙事,正在转向“token收益”。它综合考量了能效(tokens/W)、时延(TTFT,首次生成令牌所需时间)、服务中断时间(MTBI)以及硬件寿命(Useful Life)等指标。

像Anthropic这样的企业,越来越重视低时延的高质量交互体验,这对应的正是编码、智能体等实际工作场景的需求,而这些往往又是任务价值更高的工作场景。虽然在一定程度上,基于同一套算力设施,追求更高频的交互和更低的时延,会牺牲部分Token吞吐,但硬件代际升级又会重新抬升这一效率边界,推动价值总量的抬升。
在较长一段时间里,中国开源模型还无法触及这一门槛,也就难以真正打开这些高价值工作场景。随着今年下半年诸多模型开始变得好用,中国企业的ARR也迎来了一波快速攀升。但中国与美国在模型能力上的差距,长期以来呈现间歇式追赶与落后的状态,也使得模型能力所带来的溢价,始终更多掌握在美国模型厂商一侧。
但即便进入相同的软件、法律、医疗、金融、咨询等高价值领域,Token的商业价值也未必完全相同。因为AI最终替代的是人的时间,而不同市场中,单位员工所对应的人工成本、专业服务价格以及企业IT支出水平本身就存在差异。这是一个超越AI自身的话题。
背后的国产算力,以及token出口
中国Token供给的边际增量,正在越来越多地来自本土算力。但就存量而言,当前500万亿Token背后的推理基础设施仍然主要由英伟达GPU提供。
4月,据IDC统计报告,2025年中国云端AI加速器市场,本土芯片厂商合计拿下了41%份额;英伟达的市场份额仍有约55%,而之前更是高达95%。这意味着,当前为中国模型提供训练及推理算力的,事实上仍然主要是英伟达GPU。
不过,这一趋势正在得以扭转。年初至今,数个本土GW集群正在加速部署。智谱已用国产芯片集群承载了6天60多万亿token的推理需求;这还只是一个免费畅用的“内测”模型。
而国家的“十五五计划”,提出“适度超前”建设AI算力,到2030年达到9800EFLOPS,较2025年大幅增长6倍多。如果这些算力几乎都由本土芯片提供,那么token生产的国产化率,将至少在80%甚至90%以上(取决于当前算力的国产化率占比)。而按照摩根大通此前从本土产能增长的角度估算,同样认为本土算力满足中国AI基础设施需求的比例,至2030年将提升至90%。不过,从单卡性能来看,这仍是一个“电力换算力”的过程。

从统计的技术难度看,中国日均500万亿Token更可能是模型及MaaS等供给侧口径,而不是应用层用户口径。这就意味着,这一数据其实也隐含了全球客户对在中国生产的token的调用,即“token出海”的叙事。
今年6月,在FORCE原动力大会期间,火山引擎总裁谭待透露,Seedance系列模型近一半的调用量来自海外市场。与此同时,据媒体报道,豆包大模型的Token消耗中超过一半来自Seedance和Seedream两个多模态生成模型系列。粗略估算,仅Seedance就可能贡献近50万亿Token日均海外调用,相当于中国500万亿日均调用量的约10%。视频生成模型为主营的快手可灵、昆仑万维,也有着相似的收入结构。
而在大型语言模型层面,上市公司MiniMax披露了上半年海外收入占比则达到60.8%。而智谱、Kimi、DeepSeek等模型厂商,以及阿里等云巨头,也在加速进入海外市场。这意味着,我们同样无法将中国官方口径的日均token调用增长,简单地等同于中国国内智能体经济市场的繁荣。
期待9月底中国日均Token调用数据的公布。届时,这个数字或许能够为上述问题提供一个更清晰的观察窗口。
