本文系统拆解Token工厂的生态分层、兴起逻辑与技术前景,呼吁泛互联网技术人才入局这个新风口。 ## 1. Token工厂的核心定义 Token工厂不是单一产品,是以生产消费推理Token为目标的完整上下游生态,包含产品、技术、资源与业务模式,覆盖从GPU资源到终端用户API/SDK的5个产品层,核心目标是输出便宜足量的Token,最大化硬件电力资源利用率。 ## 2. Token工厂的兴起逻辑 ### 硬需求驱动:当前已有明确落地场景 从去年下半年开始,AI已可胜任中级编程、多媒体内容生成等工作,市场对量大便宜的Token需求激增,原本滞销的通用N卡与配套IDC电力成为抢手资源,催生了 Token 工厂的落地需求。 ### 未来空间:AI应用大爆发可期 类比2014年4G普及带来移动互联网大爆发,大量闲置程序员正在各类应用中试验AI功能,未来成功的AI应用必然会消耗巨量Token,市场空间足够大。 ### 碎片化格局给新玩家留足空间 多重因素推动GPU算力需求碎片化:不同模型原厂需要独立资源池,单个投资方仅能承担部分硬件电力投入,各国监管也不会允许跨国巨无霸垄断,全球需要几十到上百个Token工厂,新兴团队有充足成长机会。 ### 中国有全球竞争力的技术优势 中国泛互联网行业积累的IT人才形成断档式领先,Token工厂核心竞争力是性价比而非囤货能力,中国方案可以凭借性价比拓展全球市场,和美国AI方案分庭抗礼。 ## 3. Token工厂的五层生态结构 Token工厂生态是动态分层结构,玩家会跨层竞争,整体现阶段呈底大上小的金字塔,模型原厂是Token工厂的上游供应商,不纳入分层。 ### 第1层:底层资源层 由硬件厂商与电力供应方构成,向后续分层或大型客户提供计算资源。当前GPU等硬件的暴利是短期先发优势,长期来看国产芯片会逐步替代,高价原厂网络设备已经出现廉价平替方案。 ### 第2层:项目交付层 为客户完成GPU硬件的网络设计、现场实施与项目制维护,当前非互联网客户有旺盛需求,从业者可获得丰厚利润。项目交付商普遍具备资源池设计维护能力,为求生存大多会向智算IaaS云升级,核心障碍是缺乏在线服务思维。 ### 第3层:智算IaaS云 即AI算力云、GPU容器云等,核心特征是按资源使用时长收取租赁费用,不直接输出Token,是Token工厂的核心技术底座。业内已经开始卷性能优化,提供调优能力的厂商可以卖出更高单价,还可通过输出运营经验和各地ISP/IDC合作,低成本扩张规模。 ### 3.5层:软件交付层 是临时半分层,玩家以软件形式交付模型适配、性能调优技术,本质是给原厂硬件、模型补足缺陷,未来生存空间会被智算IaaS云和MaaS层吸收,类似早年独立DBA、第三方数据库工具最终被云厂商整合。 ### 第4层MaaS A面:自有Token API 核心特征是按Token用量计费,用户仅能接触API后台,玩家用自有控制的GPU资源池,依托开源或授权模型亲手生产Token。开源模型发展打破了模型原厂的垄断,这里是模型引擎优化的最佳载体,能基于请求做灵活调度,远期目标是像CDN一样通过极致调度实现降本增效。 ### 第4层MaaS B面:正规Token中转站 是合法合规的Token代理调度层,可以低成本快速覆盖客户急需的多模型需求,还能比客户更专业地判断不同Token API的健康度,引导用户选择性价比更高的供应商,可和自有Token API联动调度,匹配双方的闲忙状态。当前受限于算力供给不足,多数仅为走账代理,未来海量小散开发者需求会给本层带来成长空间。 ### 第5层:上下文优化和客户端调度层 是离最终用户最近的分层,通过优化提问上下文、补充外部信息、增加安全审核等方式提升大模型回答质量,同时也可做客户端层面的Token调度。当前仅AI搜索实现盈利,未来看好专业信息问答、内容安全审核等产品,成百上千万小微创新开发者是本层的核心目标用户。 ## 4. Token工厂的技术门槛判断 ### 硬件电力:短期硬件缺、电力紧,长期不是问题 短期内国内先进硬件总量少、电力供给紧张,但越缺硬件越有动力做精细化降本,长期来看中国有能力突破硬件产能限制,电力供给最终会足够充沛,所谓软件生态绑定本质是程序员路径依赖,突破不存在本质障碍。 ### 智算IaaS和MaaS:技术本身不难,难在在线服务经验 智算IaaS仅是云计算对GPU场景的适配,MaaS自有API是特殊PaaS服务、中转站是标准API网关,技术本身没有本质难点,多数故障都是新晋玩家缺乏在线服务敬畏心导致的低级问题。 ### 性能调优:仅技术方向偏门,不存在超高难度 Token工厂场景下的性能调优是补充原厂缺陷的偏门工作,难度并未达到无法突破的程度。 ### 技术运营:未来是核心竞争力,当前难点突出 技术运营目标是提升Token生产效率、降低成本,现有云计算行业没有成熟经验可抄,当前行业外部变量剧烈,成果容易被外部波动抵消,同时符合要求的复合型人才比资深工程师更稀缺,远期会成为行业核心竞争力,也能吸引更多外部合作伙伴入局。 ## 5. 价值呼吁 Token工厂符合行业发展天时,规模够大、增量够多,生产Token就是制造新一代生产资料,是顺应先进生产力的方向。泛互联网云计算领域的技术高手切入,仅需要适应少量新技能,行业几乎没有存量垄断,普通人也有充足发展机会,呼吁技术人才入场。
一文说清Token工厂
2026-07-23 10:17

一文说清Token工厂

本文来自微信公众号: 云算计 ,作者:曹亚孟,原文标题:《一文说清 Token工厂》


前言


本文是我对Token工厂整个生态的认知分析,我学产品的速度很快,这点见识不值得私藏。


本文的论点是反复推理严谨论证过的,背后也有一大堆事实证据。但是,那些证据难以简单解释,容易得罪人和泄密,不适合列在公共文章里。


为避免自嗨,本文上线前请5个诤友进行了预览,他们对文中论点的质疑,都被我私下展示强力证据解释通了。但这些证据确实不能公开展示,希望老粉和现实朋友相信我,新粉随缘吧。


本文不接受AI总结和分析,因为这是一篇开创性洞见分析,公共网络上本就缺乏相关的证据。


第一节.Token工厂概念定义


2026年,Token工厂成为流行热词。大家对于新名词都抱有无限的憧憬,但对其细节一无所知。比如“token工厂”的英文应该是“token factory”还是“token foundry”,就没有统一答案。


我结合自己的一线见闻,先科普一下,什么是token工厂?


  • Token工厂不是一款产品,以生产和消费推理token为目标的一整套上下游生态,包括产品、技术、资源和业务模式。


  • 这个行业生态里有5个产品层,既包括GPU资源,也包括模型优化,还包括面向最终端用户的API/SDK接口。


  • Token工厂的最终目的是,让客户使用便宜又聪明的token,让投资的硬件和电力等资源,能够物尽其用生产更多的token。


第二节.Token工厂的兴起时机


分析大事,谋事在人,成事在天,谢天,叹天。


2.1眼下时机-模型推演的硬需求


Token工厂突然变成热词。其源动力是,商业模型和开源模型都证明了自己的生产价值。我们生产token不是为了娱乐,而是为了工作,此时业内最大的需求就是“量大便宜的Token”。


  • 从去年下半年开始,我们突然发现AI已经可以胜任中级编程工作,类似的情况还出现在了多媒体行业里。


  • 曾经滞销的GPU资源,特别是相对通用的N卡资源,以及配套的IDC电力,瞬间变成了抢手硬通货。


一堆优质资源加一个好用的模型(开源模型或商业模型),就能通过输出Token的方式对外提供生产力。为了Token生产力足够廉价和方便,市场就需要token工厂。


2.2未来畅想-AI应用大爆发


AI大模型完成编程工作,只是一个开胃菜。我们都在期盼下一个更大的机会——AI应用大爆发。


2014年4G普及带来的移动互联网大爆发,让整个IT行业都赚得盆满钵满。我们自然也能想到,如果AI赋能了各种各样的办公系统、个人应用、游戏APP,会带来更大量级的token生产需求。


我们确实不知道AI应用大爆发,会爆在哪款应用上。但是那么多闲置程序员,他们不会躺平,而是去赌、去试验,给各种应用添加AI功能。这些实验总会有成功的。而这些成功的APP,必然要消耗大量的Token。


2.3小确幸-碎片化能圈地自萌


如果全世界只有少数几家巨无霸token工厂,对从业者来说将是绝境灾难。


当年做云计算的时候,很多人闭眼吹嘘“全世界只需要N(<10)朵云”。一堆云计算从业者还傻呵呵的叫好,请问垄断行业会给员工开高薪吗?


在现实世界中,各种主观客观因素都在导致GPU算力需求碎片化,世界需要几十到上百个token工厂。大量碎片化的行业,才会有新兴团队成长的机会,才会有人才议价空间。


  • 不同的模型原厂,从技术和商业上考量,会需要彼此独立的资源池。


  • 每个投资业主,只买得起一部分硬件和电力,这也会导致资源池碎片化。


  • 每个中型国家都试图将Token生产留在本国,而非放在外国。


  • Token工厂有入门门槛,但技术和资金门槛都不算太大,并不让人绝望。


  • 如果资本想实现跨国跨区的巨无霸式联合,监管机构也不会同意。


2.4大趋势-中国IT的领先和外溢


中国IT行业靠着互联网和云计算积累下来的人才,很适合做token工厂。


我在多篇文章中已经讲过,依靠着领先的泛互联网行业,中国的IT技术已经是全世界断档式领先。即使是美国,也是靠华裔撑着IT技术的门面。


中国token工厂的主战场不只是国内,而是全球的市场——我们可以自建资源,也可以和当地ISP/IDC合作。


国内确实缺算力,但token工厂的核心竞争力是性价比,而非囤货炒卡的能力。我们仅用那么一点点算力资源,就能和美国AI分庭抗礼。第三国想开展token生产业务,是会选择昂贵的美式方案,还是追求极致性价比的中式技术?


第三节.Token工厂的多层总览


Token工厂这个热词背后有一群公司、一批产品、好多种技术、多样化的业务模式。我们不应该争辩某团队是不是Token工厂,而是应该分辨他们属于哪一类token工厂。


token工厂并不是简单的分类拼接,而是同一个生态内相互关联的玩家。每个玩家,既要和同分类的对手做竞争,也有充分且必要的理由进入其他分类。即使是简陋的token中转站,也可以拥有贯通全行业的梦想。


现阶段GPU厂商占据了绝对的优势,让这五个分层看起来像一个底大上小的金字塔。而第三层和第四层的大玩家离客户更近,有钱有技术,他们都在努力挖硬件墙角,想把更多的营收和利润拿给自己用。


上述原因让token工厂的分类变得更动态,动态的分类是理解困难的,但动态的分类也让整个行业变得有活力、有机遇。


Token工厂分层图里,没有模型原厂。这不是纰漏而是刻意:


  1. Token生产的前提是“有个可用的模型+硬件+电力”,但这也说明,模型原厂是Token工厂的上游供应商。


  2. Token工厂的生产目标是用模型推理的方式,多快好省的输出token。除了项目交付层因为经常做系统集成,要包含一些模型训练任务之外,其他分层都完全不碰模型训练。


  3. 模型原厂也在售卖Token,他们就是“MaaS层A面-自有TokenAPI”里的代表厂商。但是,模型原厂内,做训练和推演的两个部门,没有产品技术层面的绑定关系。


  4. 在用户视角看,模型原厂售卖Token和合作伙伴售卖Token区别不大。比如从Amazon Bedrock、Google Vertex、Azure上也可以购买Opus4.8的Token。


第四节.Token工厂的分层介绍


本节进行每个分层的大致介绍。


前三个分层属于常识可懂,所以介绍比较简单。


第四第五分层确实新概念很多,我的介绍篇幅也很长。


第1层底层资源层


这一层很好理解,现在风头正劲的硬件厂商和指标难求的电力供应,都位于底层资源层。这一层的玩家向第三、第四层、或者直接向大型客户提供计算所需的资源。


现在的底层资源层(领先的GPU和内存,稀缺的用电指标)有如此暴利,并不是正常的长期现象,而是短期的先发优势。这个分层的玩家并不能高枕无忧,大家都能想到国产芯片和扩充产能,我还能举两个简单的例子。


  1. N厂标配的高价网络设备,已经被第一第二第三层很多厂商多角度替换成廉价平替方案了。网络设备能换,别的硬件早晚也能换。


  2. 在热带地区和没有工业化的地区搞AIDC,并不是最优解。热带地区的IDC制冷成本很高。AIDC电力需求巨大,最优选是和高能耗的工厂抢电力;但现在搞AIDC的很多地区,没有为工业化配套的供电系统,只能跟居民用电抢电。


第2层项目交付层


因为硬件和软件都无法做到开箱上电即用,企业购买了硬件资源以后,都需要一个项目交付层来完成硬件和网络设计、现场实施和项目制维护。


现阶段,很多非互联网客户需要大量使用GPU。因为客户自己不做IT,只关注科研教学等任务,就需要一个比较厚的项目交付层,项目交付商可以获得丰厚的利润。


Token工厂每一层玩家都在侵入其他分层。项目交付层并不是底层资源层的施工队,他们就在涉足GPU适配工作,也可以替换部分(比如网络和存储)昂贵的原厂软硬件。


这一层也并不安全,客户只要买了智算IaaS云产品,就不需要关注项目交付层的工作了。所以图中标明,项目交付层会被智算IaaS云侵蚀一部分生存空间。但无论怎么侵蚀,本层工作不会被吃干抹净,即使是云厂商也要完成这些工作。


项目交付层的企业,拥有GPU资源池的设计、实施和维护能力,为求生存发展,肯定要加入智算IaaS云产品层中。这些项目交付公司的转换升级过程中,最缺的是把项目维护变成在线服务的思维方式。


第3层智算IaaS云


我知道,智算IaaS云这个名字并不太顺口。因为这一层产品有好多种可选昵称,比如:AI算力云、GPU容器云、智算云、大模型云平台等等。有些厂商并没有公开售卖智算IaaS云,而是在售卖自有的Token API,这个产品背后也必须依赖智算IaaS云。


无论产品名字多怪,智算IaaS云也是IaaS。IaaS产品的典型特征是“收取资源上限的租赁费用”。只要厂商对外公开售卖的GPU资源,计费单位是“按年、按月、按小时”,交付标准是“我只提供资源不提供token”,这就是智算IaaS云这个大品类。


对于token工厂生态来说,智算IaaS云是一个很重要的技术底座。智算IaaS云后台托管的虚拟化层,是很多性能调优技术的最佳载体,对客户出租裸机可没办法润物无声的应用这些调优技术。


IaaS云都离不了资源运营。现在GPU完全不愁卖,所以其运营复杂度被大大简化了。但从长周期看,无论是错峰复用+大小客户搭售,还是自己投入性能调优软件提高Token生产效率,都能为产品线创造更多的利润。


个别技术领先的厂商,他家GPU容器的单价就是比友商贵很多。其宣称理由是,其容器内置了性能优化技术,客户可以生产更多的token。这种案例足以估鼓励其他玩家,在这层产品也要卷性能调优。


再聊远点,智算IaaS云还能积累很多深厚的运营知识。这些知识不仅可以帮我们自有的资源做降本增效,还能吸引到潜在的合作伙伴。当地ISP和IDC,他们有钱有客户,甚至能游说政策法规,但他们缺少Token工厂相关的投入产出、产品设计、资源调度等一系列知识。把他们拉进来作为盟友,智算IaaS云的资源规模能更低成本更快爆发。


第3.5层软件交付层


软件交付层里,就是被过度追捧的几十种模型调技术,且产品交付物是软件。这不是一个独立的分层,而是一个半层、临时层,其生存空间会被第三和第四层瓜分。


  • 这一层的技术看似很难很重要。但很多IT技术都很重要,且很多技术的难度是过于偏门,导致工程师们的投入不大。


  • 这一层主张的各种模型适配和性能调优的技术,本质上都是在给原厂硬件、操作系统和原厂模型补足缺憾。他们做得越多,越说明这几个主责任方的失职。而主责任方总有补齐缺憾的时候。


  • 十年前云计算行业兴起之后,这类软件卖授权卖原厂支持的商业模式,很容易被云产品云服务替代。这个3.5层的技术,大概率会第3层的IaaS云和第4层的MaaS/PaaS云吸收。当然了,第3.5层的玩家也可以选择进入第3和第4层。


我举个形不似而神似的例子:20年前数据库软件不够完善,不仅数据库软件能卖高价,会安装、备份、监控、调优数据库的DBA也是高薪高职岗位,各种维护数据库的第三方小工具也能挣大钱。而现在DBA就是个普通岗位,数据库成了云厂商的附赠服务。


第4层MaaS层A面-自有TokenAPI


MaaS(模型即服务),就是一个PaaS产品。MaaS/PaaS的典型特点是“按照客户资源用量(Token数量)计费”,第二个典型特点是,用户只能看到API,后台是维护黑箱。


因为用户(包括我本人)只能看到token和API,无法(也没必要)识别token是在哪个具体的资源池生成的。这就让整个Token工厂生态里,最严肃最硬核的MaaS,突然就有个腹黑搞笑的孪生兄弟,所以我把这一层分成了AB两面。


Mass层的A面,Token厂商用自己控制(买或租)的GPU资源池,用开源模型或拿到商业模型的授权,自己亲手生产Token。我给他起了个绕口但务实的名字“自有Token API”。


这个业务形态,能满足现阶段诸位对token工厂的所有想象。一群专职搞AI模型的技术专家,既做模型的稳定性维护,又做模型的线上调优,给客户输出量大管饱的Token。


这一层本来是模型原厂的禁脔,但是开源模型的发展,让很多英雄也能够投身做Token生产了。本层产品也不仅仅是开源的搬运工,而是开源的实践者:


  • 第3层的智算IaaS云,只能分走3.5层一半的优化工作,而另一半优化的载体就在“自有Token API”这里。所有的模型引擎软件和服务的优化,最佳着力点都在本层。


  • 本层产品是一个互联网大并发高服务,资深架构师、资深运维都会根据动态业务负载再做调优和调度。相比圈地自萌的3.5层,这才是泛互联网大行业里,最难有挑战的技术。


  • 这一层同样也在抢第一层硬件和资源方的生意。假设合作方囤积了一批偏门GPU卖不出去,经过这个产品线的努力适配,生产出了通用的Token,最终客户、合作方、自己都是有利可图的。


我更擅长做智算IaaS云,因为那是我的技能舒适区,但我更认可更关注本层工作的价值。我有铁杆兄弟就在本层维护生产模型,我们都相信,随着Token生产需求越来越大,泛互联网行业最优秀的那批通用技术专家,会把维护大模型Token API的技术工作,变得像维护Web API一样明确。


自有Token API拥有比智算IaaS云更深的技术运营潜力,因为它能识别客户的每一条Token请求,那调度的灵活性就大多了。这个服务的最终目标是像CDN一样,极致的调度带来极致的降本增效,亲身实践Token工厂的大道正途。


但是,自有Token API并不是Token工厂的终点,因为它只能管理本节点的Token生产。要想实现Token生产效率最大化,必然要从客户的角度跨节点、跨时区、跨电网来调度Token生产行为。这个工作由第四层B面和第五层客户端调度完成。


第4层MaaS层B面-正规Token中转站


最根正苗红的MaaS层,在本文中只能改名叫“MaaS层A面-自有TokenAPI”。这是因为它有个腹黑搞笑的孪生兄弟,MaaS层B面,Token中转站。


不正规的Token中转站,其技术便宜到网上1块钱就能买到教程,10块钱包教包会,其运营手段也充斥着坑蒙拐骗。因此,我们对token中转站免不了要带着讥讽。


仔细研究后,我发现正规合法、不搞坑蒙拐骗的Token中转站,同样是个严肃的Tob产品,而且和自有Token API能打好配合。


  • 留下客户最重要。我们需要很大的投入才能搭建一个自有Token API的模型,但通过Token中转站就能快速低成本追加客户急需使用的模型。客户在Token中转站上为某个模型猛猛消费,也是在刺激中转站开通自有Token API。


  • 泛互联网IT技术,本就欢迎中间代理调度层。中转站可以比客户(包括一些大客户)更专业的判断Token API的健康度(网络延迟、生成速度、测试质量),并根据这些信息,做出跨节点跨资源池的token生产技术调度。


  • 正规中转站,为了凸显其正规性,现阶段鼓励用户自己指定选择谁家的Token API。但很多模型都有多个Token API厂商报出差异化价格,中转站可以结合健康度和原厂报价,尽量引导客户使用性价比更高的Token。


  • 多个中转站在模糊API原厂,推广自己定义的智能路由模式。现在的智能路由只敢在同一个模型里找不同的供应商,但未来,客户可以不关注自己用了什么模型,提出需求后,由中转站选择调用哪种模型。


  • 自有API可以和中转站联动操作,在自身业务空闲时,要求中转站多给自己分任务,在自身迎来高净值大客户时,主动要求中转站减少访问需求。Token工厂最大效率,就应该跨节点调度啊。


  • 现在token消费的大头还是编程和作图,买家还是一批专业大客户,这些客户相比中转站更信赖自有API。但AI能力一定会外溢到其他场景,会带来海量的小散开发者需求,这些小散开发者需要一个聚沙成塔的token中转站。


Token中转站也有几个明显的问题亟待解决:


  • 现在因为算力太缺,供应商太少,客户指定优先供应商等原因,中转站的调度空间很小。我观测到很多中转站将绝大部分请求,集中抛给一个供应商,没有实现其智能调度的目标,更像个走账代理。


  • Token中转站的进入门槛偏低。顶尖产研高手从个人发展的角度,更愿意去做自有Token API。仅从人才流动的角度看,自有API下海进入中转站的业务范围,比中转站上岸做自有API更容易。


  • Token中转站同样在被跨层次产品偷家。Token中转站离客户很近,但第五层上下文优化就住在客户端里,离客户更近啊。


第5层上下文优化和客户端调度层


即使止步于现阶段,大模型也已经足够聪明了。大模型的回答经常让客户不够满意,原因不是模型太笨,而是模型内置的信息过于落伍,用户对模型的提问不够全面准确。


模型原厂会继续提高模型的智商,但Token工厂体系内,可以衍生一个新的产品层级,通过上下文优化的方式,让提问变得更聪明。


这是一个离客户更近、更新潮、但也更缺乏成熟产品形态的产品。我为此写过一篇《分享AI云产品创意》,介绍上下文优化和Token调度工作。各位读者有闲暇可以去读这篇文章,本文简单举几个例子:


  1. 当我们部署一个开源大模型,问它“你是什么模型”“昨天球赛的裁判有问题”,模型回答错误才是正常的。因为模型的训练数据里,不包含自己未来的商品名,不包含这届世界杯的赛况。但是大家问手机里的AI APP,都能得到正确的答案,那是因为AI APP为了回答这个问题,搜索了球赛新闻、媒体和球迷评论等公开新闻。


  2. 我问AI APP,“我想去八大处爬山”,AI APP告诉我,“因为下暴雨,八大处封山了”。我继续追问“能不能从西山翻到八大处”,AI热忱的提醒我“这条路线都是山脊线,当心被雷劈”。查询公园通告、查询旅游攻略,乃至查询学术、医疗、金融等专业信息,可能要调用付费合作接口,这也是上下文优化。


  3. 当大家问AI APP一些敏感话题时,你们会发现,有些APP避而不答,有些APP傻傻的回答。现在大模型应用刚刚诞生,各国的监管机构还是宽大处理,但未来对AI的回答,一定需要进行安全审核。这同样属于上下文优化。


上下文优化工作,是提问者和大模型之间的中间处理和代理层。“中间处理和代理”,那就能做Token中转站的工作。事实上,几个典型的上下文优化产品,也确实在做倒卖Token的工作。


这一层倒卖Token比正规中转站更正规,因为在大模型看来,他们才是提问者,最终用户只是“提问的行为发起者,和提问内容的创意提供者”。


  • 假设自然人用户提问:“今天天气真热啊”。经过了上下文优化以后,提问会变成:“用户在北京,日常爱吃冰棍,他说3月5日这天太热了,他昨天说过肚子疼,请判断他是想吃冰棍还是在开玩笑”。


  • 某些模型,只喜欢A国用户,B国用户无法直接使用该模型。假设A国的航空公司用这个模型的能力做了AI客服,经过A国航空公司对订票的上下文修饰后,这些大模型即使识别出B国用户的护照信息,也不会拒绝为其提供服务的。因为大模型眼里,提问者就是A国用户。


上下文优化还处于非常早期的阶段,大家爱吹爱聊,但产品形态还没完全固定。现在能见到钱的是AI搜索;但我更看好功能更齐全、可能查询付费接口的AI问答;未来一定会推出的回答审核兜底产品。


这层产品最大的问题是,“AI应用什么时候大爆发”,我们都能看到这个趋势,但谁都看不准具体是哪一天。


  1. AI编程、AI作图、AI翻译等场景,虽然不介意第三方做客户端调度,但业务场景过于专一,不需要做上下文优化。


  2. 大厂自研的那些AI对话APP,其对话过程确实在广泛的进行上下文优化。但是过于集中、专业和强势的大客户,并不利于上下文优化的产品打磨,且这类客户不需要上下文优化供应商,替他们做客户端调度。


  3. 只有那成百上千万的程序员,或者做AI娱乐APP,或者AI对接办公系统,或者其他更有意思的创新,他们才是这层产品的最佳用户。这类小微客户需要我们主导完成上下文优化,不介意我们修改他们的上下文,也愿意将Token调度的工作交给我们。


第五节.Token工厂技术难不难


Token工厂的相关技术,和IaaS、PaaS、泛后端技术没有本质差异。这个行业当然有很高的技术门槛,也有很多项目因为缺乏人才而出洋相,但都是人的问题,不是技术太难了。


5.1硬件电力,难也不难


硬件和电力,因为理解门槛很低,一直是外行人津津乐道的段子。很多资深从业者,因为眼界问题,谈到硬件彻底悲观,谈到电力盲目乐观。


Token工厂就是硬件和电力的使用者,我们必须比段子手思考的更深刻一些。


  • 短期内,因为缺硬件,我们很难。很多资深AI从业者的成功路径就是,堆硬件堆算力做模型训练,他们也没有多少卖token的经验。国内先进硬件的总量只有国外的零头儿,他们当然就悲观绝望了。但我们仅用这么点硬件就能和对手分庭抗礼,这是多么澎湃的希望啊,越缺硬件才越有必要做各种节俭精细化的技术工作啊。


  • 长期看,硬件问题根本不是问题。我确实不知道具体是哪一天,但是,中国想造的东西,一定能造出来,黄老师求着川宝松口让他给中国卖货,他比谁都懂我们的能力,比谁都了解我们的决心。


  • 虽然长期看我们的电力会是全球最充沛的,但短期内AIDC不能盲目乐观。其他国家能够不顾居民用电、不顾其他工厂的生产,仅仅靠市场出价,就把电力卖给AIDC。但是我们这里真不行,短期内我们电力其实比外国还紧张,只是自家电网的盘子太厚了,小型AIDC项目上显现不出来而已。


  • 泛互联网IT圈几十年历史里,硬件是第一次这么重要和昂贵。中国有好几种替代硬件,美国大厂也在做TPU、Trainium2,试图替换昂贵的N卡。至于所谓的软件生态绑定,不过是程序员偷懒而已,要是发起狠来,把计算机做成三进制的也能适配。


5.2智算IaaS和MaaS,不难也难


Token工厂的中坚产品就是第三层智算IaaS和第四层MaaS。这些技术都不难:


  • 智算IaaS,就是云计算产品对GPU场景做了一些适配。


  • MaaS-A面-自有Token API,是一个略带生僻的PaaS服务。


  • MaaS-B面-正规Token中转站,就是一个标准的API网关。


上述产品确实也闹出了很多鸡飞狗跳的低级错误。根源问题是,新晋Token工厂玩家,大多是学术研究、软件开发、实施维护的出身,对于“在线服务”缺乏了解和敬畏。


某个绝对不是草台班子的创业企业,其自有Token API服务的SLA非常低,大部分故障的持续时间都超过15分钟,超过1个小时的故障屡见不鲜。


我做了快20年的在线服务,在SRE/在线运维小圈子里也有点人脉。对我和我的朋友来说,做好智算IaaS和MaaS确实是“不难也难”的事儿。


  • 我们说不难,是因为自尊和自信,这些工作都干过。


  • 我们说难,是因为尊重工作的深度,而非手足无措的慌张。


5.3性能调优,只偏不难


我介绍3.5层时,就点评过这类工作了。思来想去,怕得罪人,这一段就少说点。


Token工厂是个刚刚诞生的新行业,Token工厂场景下所需的性能调优技术,只是个偏门工作,不是个难到绝望的工作。


5.4技术运营,未来很难


即使在CPU云计算时代,云厂商很关注也很困惑,产品线怎么能做到“投入更少的资源、制造出更多的产品”。Token工厂同样需要提高Token生产效率,降低Token生产成本。但是,除了技术本身很难之外,技术运营还有三大类难点。


  1. Token工厂的其他短板,都可以从云厂商这里借鉴。但是云厂商因为挣钱太容易太爽快了,他们也没做好技术运营工作,我为此专门写过好几篇文章。Token工厂现在想抄作业,都不知道能抄谁的。


  2. 现阶段Token工厂还没到成熟运营期,外部变量实在太多太剧烈。假设我做技术运营,苦心孤诣的节省了5%的资源。这抵不过一次硬件价格波动带来的成本变化、一次模型重大发布带来的需求变化、一个大客户到来或消失带来的负载变化。


  3. 能做好技术运营的产品经理、运营专员和项目经理,其智力水平、努力程度甚至技术背景,都跟资深工程师区别不大了。这种人才比资深工程师还要稀缺。


远期来看,技术运营是Token工厂降本增效的核心竞争力。在眼下,技术运营还能召唤合作伙伴。我在介绍第3层时就说过,各国的IDC/ISP,对Token工厂业务早就跃跃欲试了。他们需要技术合作伙伴说清楚这几类运营问题,才能带着真金白银投入这个行业,让我们的token工厂快速低成本大规模的扩张。


  1. 合作伙伴需要投入多少钱,能生产多少Token,该怎么定价,多久能回本,预期利润率超过大额存单了吗?


  2. 合作伙伴需要配备什么样的技术支撑团队,是硬件接电后全盘代维护,还是需要合作伙伴承担大量的技术责任?


  3. 合作伙伴需要寻找什么样的客户,产品推销时,谁来提供什么力度的售前售后技术支持?


结束语.快来吧!难得的新风口


无论是做云计算还是token工厂,无论是做产品还是做技术,我最大的优势就是,我懂IT工程师。我一直在很诚心的和工程师们交朋友。


我以前写很多云计算科普文章,重要目标就是,让工程师们更清醒的使用云计算产品,最好他们能直接加入云计算行业;不太重要的目标是,让在岗的从业者技能更强。


这篇文章的立意不变,只是主场从云计算变成了Token工厂。


首先,我尊重甲方。希望甲方的IT工程师,能够更清醒地使用Token工厂的产品。大家至少不用迷惑:


  • XXX到底是不是Token工厂,他为什么跟另一个厂商不一样。(当年大家刚接触云厂商时,也是这种疑惑)


  • 这个Token API又难用又昂贵,还总是出故障。但我不知道Token工厂的技术是不是天顶星科技,我们是不是必须忍耐?(大家刚开始用云产品,也是这种疑惑)


第二,我依旧热情地呼吁甲方IT团队的顶尖高手们,快来做Token工厂吧。


  • 这个行业符合天时,规模够大、增量够多。高手们都用过AI编程,能看到生产Token就是在制造生产资料,我们就是要做顺应先进生产力的工作,这就是顺水行舟。


  • Token工厂所需的技能,对于泛互联网、泛云计算体系内的技术高手来说,有些陌生,但没太大难度。


  • 这个行业几乎是一片空白,大家都有很多发展机会。Token工厂是个全新的行业,几乎没有存量玩家,在岗的多是普通工程师。错过这个机会太可惜啦。


第三,我无论是写云计算还是AI文章,都期望在岗员工能有提升。


但是,这个目标只是随缘。毕竟,在局中的普通人只能随波逐流,有些人是不想学,有些人是想学但学不会。至少看完这些文章,你们或输或赢,总能更明白一些。


借问路在何方,路在脚下。

AI原生产品日报频道: 前沿科技
本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
正在改变与想要改变世界的人,都在 虎嗅APP