出品|虎嗅科技组
作者|陈伊凡
编辑|苗正卿
头图|AI生成
这是虎嗅WAIC“追踪Token商业新范式”系列文章第17期。
关于 AI算力的故事,通常以十亿美元为单位讲述——数据中心、万卡集群、只有巨头才付得起的账单。后摩智能的故事是一个例外:它关乎每一个人。
2026年,深圳华强北的电子市场里出现了一种新物种:巴掌大小的铝合金盒子,内置一颗10瓦功耗的芯片,却能运行千亿参数的大语言模型。这个需求,在OpenClaw出来之后,被推向了高点。
联想在此基础上推出了 AI 主机P7,长城电脑发布了 N90Pro AI PC。一个全新的硬件品类正在成形——Agent Computer:专为 AI 设计的硬件载体。
这类端侧设备的心脏,是一颗存算一体芯片,来自一家叫做后摩智能的公司。
如果不是大模型引发的指数级推理需求,市场或许很难注意到后摩智能和存算一体。这家公司至今成立6年,成立前两年,验证了存算一体做大算力端边AI芯片的商业路径的可行性,2023年,押注大模型。那对后摩而言是一个关键节点。这一次,和CEO吴强聊天里,能感受到语气里的高昂和希望。
传统芯片的工作方式,像是一辆跑车必须不停地在仓库和赛道之间往返拉货——每跑一圈计算,就得回仓库取一趟数据,再开回来。路上花的时间和油钱,比真正跑圈的还多。过去这不是问题,因为货少,跑几趟就够了。但 AI 计算的数据量是爆炸性的,相当于每秒钟要跑几十万趟,高速公路再宽,也堵死了。英伟达的 GPU 相当于把公路从四车道拓宽到几十车道,确实快了,但车还是得跑,油还是得烧。
存算一体的思路是:既然搬数据是瓶颈,那就不搬了。把计算直接放到存储内部去做,数据原地不动就能完成运算。吴强打过一个比方:GPU 通用性更好,它除了做 AI 还可以做天气预报、原子弹仿真。但让存算一体芯片做天气预报,非常不合适,可是做神经网络,不管是 CV 还是大模型,都比 GPU 干得好。
吴强 图片由后摩智能提供
2020年底吴强决定创业时,中国半导体正处于国产替代的狂热高峰的三年。中美科技脱钩加速,英伟达高端芯片对华出口受限,一级市场的钱疯狂涌入 GPU 赛道,造富神话一个接一个。壁仞科技成立9个月就拿了11亿 A 轮,摩尔线程成立百天即成独角兽,十几家公司扎堆讲“中国英伟达”的故事,合计融资超过百亿。
朋友也劝吴强直接做 GPU 国产替代,故事好讲,投资人也听得懂,他曾在AMD参与CUDA的早期开发,对GPU的生态熟悉,但他的判断是:“如果我也去做 GPU,刚开始会容易点,但长期来说很难有差异化。”
那个时候,所谓“颠覆英伟达”的技术很多,有人选了光计算,有人选了量子计算,吴强选了存算一体,原因是,它更接近落地和商业化。但即便如此,彼时的存算一体,仍是一种停留在学术论文中的计算范式,去挑战冯·诺依曼体系延续了八十年的统治地位。天使轮融资,好多投资人都听不懂,"当时国内做大算力存算一体的公司几乎没有,国外也只有一两家在探索。
存算一体,这个词显然对大众而言太过陌生和学术。这种存算一体芯片有的用在耳机中,但大算力存算一体,则用在PC、手机、各种边缘服务器上。
转变发生在2023年,大模型之后,吴强判断,未来一定会有很多物理场景需要在本地跑大模型,因为传输越来越昂贵,有隐私问题,时延也不允许,因此大模型端边推理一定是趋势。
2023年下半年,后摩用第一代产品适配了智谱的 GLM-6B 模型,发现存算一体跑大模型效果出奇地好。"所以我们当时就预判,应该为大模型端边推理做一款芯片。"吴强说,那会儿 Agent 还只是一个几乎没人讨论的概念。
过去的端侧 AI 芯片不过是 SoC 里附带的6T 算力,号称"端边 AI“,实际上只能跑一些玩具级的小模型。M50 彻底改变了这个局面:10瓦功耗、160TOPS 算力,可以运行几百亿到千亿参数的大模型。
2024年初,大算力的存算一体芯片M50开始做,2025年初流片,2026年2月正式量产。
2026年上半年,后摩智能收到了超出预期的客户订单。它的客户名单从联想、长城延伸到运营商的通信 AI RAN、陪伴机器人公司,以及一批正在深圳涌现的 Agent 硬件公司,这是一片崭新的增量市场。
吴强说,如果要用一句话概括后摩,是让端侧“免费Token工厂”成为可能。
它背后,是以大模型为主的AI产业正在经历的一次结构性迁移:算力正在从集中式的数据中心,向分布式的终端设备转移,这个结构洞的经济学逻辑,可能比技术本身更具产业的颠覆意义。而后摩,显然是这场需求结构性迁移的受益者。
和吴强聊,我们试图回答几个关键问题,存算一体是否真的能在通用大模型推理上大规模替代 GPU/NPU?在存算一体芯片大规模商业化之后,端侧大模型会不会把 AI 推理从云端按量付费,改造成一次性硬件买断的生意?成本要降到什么程度,Token工厂会进入家家户户?
一场关于"搬不搬数据"的效率之争
虎嗅:六年前确实很少听到存算一体这个概念。那个时候存算一体芯片商业化了吗?国内外有哪些公司在做?
吴强:包括国外在内,当时大部分公司做的都是小算力、超低功耗的方向,比如知存做的是 NOR Flash 的存内计算,用在耳机芯片里。真正做大算力存内计算芯片的,国内当时是零,国外也只有一两家创业公司在探索。
虎嗅:理清一下一个区别,之前的存算一体做的是小功耗的产品,比如耳机。我们现在做大算力的存算一体芯片,替代的是哪类产品?
吴强: 存算一体是一个技术路线。小算力超低功耗的方向用的是模拟计算,存储介质是 NOR Flash。我们这一波的路线大概从2017、2018年在学术界开始,用 SRAM 做纯数字的存内计算,可以把精度做高,把算力和算力密度都做上去。
在大算力这个领域,我们面向的场景不是耳机,而是 PC、手机、各种边缘服务器等。
虎嗅:所以你们对标的是原来的推理GPU 或 TPU?存算一体跟 GPU 相比,客户能感知到的优势是什么?
吴强:对客户来说,他不需要知道底层是存算一体还是常规架构。他能感受到的就是:功耗更低,或者在同等芯片面积下算力更大。
存算一体解决的核心问题是能效比——同等面积下算力更大,带宽更大。比如我们现在在消费终端上,一个手掌大小的盒子里,一颗芯片能跑几百亿到一千亿参数的模型,功耗只有10瓦左右。同样的场景,其他公司的产品可能要大几十瓦。
虎嗅:我能理解为,存算一体能在通用大模型推理上替代 GPU/NPU吗?
吴强: 两者各有侧重:GPU/NPU强在通用性和生态,存算一体强在能效和端侧部署。两者不是互相取代的关系,而是各有不可替代的价值。
虎嗅:现在还有近存计算,近存计算和存内计算有什么区别?
吴强: 近存计算,只是把计算和数据存储拉近了,实际上还有数据搬运,只不过距离变近了。Groq 走的就是这条路。而我们做的存内计算,是真正在存储内部做计算,很多情况下数据是不动的。所以我们的能效比更高,算力密度也更高——同样一个小盒子,可以提供更大的算力。
大模型救活了一条新的路
虎嗅:端侧大模型这件事出来之前,存算一体的市场是什么样的?你们那个时候的市场竞争状况如何?
吴强: 之前也可以做推理,比如计算机视觉的推理——智能驾驶、安防监控。存算一体做 CV 也能做得好,只要是数据为主的矩阵向量相乘的计算,它都比常规架构更高效。但 CV 市场非常红海,格局已定,商业机会不多。
大模型出来以后,第一,这是个新兴市场,机会更多;第二,存算一体做大模型更合适,因为数据量更大,数据量越大,存算一体的优势就越大。
虎嗅:大模型时代,推理的需求爆发,那个时候后摩接到的第一个这一类的需求是来自哪一类的客户?
吴强:存算一体除了可以让 Token 的成本降低,另外一个优势它把功耗做到极致,把成本做到极致。以前端边有很多的AI 芯片,都是小算力。
大模型出来之后,有客户希望在端边跑大模型,特别是今年初,这种需求特别多,客户希望做一个像联想AI主机P7这样的AI终端。
虎嗅: OpenClaw 出来之后,对公司的客户结构有什么变化?
吴强:我们目前客户主要来自四个场景:第一是 Agent Computer,这是增量市场,一个全新的形态;第二是智能终端,包括 PC、会议纪要一体机、实时翻译机,未来还有手机、平板、学习机;第三是具身机器人,目前主要做陪伴机器人;第四是边缘服务器,比如通信类的 AI RAN等。
虎嗅:陪伴机器人公司很多用的是云端方案,因为考虑到端侧部署成本更高,这方面也有后摩的市场吗?
吴强: 现在大部分陪伴机器人确实用云端。但云端方案有几个问题:第一,它赌客户不用。如果客户真的用起来,成本吃不消,而中国用户不习惯付订阅费;第二,隐私问题,如果只是声音还好,但如果有摄像头,大家还是敏感的。
主打便宜的一般用云端,先卖出去再说。但主打体验的、稍微高端的,基本都会有本地算力。比如陪伴机器人,需要能看到你的表情,判断你是不是皱眉、心情不好,这种算法需要本地算力,高净值客户也在意隐私。
虎嗅:你们的芯片能把 Token 生产成本降到原来的多少?
吴强:理论上是一个数量级的提升。当然今天我们还做不到10倍,但至少几倍的提升是现在可以努力的方向。
除了降低 Token 成本,更大的优势是:存功耗和成本做到极致,让大模型在端边运行变成了可能。
虎嗅:从 Token 经济学的角度看,端侧推理和云端推理的成本结构有什么本质区别?后摩的存算一体架构如何改变 Token 的“生产成本”的,这背后的逻辑是什么?
吴强:端边推理和云端推理的结构有本质区别,云端推理是持续消耗的成本结构,用的越多,付费越多。端边推理一次性硬件投入,零边际成本。设备购买后,所有推理任务在本地完成,无Token消费、无调用次数限制。一次性投入之后,使用是个免费token 工厂。
存算一体架构改变Token生产成本的逻辑在于两个方面:首先是存算一体的低功耗、高效率推理可以让token生成的成本降低;其次,更重要的一方面,在端边功耗和成本敏感的场景下,存算一体让足够大的大模型运行变成可能,让免费token 工厂变得可能。
虎嗅:端侧大模型会不会把 AI 推理从云端按量付费,改造成一次性硬件买断的生意?
吴强:端侧模型其实是将AI从一种持续的运营成本,转变为一种可预期的资本投入,为用户和企业提供了一种全新的选择。未来的主流模式更可能是 “端云协同” ,系统自动判断任务该由端侧还是云端处理,在成本、性能和体验之间找到平衡点。
让每个人都能用上免费的Token工厂
虎嗅:这几年在你的观察视角下是否发现了一些新的需求?我们是否有针对这些涌现的新的需求做产品?或者说这些需求对我们的产品提出了什么挑战?
吴强:模型在逐步变大,对算力和带宽的要求在变高,从单一大语言模型向多模态迁移等新的需求,针对这些需求,我们也在做端边能处理更大规模参数的芯片,未来,端边芯片应该能处理接近或超过今天满血版模型的能力,同时,我们针对消费终端的多模态模型需求,也布局了更适合做dense多模态模型的芯片。
虎嗅:你们现在有海外的客户吗?国产模型加国产芯片在国际竞争上是否有优势?
吴强: 我觉得中国未来“Token 出海”是一个很大的机会。
我的逻辑是:免费产品一定是大家用最好的——社交网络、搜索都是这样。但 Token 要花钱,只要花钱,即使你不是最好的,性价比高也有市场。
国产开源模型加国产芯片,绝对能力可能做不到海外 SOTA 水平,但通过性价比,一定能覆盖到国际舞台。我们现在海外客户都是做端边智能设备的,他们的逻辑是:海外网络没有中国那么好,特别是农村地区;对隐私也更敏感。他们很喜欢这种本地的“免费 Token 工厂”——小巧、不依赖网络、足够智能。
你可以把这看成广义的 Token 出口,出口的是一台 Token 机器。
虎嗅:中美在存算一体上的技术差距有多大?
吴强:存算一体的好处是我们跟巨头在同一起跑线上。之前这还是学术界的领域,海外和整个行业走的都是英伟达或 ARM 的路线。存算一体作为新的探索性技术,大家起点一样。而且巨头有更大的包袱。英伟达那套东西已经走得很深了,要用存算一体这种颠覆性技术,意味着把原来的东西通通打破,历史包袱太重。英伟达收购 Groq,也只是拿来配合使用,把大模型里有低延迟需求的部分分给 Groq 做,本质上还是改良,不会放弃 GPGPU。而我们从零开始,没有包袱,整个架构都是存算一体。
虎嗅:我可以理解为,大模型之后后摩的价值也出现了大幅提升,如果拿掉国产替代的叙事,后摩的价值在哪里?
吴强: 今天的格局是:训练方面英伟达还是主导;推理方面国产比例越来越大,大家发现至少在推理上跟英伟达差不多。所以现在拼的不是国产替代,而是都是国产的情况下,谁的性价比更高、性能更好。
后摩从第一天就没有主打国产替代。我们一直说自己是“国产创新”,一直说不能用英伟达的方式打英伟达,要弯道超车。后摩今天的价值是:我们用了一个跟英伟达完全不同的新技术,把它从学术概念变成了现实,做到了量产和商业化,并且在大算力存算一体赛道上走在全球前列——不只是中国前列。
虎嗅:现在其实也有很多做端侧和边缘芯片的厂商,半导体又是一个头部效应很明显的行业,端侧未来还需要那么多家算力芯片公司吗?后摩的竞争窗口期你认为还有多长?
吴强:目前端侧芯片大部分还是控制为主的CPU芯片或者SoC芯片,AI算力一般都很小,传统端边AI芯片算力仅为6-16T左右,随着大模型的普及,算力超过百T的端边大模型芯片,会逐渐成为主导,在这块后摩是先行者。
未来整合的话,端边可能也不超过5家。当然大家会相互试探——比如高通做手机也往 PC 上布局——但每家都有自己的主战场。
虎嗅:如果用一句话描述后摩智能在 Token 新范式中的角色定位,你觉得是什么?
吴强:让端侧“免费Token工厂”成为可能。
虎嗅:或者说家家户户都有一个超节点?
吴强:是的。就是这类“家用超节点”,可以把家里的所有智能设备都连到这上面去。
虎嗅:成本要降到什么程度,Token工厂会进入家家户户?
吴强:现在有的盒子可能在几千块钱,随着市场规模扩大,技术成熟,成本会持续下降。现在,差的可能不是成本,而是一个杀手级应用,让大家觉得“必须拥有本地Token工厂”。一旦这个应用出现,叠加已降至临界点的成本,Token工厂才能真正进入千家万户。
虎嗅:未来5年,后摩面前最大的挑战可能是什么?你觉得真正的威胁可能会来自那些公司?
吴强: 从组织发展角度,今天公司还在生存阶段,大家都很拼,go big or go home。如果5年后真的做到了头部,组织怎么进一步迭代,这是一个挑战。
从产业角度,如果那时候端边已经是很大的市场,竞争会很激烈。端边推理的生态壁垒不像云端训练那么深,所以必须不停提升效率才能保持领先。
我觉得真正的威胁不会来自巨头,会来自另外的创业公司,用一套完全新的技术打法对我形成降维打击。而那个东西是我当时忽略的、没有重视的。
文章标题:把“Token工厂”搬回家,是不是一场好生意
文章链接:https://www.huxiu.com/article/4876593.html
阅读原文:把“Token工厂”搬回家,是不是一场好生意_虎嗅网