本文来自微信公众号: 海豚研究 ,作者:海豚君,原文标题:《从绿叶到鲜花,AI 推理如何为 NAND“逆天改命”?》
NAND是一个被“技术诅咒”的行业:正如海豚君在前篇《NAND天性“多产”,闪迪凭什么守80%毛利率?》中所说,AI爆发前的NAND就是典型的大宗生意——产能由市场无情出清,技术领先换不来溢价,只能“亏得比别人少”,销量增长的红利被降价全部吞噬。
根源在供给端太多产:靠单一晶圆上向上堆叠、横向缩孔,从BiCS5到BiCS11五代,闪迪每片晶圆的bit产出每代增加54%,年化复合约27%。
也就是说,哪怕一分钱扩产(CapEx)不花,bit产能每年也会自动膨胀近三成。3D转型期更是一次性猛增,供给一度远超需求,这让“轻资产”NAND生意在下行周期比“重资产”DRAM更惨烈。
而AI的爆发,正在重写NAND的剧本。本篇报告中,海豚君重点关注AI浪潮究竟给NAND下游需求带来了怎样的结构性重塑?
以下为详细分析
1.AI浪潮究竟给NAND下游需求带来了怎样的结构性重塑?
AI之前的消费电子周期中,“话事”需求场景——手机、PC、传统服务器等核心下游增长平稳可预期,缺乏爆发变量,所以周期的大起大落,实质由供给端的无序扩产与急剧收缩主导。
需求增长来自三大动能:单机容量升级、新兴市场渗透,以及固态硬盘(SSD)对机械硬盘(HDD)的存量替代,缓步而稳定。
稳定的需求,配上刚性提升供给,导致NAND属性被困在经典的“硅周期”中:供过于求、价格暴跌→原厂减产,低价同时刺激单机容量升级→供需再平衡、价格回升→原厂在高利润下追高扩产→再次陷入产能过剩。
只要NAND摆脱不了“外围零件”的定位,这个死循环就打不破。唯一出路,是出现一个不太看价格、且与GPU算力部署直接绑定的新场景——这正是后来AI浪潮所扮演的破局者角色。




第二阶段(2025年之后):AI推理驱动的结构性爆发
2026年是NAND历史上最具标志性的分水岭:数据中心占NAND总需求的比重,从2025年约30%跃升至2026年约45%,历史性反超智能手机(同期收缩至约23%),成为最大终端基本盘。
驱动NAND需求的主角,从对价格高度敏感、库存大起大落的消费电子,换成了以TCO(总拥有成本)和算力回报(ROI)做决策、对价格脱敏的云服务商。
云厂商关心的不再是“这季度颗粒够不够便宜”,而是“能否按时拿到足额的高性能eSSD,保证未来三年GPU基建不掉链子”。从“短期压价”转向“长期保供”,正是原厂推行NBM(新型长协模式)的需求侧基石。
伴随基本盘切换,AI重心“由训转推”,更让NAND的角色质变:
AI早期,NAND只是外围的“数据仓库”:把训练语料、模型权重、防宕机的Checkpoint(存档)等静态数据,放在GPU能快速调取的近端。这些数据可替代性极强——丢了从数据湖重新下载即可,只花带宽和极少电费,不必动用昂贵GPU重算。
但推理时代,计算变成高并发、持续性的“动态消耗”——存储需求与“AI用户数×使用频次×上下文长度”强绑定。更关键的是,NAND首次存储“计算的中间产物”。
长文本推理产生的庞大KV Cache不是外部搬来的静态数据,是GPU大量消耗算力后生成的“工作记忆”。它一旦丢失,中央仓库没有备份,只能再花昂贵的GPU算力和电费重算。
存储的价值第一次可以直接折算成“算力与电费”。正如闪迪所说——SSD本质上已经进化为一块“Token电池”:Token是已经做过的功,与其丢弃重算,不如“充”入硬盘;存KV Cache就是帮云厂商省电、省算力。
铠侠的预测也印证了这一趋势:数据中心NAND总需求将从2025年的286 EB增至2031年的1,686 EB(CAGR 34%),且内部结构极度分化:
AI推理:从2025年的86 EB激增至2031年的1,251 EB,CAGR高达56%;占数据中心NAND需求的比例也从30%攀升至74%。
AI训练与传统负载:同期AI训练的CAGR仅11%,传统云工作负载(以CPU为主)仅14%。
推理需求的增速是训练的5倍——本轮NAND超级行情,将主要由推理需求的爆发主导。



先看NAND在AI数据中心的主要应用:
①KV Cache卸载——NAND成GPU的上下文存储层
AI推理时,GPU必须为每个Token实时计算并维护KV Cache(模型的“工作记忆”)。但早期架构中它是“算完即弃”的消耗品:一轮对话结束,或GPU要腾显存服务下一个用户,HBM里的KV Cache就被清空。
于是用户一旦追问,或多人并发调用同一份超长文档,系统只能把上下文重新喂给GPU,从头做一次昂贵的Prefill(预填充)。
Prefill是推理第一步:GPU一口气通读全部输入、算清Token间的关联(Attention机制),再生成一遍KV Cache——这是整个推理中最吃算力、最费电的环节。


过去“用了就丢”,是因为两笔账算不过来:
a.重算比存起来更便宜:早期(如GPT-3时代)上下文只有2K Tokens,KV Cache很小,GPU零点几秒就能重算完;而存进硬盘要经CPU和内存中转、在PCIe上“折返跑”,来回耗时甚至超过重算。
b.HBM又小又贵:GPU自带显存“寸土寸金”,必须留给当前活跃的计算任务,不可能长期保管已下线用户历史记忆。
但长文本时代推翻了这笔账:从2020年GPT-3的2K Token到2026年主流模型的百万级上下文,六年暴涨500倍。重算一次百万Token的KV Cache,要让昂贵的GPU满载跑好几秒,有算力与电费代价。
这直接促成KV Cache的“再定性”:英伟达ICMS(推理上下文内存存储)架构,正式把它从“算完即弃的临时缓存”改定义为“AI原生持久数据”。

现在,临时缓存变长久缓存,这个账是否算得过来?
a.容量约束:算法压缩也赶不上KV Cache膨胀速度
第一个条件,是HBM的扩容速度远追不上KV Cache的膨胀。
KV Cache总量=上下文长度×并发会话数×单Token存储量。目前,前两个变量都在被急剧放大:
上下文长度每年翻倍以上:主流模型从4K、128K快速演进到1M+,KV Cache随之线性放大。
并发与推理轮次爆发——正被三种应用架构急剧放大:
a.RAG(检索增强生成):问一句话,后台塞进两本书。系统把检索到的大量文档拼接到输入端,送进GPU的Token远超原始提问,单次任务的KV Cache直接拉爆。
b.Agentic Search:AI从“一问一答”变成自主循环的“规划—调用—评估—再检索”。多步任务把单次Token消耗从数百个拉到上百万个。
c.Multi-Agent:多个Agent并发协作,每个独立生成KV Cache,存储需求随数量成倍叠加。
模型厂商每年至少把上下文扩大一倍,HBM的物理扩容却接近极限:单卡容量约2-3年才翻一倍,红利还在放缓。


判断KV Cache会不会溢出,要以单个推理机柜的可用HBM池为单位。以Rubin NVL72的21T的HBM容量为例:
部署2.8T参数的旗舰MoE模型,FP8下权重占约2.8 TB;再扣掉激活值、分页与框架开销(约占12%,约2.5 TB),真正能给KV Cache的池化空间上限约15.4 TB。
不压缩时,10万Token约占40 GB。即便用最前沿的压缩算法(如谷歌TurboQuant,16位压到3位、约5–6倍无损压缩),100万Token仍要占67–80 GB。
也就是说,一台造价约500万美元的机柜,极限只能同时服务193–230个百万Token级长度得会话。对企业级云服务而言,这意味着极低的算力变现效率(ROI)。
一旦上下文扩到500万Token,或并发突破这一阈值,机柜级HBM池会迅速触顶。因此把KV Cache从HBM逐级卸载到DRAM再到NAND,往后看是一场必然之路。



b.便宜,也是致命吸引力
哪怕HBM容量勉强够用,用它长期留存KV Cache在经济上也不成立:HBM4约16美元/GB,eSSD约0.3-0.4美元/GB,前者是后者的40-50倍。用它去放几小时都不调一次的“温/冷KV Cache”,是极度的资源错配。
为此英伟达确立了新的分层内存架构:G1 HBM→G2系统DRAM→G3本地SSD(NAND)→G4共享网络存储(NAND/HDD),由NVIDIA Dynamo在软件层统筹,让KV Cache在各层间透明迁移。
英伟达估计,大规模多智能体推理下每个GPU模组最高需要16 TB的KV Cache,因此在Rubin平台构建了ICMS/CMX上下文存储层,位于G3本地SSD与G4共享存储之间,定义为G3.5层——因为G3容量有限、不能跨节点共享,撑不住多智能体的大规模复用。
CMX单层容量约16TB,是单卡288GB HBM的近60倍——NAND够便宜,才能做到量大不贵。

c.改用NAND,时延上来得及吗?
卸载值不值得,最终看TTFT(首Token时延)——只有“从SSD读回来”的时间和成本低于“用GPU重新算一遍”,卸载在商业上才成立。
GPU Direct Storage(GDS)是跨越门槛的关键:它绕过CPU和DRAM,通过PCIe/RDMA在eSSD与GPU的显存之间修一条直连高速路。
据公开验证,GDS结合压缩技术可把KV Cache的恢复时延改善10倍,让超低时延的上下文交付在工程上成为现实。


NAND存储KV Cache的数据类型:“共享型记忆”和高频复用
即使跨过容量与成本的门槛,KV Cache要卸载到NAND里,还需满足两个条件:
条件一:必须是共享型缓存
a.短暂型缓存(逐字生成的草稿):HBM承载
AI逐字回答(Decode阶段)时,每吐一个字都要全量重读历史上下文。此时强行写SSD,一是带宽不够、会卡死AI“说话”的节奏(速度墙),二是高频碎片化追加写几周就能耗尽企业级硬盘的寿命(寿命墙)。所以这类草稿禁止落盘,必须留在HBM显存中。
b.共享型缓存(静态打包案卷):NAND来存
只有当AI刚读完超长提示词(Prefill阶段)、用户切出对话或Agent挂起任务时,产生的才是算完、可整段打包写出的完整上下文。它“块大、顺序、低频”,像整箱搬运定稿档案,与NAND大块连续读写完美契合,这类数据才可以NAND层。


条件二:高频复用才能“值回票价”
除了可用,经济也要可行:卸载净收益=复用次数×(重算算力成本−读回成本)−(写入成本+占位存储成本)
GPU重算既费电又费算力,已算好的缓存从SSD读回,只要被复用1到2次就能盈亏平衡。挑战在于硬盘空间同样稀缺,只有高频复用的上下文,才值这个存储占位。
这最终浓缩为一个核心指标——缓存命中率:命中率越高,边际服务成本越趋近于零。新请求进来时,系统通过“前缀比对”去硬盘取回备份,跳过最烧钱的Prefill重算。
正如Manus团队指出的:命中缓存的Token比未命中的便宜约10倍。普通大模型命中率在40%–70%(MiniMax 71%、Z.ai GLM5约40%),多步执行的Agent场景则长期企稳在95%以上(DeepSeek实测98.7%),实现“写一次、读上千次”的红利。
实际使用中,对话变长或GPU换用户都会产生中断,当前KV Cache就可让出HBM空间。如果这些会话还会被再次调用就可存到NAND中,服务恢复时再载入。
典型卸载场景包括:用户阅读停顿、跨周期历史回溯、Agent挂起的长空隙、超大规模并发共享,以及企业级知识库调用。

KV Cache分层:AI推理对存储拉动不是单点,而是从高性能闪存(pSLC/TLC)到海量温冷存储(QLC),连同DRAM与HBM,把整条企业级存储产品线一起拉起来。
这条通路上,各类存储分工明确:
DRAM(G2)承接活跃任务的“热溢出”:它是HBM的直接缓冲带,收容同一场活跃会话中因显存触顶放不下的KV数据。速度快,会话不卡顿,但断电丢失。
NAND(G3–G4)主导高价值资产的“持久复用”:跨过断电可保留的门槛后,数据进入非易失闪存主导的持久化复用链路,并沿介质特性逐级下沉:
a.G3直连层(pSLC/性能型TLC):承接刚刚换出、随时可能被重新唤醒的温热会话上下文。
b.G3.5本地网络层(耐久型TLC):承接同一算力集群内,需跨节点高频共享的System Prompt与Agent状态。
c.G4远端归档层(大容量QLC/HDD):承接海量、极低频调用的RAG企业知识库与历史对话归档。


②Staging场景:TLC与pSLC的刚性基本盘
据闪迪测算,Staging(类似候场类数据,等待被HBM随时调用)占2030年AI数据中心NAND需求的40%,是最大的单一板块,且全部由TLC(含pSLC)包揽。
打个比方:从数据湖调出的数据,先存在紧贴GPU主板的高速NVMe SSD缓冲区(G3直连SSD)。像厨师案板旁的切菜盘——食材从冷库取出先放手边,不必每切一刀跑一趟冷库。
a.训练侧Staging:突发覆盖写
核心任务是给模型做“定时存档”(Checkpoint)与数据集暂存。训练万亿参数大模型时,单次存档高达TB级,且每隔几十分钟就要滚动保存一次。
虽然现在能让GPU“边算边存”(异步存档)、不必停工干等,但这么大规模的集中落盘依然会严重挤占带宽;存档拖得越久,对计算流水线的干扰越大。
所以训练侧Staging面对双重约束:既要扛住反复覆盖写入的磨损,又要把写入窗口压到最短。
b.推理侧Staging:高并发读取
推理侧Staging的三大任务,共同特征是读密集、写极少:
模型冷启动与弹性伸缩:训练机可按月连轴转,但推理机却要随早晚高峰频繁调节容量和开关机,而内存又断电即失。所以新节点上线,都要靠本地SSD的强连续读取带宽把参数瞬间搬进空显存,实现“秒级接客”(一天可能触发数十次重载)。
多模型/多版本动态常驻:生产节点常需同时伺候几十TB的“全家桶”(不同尺寸、精度、版本)。单卡显存(288GB)和系统内存与之差一到两个数量级,唯有4–16TB直连SSD装得下整套工具箱。让极少调用的旧模型霸占昂贵显存是错配,下沉至SSD换入换出才是最优解。

面对这种极端的I/O强度,各类介质逐一被淘汰:
HBM&DRAM:成本极高且容量稀缺,必须留给活跃的KV Cache;更致命的是DRAM断电即失,而Checkpoint的意义恰恰是“系统崩溃后还能恢复”。
HDD:吞吐量跟不上GPU突发的大块写入,且受体积与功耗限制,根本进不了GPU计算托盘所在的机柜。
QLC:擦写寿命约为TLC的十分之一(QLC约1,000次,TLC约10,000次)。Staging是AI存储栈中写入最重的环节,QLC寿命会迅速耗尽——这是硬约束,而非成本权衡。
这样,TLC正好适合Staging,但TLC在部分场景下还不够,由此衍生出pSLC:
pSLC,是把TLC或QLC颗粒当SLC用——本可存3 bit或4 bit的Cell只存1 bit。换来更长的耐久度和更低的写入延迟,代价是牺牲约三分之二有效容量。
直接后果是:要达到与标准SSD相同的有效容量,需要3-4倍晶圆产出。核心触发场景是RAG与Agentic Search的高频向量检索。
AI智能体做大规模向量检索新特征(如下),逼着NAND必须以高速pSLC模式运行:
a.找得太碎(访问粒度极细):AI搜索知识库时往往只需比对一小串特征(几百字节)。但标准TLC SSD是个“死脑筋”,哪怕只要一个字,也得把整页(4KB)全读出来,浪费读取带宽。
b.问得太密(并发强度极高):现在的AI会自己做计划、调工具、反复查资料,单次任务瞬间裂变成成千上万个密集的“查字典”请求。标准TLC SSD在高并发下迅速排队饱和。
c.边读边写(读写双向承压):AI智能体会一边查一边更新索引、记录中间状态。这种“一边翻书一边做笔记”的强度会让普通TLC寿命快速耗尽,而pSLC寿命是它的十几倍。


但承载这一层的下一代直连架构——NVIDIA Storage-Next(G2.6层,位于G2.5 CXL内存之下、G3本地SSD之上)——仍处在英伟达主导、与铠侠等厂商协同定义规格的阶段。
它的定位,是在DDR与本地SSD之间新增一层直连GPU的pSLC存储层,让NAND具备接近DRAM的IOPS与访问粒度(512B细粒度随机访问),同时保留低成本、大容量优势。



③Fast Data Lake场景:QLC的主战场
如果说GPU直连SSD是案板旁的“切菜盘”,存储需要读写双能。G4远端网络层的Fast Data Lake(快速数据湖)就是AI数据中心的“远端中央总仓”,以读为主:以PB级容量装下AI运转所需的全部“家底”——训练语料、多模态数据集、各版本模型权重、RAG知识库和推理回流日志。
按闪迪2030年的需求拆分,Fast Data Lake约占AI数据中心NAND需求的25%,几乎全部由QLC承载。
核心问题是:QLC能否替代HDD?海豚君认为需从以下维度分析:

a.热数据——QLC稳坐主位
正在被CPU/GPU高频消费的数据(如正在处理的训练集、等待检索的RAG知识库),需要极高的数据吞吐量。
HDD的机械磁头寻道延迟(毫秒级)与AI所需的微秒级响应差了两个数量级,从一开始就被物理排除。QLC凭借超大容量和读写带宽,在此层是替代的绝对主力。
b.温冷数据:HDD坐主桌
对于“存着备查”和“历史归档”类数据,是否放入QLC取决于两个维度:
①供给侧扰动:短期“假性替代”
短期HDD将出现300EB至400EB的供给缺口。当前部分云厂商用eSSD临时兜底,造成了“加速替代”的假象。
但HDD也能用类似SSD的技术持续拉升产能,被eSSD临时接管的纯容量需求回流HDD,替代逻辑变弱。
②经济账:QLC涨价后算不平
短期因缺货有替代迹象,但后续QLC因热数据层的替代是刚需,导致QLC涨价。当下HDD的每GB价差已飙升至20–25倍。在稳冷层数据存储中,QLC反而难取代HDD。后续要QLC出现大容量低成本的产品面世后,替代概率才可能加大。
因此QLC替代HDD绝非单向线性推进,而是分化为三种叙事:
a.性能关键路径(热数据)上,替代已经完成且不可逆;
b.温冷归档层,高昂价差阻断了正常置换,目前的“替代份额”更多是HDD缺货逼出的“临时补位”,未来面临回流风险;
c.长期胜负手在于大容量高密度QLC量产,能否靠极致“空间与能耗压缩”,在TCO上跨过2-3倍的替换红线。
据闪迪业绩会,超大容量QLC在FQ4'26(2026年4-6月)刚产生首批收入,FQ1'27进入早期爬坡。闪迪预计QLC占整体bit出货的比例,从2025年约20%升至2026财年末的40%,主要由Stargate(超大容量QLC)在云厂商放量驱动。

④HBF:需求上行期权
在传统AI存储层级中,紧贴GPU的HBM虽有百纳秒级延迟与超高带宽,但受DRAM制程限制,单堆栈容量小、成本高;再往下到NVMe SSD,延迟与带宽又出现严重断层。
NAND厂商现在在努力推新品:HBF(High Bandwidth Flash)——它的结构基本是HBM的复刻:多层堆叠、TSV贯通连接上下、与XPU共同封装,只是把DRAM颗粒换成了NAND颗粒
闪迪正开发的HBF,号称堆叠16层NAND、在维持HBM级带宽的同时把容量放大8倍。(参考:从HBM限高到NAND加量,英伟达vs存力到底谁拿捏谁?)。

HBF与HBM并非简单替代关系,而是基于物理特性的优劣互补:
HBF优势是容量大,成本低,但短板同样明确:微秒级延迟让它反应偏慢,不擅长细碎的随机散读;且有物理擦写寿命上限,只能当“只读参考书”,扛不住高频写入。
此外HBF仍在工程推进期:2026年下半年进入试产建线、预计2027年商业化,但紧贴高发热GPU部署的散热标准仍待确立。

由此形成分工:
HBM专注“性能至上”,是旗舰GPU的绝对标配,负责对延迟极敏感的预填充(Prefill)阶段、高频读写的活跃KV Cache,以及要求最高对称读写带宽的训练任务。
HBF主打“容量为王”,接管以顺序读取为主的常规推理、需单机容纳全量模型的长文本与MoE场景,以及读多写少的温冷KV Cache卸载,让中低端GPU甚至未来的边缘设备也能跑超大模型。

因此海豚君认为,HBF不是颠覆HBM,二者共存互补——HBM管延迟敏感的热数据,HBF管容量饥饿的温数据。未来HBF的使用渗透还要继续观察。
闪迪将HBF分成四种部署形态,具体定义可见《AI推理大爆发,“悲催”闪迪真有凤凰涅槃?》。海豚君认为,③增配型(HBF+HBM混搭)和④解耦型(池化)落地可能性最大。
增配型的逻辑最简单:HBM不撤,HBF加进来一起用。GPU厂商不用大改,HBM继续干擅长的活,HBF在旁边装权重和冷KV缓存。SK海力士新提的H3架构就是HBM和HBF混搭——2027年量产、2028年客户上车,是目前阻力最小的路。
解耦型则是把HBF从GPU旁独立出来,像硬盘柜一样池化部署、通过网络连接计算单元。这是未来大方向——NVIDIA的CMX方案推的也是类似的机架级存储池;但它要求网络架构跟着升级,预计2028年之后才可能成为实际选项。


从各厂商路线来看,HBF目前仍处于标准联盟阶段,尚未进入GPU厂商(特别是NVIDIA)的官方架构标准中。
闪迪与SK海力士是当前唯二的实质推动者:双方已于2026年初成立标准联盟并建起试产线,比原计划提前半年——预计2026年底造出芯片,明年推控制器,2027年冲刺量产。
谷歌、英伟达、AMD等最早要到2028年才可能作为客户采用,但采用≠定义——HBF真正进入GPU厂商的架构体系,还要过标准认证、参考设计集成、生态适配等关卡。
其他厂商:三星有专利储备,但未公开原型与时间表;铠侠走XL-FLASH路线(G2.6 Storage Next),与HBF不直接竞争;美光暂无公开计划。
总体看,HBF产业化时间线虽在加速,但格局本质是“存储厂商在推动,GPU厂商尚未上车”。真正的分化要等2027年样品表现,以及2028年头部客户是否正式将其纳入系统设计。

总结:
AI对NAND的重塑,不只是把需求曲线抬高一个台阶,确实有希望打破“硅周期”宿命:“算力部署与推理负载主导”下,NAND也从“外围零部件”变成“计算路径上的必需品”。
在“由训转推”与长上下文时代,用NAND存KV Cache是保存昂贵的GPU算力与电费资源,SSD一定程度上就是“Token电池”。
据闪迪测算,2030年AI数据中心NAND出货量将达1.2 ZB(较2026年增长约三倍),三大核心负载分工明确:
a.Staging暂存层(占比40%):贴近GPU的极高强度I/O缓冲区,受极端覆盖磨损与高并发限制,由高性能TLC(及pSLC)垄断。
b.KV Cache卸载层(占比35%):推理时代全新增量,承载HBM溢出的动态存储容量,由TLC/QLC梯次承接。
c.Fast Data Lake快速数据湖(占比25%):远端中央数据总仓,由大容量QLC稳坐主位。
按NAND类型计,TLC占66%、QLC占34%:占比最大的Staging因写入强度,天然排斥QLC,TLC稳占基本盘;QLC聚焦数据湖与温冷KV Cache卸载。
这三类负载的演进方向恰好相反:数据湖向“更便宜”走(QLC容量放大),Staging与热路径则向“更快更耐用”走(TLC乃至pSLC,牺牲约三分之二容量换取10倍耐久性)。
而这波涨价的“超级行情”还能飞多久?站在当前估值节点,涅槃后的闪迪是否仍有向上空间?海豚君将继续在下篇为您拆解,敬请期待!
