• 登录
  • 注册

从绿叶到鲜花,AI 推理如何为 NAND“逆天改命”? - 功能介绍

在数字体育快速发展的今天,星空体育APP始终致力于为用户提供稳定、高效的赛事资讯与实时比分服务。进入2026年,我们的客户端在功能定义与用户体验上进行了全面升级,确保每一位体育爱好者都能第一时间获取最新版本与安装指导。

星空体育APP专注功能介绍,为用户提供专业可靠的体验。 - 星空体育APP
王磊 - 高级总监
  • 客户服务
星空体育APP专注功能介绍,为用户提供专业可靠的体验。 - 星空体育APP

NAND 行业长期受制于“技术诅咒”:正如海豚君在《NAND天性 “多产”,闪迪凭什么守 80% 毛利率?》中指出,AI 兴起前的 NAND 本质上属于大宗商品生意——产能只能靠市场残酷出清,技术领先无法转化为溢价,只能做到“比同行亏得少”,销量增长带来的红利被持续降价完全抵消。

问题根源在于供给端产能过剩:通过在同一晶圆上垂直堆叠和横向缩小孔洞,从 BiCS5 到 BiCS11 共五代,闪迪每片晶圆的 bit 产出每代提升 54%,年化复合增长率约 27%。

换句话说,即便不投入一分钱用于扩产(CapEx),bit 产能每年也会自动膨胀近三成。3D 转型期间更是出现了一次性猛增,供给一度远超需求,这让“轻资产”的 NAND 业务在下行周期中比“重资产”的 DRAM 更为惨烈。

而 AI 的爆发,正在改写 NAND 的剧本。本报告中,海豚君重点分析 AI 浪潮究竟如何对 NAND 下游需求带来结构性重塑?

以下为详细分析

1. AI 浪潮究竟如何对 NAND 下游需求带来结构性重塑?

在 AI 之前的消费电子周期中,“主导”需求场景——手机、PC、传统服务器等核心下游增长平稳且可预测,缺乏爆发性变量,因此周期的大起大落实际上是由供给端的无序扩产与急剧收缩所主导。

需求增长源于三大动力:单机容量升级、新兴市场渗透,以及固态硬盘(SSD)对机械硬盘(HDD)的存量替代,进程缓慢而稳定。

稳定的需求,加上刚性的供给增长,导致 NAND 属性被锁定在经典的“硅周期”中:供过于求、价格暴跌 → 原厂减产,低价同时刺激单机容量升级 → 供需再平衡、价格回升 → 原厂在高利润下追高扩产 → 再次陷入产能过剩。

只要 NAND 无法摆脱“外围零件”的定位,这个死循环就无法打破。唯一的出路,是出现一个对价格不太敏感、且与 GPU 算力部署直接绑定的新场景——这正是后来 AI 浪潮所扮演的破局者角色。

(图片链接保持原样)

第二阶段(2025 年之后):AI 推理驱动的结构性爆发

2026 年将成为 NAND 历史上最具标志性的分水岭:数据中心占 NAND 总需求的比重,从 2025 年约 30% 跃升至 2026 年约 45%,历史性地反超智能手机(同期收缩至约 23%),成为最大的终端基本盘。

驱动 NAND 需求的主角,从对价格高度敏感、库存大起大落的消费电子,转变为以 TCO(总拥有成本)和算力回报(ROI)做决策、对价格脱敏的云服务商。

云厂商关心的不再是“这季度颗粒够不够便宜”,而是“能否按时拿到足额的高性能 eSSD,保证未来三年 GPU 基建不掉链子”。从“短期压价”转向“长期保供”,这正是原厂推行 NBM(新型长协模式)的需求侧基础。

伴随基本盘切换,AI 重心“由训转推”,更让 NAND 的角色发生质变:

AI 早期,NAND 只是外围的“数据仓库”:存放训练语料、模型权重、防宕机的 Checkpoint(存档)等静态数据,放在 GPU 能快速调取的近端。这些数据可替代性极强——丢失后从数据湖重新下载即可,仅消耗带宽和少量电费,无需动用昂贵的 GPU 重算。

但推理时代,计算转变为高并发、持续性的“动态消耗”——存储需求与“AI 用户数 × 使用频次 × 上下文长度”强绑定。更关键的是,NAND 首次存储“计算的中间产物”。

长文本推理产生的庞大 KV Cache 并非外部搬来的静态数据,而是 GPU 大量消耗算力后生成的“工作记忆”。它一旦丢失,中央仓库没有备份,只能再次耗费昂贵的 GPU 算力和电费重算。

存储的价值第一次可以直接折算成“算力与电费”。正如闪迪所说——SSD 本质上已经进化为一块“Token 电池”:Token 是已经做过的功,与其丢弃重算,不如“充”入硬盘;存储 KV Cache 就是帮云厂商省电、省算力。

铠侠的预测也印证了这一趋势:数据中心 NAND 总需求将从 2025 年的 286 EB 增至 2031 年的 1,686 EB(CAGR 34%),且内部结构极度分化:

AI 推理: 从 2025 年的 86 EB 激增至 2031 年的 1,251 EB,CAGR 高达 56%;占数据中心 NAND 需求的比例也从 30% 攀升至 74%。

AI 训练与传统负载: 同期 AI 训练的 CAGR 仅 11%,传统云工作负载(以 CPU 为主)仅 14%。

推理需求的增速是训练的 5 倍——本轮 NAND 超级行情,将主要由推理需求的爆发主导。

(图片链接保持原样)

先看 NAND 在 AI 数据中心的主要应用:

① KV Cache 卸载——NAND 成为 GPU 的上下文存储层

AI 推理时,GPU 必须为每个 Token 实时计算并维护 KV Cache(模型的“工作记忆”)。但早期架构中它是“算完即弃”的消耗品:一轮对话结束,或 GPU 要腾出显存服务下一个用户,HBM 里的 KV Cache 就被清空。

于是用户一旦追问,或多人并发调用同一份超长文档,系统只能把上下文重新喂给 GPU,从头做一次昂贵的 Prefill(预填充)。

Prefill 是推理的第一步:GPU 一口气通读全部输入、算清 Token 间的关联(Attention 机制),再生成一遍 KV Cache——这是整个推理中最吃算力、最费电的环节。

(图片链接保持原样)

过去“用了就丢”,是因为两笔账算不过来:

a. 重算比存起来更便宜: 早期(如 GPT-3 时代)上下文只有 2K Tokens,KV Cache 很小,GPU 零点几秒就能重算完;而存进硬盘要经 CPU 和内存中转、在 PCIe 上“折返跑”,来回耗时甚至超过重算。

b. HBM 又小又贵: GPU 自带显存“寸土寸金”,必须留给当前活跃的计算任务,不可能长期保管已下线用户的历史记忆。

但长文本时代推翻了这笔账:从 2020 年 GPT-3 的 2K Token 到 2026 年主流模型的百万级上下文,六年暴涨 500 倍。重算一次百万 Token 的 KV Cache,要让昂贵的 GPU 满载跑好几秒,需付出算力与电费代价。

这直接促成 KV Cache 的“再定性”:英伟达 ICMS(推理上下文内存存储)架构,正式把它从“算完即弃的临时缓存”重新定义为“AI 原生持久数据”。

(图片链接保持原样)

现在,临时缓存变为长久缓存,这笔账是否算得过来?

a. 容量约束:算法压缩也赶不上 KV Cache 膨胀速度

第一个条件,是 HBM 的扩容速度远追不上 KV Cache 的膨胀。

KV Cache 总量 = 上下文长度 × 并发会话数 × 单 Token 存储量。目前,前两个变量都在被急剧放大:

上下文长度每年翻倍以上:主流模型从 4K、128K 快速演进到 1M+,KV Cache 随之线性放大。

并发与推理轮次爆发——正被三种应用架构急剧放大:

a. RAG(检索增强生成): 问一句话,后台塞进两本书。系统把检索到的大量文档拼接到输入端,送进 GPU 的 Token 远超原始提问,单次任务的 KV Cache 直接拉爆。

b. Agentic Search: AI 从“一问一答”变成自主循环的“规划—调用—评估—再检索”。多步任务把单次 Token 消耗从数百个拉到上百万个。

c. Multi-Agent: 多个 Agent 并发协作,每个独立生成 KV Cache,存储需求随数量成倍叠加。

模型厂商每年至少把上下文扩大一倍,HBM 的物理扩容却接近极限:单卡容量约 2-3 年才翻一倍,且红利还在放缓。

(图片链接保持原样)

判断 KV Cache 是否会溢出,要以单个推理机柜的可用 HBM 池为单位。以 Rubin NVL72 的 21T HBM 容量为例:

部署 2.8T 参数的旗舰 MoE 模型,FP8 下权重占约 2.8 TB;再扣除激活值、分页与框架开销(约占 12%,约 2.5 TB),真正能给 KV Cache 的池化空间上限约 15.4 TB。

不压缩时,10 万 Token 约占 40 GB。即便用最前沿的压缩算法(如谷歌 TurboQuant,16 位压到 3 位、约 5–6 倍无损压缩),100 万 Token 仍要占 67–80 GB。

也就是说,一台造价约 500 万美元的机柜,极限只能同时服务 193–230 个百万 Token 级长度的会话。对企业级云服务而言,这意味着极低的算力变现效率(ROI)。

一旦上下文扩到 500 万 Token,或并发突破这一阈值,机柜级 HBM 池会迅速触顶。因此把 KV Cache 从 HBM 逐级卸载到 DRAM 再到 NAND,往后看是一场必然之路。

(图片链接保持原样)

b. 便宜,也是致命吸引力

哪怕 HBM 容量勉强够用,用它长期留存 KV Cache 在经济上也不成立:HBM4 约 16 美元/GB,eSSD 约 0.3-0.4 美元/GB,前者是后者的 40-50 倍。用它去放几小时都不调一次的“温/冷 KV Cache”,是极度的资源错配。

为此英伟达确立了新的分层内存架构:G1 HBM → G2 系统 DRAM → G3 本地 SSD(NAND)→ G4 共享网络存储(NAND/HDD),由 NVIDIA Dynamo 在软件层统筹,让 KV Cache 在各层间透明迁移。

英伟达估计,大规模多智能体推理下每个 GPU 模组最高需要 16 TB 的 KV Cache,因此在 Rubin 平台构建了 ICMS/CMX 上下文存储层,位于 G3 本地 SSD 与 G4 共享存储之间,定义为 G3.5 层——因为 G3 容量有限、不能跨节点共享,撑不住多智能体的大规模复用。

CMX 单层容量约 16TB,是单卡 288GB HBM 的近 60 倍——NAND 够便宜,才能做到量大不贵。

(图片链接保持原样)

c. 改用 NAND,时延上来得及吗?

卸载值不值得,最终看 TTFT(首 Token 时延)——只有“从 SSD 读回来”的时间和成本低于“用 GPU 重新算一遍”,卸载在商业上才成立。

GPU Direct Storage(GDS)是跨越门槛的关键:它绕过 CPU 和 DRAM,通过 PCIe/RDMA 在 eSSD 与 GPU 的显存之间修一条直连高速路。

据公开验证,GDS 结合压缩技术可把 KV Cache 的恢复时延改善 10 倍,让超低时延的上下文交付在工程上成为现实。

(图片链接保持原样)

NAND 存储 KV Cache 的数据类型:“共享型记忆”和高频复用

即使跨过容量与成本的门槛,KV Cache 要卸载到 NAND 里,还需满足两个条件:

条件一:必须是共享型缓存

a. 短暂型缓存(逐字生成的草稿):HBM 承载

AI 逐字回答(Decode 阶段)时,每吐一个字都要全量重读历史上下文。此时强行写 SSD,一是带宽不够、会卡死 AI“说话”的节奏(速度墙),二是高频碎片化追加写几周就能耗尽企业级硬盘的寿命(寿命墙)。所以这类草稿禁止落盘,必须留在 HBM 显存中。

b. 共享型缓存(静态打包案卷):NAND 来存

只有当 AI 刚读完超长提示词(Prefill 阶段)、用户切出对话或 Agent 挂起任务时,产生的才是算完、可整段打包写出的完整上下文。它“块大、顺序、低频”,像整箱搬运定稿档案,与 NAND 大块连续读写完美契合,这类数据才可以卸载到 NAND 层。

(图片链接保持原样)

条件二:高频复用才能“值回票价”

除了可用,经济也要可行:卸载净收益 = 复用次数 × (重算算力成本 − 读回成本) − (写入成本 + 占位存储成本)

GPU 重算既费电又费算力,已算好的缓存从 SSD 读回,只要被复用 1 到 2 次就能盈亏平衡。挑战在于硬盘空间同样稀缺,只有高频复用的上下文,才值这个存储占位。

这最终浓缩为一个核心指标——缓存命中率:命中率越高,边际服务成本越趋近于零。新请求进来时,系统通过“前缀比对”去硬盘取回备份,跳过最烧钱的 Prefill 重算。

正如 Manus 团队指出的:命中缓存的 Token 比未命中的便宜约 10 倍。普通大模型命中率在 40%–70%(MiniMax 71%、Z.ai GLM5 约 40%),多步执行的 Agent 场景则长期企稳在 95% 以上(DeepSeek 实测 98.7%),实现“写一次、读上千次”的红利。

实际使用中,对话变长或 GPU 换用户都会产生中断,当前 KV Cache 就可让出 HBM 空间。如果这些会话还会被再次调用,就可存到 NAND 中,服务恢复时再载入。

典型卸载场景包括:用户阅读停顿、跨周期历史回溯、Agent 挂起的长空隙、超大规模并发共享,以及企业级知识库调用。

(图片链接保持原样)

KV Cache 分层: AI 推理对存储的拉动不是单点,而是从高性能闪存(pSLC/TLC)到海量温冷存储(QLC),连同 DRAM 与 HBM,把整条企业级存储产品线一起拉起来。

这条通路上,各类存储分工明确:

DRAM(G2)承接活跃任务的“热溢出”: 它是 HBM 的直接缓冲带,收容同一场活跃会话中因显存触顶放不下的 KV 数据。速度快,会话不卡顿,但断电丢失。

NAND(G3–G4)主导高价值资产的“持久复用”: 跨过断电可保留的门槛后,数据进入非易失闪存主导的持久化复用链路,并沿介质特性逐级下沉:

a. G3 直连层(pSLC/性能型 TLC): 承接刚刚换出、随时可能被重新唤醒的温热会话上下文。

b. G3.5 本地网络层(耐久型 TLC): 承接同一算力集群内,需跨节点高频共享的 System Prompt 与 Agent 状态。

c. G4 远端归档层(大容量 QLC/HDD): 承接海量、极低频调用的 RAG 企业知识库与历史对话归档。

(图片链接保持原样)

② Staging 场景:TLC 与 pSLC 的刚性基本盘

据闪迪测算,Staging(类似候场类数据,等待被 HBM 随时调用)占 2030 年 AI 数据中心 NAND 需求的 40%,是最大的单一板块,且全部由 TLC(含 pSLC)包揽。

打个比方:从数据湖调出的数据,先存在紧贴 GPU 主板的高速 NVMe SSD 缓冲区(G3 直连 SSD)。像厨师案板旁的切菜盘——食材从冷库取出先放手边,不必每切一刀跑一趟冷库。

a. 训练侧 Staging:突发覆盖写

核心任务是给模型做“定时存档”(Checkpoint)与数据集暂存。训练万亿参数大模型时,单次存档高达 TB 级,且每隔几十分钟就要滚动保存一次。

虽然现在能让 GPU“边算边存”(异步存档)、不必停工干等,但这么大规模的集中落盘依然会严重挤占带宽;存档拖得越久,对计算流水线的干扰越大。

所以训练侧 Staging 面对双重约束:既要扛住反复覆盖写入的磨损,又要把写入窗口压到最短。

b. 推理侧 Staging:高并发读取

推理侧 Staging 的三大任务,共同特征是读密集、写极少:

模型冷启动与弹性伸缩: 训练机可按月连轴转,但推理机却要随早晚高峰频繁调节容量和开关机,而内存又断电即失。所以新节点上线,都要靠本地 SSD 的强连续读取带宽把参数瞬间搬进空显存,实现“秒级接客”(一天可能触发数十次重载)。

多模型/多版本动态常驻: 生产节点常需同时伺候几十 TB 的“全家桶”(不同尺寸、精度、版本)。单卡显存(288GB)和系统内存与之差一到两个数量级,唯有 4–16TB 直连 SSD 装得下整套工具箱。让极少调用的旧模型霸占昂贵显存是错配,下沉至 SSD 换入换出才是最优解。

(图片链接保持原样)

面对这种极端的 I/O 强度,各类介质逐一被淘汰:

HBM & DRAM: 成本极高且容量稀缺,必须留给活跃的 KV Cache;更致命的是 DRAM 断电即失,而 Checkpoint 的意义恰恰是“系统崩溃后还能恢复”。

HDD: 吞吐量跟不上 GPU 突发的大块写入,且受体积与功耗限制,根本进不了 GPU 计算托盘所在的机柜。

QLC: 擦写寿命约为 TLC 的十分之一(QLC 约 1,

推荐阅读

星空体育APP使用指南:前90天快速上手 - 星空体育APP
  • 工程开发

星空体育APP使用指南:前90天快速上手

星空体育APP全新功能与版本更新解读 - 星空体育APP
  • 自动化

星空体育APP全新功能与版本更新解读

深度解析:体育资讯平台内容管理新趋势 - 星空体育APP
  • AI内容

深度解析:体育资讯平台内容管理新趋势

星空体育APP以提供明确的版本更新日志与更新流程说明,降低用户升级门槛。为核心,带来高效便捷的体验。