---
title: "从绿叶到鲜花，AI 推理如何为 NAND“逆天改命”？"
type: "Topics"
locale: "zh-CN"
url: "https://longbridge.com/zh-CN/dolphin/post/44124083.md"
description: "存 KV Cache 就是存算力，SSD 正变成 “Token 电池”"
datetime: "2026-09-30T02:24:17.000Z"
locales:
  - [en](https://longbridge.com/en/dolphin/post/44124083.md)
  - [zh-CN](https://longbridge.com/zh-CN/dolphin/post/44124083.md)
  - [zh-HK](https://longbridge.com/zh-HK/dolphin/post/44124083.md)
author: "[Dolphin Research](https://longbridge.com/zh-CN/dolphin.md)"
generator: "portal-rs"
---

# 从绿叶到鲜花，AI 推理如何为 NAND“逆天改命”？

NAND 是一个被“技术诅咒”的行业：正如海豚君在前篇《[NAND天性 “多产”，闪迪凭什么守 80% 毛利率？](https://longbridge.cn/zh-CN/dolphin/post/43966452?app_id=longbridge&utm_source=longbridge_app_share&share_track_id=2fe75b8d-e993-417d-9a96-71a7c3f794e7&invite-code=4NOXYT&locale=zh-CN&community_badge=1&profile_following_followers_activities=1&channel=OWSN00110)》中所说，AI 爆发前的 NAND 就是典型的大宗生意——产能由市场无情出清，技术领先换不来溢价，只能“亏得比别人少”，销量增长的红利被降价全部吞噬。

根源在供给端太多产：靠单一晶圆上向上堆叠、横向缩孔，从 BiCS5 到 BiCS11 五代，闪迪每片晶圆的 bit 产出每代增加 54%，年化复合约 27%。

也就是说，哪怕一分钱扩产（CapEx）不花，bit 产能每年也会自动膨胀近三成。3D 转型期更是一次性猛增，供给一度远超需求，这让“轻资产”NAND 生意在下行周期比“重资产”DRAM 更惨烈。

**而 AI 的爆发，正在重写 NAND 的剧本。本篇报告中，海豚君重点关注AI 浪潮究竟给 NAND 下游需求带来了怎样的结构性重塑？**

正文如下：

**1\. AI 浪潮究竟给 NAND 下游需求带来了怎样的结构性重塑？**

AI之前的消费电子周期中，“话事”需求场景——手机、PC、传统服务器等核心下游增长平稳可预期，缺乏爆发变量，所以周期的大起大落，实质由供给端的无序扩产与急剧收缩主导。

需求增长来自三大动能：单机容量升级、新兴市场渗透，以及固态硬盘（SSD）对机械硬盘（HDD）的存量替代，缓步而稳定。

**稳定的需求，配上刚性提升供给，导致NAND 属性被困在经典的“硅周期”中：供过于求、价格暴跌 → 原厂减产，低价同时刺激单机容量升级 → 供需再平衡、价格回升 → 原厂在高利润下追高扩产 → 再次陷入产能过剩。**

只要 NAND 摆脱不了“外围零件”的定位，这个死循环就打不破。唯一出路，是出现一个不太看价格、且与 GPU 算力部署直接绑定的新场景——**这正是后来 AI 浪潮所扮演的破局者角色。**

**第二阶段（2025 年之后）：AI 推理驱动的结构性爆发**

2026 年是 NAND 历史上最具标志性的分水岭：数据中心占 NAND 总需求的比重，从 2025 年约 30% 跃升至 2026 年约 45%，历史性反超智能手机（同期收缩至约 23%），成为最大终端基本盘。

**驱动 NAND 需求的主角，从对价格高度敏感、库存大起大落的消费电子，换成了以 TCO（总拥有成本）和算力回报（ROI）做决策、对价格脱敏的云服务商。**

云厂商关心的不再是“这季度颗粒够不够便宜”，而是“能否按时拿到足额的高性能 eSSD，保证未来三年 GPU 基建不掉链子”。从“短期压价”转向“长期保供”，正是原厂推行 NBM（新型长协模式）的需求侧基石。

**伴随基本盘切换，AI 重心“由训转推”，更让 NAND 的角色质变：**

AI早期，NAND 只是外围的“数据仓库”：把训练语料、模型权重、防宕机的 Checkpoint（存档）等静态数据，放在 GPU 能快速调取的近端。这些数据可替代性极强——丢了从数据湖重新下载即可，只花带宽和极少电费，不必动用昂贵 GPU 重算。

但推理时代，计算变成高并发、持续性的“动态消耗”——存储需求与“AI 用户数 × 使用频次 × 上下文长度”强绑定。更关键的是，**NAND 首次存储“计算的中间产物”。**

长文本推理产生的庞大 KV Cache 不是外部搬来的静态数据，是 GPU 大量消耗算力后生成的“工作记忆”。它一旦丢失，中央仓库没有备份，只能再花昂贵的 GPU 算力和电费重算。

存储的价值第一次可以直接折算成“算力与电费”。正如闪迪所说——**SSD 本质上已经进化为一块“Token 电池”**：Token 是已经做过的功，与其丢弃重算，不如“充”入硬盘；存 KV Cache 就是帮云厂商省电、省算力。

**铠侠的预测也印证了这一趋势：数据中心 NAND 总需求将从 2025 年的 286 EB 增至 2031 年的 1,686 EB（CAGR 34%），且内部结构极度分化：**

**AI 推理：** 从 2025 年的 86 EB 激增至 2031 年的 1,251 EB，**CAGR 高达 56%**；占数据中心 NAND 需求的比例也从 30% 攀升至 74%。

**AI 训练与传统负载：** 同期 AI 训练的 CAGR 仅 11%，传统云工作负载（以 CPU 为主）仅 14%。

**推理需求的增速是训练的 5 倍——本轮 NAND 超级行情，将主要由推理需求的爆发主导。**

**先看 NAND 在 AI 数据中心的主要应用：**

**① KV Cache 卸载——NAND成GPU 的上下文存储层**

AI 推理时，GPU 必须为每个 Token 实时计算并维护 KV Cache（模型的“工作记忆”）。但早期架构中它是“算完即弃”的消耗品：一轮对话结束，或 GPU 要腾显存服务下一个用户，HBM 里的 KV Cache 就被清空。

于是用户一旦追问，或多人并发调用同一份超长文档，系统只能把上下文重新喂给 GPU，从头做一次昂贵的 Prefill（预填充）。

Prefill 是推理第一步：GPU 一口气通读全部输入、算清 Token 间的关联（Attention 机制），再生成一遍 KV Cache——这是整个推理中最吃算力、最费电的环节。

**过去“用了就丢”，是因为两笔账算不过来：**

**a. 重算比存起来更便宜：** 早期（如 GPT-3 时代）上下文只有 2K Tokens，KV Cache 很小，GPU 零点几秒就能重算完；而存进硬盘要经 CPU 和内存中转、在 PCIe 上“折返跑”，来回耗时甚至超过重算。

**b. HBM 又小又贵：**GPU 自带显存“寸土寸金”，必须留给当前活跃的计算任务，不可能长期保管已下线用户历史记忆。

但长文本时代推翻了这笔账：从 2020 年 GPT-3 的 2K Token 到 2026 年主流模型的百万级上下文，六年暴涨 500 倍。重算一次百万 Token 的 KV Cache，要让昂贵的 GPU 满载跑好几秒，有算力与电费代价。

这直接促成 KV Cache 的“再定性”：英伟达 ICMS（推理上下文内存存储）架构，正式把它从“算完即弃的临时缓存”改定义为“AI 原生持久数据”。

**现在，临时缓存变长久缓存，这个账是否算得过来？**

**a. 容量约束: 算法压缩也赶不上KV Cache膨胀速度**

**第一个条件，是 HBM 的扩容速度远追不上 KV Cache 的膨胀。**

KV Cache 总量 = 上下文长度 × 并发会话数 × 单 Token 存储量。目前，前两个变量都在被急剧放大：

**上下文长度每年翻倍以上**：主流模型从 4K、128K 快速演进到 1M+，KV Cache 随之线性放大。

**并发与推理轮次爆发——正被三种应用架构急剧放大：**

a. RAG（检索增强生成）： 问一句话，后台塞进两本书。系统把检索到的大量文档拼接到输入端，送进 GPU 的 Token 远超原始提问，单次任务的 KV Cache 直接拉爆。

b. Agentic Search： AI 从“一问一答”变成自主循环的“规划—调用—评估—再检索”。多步任务把单次 Token 消耗从数百个拉到上百万个。

c. Multi-Agent： 多个 Agent 并发协作，每个独立生成 KV Cache，存储需求随数量成倍叠加。

模型厂商每年至少把上下文扩大一倍，HBM 的物理扩容却接近极限：单卡容量约 2-3 年才翻一倍，红利还在放缓。

判断 KV Cache 会不会溢出，要以单个推理机柜的可用 HBM 池为单位。以 Rubin NVL72 的21T的HBM容量为例：

部署 2.8T 参数的旗舰 MoE 模型，FP8 下权重占约 2.8 TB；再扣掉激活值、分页与框架开销（约占 12%，约 2.5 TB），真正能给 KV Cache 的池化空间上限约 15.4 TB。

不压缩时，10 万 Token 约占 40 GB。即便用最前沿的压缩算法（如谷歌 TurboQuant，16 位压到 3 位、约 5–6 倍无损压缩），100 万 Token 仍要占 67–80 GB。

也就是说，一台造价约 500 万美元的机柜，极限只能同时服务 193–230 个百万 Token 级长度得会话。对企业级云服务而言，这意味着极低的算力变现效率（ROI）。

一旦上下文扩到 500 万 Token，或并发突破这一阈值，机柜级 HBM 池会迅速触顶。因此把 KV Cache 从 HBM 逐级卸载到 DRAM 再到 NAND，往后看是一场必然之路。

**b. 便宜，也是致命吸引力**

哪怕 HBM 容量勉强够用，用它长期留存 KV Cache 在经济上也不成立：HBM4 约 16 美元/GB，eSSD 约 0.3-0.4 美元/GB，前者是后者的 **40-50 倍**。用它去放几小时都不调一次的“温/冷 KV Cache”，是极度的资源错配。

为此英伟达确立了新的分层内存架构：G1 HBM → G2 系统 DRAM → G3 本地 SSD（NAND）→ G4 共享网络存储（NAND/HDD），由 NVIDIA Dynamo 在软件层统筹，让 KV Cache 在各层间透明迁移。

英伟达估计，大规模多智能体推理下每个 GPU 模组最高需要 16 TB 的 KV Cache，因此在 Rubin 平台构建了 ICMS/CMX 上下文存储层，位于 G3 本地 SSD 与 G4 共享存储之间，定义为 G3.5 层——因为 G3 容量有限、不能跨节点共享，撑不住多智能体的大规模复用。

CMX 单层容量约 16TB，是单卡 288GB HBM 的近 60 倍——NAND够便宜，才能做到量大不贵。

**c. 改用NAND，时延上来得及吗？**

卸载值不值得，最终看 **TTFT（首 Token 时延）**——只有“从 SSD 读回来”的时间和成本低于“用 GPU 重新算一遍”，卸载在商业上才成立。

GPU Direct Storage（GDS）是跨越门槛的关键：它绕过 CPU 和 DRAM，通过 PCIe/RDMA 在 eSSD 与 GPU 的显存之间修一条直连高速路。

据公开验证，GDS 结合压缩技术可把 KV Cache 的恢复时延改善 10 倍，让超低时延的上下文交付在工程上成为现实。

**NAND存储KV Cache的数据类型：“共享型记忆”和高频复用**

**即使跨过容量与成本的门槛，KV Cache 要卸载到 NAND里，还需满足两个条件：**

**条件一：必须是共享型缓存**

**a. 短暂型缓存（逐字生成的草稿）：HBM承载**

AI 逐字回答（Decode 阶段）时，每吐一个字都要全量重读历史上下文。此时强行写 SSD，一是带宽不够、会卡死 AI“说话”的节奏（速度墙），二是高频碎片化追加写几周就能耗尽企业级硬盘的寿命（寿命墙）。所以这类草稿禁止落盘，必须留在 HBM 显存中。

**b. 共享型缓存（静态打包案卷）：NAND来存**

只有当 AI 刚读完超长提示词（Prefill 阶段）、用户切出对话或 Agent 挂起任务时，产生的才是算完、可整段打包写出的完整上下文。它“块大、顺序、低频”，像整箱搬运定稿档案，与 NAND 大块连续读写完美契合，这类数据才可以NAND层。

**条件二：高频复用才能“值回票价”**

除了可用，经济也要可行：卸载净收益 = 复用次数 × (重算算力成本 − 读回成本) − (写入成本 + 占位存储成本)

GPU 重算既费电又费算力，已算好的缓存从 SSD 读回，只要被复用 1 到 2 次就能盈亏平衡。挑战在于硬盘空间同样稀缺，只有高频复用的上下文，才值这个存储占位。

这最终浓缩为一个核心指标——**缓存命中率**：命中率越高，边际服务成本越趋近于零。新请求进来时，系统通过“前缀比对”去硬盘取回备份，跳过最烧钱的 Prefill 重算。

正如 Manus 团队指出的：命中缓存的 Token 比未命中的便宜约 10 倍。普通大模型命中率在 40%–70%（MiniMax 71%、Z.ai GLM5 约 40%），多步执行的 Agent 场景则长期企稳在 95% 以上（DeepSeek 实测 98.7%），实现“写一次、读上千次”的红利。

实际使用中，对话变长或 GPU 换用户都会产生中断，当前 KV Cache 就可让出HBM空间。如果这些会话还会被再次调用就可存到 NAND中，服务恢复时再载入。

典型卸载场景包括：**用户阅读停顿、跨周期历史回溯、Agent 挂起的长空隙、超大规模并发共享，以及企业级知识库调用。**

**KV Cache 分层：** AI 推理对存储拉动不是单点，而是从高性能闪存（pSLC/TLC）到海量温冷存储（QLC），连同 DRAM 与 HBM，把整条企业级存储产品线一起拉起来。

**这条通路上，各类存储分工明确：**

**DRAM（G2）承接活跃任务的“热溢出”：** 它是 HBM 的直接缓冲带，收容同一场活跃会话中因显存触顶放不下的 KV 数据。速度快，会话不卡顿，但断电丢失。

**NAND（G3–G4）主导高价值资产的“持久复用”：** 跨过断电可保留的门槛后，数据进入非易失闪存主导的持久化复用链路，并沿介质特性逐级下沉：

**a. G3 直连层（pSLC/性能型 TLC）：** 承接刚刚换出、随时可能被重新唤醒的温热会话上下文。

**b. G3.5 本地网络层（耐久型 TLC）：** 承接同一算力集群内，需跨节点高频共享的 System Prompt 与 Agent 状态。

**c. G4 远端归档层（大容量 QLC/HDD）：** 承接海量、极低频调用的 RAG 企业知识库与历史对话归档。

**② Staging 场景：TLC 与 pSLC 的刚性基本盘**

据闪迪测算，Staging（类似候场类数据，等待被HBM随时调用） 占 2030 年 AI 数据中心 NAND 需求的 40%，是最大的单一板块，且全部由 TLC（含 pSLC）包揽。

打个比方：从数据湖调出的数据，先存在紧贴 GPU 主板的高速 NVMe SSD 缓冲区（G3 直连 SSD）。像厨师案板旁的切菜盘——食材从冷库取出先放手边，不必每切一刀跑一趟冷库。

**a. 训练侧 Staging：突发覆盖写**

核心任务是给模型做“定时存档”（Checkpoint）与数据集暂存。训练万亿参数大模型时，单次存档高达 TB 级，且每隔几十分钟就要滚动保存一次。

虽然现在能让 GPU“边算边存”（异步存档）、不必停工干等，但这么大规模的集中落盘依然会严重挤占带宽；存档拖得越久，对计算流水线的干扰越大。

所以训练侧 Staging 面对双重约束：既要扛住反复覆盖写入的磨损，又要把写入窗口压到最短。

**b. 推理侧 Staging：高并发读取**

推理侧 Staging 的三大任务，共同特征是读密集、写极少：

**模型冷启动与弹性伸缩：**训练机可按月连轴转，但推理机却要随早晚高峰频繁调节容量和开关机，而内存又断电即失。所以新节点上线，都要靠本地 SSD 的强连续读取带宽把参数瞬间搬进空显存，实现“秒级接客”（一天可能触发数十次重载）。

**多模型/多版本动态常驻：**生产节点常需同时伺候几十 TB 的“全家桶”（不同尺寸、精度、版本）。单卡显存（288GB）和系统内存与之差一到两个数量级，唯有 4–16TB 直连 SSD 装得下整套工具箱。让极少调用的旧模型霸占昂贵显存是错配，下沉至 SSD 换入换出才是最优解。

**面对这种极端的 I/O 强度，各类介质逐一被淘汰：**

**HBM & DRAM：**成本极高且容量稀缺，必须留给活跃的 KV Cache；更致命的是 DRAM 断电即失，而 Checkpoint 的意义恰恰是“系统崩溃后还能恢复”。

**HDD：**吞吐量跟不上 GPU 突发的大块写入，且受体积与功耗限制，根本进不了 GPU 计算托盘所在的机柜。

**QLC：**擦写寿命约为 TLC 的十分之一（QLC 约 1,000 次，TLC 约10,000 次）。Staging 是 AI 存储栈中写入最重的环节，QLC 寿命会迅速耗尽——这是硬约束，而非成本权衡。

**这样，TLC 正好适合 Staging，但TLC在部分场景下还不够，由此衍生出pSLC：**

pSLC，是把 TLC 或 QLC 颗粒当 SLC 用——本可存 3 bit 或 4 bit 的 Cell 只存 1 bit。换来更长的耐久度和更低的写入延迟，代价是牺牲约三分之二有效容量。

**直接后果是：要达到与标准 SSD 相同的有效容量，需要 3-4 倍晶圆产出。核心触发场景是 RAG 与 Agentic Search 的高频向量检索。**

**AI 智能体做大规模向量检索新特征（如下），逼着 NAND 必须以高速 pSLC 模式运行：**

**a. 找得太碎（访问粒度极细）：** AI 搜索知识库时往往只需比对一小串特征（几百字节）。但标准 TLC SSD 是个“死脑筋”，哪怕只要一个字，也得把整页（4KB）全读出来，浪费读取带宽。

**b. 问得太密（并发强度极高）：** 现在的 AI 会自己做计划、调工具、反复查资料，单次任务瞬间裂变成成千上万个密集的“查字典”请求。标准 TLC SSD 在高并发下迅速排队饱和。

**c. 边读边写（读写双向承压）：** AI 智能体会一边查一边更新索引、记录中间状态。这种“一边翻书一边做笔记”的强度会让普通 TLC 寿命快速耗尽，而 pSLC 寿命是它的十几倍。

但承载这一层的下一代直连架构——NVIDIA Storage-Next（G2.6 层，位于 G2.5 CXL 内存之下、G3 本地 SSD 之上）——仍处在英伟达主导、与铠侠等厂商协同定义规格的阶段。

它的定位，是在 DDR与本地 SSD 之间新增一层 直连GPU的pSLC 存储层，让 NAND 具备接近 DRAM 的 IOPS 与访问粒度（512B 细粒度随机访问），同时保留低成本、大容量优势。

**③ Fast Data Lake 场景：QLC 的主战场**

如果说 GPU 直连 SSD 是案板旁的“切菜盘”，存储需要读写双能。 G4 远端网络层的 Fast Data Lake（快速数据湖）就是 AI 数据中心的“远端中央总仓”，以读为主：以 PB 级容量装下 AI 运转所需的全部“家底”——训练语料、多模态数据集、各版本模型权重、RAG 知识库和推理回流日志。

按闪迪 2030 年的需求拆分，Fast Data Lake 约占 AI 数据中心 NAND 需求的 25%，几乎全部由 QLC 承载。

**核心问题是：QLC 能否替代 HDD？海豚君认为需从以下维度分析：**

**a. 热数据——QLC 稳坐主位**

正在被 CPU/GPU 高频消费的数据（如正在处理的训练集、等待检索的 RAG 知识库），需要极高的数据吞吐量。

HDD 的机械磁头寻道延迟（毫秒级）与 AI 所需的微秒级响应差了两个数量级，从一开始就被物理排除。QLC 凭借超大容量和读写带宽，在此层是替代的绝对主力。

**b. 温冷数据：HDD坐主桌**

**对于“存着备查”和“历史归档”类数据，是否放入 QLC 取决于两个维度：**

**①供给侧扰动：短期“假性替代”**

短期 HDD 将出现 300EB 至 400EB 的供给缺口。当前部分云厂商用 eSSD 临时兜底，造成了“加速替代”的假象。

但 HDD也能用类似SSD的技术持续拉升产能，被 eSSD 临时接管的纯容量需求回流 HDD，替代逻辑变弱。

**②经济账：QLC涨价后算不平**

短期因缺货有替代迹象，但后续QLC因热数据层的替代是刚需，导致QLC涨价。当下HDD 的每 GB 价差已飙升至 20–25 倍。在稳冷层数据存储中，QLC反而难取代HDD。后续要QLC出现大容量低成本的产品面世后，替代概率才可能加大。

**因此 QLC 替代 HDD 绝非单向线性推进，而是分化为三种叙事：**

a. 性能关键路径（热数据）上，替代已经完成且不可逆；

b. 温冷归档层，高昂价差阻断了正常置换，目前的“替代份额”更多是 HDD 缺货逼出的“临时补位”，未来面临回流风险；

c. 长期胜负手在于大容量高密度QLC 量产，能否靠极致“空间与能耗压缩”，在 TCO 上跨过 2-3 倍的替换红线。

**据闪迪业绩会，超大容量 QLC 在 FQ4'26（2026 年 4-6 月）刚产生首批收入，FQ1'27 进入早期爬坡。闪迪预计 QLC 占整体 bit 出货的比例，从 2025 年约 20% 升至 2026 财年末的 40%，主要由 Stargate （超大容量QLC）在云厂商放量驱动。**

**④ HBF: 需求上行期权**

在传统 AI 存储层级中，紧贴 GPU 的 HBM虽有百纳秒级延迟与超高带宽，但受 DRAM 制程限制，单堆栈容量小、成本高；再往下到 NVMe SSD，延迟与带宽又出现严重断层。

NAND厂商现在在努力推新品：HBF（High Bandwidth Flash）——**它的结构基本是HBM的复刻**：多层堆叠、TSV贯通连接上下、与XPU共同封装，只是把DRAM颗粒换成了NAND颗粒

闪迪正开发的 HBF，号称堆叠 16 层 NAND、在维持 HBM 级带宽的同时把容量放大 8 倍。（参考：[从 HBM 限高到 NAND 加量，英伟达 vs 存力到底谁拿捏谁？](https://longbridge.com/zh-CN/dolphin/post/44108509?channel=OWNN00110)）。

**HBF 与 HBM 并非简单替代关系，而是基于物理特性的优劣互补：**

HBF优势是容量大，成本低，但短板同样明确：微秒级延迟让它反应偏慢，不擅长细碎的随机散读；且有物理擦写寿命上限，只能当“只读参考书”，扛不住高频写入。

此外 HBF 仍在工程推进期：2026 年下半年进入试产建线、预计 2027 年商业化，但紧贴高发热 GPU 部署的散热标准仍待确立。

**由此形成分工：**

HBM 专注“性能至上”，是旗舰 GPU 的绝对标配，负责对延迟极敏感的预填充（Prefill）阶段、高频读写的活跃 KV Cache，以及要求最高对称读写带宽的训练任务。

HBF 主打“容量为王”，接管以顺序读取为主的常规推理、需单机容纳全量模型的长文本与 MoE 场景，以及读多写少的温冷 KV Cache 卸载，让中低端 GPU 甚至未来的边缘设备也能跑超大模型。

因此海豚君认为，HBF 不是颠覆 HBM，二者共存互补——HBM 管延迟敏感的热数据，HBF 管容量饥饿的温数据。未来HBF的使用渗透还要继续观察。

闪迪将 HBF 分成四种部署形态，具体定义可见《[**AI 推理大爆发，“悲催” 闪迪真有凤凰涅槃？**](https://longbridge.cn/zh-CN/dolphin/post/43891402?app_id=longbridge&utm_source=longbridge_app_share&share_track_id=2df009f8-893f-42a6-b66a-4f06de470793&invite-code=4NOXYT&locale=zh-CN&community_badge=1&profile_following_followers_activities=1&channel=OWSN00110)》。海豚君认为，**③ 增配型（HBF+HBM 混搭）和 ④ 解耦型（池化）落地可能性最大**。

增配型的逻辑最简单：**HBM 不撤，HBF 加进来一起用**。GPU 厂商不用大改，HBM 继续干擅长的活，HBF 在旁边装权重和冷 KV 缓存。SK 海力士新提的 H3 架构就是HBM和HBF混搭——2027 年量产、2028 年客户上车，是目前阻力最小的路。

解耦型则是把 HBF 从 GPU 旁独立出来，像硬盘柜一样池化部署、通过网络连接计算单元。这是未来大方向——NVIDIA 的 CMX 方案推的也是类似的机架级存储池；但它要求网络架构跟着升级，预计 2028 年之后才可能成为实际选项。

**从各厂商路线来看，HBF 目前仍处于标准联盟阶段，尚未进入 GPU 厂商（特别是 NVIDIA）的官方架构标准中。**

**闪迪与 SK 海力士是当前唯二的实质推动者：**双方已于 2026 年初成立标准联盟并建起试产线，比原计划提前半年——预计2026年底造出芯片，明年推控制器，2027 年冲刺量产。

谷歌、英伟达、AMD 等最早要到 2028 年才可能作为客户采用，但采用≠定义——HBF 真正进入 GPU 厂商的架构体系，还要过标准认证、参考设计集成、生态适配等关卡。

其他厂商：三星有专利储备，但未公开原型与时间表；铠侠走 XL-FLASH 路线（G2.6 Storage Next），与 HBF 不直接竞争；美光暂无公开计划。

总体看，HBF 产业化时间线虽在加速，但格局本质是“存储厂商在推动，GPU 厂商尚未上车”。真正的分化要等 2027 年样品表现，以及 2028 年头部客户是否正式将其纳入系统设计。

**总结：**

**AI 对 NAND 的重塑，不只是把需求曲线抬高一个台阶，确实有希望打破“硅周期”宿命： “算力部署与推理负载主导”下，NAND 也从“外围零部件”变成“计算路径上的必需品”。**

**在“由训转推”与长上下文时代，用NAND存 KV Cache 是保存昂贵的 GPU 算力与电费资源，SSD 一定程度上就是“Token 电池”。**

**据**$闪迪(SNDK.US) **测算，2030 年 AI 数据中心 NAND 出货量将达 1.2 ZB（较 2026 年增长约三倍），三大核心负载分工明确：**

a. Staging 暂存层（占比 40%）：贴近 GPU 的极高强度 I/O 缓冲区，受极端覆盖磨损与高并发限制，由高性能 TLC（及 pSLC）垄断。

b. KV Cache 卸载层（占比 35%）：推理时代全新增量，承载HBM 溢出的动态存储容量，由 TLC/QLC 梯次承接。

c. Fast Data Lake 快速数据湖（占比 25%）：远端中央数据总仓，由大容量 QLC 稳坐主位。

按 NAND 类型计，TLC 占 66%、QLC 占 34%：占比最大的 Staging 因写入强度，天然排斥 QLC，TLC 稳占基本盘；QLC 聚焦数据湖与温冷 KV Cache 卸载。

**这三类负载的演进方向恰好相反：**数据湖向“更便宜”走（QLC 容量放大），Staging 与热路径则向“更快更耐用”走（TLC 乃至 pSLC，牺牲约三分之二容量换取 10 倍耐久性）。

**而这波涨价的“超级行情”还能飞多久？站在当前估值节点，涅槃后的闪迪是否仍有向上空间？海豚君将继续在下篇为您拆解，敬请期待！**

<此处结束>

本文的风险披露与声明：[海豚研究免责声明及一般披露](https://support.longbridge.global/topics/misc/dolphin-disclaimer)

更新分析：

**一、海豚君AI 存储系列分析**

DRAM行业：

[《存力接棒算力，HBM 为什么 “脱颖而出”？》](https://longbridge.com/zh-CN/dolphin/post/43941280?channel=OWNN00110)

[《从 HBM 限高到 NAND 加量，英伟达 vs 存力到底谁拿捏谁？》](https://longbridge.com/zh-CN/dolphin/post/44108509?channel=OWNN00110)

个股：

闪迪（上）：[《AI 推理大爆发，“悲催” 闪迪真有凤凰涅槃？》](https://longbridge.com/zh-CN/dolphin/post/43891402?channel=OWNN00110)

闪迪（中）：[《NAND 天性 “多产”，闪迪凭什么守 80% 毛利率？》](https://longbridge.com/zh-CN/dolphin/post/43966452?channel=OWNN00110)

**二、海豚君AI DC互联系列分析：**

**CPO行业**

《[AI 超连接时代：AI 向 “光” 飞奔？](https://longbridge.cn/zh-CN/dolphin/post/41423680?channel=OWNN00110)》《[“‘铜’ 牛夫人” 不走！CPO：真机会 or 镜中花？](https://longbridge.cn/zh-CN/dolphin/post/42139974?channel=OWNN00110)》

**组网架构**

英伟达组网：《[AI 时代 DC 互联：单芯之上抱 “网” 作战，真有 “中国” 机会吗？](https://longbridge.com/zh-CN/dolphin/post/43798848?channel=OWNN00110)》

DC组网之AMD vs英伟达：《[AMD 跟英伟达 “掰手腕”，Helios 够格吗？](https://longbridge.com/zh-CN/dolphin/post/43906382?channel=OWSN00110)》

谷歌组网：《[叫板英伟达霸权，谷歌 “光网” 凭什么？](https://longbridge.com/zh-CN/dolphin/post/43994983?channel=OWNN00110)》

**个股**

Lumentum：[《从光互联老炮到 “全能卖水人”，Lumentum 凭什么？》](https://longbridge.com/zh-CN/dolphin/post/44059432?channel=OWNN00110)

**三、海豚君AI XPU系列分析**

Agent与CPU：[《Muse“爆火”，CPU 迎来自己的 ChatGPT 时刻？》](https://longbridge.com/zh-CN/dolphin/post/44095954?channel=OWNN00110)

……更多内容，敬请关注[长桥海豚研究官网](https://longbridge.com/zh-CN/profiles/2106669?channel=OWNN00030)。

### 相关股票

- [SNDK.US](https://longbridge.com/zh-CN/quote/SNDK.US.md)
- [MU.US](https://longbridge.com/zh-CN/quote/MU.US.md)
- [DRAM.US](https://longbridge.com/zh-CN/quote/DRAM.US.md)
- [WDC.US](https://longbridge.com/zh-CN/quote/WDC.US.md)
- [AAPL.US](https://longbridge.com/zh-CN/quote/AAPL.US.md)
- [603020.CN](https://longbridge.com/zh-CN/quote/603020.CN.md)
- [WDCX.US](https://longbridge.com/zh-CN/quote/WDCX.US.md)
- [AAPB.US](https://longbridge.com/zh-CN/quote/AAPB.US.md)
- [AAPD.US](https://longbridge.com/zh-CN/quote/AAPD.US.md)
- [AAPU.US](https://longbridge.com/zh-CN/quote/AAPU.US.md)

## 评论 (1)

- **xyy · 2026-09-30T09:40:02.000Z**: 扫描磁盘如此光荣的奔跑


---
> **免责声明: 本文仅供参考，不构成任何投资建议。**