当存储开始思考:AI SSD如何重构大模型推理的数据路径

大模型推理的真正瓶颈,可能不在算力,而在数据搬运。

这个判断正在被产业界快速验证。8月初的沙利文全球增长峰会上,忆芯科技首席科学家薛立成提出了一个被多数人忽视的问题:在大模型推理中,KV Cache已成为最重、最贵、也最容易被忽视的基础资源之一。GPU显存速度快但容量有限,应该优先留给模型权重和核心算子计算;而KV Cache的管理却仍落在CPU上,导致数据路径变长、CPU负载升高。

这不是一个小问题。当上下文窗口从几千token扩展到百万token级别,KV Cache的体量可以轻松突破数十GB甚至上百GB。这些数据在GPU、CPU和SSD之间的反复搬运,正在吞噬推理系统的大量有效算力。

KV Cache为何成为瓶颈

理解这个问题,需要从Transformer架构的推理机制说起。

大模型在生成每个token时,需要访问之前所有token的Key和Value向量——这些向量缓存在GPU显存中,避免重复计算。这就是KV Cache。它的好处是显著降低计算量,但代价是显存占用随序列长度线性增长。

以一个千亿参数模型为例,在128K上下文窗口下,单次推理的KV Cache可达80-120GB。而单张H100的显存仅80GB——这意味着KV Cache根本放不进GPU显存,必须溢出到主机内存甚至SSD。

传统架构下,KV Cache的管理链路是:SSD → CPU内存 → GPU显存 → 计算单元。每一次token生成,CPU都需要调度KV Cache的加载和换出。当上下文窗口扩展到百万token时,这条数据路径的延迟和带宽开销急剧攀升——CPU成为不折不扣的"交通瓶颈"。

更关键的是,GPU在等待KV Cache加载期间处于空闲状态。这意味着昂贵的GPU算力被白白浪费在等待数据上。业界将这种现象称为"memory wall"(内存墙),它与算力瓶颈不同,无法通过增加GPU数量来解决。

当存储开始思考:AI SSD如何重构大模型推理的数据路径

存算一体的解题思路

AI SSD的核心思路是:把计算能力嵌入存储设备本身,让KV Cache的量化、检索等处理在SSD内部直接完成,无需搬运到CPU再处理。

忆芯科技的AI SSD搭载自研主控芯片,在存储管理之外集成了8TOPS计算能力。这个数字本身不算惊人——对比GPU动辄数百TFLOPS的算力,8TOPS似乎微不足道。但其价值不在于绝对算力,而在于数据搬运距离的缩短。

传统路径中,KV Cache的量化操作需要将数据从SSD读到CPU内存,CPU执行量化计算,再将结果传回GPU。而AI SSD直接在存储设备内部完成量化,只将压缩后的结果传输给GPU。数据搬运量减少,CPU负载降低,GPU等待时间缩短。

这本质上是冯·诺依曼架构中"存算分离"范式向"存算一体"的局部回归。在AI推理场景下,数据搬运的成本已经超过了计算本身的成本,因此把计算推向数据所在位置,比把数据搬到计算位置更高效。

产业含义:算力栈的重新分层

AI SSD的出现意味着AI算力栈正在重新分层。传统架构是"GPU计算 + CPU调度 + SSD存储"的三层结构;AI SSD将其压缩为"GPU核心计算 + AI SSD近数据计算 + 普通SSD冷存储"。

这个重新分层的产业含义在于:

当存储开始思考:AI SSD如何重构大模型推理的数据路径

存储厂商不再只是被动的硬件供应商,而是算力链路中的主动参与者。SSD主控芯片的设计逻辑从"管理闪存读写"扩展为"管理闪存读写 + 执行AI推理辅助计算",这意味着SSD芯片的架构复杂度、附加值和毛利率都将提升。

同时,GPU厂商的定价权可能受到间接影响。如果KV Cache管理效率提升,GPU的有效利用率(实际计算时间占总运行时间的比例)上升,用户对GPU数量的边际需求可能降低——不是不需要GPU,而是不需要那么多GPU来弥补等待浪费。

尚未解决的问题

AI SSD目前仍面临工程挑战。8TOPS的计算能力只能覆盖量化、检索等轻量操作,无法承担矩阵乘法等核心计算。SSD内部计算与GPU核心计算之间的数据同步协议尚无行业标准,不同厂商的AI SSD与不同型号GPU之间的兼容性需要逐一验证。此外,SSD写入寿命(P/E cycles)在高频KV Cache更新场景下的衰减速度,还需要长期数据验证。

但从技术方向看,存算一体在AI推理场景下的逻辑是成立的:数据搬运成本超过计算成本时,计算就应该靠近数据。AI SSD不是要替代GPU,而是要把GPU从等待数据的空闲中解放出来。

*数据来源:沙利文全球增长峰会、忆芯科技公开演讲、各企业技术文档*

相关推荐