AI News Feed
Market watch
AI Chips & Compute

AI storage infrastructure gains new tier as context windows grow for agentic AI

As agentic AI expands context windows, storage infrastructure becomes a critical performance lever. Solidigm, Vast Data and Supermicro are introducing new storage tiers and KV cache offload to cut latency and GPU costs.

Solidigm公司技术规划总监Scott Shadley表示,智能体AI时代的数据问题正在改变形态,交互时间更长、产生更多信息,数据的大小、重要性以及在基础设施中的移动方式都会影响应用响应速度。他说,人们开始关注存储,“这个时代独特之处在于它不再是一维或二维的,我们有数据量级和规模、重要性等所有体积方面的增长。但归根结底,取决于那一点数据从A点到B点的移动速度。”

在Supermicro Open Storage Summit访谈系列中,Shadley与Vast Data AI架构总监Anat Heilper、Supermicro解决方案管理总监Ben Lee共同讨论了各自技术如何协同工作,以满足扩展上下文窗口和KV缓存带来的新存储与内存需求。

随着上下文窗口扩大,仅靠GPU内存无法容纳智能体工作负载在推理期间需要的所有内容。Shadley称,AI存储基础设施必须提供额外的层级,以平衡邻近性、容量和速度。固态硬盘(SSD)找到了新的位置,他们正在创建的3.5层级依赖于NVMe SSD等技术的出现。

这一中间层是更大架构的一部分。Solidigm提供SSD以快速访问缓存数据,Supermicro将其集成到机架级系统中,Vast Data的AI操作系统提供网络存储和数据服务。Heilper指出,KV缓存是AI推理中一项非常重要的优化,本质上是用存储替换计算。当KV缓存命中率很高时,既能节省计算资源,又能显著降低延迟。

Supermicro的Context Memory eXtension(CMX)提案面向拥有大型AI集群和大量数据需求的组织。Lee表示,单靠购买更多带高带宽内存的GPU很贵,KV缓存会从GPU、HBM自然溢出到系统内存、本地SSD和网络存储。他们提出的G3.5是一种AI原生的KV缓存层,可以满足这一需求。

Vast Data一直在不同软件环境中与合作伙伴测试KV缓存卸载。Heilper称,通过Nvidia Dynamo,他们实现了20倍的time-to-first-token加速,用户感知的延迟显著降低,同时GPU时间节省达90%。

这些结果依赖于能够将存储性能和容量与工作负载相匹配的AI存储基础设施。Solidigm的D7-PS1010性能型SSD和D5-P5336容量型驱动器分别针对层级中的不同节点,Supermicro将组件集成到可根据客户需求配置的系统中。Shadley说,这个层级堆栈的定义并不是唯一的,但它是当前主流的标准,并且仍在继续演进。