存储成AI推理新瓶颈,企业如何破局?

作者:Leo张ToB杂谈 发布时间:2026-09-01 12:47:56 浏览:10
AI推理算力需求激增,KV Cache缓存导致显存瓶颈。中科曙光发布ParaCache,通过分层存储与全局调度,大幅提升推理效率,降低延迟,助力企业突破存储阻碍。

大模型推理中,GPU重复计算系统提示词和历史对话导致KV Cache重复生成,形成“显存墙”,成为算力消耗的主要瓶颈。

业界尝试卸载KV Cache至低成本存储,但单机方案存在资源孤岛,分布式存储因强一致锁延迟过高,难以满足实时推理需求。

中科曙光在2026数博会发布ParaCache,将KV Cache管理扩展至集群,实现四级全局池化与动态调度,实测多轮对话首包延迟降低89%,多并发吞吐量提升近26倍。

存储正从“配角”变为推理效率放大器,企业无需堆叠GPU,而应通过软件优化减少算力浪费,推动AI集群向算力、存储、网络一体化设计转型。

阅读原文