大模型推理中,GPU重复计算系统提示词和历史对话导致KV Cache重复生成,形成“显存墙”,成为算力消耗的主要瓶颈。
业界尝试卸载KV Cache至低成本存储,但单机方案存在资源孤岛,分布式存储因强一致锁延迟过高,难以满足实时推理需求。
中科曙光在2026数博会发布ParaCache,将KV Cache管理扩展至集群,实现四级全局池化与动态调度,实测多轮对话首包延迟降低89%,多并发吞吐量提升近26倍。
存储正从“配角”变为推理效率放大器,企业无需堆叠GPU,而应通过软件优化减少算力浪费,推动AI集群向算力、存储、网络一体化设计转型。
