5.3倍吞吐提升
vLLM官方博客介绍,DeepSeek-V4.1-Flash发布三周内,Inferact与vLLM社区完成针对性优化,实现低并发下1.9倍加速、150 TPS约束下5.3倍吞吐提升。这一优化显著提升了DeepSeek模型在Agent场景下的实际可用性。
关键技术优化
优化包括:SWA bounded replay结合CUDA graphs使TTFT(首token时间)降低约30%;集成DeepSeek新发布的MegaAttention、Mega-mHC等算子及其余算子的融合与并行化。这些优化充分利用了Blackwell GPU的硬件特性。
开源社区的协作力量
vLLM是开源LLM推理框架的标杆项目,DeepSeek-V4.1-Flash的快速优化体现了开源社区的协作效率。模型发布与推理框架优化的紧密配合,正在缩短从模型发布到生产部署的时间窗口。
对Agent部署的意义
5.3倍的吞吐提升意味着同样的硬件可以服务更多的Agent实例,或者降低单个Agent的响应延迟。对于需要大量Agent并发运行的企业应用,这一优化具有显著的成本效益。
