9月21日AICC2026大会上,SGLang核心贡献者王书文披露:Agent单次请求中位数输入达8.8万Token,输出仅413个Token,算力主要消耗在反复携带的历史上下文上。
智能体已贡献约70%的推理流量,SGLang用RadixAttention复用KV Cache并将缓存下沉至内存和SSD,实测命中率从10%-30%升至80%-90%,首Token延迟明显下降。
模型落地需闯推理框架、算子、芯片适配等"九道关",SGLang已首批适配DeepSeek-V4.1等模型,智源FlagOS社区四天完成覆盖10款AI芯片的多芯适配。
中国AI计算正走向开源与多元,有厂商日均Token产量突破1万亿、产能增长超30倍,竞争已升级为开放协同的算力供给之争。
