213:1的Token悬殊背后,智能体正在改写推理方式

作者:zhidx.com 发布时间:2026-09-23 20:31:01 浏览:11
关键字:
AICC2026大会上,SGLang团队披露智能体一次请求输入输出Token相差213倍,推理负载正从单次调用变为持续任务链,开源协同与多元芯片适配成中国AI计算破局方向。

9月21日AICC2026大会上,SGLang核心贡献者王书文披露:Agent单次请求中位数输入达8.8万Token,输出仅413个Token,算力主要消耗在反复携带的历史上下文上。

智能体已贡献约70%的推理流量,SGLang用RadixAttention复用KV Cache并将缓存下沉至内存和SSD,实测命中率从10%-30%升至80%-90%,首Token延迟明显下降。

模型落地需闯推理框架、算子、芯片适配等"九道关",SGLang已首批适配DeepSeek-V4.1等模型,智源FlagOS社区四天完成覆盖10款AI芯片的多芯适配。

中国AI计算正走向开源与多元,有厂商日均Token产量突破1万亿、产能增长超30倍,竞争已升级为开放协同的算力供给之争。

阅读原文

本文由融业云AI采集并编辑,仅供学习使用!

本文来自zhidx.com,作者zhidx.com

有问题,请联系客服!http://www.rongyeyun.com/kefu/