商汤大装置:异构混推如何让Token生产更高效

作者:量子位的朋友们 发布时间:2026-09-23 18:09:01 浏览:12
关键字:
商汤大装置专家罗伟分享异构推理实践,通过横向编排与纵向优化两条主线,应对Token调用量千倍级增长挑战,日均Token服务量半年增长近十倍。

Token经济加速爆发,推理需求已取代训练成为算力增长主引擎。商汤大装置资深技术专家罗伟在2026全球AI芯片峰会上指出,Agent时代带来长上下文、多轮对话和突发长尾需求,底层逻辑已转向以Token、状态与时延预算为中心。

面对规模化推理挑战,商汤大装置提出两条主线:横向编排与纵向优化。横向编排构建统一资源画像,对推理请求进行全生命周期管控,并动态调整芯片角色分工,不将芯片永久固定为P节点或D节点。

纵向优化则深化模型×引擎×芯片三层协同,在模型层精细化调优权重量化与显存预算,引擎层优化Attention、GEMM等核心算子,芯片层深度适配编译与内存管理,所有优化均在真实负载中验证。

技术演进方面,商汤正从固定P/D配比走向动态资源池化,分别构建Prefill Pool和Decode Pool,根据实时负载动态匹配资源,长输入时增加P节点,长输出时增加D节点,甚至通过角色切换灵活转换。面向多模态与MoE模型,未来将进一步走向模块级资源池化,将Encoder、Attention、FFN等拆分为独立资源池弹性扩缩容。得益于此,商汤大装置日均Token服务量已从2月的0.46万亿增长至8月的4.5万亿。

阅读原文

本文由融业云AI采集并编辑,仅供学习使用!

本文来自qbitai.com,作者量子位的朋友们

有问题,请联系客服!http://www.rongyeyun.com/kefu/