Token经济加速爆发,推理需求已取代训练成为算力增长主引擎。商汤大装置资深技术专家罗伟在2026全球AI芯片峰会上指出,Agent时代带来长上下文、多轮对话和突发长尾需求,底层逻辑已转向以Token、状态与时延预算为中心。
面对规模化推理挑战,商汤大装置提出两条主线:横向编排与纵向优化。横向编排构建统一资源画像,对推理请求进行全生命周期管控,并动态调整芯片角色分工,不将芯片永久固定为P节点或D节点。
纵向优化则深化模型×引擎×芯片三层协同,在模型层精细化调优权重量化与显存预算,引擎层优化Attention、GEMM等核心算子,芯片层深度适配编译与内存管理,所有优化均在真实负载中验证。
技术演进方面,商汤正从固定P/D配比走向动态资源池化,分别构建Prefill Pool和Decode Pool,根据实时负载动态匹配资源,长输入时增加P节点,长输出时增加D节点,甚至通过角色切换灵活转换。面向多模态与MoE模型,未来将进一步走向模块级资源池化,将Encoder、Attention、FFN等拆分为独立资源池弹性扩缩容。得益于此,商汤大装置日均Token服务量已从2月的0.46万亿增长至8月的4.5万亿。
