英伟达技术博客发布《用投机解码做AI模型协同设计》,系统梳理6种主流推理加速方案,其中核心方案多由华人团队主导,引发业界关注。
投机解码通过小模型草稿预测和大模型验证实现无损加速,技术已迭代四代至EAGLE-3、MTP、DFlash、DSpark。
DFlash采用并行生成策略实现6倍加速;DSpark由DeepSeek与北大团队合作,在DeepSeek-V4上速度比MTP快60%至85%。
指南揭示硬件常数对模型架构的反向约束,标志推理优化从工程调优转向架构协同设计,华人团队在该领域已占据领先地位。
