字节跳动Seed团队与清华大学AIR研究院联合推出完全开源的大规模语言模型强化学习系统DAPO,涵盖算法、代码基础设施及数据集,为研究社区提供可扩展的强化学习实践路径。
DAPO提出“解耦裁剪与动态采样策略优化”算法。基于Qwen2.5-32B训练的DAPO-Qwen-32B,在AIME 2024基准测试中取得50分,仅用此前最强模型DeepSeek-R1-Zero-Qwen-32B50%的训练步数即实现性能超越。训练监控显示,其在响应长度、奖励分数及熵值控制上高度稳定,有效平衡探索与利用。
为实现高复现性,团队开源了完整训练配方。系统基于verl框架构建,并在火山引擎机器学习平台完成验证,提供训练集DAPO-Math-17k、验证集AIME 2024及两版复现脚本——早期版本AIME得分44,完整版得分50,训练记录已在Wandb公开。
系统支持通过Ray Serve和vLLM进行模型部署与评估,并提供基于Huggingface及本地路径的加载示例。目前DAPO-Qwen-32B模型权重已公开,开发者可快速集成测试数学推理任务,后续还将发布完整复现指南。
