字节清华联合开源DAPO,Qwen-32B推理成绩超越DeepSeek

作者:ZAKER科技 发布时间:2026-09-22 05:23:18 浏览:14
关键字:
字节跳动Seed团队与清华AIR联合开源强化学习系统DAPO,其训练的Qwen-32B模型仅用一半训练步数便在AIME 2024上超越DeepSeek,并全栈开源算法、代码与数据。

字节跳动Seed团队与清华大学AIR研究院联合推出完全开源的大规模语言模型强化学习系统DAPO,涵盖算法、代码基础设施及数据集,为研究社区提供可扩展的强化学习实践路径。

DAPO提出“解耦裁剪与动态采样策略优化”算法。基于Qwen2.5-32B训练的DAPO-Qwen-32B,在AIME 2024基准测试中取得50分,仅用此前最强模型DeepSeek-R1-Zero-Qwen-32B50%的训练步数即实现性能超越。训练监控显示,其在响应长度、奖励分数及熵值控制上高度稳定,有效平衡探索与利用。

为实现高复现性,团队开源了完整训练配方。系统基于verl框架构建,并在火山引擎机器学习平台完成验证,提供训练集DAPO-Math-17k、验证集AIME 2024及两版复现脚本——早期版本AIME得分44,完整版得分50,训练记录已在Wandb公开。

系统支持通过Ray Serve和vLLM进行模型部署与评估,并提供基于Huggingface及本地路径的加载示例。目前DAPO-Qwen-32B模型权重已公开,开发者可快速集成测试数学推理任务,后续还将发布完整复现指南。

阅读原文

本文由融业云AI采集并编辑,仅供学习使用!

本文来自m.toutiao.com,作者ZAKER科技

有问题,请联系客服!http://www.rongyeyun.com/kefu/