字节清华联合开源DAPO,Qwen-32B推理成绩超越DeepSeek
字节跳动Seed团队与清华AIR联合开源强化学习系统DAPO,其训练的Qwen-32B模型仅用一半训练步数便在AIME 2024上超越DeepSeek,并全栈开源算法、代码与数据。