DAPO:字节跳动种子和清华航空的开源强化学习系统
真正值得关注的不是这条新闻本身,而是它可能把「开源」的竞争焦点推向更大范围的连锁反应。
原文链接:https://github.com/BytedTsinghua-SIA/DAPO
[2025/05] 我们更新了完整 DAPO 的 wandb 训练记录以及在 AIME 2024 上达到 50%+ 的检查点。我们还提供了 AIME 2024 的评估说明。
[2025/03] 我们在 wandb 中发布了早期版本 DAPO 的训练记录(没有 Token 级 PG Loss & 动态采样),在 AIME 2024 上达到了 44% 以上。我们发布了一个用于大规模 LLM RL 的完全开源系统,包括算法、代码基础设施和数据集。该系统实现了最先进的大规模 LLM RL 性能。我们提出了解耦剪辑和动态采样策略优化(DAPO)算法。通过开源,我们为更广泛的研究社区和社会提供了可扩展的强化学习的实用途径,使所有人都能从这些进步中受益。我们的系统基于很棒的 verl 框架。感谢他们的出色工作!
🤗 如果您对我们的论文有任何疑问,欢迎提出问题,我们可以在那里讨论。谢谢你!
🚀 DAPO 基于 Qwen2.5-32B 基础模型在 AIME 2024 上获得 50 分,以 50% 的训练步数优于之前的 SoTA DeepSeek-R1-Zero-Qwen-32B。长度稳定性和增长:响应长度的稳定增加可以进行更大的探索,促进模型学习更复杂的推理行为的能力,最终有助于训练稳定性和性能提高。奖励分数稳定性:奖励信号的稳定增加表明模型成功拟合训练分布,确保学习过程保持稳健和一致,没有明显波动。熵和平均概率趋势:在最初下降后,熵的受控增加可确保探索和利用之间的健康平衡,避免过度拟合或过度随机性等问题,并促进持续的模型性能。我们提供了 DAPO-Qwen-32B 的模型权重,它是基于 Qwen2.5-32B 使用 DAPO 算法训练的。
"question" : "逐步解决以下数学问题。您回答的最后一行应采用以下形式 Answer: $Answer (不带引号),其中 $Answer 是问题的答案。
\n \n 求 \\ [(75+117i)z+ \\ frac{96+144i}{z} \\ ] 的最大可能实部,其中 $z$ 是一个复数,$|z|=4$。
\n \n 记住将您的答案放在 \" Answer: \" 之后单独一行。"