日本語

モデル発表ByteDanceByteDance Seed清華大学DAPODAPO-Qwen-32B

ByteDanceと清華大学がDAPOを公開:大規模LLM学習のためのオープンソースRLシステム

この記事は翻訳です。 原文を読む

ByteDance Seedと清華大学のAI産業研究院(AIR)は、大規模な大規模言語モデル(LLM)の学習向けに設計されたオープンソースの強化学習(RL)システムであるDAPO(Decoupled Clip and Dynamic sAmpling Policy Optimization)を公開しました。このシステムには、アルゴリズム、コードインフラストラクチャ、および厳選されたデータセットが含まれています。

AIME 2024数学コンペティションの評価において、Qwen2.5-32Bベースモデルで学習されたDAPO-Qwen-32Bモデルは、50のスコアを達成しました。研究者らによると、このパフォーマンスは、トレーニングステップをわずか50%に抑えつつ、47ポイントを記録した従来の最先端の結果であるDeepSeek-R1-Zero-Qwen-32Bを上回っています。

DAPOアルゴリズムは、長いChain-of-Thought(CoT)推論シナリオにおける大規模RLを改善するために、4つの主要な技術的アプローチを導入しています:

  • Clip-Higher: 下限と上限のクリッピング範囲を分離することで、ポリシーのエントロピーを強化し、エントロピーの崩壊を防ぎます。
  • Dynamic Sampling: 正解率が完全(100%)またはゼロのプロンプトをフィルタリングし、効果的な勾配を維持してサンプル効率を向上させます。
  • Token-Level Policy Gradient Loss: トークンレベルで損失計算を適用し、より長いシーケンスが勾配更新に対して十分な影響を持つようにします。
  • Overlong Reward Shaping: 切り捨てられたサンプルに対してペナルティメカニズムを実装し、報酬ノイズを低減して学習を安定させます。

研究者らは、大規模RL学習の再現性を向上させるため、DAPO-Math-17kデータセットを含むトレーニングレシピを完全にオープンソース化しました。実装はverlフレームワークに基づいて構築されています。

出典

  1. DAPO: An Open-Source RL System from ByteDance Seed and Tsinghua Air (Hacker News Frontpage, 2026-09-20)
  2. arXiv