Apple Machine Learningの研究者らは、標準的な手法ではエージェントが成功するには困難すぎるタスクにおいて、強化学習における自己改善を可能にするために設計された新しいパラダイム「RLTL;DR」を導入した。
一般的な手法である検証可能な報酬を用いた強化学習(RLVR)は、エージェントが行動を最適化するために成功する試みを行うことに依存している。しかし、タスクが非常に困難でエージェントに成功の可能性がほとんどない場合や、教師モデルが利用できない場合には、これが問題となる。
RLTL;DRは、失敗した試行の後にポリシーが検証者の出力を観察し、単一の「TL;DR(要約)」という洞察の形で自身のフィードバックを生成させることで、この問題に対処する。その後の試行は、これら過去の洞察を条件とする。また、この手法は、タスクから洞察へのマッピングを内面化するために、これらコンテキスト内の洞察に対するバックプロパゲーション(誤差逆伝播)を可能にする。
標準的なQwen 3.5 9B Thinkingポリシーを用いたGRPOトレーニングでは、困難なツール呼び出しおよびコーディングのデータセットにおいて、大幅な成功を収めることができなかった(Pass@1が0%から1%)テストにおいて、RLTL;DRはトレーニング中に14–31%のPass@1を達成した。極めて重要なことに、評価時にはコンテキスト内に洞察がない状態でも、12–13%のPass@1を維持した。研究者らは、タスクから洞察へのマッピングの内面化が、このパフォーマンスの飛躍的向上における鍵となる要因であったと述べている。
出典
- RLTL;DR: Self-Improvement by Internalizing Self-Generated Feedback (Apple Machine Learning, 2026-10-01)
- arXiv