日本語

ニュースマイケル・ヌーコヴィッチ

LLMにおける困難なRL問題を解決するための新しい手法「Never Give Up」が登場

この記事は翻訳です。 原文を読む

研究者の Michael Noukhovitch 氏らは、大規模言語モデル(LLM)の強化学習(RL)におけるマタイ効果に対処するために設計された手法「Never Give Up」を発表した。マタイ効果とは、強化学習のパフォーマンス向上が簡単なタスクに不均衡に集中する一方で、モデルがより困難な問題において大幅な進展を遂げられない現象を指す。

「Never Give Up」のアプローチは、適応的なサンプリング戦略を使用することで計算資源の割り当てを最適化する。固定されたサンプル数(k)を使用するのではなく、この手法は簡単に解決できるタスクを迅速にフィルタリングし、初期のセットで解決策が得られなかった場合には追加の補完(completions)をサンプリングすることで、計算リソースをより困難な問題へと再割り当てする。

GSM8k および Manufactoria のようなコード RL ベンチマークを用いた評価において、この手法は標準的な Group Relative Policy Optimization (GRPO) と比較して、困難なサブセットにおいてパフォーマンスの向上を示した。研究者らは、この効率性が、複雑な推論やコーディングタスクにおける従来の RL トレーニングでしばしば見られる停滞を軽減するのに役立つと示唆している。

出典

  1. Learning to solve hard problems in RL for LLMs by never giving up (Hacker News Frontpage, 2026-09-15)