日本語

ニュース

LLMは単なる次トークン予測機ではないとする技術考察が公開される

LLMを単なる「次トークン予測機」と捉えるのは不完全であるとする技術的な考察が公開されました。

事前学習段階では、モデルは学習データに含まれる既存のシーケンスに続くトークンを予測するように学習します。このプロセスでは、データセットに存在する次の一手を再現する動作が中心となります。

しかし、現代のLLMで行われるポストトレーニング、特に検証可能な報酬を用いた強化学習(RLVR)は性質が異なります。

RLVRにおいて、モデルは自ら新しいシーケンスを生成する「探索」を行い、その結果得られる報酬に基づいて学習を進めます。

著者によると、このプロセスはチェスエンジンに例えることができます。既存の棋譜を模倣するシステムは「次の一手予測機」ですが、自らの探索を通じて勝利に導く手を選択するシステムは、単なる予測機とは呼べないと指摘しています。

このように、ポストトレーニングを経たモデルは、既存のテキストの模倣だけでなく、自らの探索から得た成果からも学習しているというのです。


出典: Stop Thinking of LLMs as Next-Token Predictors(Hacker News Frontpage、2026-09-05)