日本語

ニュースgptvis

最小限のデータと簡素化モデルでTransformer内部を可視化する手法が公開

Transformerの大規模言語モデルの内部機構、特に層間の情報フローや注意機構の動作は、数値の多さゆえに把握が難しいとされています。この記事では、可視化を通じてこれらの動きを直感的に理解することを目的としています。

手法は、学習データ・トークン化・モデルアーキテクチャの3点で徹底した簡素化を図っています。学習データは果物と味覚の関係に特化した94語の最小セットで、検証には「chili」と「spicy」の関連性をテストする文を使用しています。

トークン化はBPEなどのサブワード手法ではなく、正規表現による単純な単語分割を採用。語彙は19トークンに限定され、各トークンが単語と直接対応します。

モデルはデコーダーオンリーで、2層・各2アテンションヘッド・20次元埋め込みという極小構成です。パラメータ数は約1万と、通常のLLMとは桁違いに小さいため、内部計算の追跡が可能になります。

1万ステップ学習後、モデルは検証文で「chili」を正しく予測しました。これは単純な暗記ではなく、意味的関連性を一般化して学習したことを示しています。

コードとデータセットはMITライセンスで公開されています。https://github.com/rti/gptvis


出典: Understanding Transformers Using a Minimal Example(HN 295pt・25コメント)(HN Search (backfill)、2025-09-04)