新しいオープンソースプロジェクトであるmini-AGIは、8GBというわずかなVRAMしか持たないコンシューマー向けハードウェア上で、バイトレベルの言語モデルが「継続学習」――すなわち、破滅的忘却を起こすことなく連続的なデータストリームから学習すること――を達成できることを実証しました。
このモデルは、1文字ずつ自己組み立てを行う動的なMixture of Experts(MoE)アーキテクチャを利用しています。静的なデータセットで訓練された後に凍結される従来の大型言語モデル(LLM)とは異なり、mini-AGIは訓練中に自身の容量を拡張および削減します。具体的には、1文字あたり最大26回のブロック適用を行うリカレントブロックを使用し、即時的な入力に基づいて共有プールからエキスパートを選択します。メモリ管理のためにモデルの重みはディスクに保存され、必要に応じてVRAMにページインされるため、総パラメータ数はビデオメモリではなくディスク容量によって制限されます。
新しいデータで訓練を行う際に、ニューラルネットワークがそれまでに学習した情報を失ってしまう「破滅的忘却」を防ぐため、この設計では「トランク(幹)」学習率を採用しています。トランクを個々のエキスパートの10分の1の学習率で動作させることにより、単一のデータストリームから全く新しい主題を学習しながら、進行状況の99.84%を保持することに成功しました。
このモデルはバイトレベルで動作し、265トークン(256バイトと構造マーカー)の語彙を使用しているため、固定されたトークナイザーなしであらゆるデータを処理できます。少なくとも8GBのVRAMを備えたPCまたはノートPC向けに設計されており、訓練と学習プロセスが継続的であり、ユーザー自身のハードウェアとデータに紐付いていることから、真にパーソナルなものとなるよう構築されています。
出典
- Mini-AGI – dynamic continual learning model trained from scratch on 8GB VRAM (Hacker News Frontpage, 2026-09-21)