Allen Institute for AIは、大規模言語モデル開発のためのフレームワークの大幅なアップグレードとなるOlmo-core 3をリリースしました。このアップデートでは、Mixture of Experts(MoE)アーキテクチャに特化して最適化された再設計済みのトレーニングシステムが特徴となっています。このアーキテクチャにより、入力ごとにパラメータの一部のみをアクティブ化することで、計算効率を維持しながら、モデルにより多くのパラメータを持たせることが可能になります。
Olmo-core 3は、MoEのトレーニングを1兆パラメータ規模までスケールさせるように設計されています。ベンチマークでは、トレーニングのスループットを維持したまま、1トークンあたりのアクティブなパラメータ数を約32億に固定しつつ、エキスパートのプールを8から128へと増やすことに成功しました。
新しいインフラストラクチャは、フルシャード・データ並列(FSDP)アプローチから、分散データ並列(DDP)に基づくシステムへと切り替わっています。この変更により、エキスパートをGPU上に常駐させ、データ them へとルーティングすることが可能になり、繰り返しの重み収集(weight gathering)を回避しています。8枚のNVIDIA B300 GPUを用いた予備テストでは、470億パラメータのMoEが、従来の実装と比較して約2.7倍のスループットを達成しました。
また、このフレームワークには、計算効率を向上させるためのrowwise expert parallelism、GPU-resident routing、grouped GEMMなどの複数の最適化が組み込まれています。さらに、Olmo-core 3は、計算コストとGPU間のデータ移動を削減できる低精度数値フォーマットであるMXFP8をサポートしています。テストの結果、NVIDIA B300 GPUにおいてMXFP8を有効にすることで、BF16のベースラインと比較してトレーニングのスループットを約21%向上させられることが示されました。
Olmo-core 3は、より高い能力を実現するためにMoEアーキテクチャの採用が見込まれる、次世代Olmoモデルの基盤となります。このフレームワークは、研究者や開発者が独自のMoEモデルをトレーニングし、さまざまなルーティングや並列化構成を実験できるように、オープンソースのツールとしてリリースされます。
出典
- Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs (Hugging Face Blog, 2026-10-01)
- Code