Muse Glimmerは、単一のコンシューマーGPUを搭載したMacやPCで動作するよう設計されています。これにより、インターネット接続がなくてもローカルエージェントや関数呼び出し、ローカルコーディング、LLM-as-a-judge評価といった利用が可能になります。
モデル発表Meta Superintelligence LabsMuse Glimmer
Meta Superintelligence Labs、30Bパラメータのローカルエージェント向けモデル「Muse Glimmer」を公開
同社は、このモデルがサイズクラスを代表する既存モデルと比較して、エージェント的なユースケースやベンチマークで強力なパフォーマンスを発揮すると述べています。公開はHugging Face上で実施され、開発者向けのドキュメントも同時に提供されました。
技術面では、コンパクトなアーキテクチャと、より大きな教師モデルからのエージェント推論を転移する新しい蒸留レシピを採用しています。また、推論の最適化として量子化も施されており、レイテンシ要件を満たすよう調整されています。
メモリ効率の観点では、フルプレシジョンの場合55GBを超えるメモリを必要とする30Bモデルを、約4ビット精度に圧縮しています。これにより言語モデルは20GB未満に収まり、24GBまたは32GBのメモリ環境でKVキャッシュや画像理解エンコーダーと同時実行できるようになりました。
さらに、生成速度を向上させるため、DFlashベースの軽量なドラフターモデルを搭載した投機的デコーディングも実装されています。これにより、長文の推論や多段階のツール呼び出しでも応答性を保つことが可能になります。
出典: Muse Glimmer: 30B-parameter model optimized for always-on local agent workflows(HN 1209pt・639コメント)(HN Search (backfill)、2026-08-10)