WebLLMは、WebGPUによってハードウェア加速を行い、ブラウザ上で直接大規模言語モデル(LLM)の推論を実行できるエンジンです。すべての処理はブラウザ内で完結するため、サーバー側のサポートを必要としません。
本プロジェクトは、さまざまなハードウェア環境へのLLM展開を可能にするMLC LLMのコンパニオンプロジェクトとして位置づけられています。
WebLLMはOpenAI APIとの完全な互換性を備えています。ストリーミングやJSONモードに加え、logitレベルの制御やシーディングといった機能も提供しています。また、WebAssemblyを用いて最適化された、高度なJSON生成機能もサポートしています。
対応モデルには、Llama 3やPhi 3、Gemma、Mistral、Qwenなどが含まれます。ユーザーはNPMやYarn、CDNを通じてパッケージとして統合できます。さらに、Web WorkerやService Worker、Chrome拡張機能への対応も行っています。
出典: WebLLM: high-performance in-browser LLM inference engine(Hacker News Frontpage、2026-09-02)