DwarfStar 4は、Mac (Metal)、CUDA、およびROCmプラットフォームを含む、大容量メモリを搭載したコンシューマー向けハードウェアに特化して最適化された、軽量なC言語ベースの推論エンジンです。このエンジンは、非対称量子化を利用してルーティングされるエキスパートを対象としつつ、重要な計算パスを維持することで、大規模なMixture of Experts(MoE)モデルのローカル実行を容易にするように設計されています。
製品発表サルヴァトーレ・サンフィリッポDwarfStar 4
DwarfStar 4:大容量メモリを搭載したハードウェアに特化したローカル推論エンジン
この記事は翻訳です。 原文を読む
Salvatore Sanfilippoによって作成されたこのプロジェクトは、DeepSeek V4およびV4.1 Flash(実験的なビジョンモデルを含む)、GLM 5.x、そしてQwen3.8 Flash Nextをサポートしています。また、ローカルAPI、コマンドラインインターフェース(CLI)、およびネイティブエージェントを含むフルスタックを提供します。このエンジンは自己完結型として構築されており、通常はリモートサーバーでの配信が必要となる大規模モデル向けに特別にチューニングされているため、128 GBのノートPCや大型のワークステーションなどの大容量メモリを搭載したマシンで実用的に動作します。
主な機能には、長いプリフィックスをSSDに保存し、プロンプトハッシュを介してセッションを再開できる統合されたKVキャッシュ管理システムが含まれており、フルなプリフィリングをやり直す必要がありません。このソフトウェアは、対話型チャット用の ./ds4、ローカルAPIサーバー用の ./ds4-server、および永続的なコーディングセッション用の ./ds4-agent といった、さまざまなデプロイモードをサポートしています。さらに、対応モデルに対しては --mtp オプションによる投機的デコーディング、および推論重視のモデル向けの専用の「思考(thinking)」コントロールも提供しています。
出典
- From the creator of Redis; run LLM locally with ds4 (Hacker News Frontpage, 2026-10-02)
- GitHub