日本語

PLUS ULTRA製品発表Inco AISplash

Inco AIがSplash Engineを発表、Apple Silicon上でのQwen3.8実行を高速化

PLUS ULTRA by アメノヨミ

この記事は翻訳です。 原文を読む

Inco AIは、Apple Silicon上で言語モデルをローカルで実行するために特別に設計された、オープンソースの推論エンジン「Splash」をリリースしました。このエンジンはQwen3.6-35B-A3BおよびQwen3.8-27Bに最適化されており、サポートされている各モデルに対して専用のGPUカーネルと調整されたメモリプランを提供します。

生成速度を向上させるため、各モデルには投機的デコードをサポートするための専用DFlash 2ドラフトモデルが同梱されています。投機的デコ―ディングは、小さなモデルを使用してトークンを予測することで、推論プロセスを加速させる技術です。

48 GB M5 Proで行われた内部テストにおいて、SplashはQwen3.8-27Bに対して測定された次点で高速なエンジンと比較して、約2倍のデコード速度を達成しました。具体的には、短いプロンプトで74トークン/秒、32Kコンテキストで54トークン/秒を記録しました。短いプロンプトで4つの同時リクエストを処理する場合、合計スループットは170トークン/秒に達し、Inco AIはこれを比較対象の次点で高速なエンジンのスループットの3.9倍であると報告しています。

Splashは、LM Studio Bionic 1.1.5以降で利用可能です。このエンジンには、macOS 26.4以降を搭載したM3以降のMac、および少なくとも36 GBのユニファイドメモリが必要ですが、Inco AIは48 GB以上を推奨しています。ユーザーは、Settings > Runtimeに移動し、Experimental backendsセクションからSplash (Metal) を選択することでエンジンをインストールできます。

PLUS ULTRAby Amenoyomi

これらのパフォーマンス向上を実現するために、Splashはモデル固有のハードウェアアーキテクチャと予測生成を組み合わせることで、汎用的な推論パスから脱却しています。

このエンジンは、Qwen3.6-35B-A3BおよびQwen3.8-27B専用に設計されたGPUカーネルとメモリプランを採用しています。これらの特定のモデルの正確な要件にハードウェアとのやり取りを合わせることで、SplashはApple Silicon上でのメモリアクセスと計算効率を最適化します。

生成速度は、専用のDFlash 2ドラフトモデルを用いた投機的デコードによってさらに向上します。これらの小さなモデルが次に続くトークンを予測することで、メインエンジンはトークンを一つずつ処理するのではなく、一度のステップで複数のトークンを検証して生成することが可能になります。

この組み合わせにより、SplashはQwen3.8-27Bにおいて他のエンジンの約2倍のデコード速度を実現し、同時リクエスト時には最大3.9倍の合計スループットに達することができます。

出典

  1. Splash Engine - the fastest local Qwen3.8 on Apple Silicon (LM Studio Blog, 2026-09-18)