Apple Silicon向けローカル推論エンジン「Splash Engine」公開、Qwen3.8を高速化

Apple Silicon向けローカル推論エンジン「Splash Engine」公開、Qwen3.8を高速化

基本情報

項目 内容
公開元 LM Studio
公開日 2026-09-18
出典の種類 公開元の一次情報(LM Studio公式ブログが一次情報源)

収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。

概要

Inco AIは2026年9月18日、Apple Siliconを搭載したMac環境向けに特化したオープンソースのローカルLLM推論エンジン「Splash Engine」を公開した。あわせてLM Studioとの協業により、同日リリースのデスクトップアプリ「LM Studio Bionic」にSplash Engineがネイティブ統合されたことを発表した。Splash Engineは汎用的な推論エンジンとは異なり、特定モデル専用にカーネルやメモリ計画を構築する設計を採用しており、対応モデルにおいて高い処理速度を実現しているとされる。

発表の内容

今回公開されたSplash Engineは、Apache-2.0ライセンスのもとGitHub(github.com/incoai/splash)で提供されるオープンソースの推論エンジンである。一般的な推論エンジンが多様なモデルへの汎用対応を目的とするのに対し、Splash Engineはモデルごとにエンジン全体を最適化するアプローチをとっている。現時点では「Qwen3.6-35B-A3B」および「Qwen3.8-27B」の2モデルに対応しており、融合型の形状特化カーネル、専用に訓練されたドラフトモデル、最適化されたメモリプランがモデル単位で実装されている。

推論処理においては、投機的デコーディング(Speculative Decoding)を標準機能として組み込んでいる。対応する各モデルには専用のドラフトモデル「DFlash 2」が同梱される。DFlashシリーズのドラフトモデルは、SGLangやvLLM、TensorRT-LLM、llama.cppなどでも動作し、累計で600万回以上ダウンロードされている実績を持つ。Splash Engineでは、ドラフトモデルによるトークン提案・検証・受け入れ・状態更新を単一の処理ユニットとして実行し、ステップごとのオーバーヘッドを削減している。また、社内のカーネルエージェントにより事前にコンパイルされた4ビット行列乗算およびアテンションカーネルを備えており、ユーザーによる手動コンパイルやチューニング作業を必要としない。

メモリ管理では、ハードウェア構成に応じた事前予算化を行う。たとえばQwen3.8-27Bを実行する場合、モデルの重みに15 GiB、ドラフトモデルに1.2 GiBを割り当てた上でKVキャッシュ領域を計算する。

性能検証として、48 GBの統一メモリを搭載したM5 Pro Mac環境で「NVIDIA SPEED-Bench」を用いた測定結果が公表された。Qwen3.8-27Bの単一リクエスト処理において、デコード速度はショートプロンプトで74 tokens/s、32Kコンテキストで54 tokens/sを記録し、比較対象の中で次点だった「oMLX」のほぼ2倍の速度を示したとされる。Qwen3.6-35B-A3Bではショートプロンプトで210 tokens/s、32Kで143 tokens/sを達成している。また、32Kコンテキストのキャッシュ再利用時における最初のトークン生成時間(TTFT)は、Qwen3.6-35B-A3Bで123 ms、Qwen3.8-27Bで282 msとなり、oMLXと比較して6.6倍から7.3倍高速化された。さらに、4つのサブエージェントによる並行リクエスト(ショートプロンプト)の検証では、Qwen3.8-27Bで170 tokens/s、Qwen3.6-35B-A3Bで357 tokens/sの合計スループットに達し、次点エンジンの最大3.9倍の速度向上を示したと報告されている。

動作環境としては、M3以降のプロセッサを搭載し、macOS 26.4以降が動作する36 GB以上の統一メモリ(Inco AIは48 GB以上を推奨)を持つMacが必要とされる。導入方法としては、Homebrewを利用して brew install incoai/tap/splash からインストールし、 splash serve --model incoai/Qwen3.8-27B-Splash のコマンドで起動できるほか、OpenCodeやClaude Code、Codex、HermesといったツールとのCLI連携コマンドも用意されている。

あわせて、LM Studioとの協業により「LM Studio Bionic」(バージョン1.1.5以降)での統合利用が可能となっている。LM Studio Bionicの Settings > Runtime 内にある Experimental backends から Splash (Metal) をインストールし、Hugging Faceリポジトリ( incoai/Qwen3.8-27B-Splash または incoai/Qwen3.6-35B-A3B-Splash )から対応モデルをダウンロードすることで、UI上からローカル推論を実行できるようになっている。

背景

Inco AIはこれまで、データセンター向けGPUを基盤とする推論プラットフォームを展開してきた企業である。ベンチマーク評価プラットフォームである「Artificial Analysis」において、「Kimi K3」「MiniMax M3」「GLM 5.3」「GLM 5.3 Flash」「DeepSeek V4.1 Flash」という5つのオープンモデルで最速プロバイダーの実績を持つと説明されている。また、同社が開発する投機的デコーディング用ドラフトモデル「DFlash」シリーズは、SGLang、vLLM、TensorRT-LLM、llama.cppといった主要な推論フレームワークに対応し、累計ダウンロード数が600万回を超えるなど、モデル高速化の知見を蓄積してきた。

近年、ローカル環境におけるコーディング支援やエージェント運用の需要が高まるなか、リポジトリの初回読み込み(プリフィル)、履歴が蓄積した状態での対話継続(デコード)、同一コンテキストの再利用(プレフィックスキャッシュ)、複数のサブエージェントによる並行実行といった負荷の高い処理が日常的に発生するようになっている。しかし、従来の多くのローカル推論エンジンは多様なモデル構造を汎用的に実行する柔軟性を重視して設計されており、特定のモデル形状に対する最適化や投機的デコーディングの統合においてオーバーヘッドが生じていた。Inco AIは、データセンター向けインフラで培った「モデルに合わせてエンジン全体を特化設計する」という思想をApple Silicon搭載Macにも適用することで、ローカルエージェント作業における性能ボトルネックの解消を図っている。

ローカルLLMの利用者への影響

ローカル環境でオープンウェイトモデルを運用する開発者にとって、Splash Engineの登場はApple Silicon環境における高速な実行選択肢をもたらす。

利用形態とアクセシビリティ

Splash EngineはApache-2.0ライセンスでオープンソース公開されており、GitHubからHomebrewを通じて直接CLIツールとして導入できる。加えて、代表的なローカルLLMデスクトップアプリであるLM Studio Bionic(1.1.5以降)に初日からネイティブ統合されたため、複雑な環境構築を行わずにGUIから導入・実行が可能となっている。APIインターフェースとしてはOpenAI Chat Completions、Responses、Anthropic Messagesの各形式をサポートしており、ストリーミング出力、ツール呼び出し(Tool Calling)、JSON Schema出力、画像入力に対応している。OpenCodeやClaude Code、Codex、Hermesといった既存のコーディングエージェントツールともシームレスに接続できる設計となっている。

ハードウェア要件と制約

高い性能を発揮する一方で、ハードウェアに対する要求水準は高めに設定されている。対応要件はM3以降のプロセッサを搭載したMac、macOS 26.4以降、かつ最低36 GB以上の統一メモリと定められており、Inco AIは実用環境として48 GB以上のメモリを推奨している。Qwen3.8-27Bを動作させる場合、モデル本体の重み(15 GiB)とドラフトモデル(1.2 GiB)に加えてKVキャッシュ領域が確保されるため、エディタやブラウザを並行して動かしながら長いコンテキストを処理するには大容量の統一メモリが前提となる。旧世代のM1/M2チップや、メモリ容量が36 GB未満の環境では動作対象外となる点に留意が必要である。

対応モデルと今後の拡張性

Splash Engineの最大の特長である「モデル特化型」の設計は、対応モデルの選択肢が限定されるというトレードオフを伴う。現時点で提供されているモデルは「Qwen3.6-35B-A3B」および「Qwen3.8-27B」の2種類のみであり、一般的なGGUF形式やMLX形式の任意モデルを自由に読み込んで実行する汎用ランタイムとしては機能しない。Inco AIは今後も対応モデルを順次追加していく方針を表明しており、ユーザー独自のファインチューンモデルの対応要望や、エージェント開発者からの問い合わせを受け付けていると述べている。ただし、資料内においてQwenシリーズ以外の具体的な追加予定モデル名や時期については言及されていない。

関連記事

出典