推論エンジン「magnitude」v0.2.6公開、Macでのプロンプト処理が大幅高速化

基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | magnitudedev/magnitude |
| 版 | @magnitudedev/cli@0.2.6 |
| 公開日 | 2026-10-06 |
| ライセンス | Apache-2.0 |
| 出典の種類 | 公開元の一次情報(公式GitHubリポジトリのリリースノートが一次情報) |
情報を集めた時点で、当サイトのコードが確定させた値です。日付はJSTで表示しています。
概要
magnitudedev/magnitude の最新バージョン @magnitudedev/cli@0.2.6 がリリースされました。magnitudedev/magnitude は、実行するハードウェアに合わせてカーネルを自動的にコンパイル・チューニングし、最適化を行うRust製のオープンソース推論エンジンです(ライセンスはApache-2.0)。Apple Silicon、NVIDIA、AMD、CPUに対応しており、llama.cppと比較して最大2倍高速にオープンモデルを実行できる特徴を持っています。
今回のアップデートにおける最も大きな変更点は、Mac環境(特にM5以降のチップや、M1/M2/M4 Proなど各世代のApple Silicon)におけるプロンプト処理速度の大幅な向上と、長文プロンプト処理時の安定性向上です。MacでローカルLLMを動かしているユーザーにとって、パフォーマンスと安定性の両面で非常に価値のある更新となっています。
主な変更点
Mac環境でのプロンプト処理が大幅に高速化
M5以降のMacにおいて、プロンプト処理速度が約50%向上しました。例えば、Qwen3.5-4Bをコンテキスト長64Kで実行した場合、プロンプト処理速度が従来の652 tok/sから約970 tok/sへと高速化しています。これは、プロンプトに対するアテンション処理において、キーと値をステージングすることなくGPUのテンソル演算を通じて直接読み込むようにしたことや、不安定で低速なデフォルト設定を維持しないようにカーネルチューニングを改善したことによるものです。
また、すべてのMacを対象として、重みブロックのデコードを従来の64行ごとから最大512行ごとに1回へと変更しました。これにより、出力結果を変えることなく、行列乗算の速度がM4 Proで7〜11%高速化、M1で17〜25%高速化しています。M4 Pro上のQwen3.5-4B(コンテキスト64K)では、プロンプト処理が従来の513 tok/sから534 tok/sに向上します。
M1/M2 Macでの長文処理時のクラッシュを修正
M1およびM2 Macにおいて、長いプロンプトを処理している最中に「device lost: … Impacting Interactivity」というエラーが発生し、モデルがアンロードされたままになってしまう不具合が修正されました。
本バージョンでは、llama.cppと同様に、起動時にmacOSのGPUウォッチドッグの制限を緩和する処理が追加されました。これにより、Gemma 4 26Bを使用した場合に、従来は約20kトークン付近で失敗していた35kトークンや69kトークンの長いプロンプトの処理が、途中で失敗することなく完了できるようになりました。
一部MacでのMetalコンパイルエラーの解消
M5 Maxなどの一部のMac環境において、Qwen 3.6などのモデルをロードしようとした際に「no template named 'extents’ in namespace 'metal’」というMetalシェーダのコンパイルエラーが発生し、ロードに失敗する問題が修正されました。 PR #166 での対応により、Metalカーネルのコンパイル時に、デバイス検出の際に確認された言語バージョンと同一のバージョンを使用するようにしたことで、テンソル演算を利用するカーネルが、対応デバイス上で正常にビルドできるようになりました。
長時間リクエストにおける502タイムアウトの防止
ローカルモデルに対する長時間の処理要求が、約5分後に502エラーで失敗する問題が修正されました。非ストリーミングでの生成や長いプロンプトの処理では、生成が完了するまでデータが送信されませんが、エンジンへの接続が待機中にタイムアウトしないように改善されました。
Windows環境でのJSONエラーによる強制終了の防止
Windows環境において、チャットテンプレートやツール呼び出しが不正なJSONを生成した際に、エンジンが異常終了(abort)する問題が修正されました。MSVCでのビルド時にC++の例外処理を有効にしたことで、エンジンがクラッシュすることなく、JSONエラーを適切に報告できるようになりました。
ツール呼び出しやセッション処理に関する各種バグ修正
エージェント機能やAPI連携における複数の不具合が修正されています。
- Codexのツール結果送信エラーの修正: Codexがツール実行結果をローカルモデルに送信できない問題が修正されました。クライアントが
contentまたはsummaryをnullに設定して再送する推論項目(Reasoning items)を、空(empty)として受け入れるように変更されました。 - 空のアシスタントターンのスキップ: 出力を生成する前にステップが失敗した際、OpenCodeセッションが「assistant content is required unless tool_calls are present」というエラーで拒否される問題が修正されました。Chat CompletionsおよびAnthropic APIの両方において、履歴内の空のアシスタントターンをスキップするようになりました。
- Qwenモデルでのツール呼び出しの安定化: Qwenモデルにおいて、ツールのオプションプロパティに自由形式のJSONが含まれている場合に、Oh My PiやOpenClawが失敗する問題が修正されました。並列ツール呼び出しの文法が効率的にコンパイルできない場合でも、単一の呼び出しの文法がコンパイル可能であれば、1ターンにつき1つのツール呼び出しを許可するようにフォールバックします。
- headless起動時のエラー報告改善: バックグラウンド(headless)で実行された
magnitude serveが起動に失敗した際、エラー内容を報告せずにEBADFエラーでクラッシュする問題が修正され、停止原因となったエラーが正しく報告されるようになりました。
対応モデル・ハードウェア
今回のリリースで新たに対応したモデルアーキテクチャの追加は資料に記載されていませんが、既存の対応ハードウェアにおける安定性と性能が大きく改善されています。対応プラットフォームはApple Silicon、NVIDIA、AMD、CPUで変わりありません。
特に言及されているのは以下の環境です。
- Apple Silicon(M1/M2): Gemma 4 26Bなどのモデルで、35k・69kトークンという長いプロンプトを処理できるようになりました。
- Apple Silicon(M4 Pro): Qwen3.5-4B(コンテキスト64K)のプロンプト処理が高速化されています。
- Apple Silicon(M5以降・M5 Max): Qwen3.5-4Bの処理速度向上に加え、Qwen 3.6などのモデルがMetalシェーダのコンパイルエラーなくロードできるようになりました。
これらはいずれも既存対応モデルの動作改善であり、新しいモデルファミリーへの対応拡大ではない点に注意してください。
アップデート方法
資料には具体的なインストールコマンドの記載がないため、最新版への更新手順はリリースページを参照してください。
Macユーザーで長文プロンプト処理時の失敗やMetalコンパイルエラーに遭遇していた場合、本バージョンへの更新で解消される可能性があるため、優先的に更新を検討してください。
関連記事
- 推論エンジン「@magnitudedev/cli」v0.2.5公開、M5 Mac対応やMoE高速化
- 推論エンジン「Magnitude CLI 0.2.4」公開、メモリ削減と初回ロード高速化を実現
- 推論エンジン「Magnitude」公開、公式はllama.cpp比で最大2倍速、当サイトのCPU実測では約21倍遅い
次に読むなら
- このツールの更新を追う → Magnitude の概要とリリース履歴(記録済み5版)
- 同じ分類(推論エンジン・ランタイム)の他のツール → llama.cpp / Ollama / vLLM
出典
- magnitudedev/magnitude @magnitudedev/cli@0.2.6 リリースノート
- PR #166: Metalカーネルのコンパイルバージョン修正
