推論エンジン「@magnitudedev/cli」v0.2.5公開、M5 Mac対応やMoE高速化

推論エンジン「@magnitudedev/cli」v0.2.5公開、M5 Mac対応やMoE高速化

基本情報

項目 内容
リポジトリ magnitudedev/magnitude
版 @magnitudedev/cli@0.2.5
公開日 2026-10-03
ライセンス Apache-2.0
出典の種類 公開元の一次情報(公式GitHubリポジトリのリリースノート)

情報を集めた時点で、当サイトのコードが確定させた値です。日付はJSTで表示しています。

概要

エージェント向け推論エンジンmagnitudedev/magnitudeのCLIツールである「@magnitudedev/cli」のバージョン0.2.5が公開されました。magnitudeは、実行環境のハードウェアに合わせてカーネルを自動コンパイル・最適化するRust製のオープンソース推論エンジンであり、Apache-2.0ライセンスで提供されています。Apple Silicon、NVIDIA GPU、AMD製GPU、CPUなど幅広い環境に対応しています。

本バージョンにおける最大の変更点は、M5以降のMac環境におけるプロンプト処理(プリフィル)の大幅な高速化と、Multi-token prediction(複数トークン予測)を組み合わせたMixture-of-Experts(MoE)モデルの生成速度向上です。M5環境ではプロンプト処理速度が約2倍に達するほか、対応するMoEモデルや長文コンテキストでの生成速度も向上しています。対象ハードウェアや該当モデルをローカルで動かしている利用者は、推論待ち時間を大幅に削減できるため、アップデートを検討する価値があります。

主な変更点

M5以降のMacにおけるプロンプト処理が約2倍に高速化

行列乗算およびアテンション処理をGPUのTensor operations(テンソル演算機能)で実行する最適化が導入されました。これにより、M5以降のMacにおいてプロンプト処理が約2倍に高速化されます。たとえばQwen3.5-4Bを64Kコンテキストで実行した場合、プロンプト処理速度は従来の308 tok/sから649 tok/sへと倍増し、最初のトークンが出力されるまでの時間(Time to First Token)が213秒から101秒へと半減します。この変更による出力内容の差異はありません。なお、M5より前の世代のMacについては処理速度に変更はありません。設定変更は不要で、更新後にそのまま恩恵を受けられます。

MoEモデルにおけるMulti-token predictionの生成高速化

Multi-token predictionを備えたMoEモデルにおいて、従来の1トークン先ではなく3トークン先までドラフト(先行生成)を行う仕様に変更されました。これにより生成速度が大きく向上しています。具体的には、Qwen3.6-35B-A3Bを実行した場合、GB10環境では従来の97〜105 tok/sから106〜138 tok/sへ、M4 Pro環境では従来の103〜111 tok/sから109〜138 tok/sへと高速化されます。該当するMoEモデルを運用している環境に直接影響します。

16Kコンテキストにおける生成速度の向上

16Kの長文コンテキストにおける生成処理において、出力層の読み取り量を抑え、各ステップの処理をより少ないGPU起動(launch)に集約する最適化が行われました。この改良により、出力を保ったまま生成速度がMac環境で約8%(67.0 tok/sから72.4 tok/sへ)、NVIDIA GPU環境で約11%(66.3 tok/sから73.4 tok/sへ)向上します。長いコンテキストでモデルを動かしているユーザー全般に恩恵があります。

NVIDIA GPUにおけるMulti-token predictionの検証時間削減

NVIDIA GPU上でMulti-token predictionを実行する際、複数のドラフトトークンが同じエキスパートを選択した場合に、各ステップでエキスパートの重みを1回だけ読み込むように効率化されました。これにより、検証処理にかかる時間が最大で11%削減されます。NVIDIA製GPUで該当の投機的デコーディング機能を利用している環境の処理速度が改善します。

M1およびM2 Macにおけるモデルロード失敗バグの修正

M1およびM2世代のMacにおいて、「requests N threads per threadgroup; the pipeline allows M」というスレッドグループ制限に起因するエラーでモデルのロードに失敗していた問題が修正されました。Metalカーネルが起動時のスレッド数を受け入れるようにビルドされるようになり、M1 Max環境におけるQwen3.8 27Bのロード失敗などが解消しています。あわせて、キーあたり16個以上のクエリヘッドを持つモデル(Gemma 4 12B、Muse Glimmer 30B、Nemotron 3.5 Lightning、Qwen3.5 122B、Nemotron 3 Super)がM1/M2 Macで動作しなかった問題も修正されました。プリフィルアテンションにおいてキーのクエリヘッドをグループ単位に分割することで、各Macのスレッド制限内に収まるように処理されます。他環境への速度や出力の影響はありません。

Vulkan GPUでのシェーダーコンパイルエラーの修正

Vulkan環境において、DFlash2投機的デコーディングを使用するモデル(Qwen3.8 27Bなど)やNemotronモデルをロードした際にシェーダーコンパイルエラーが発生していた不具合が修正されました。カタログに掲載されているモデルが読み込む全カーネルを含め、すべてのGPUカーネルがリリース前にVulkan、CUDA、Metal向けに事前コンパイルされる体制に改められています。Vulkanで推論を行っている環境で対象モデルが正しく起動するようになります。

実行中またはロード中のモデル削除時のエラー表示改善

実行中あるいはロード処理中のモデルを削除しようとした際、誤解を招くエラーが発生していた挙動が修正されました。今後はモデルを削除する前に自動的に停止処理が挟まるようになり、確認メッセージにもその旨が明確に表示されます。

対応モデル・ハードウェア

本バージョンでは、特定のハードウェア環境におけるモデルの互換性が大幅に向上しており、これまで動作に制限のあったモデルが新たに利用可能になっています。

Apple Silicon(M1 / M2 / M5以降)への対応強化

M1およびM2世代のMacにおいて、Metalカーネルのスレッドグループ制限に起因するエラーが解消されました。これにより、以下のモデルがM1およびM2 Mac環境で新しく、あるいは安定して動作するようになっています。

  • Qwen3.8 27B(M1 Maxなどでのロード失敗を修正)
  • Gemma 4 12B
  • Muse Glimmer 30B
  • Nemotron 3.5 Lightning
  • Qwen3.5 122B
  • Nemotron 3 Super

これらのモデルは、キーあたり16個以上のクエリヘッドを持つ特徴があり、従来のバージョンではM1やM2のMacで処理上限を超えてエラーが発生していました。今回のアップデートにより、プリフィルアテンション処理においてキーのクエリヘッドをグループ単位に分割する仕組みが導入され、速度や出力を損なうことなく、すべてのMac環境の制限内で動作させることが可能になりました。

また、M5以降の最新のMac環境においては、GPUのテンソル演算(tensor operations)を利用した行列乗算やアテンション処理に新しく対応しました。これにより、Qwen3.5-4Bなどのモデルでプロンプト処理が約2倍に高速化されるなど、最新ハードウェアの性能を最大限に引き出せるようになっています。

Vulkan GPU環境における対応モデルの拡大

Vulkan対応のGPU環境において、これまでシェーダーコンパイルエラーが発生して起動できなかったモデルが正常にロードできるようになりました。具体的には、以下のモデルや構成が新たにサポートされます。

  • DFlash2投機的デコーディングを使用するモデル(Qwen3.8 27Bなど)
  • Nemotronシリーズの各種モデル

すべてのGPUカーネルがリリース前にVulkan、CUDA、Metalの各環境向けに事前コンパイルされるようになったため、Vulkan環境でもエラーを回避し、安定した推論を実行できます。

その他の対応ハードウェアとモデル

本バージョンでの最適化は、以下のハードウェアやモデルの組み合わせに対しても、生成速度の向上という形で恩恵をもたらします。

  • GB10(NVIDIA GPU)および M4 Pro(Mac):Multi-token predictionを有効にしたMoEモデル「Qwen3.6-35B-A3B」の生成速度が向上します。
  • 一般的なMacおよびNVIDIA GPU:16Kの長文コンテキストを利用するすべてのモデルにおいて、生成速度が向上します。

アップデート方法

提供された資料には、本バージョンにおける具体的なインストールコマンドやアップデート用コマンドの記載がありません。そのため、お使いの環境におけるアップデート手順の詳細については、以下のリリースページや公式リポジトリの情報を直接ご確認ください。

通常、CLIツールの更新はパッケージマネージャーを介して行われますが、環境ごとの最適な導入手順や依存関係の確認については、公式のドキュメントを参照することをおすすめします。

関連記事

次に読むなら

出典