推論エンジン「Magnitude CLI 0.2.4」公開、メモリ削減と初回ロード高速化を実現

基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | magnitudedev/magnitude |
| 版 | @magnitudedev/cli@0.2.4 |
| 公開日 | 2026-10-02 |
| ライセンス | Apache-2.0 |
| 出典の種類 | 公開元の一次情報(公式GitHubリリースノート) |
情報を集めた時点で、当サイトのコードが確定させた値です。日付はJSTで表示しています。
概要
「magnitudedev/magnitude」の最新バージョンである「0.2.4(@magnitudedev/cli@0.2.4)」がリリースされました。magnitudedev/magnitudeは、エージェント向けに開発されたRust製のオープンソース推論エンジンで、ライセンスはApache-2.0です。お使いのデバイス上でカーネルを直接コンパイルおよびチューニングし、ハードウェアに最適化させることで、オープンモデルをllama.cppと比べて最大2倍高速に動作させることができます。Apple Silicon、NVIDIA、AMD、あるいはCPU単体での動作に対応しています。
今回のアップデートにおける利用者への最も大きな影響は、モデルの実行に必要なメモリ量が大幅に削減されたこと、および初回ロード時のカーネルチューニング時間がどのデバイスでも最大約1分以内に短縮されたことです。これにより、より大きなモデルや長いコンテキストを快適に扱えるようになり、起動時の待ち時間ストレスが劇的に解消されます。
主な変更点
メモリ使用量の大幅な削減
モデルが重み以外に必要とするメモリが削減され、より大きなモデルや長いコンテキストを動作させることができるようになりました。具体的な例として、Qwen3.5-4Bを動作させる際のワーキングメモリは3.7 GBから120 MBへと削減され、実行用に確保されるメモリも10.0 GBから5.9 GBへと減少しています。このメモリ削減による推論速度の低下はありません。また、画像処理用のメモリは最初の画像が処理される際に確保され、アイドル状態になると解放されるように改善されました。
初回チューニング時間を最大約1分に制限
CPUのみを搭載したマシンなどで、モデルの初回ロードに20分から50分ほどかかり、ハングアップしたように見えていた問題が修正されました。これまではデバイスの処理能力が低いほどチューニングにかかる時間が増加していましたが、今回の変更により、どのデバイスでも最大約1分でチューニングが完了するようになり、進捗も表示されます。M4 Max環境におけるQwen3.5-4Bの初回ロードでは、チューニング時間が約50秒(以前はGPUで149秒、CPUで279秒)に短縮され、その後の推論速度は維持されています。Gemma 4 26Bのような大型モデルでも、テストデータの準備を1回にまとめ、1分以内に収まらないカーネルはデフォルト設定を維持することで、チューニング時間を1分以内に維持します。
x86 CPUでのQ6_Kモデルの高速化
x86アーキテクチャのCPU環境において、Q6_Kの重みを持つモデルの推論速度が向上しました。遅いプロセッサパスを経由することなく半精度スケールを変換できるように処理が変更されたためです。x86 CPU環境でQ6_K量子化モデルを動かしているユーザーに直接恩恵があります。
リクエスト失敗時のエラーハンドリング改善
長い会話の途中でメモリが不足した際など、リクエストが途中で失敗したにもかかわらず、空の返答を返して成功したように見えてしまう不具合が修正されました。アップデート後は、503エラーコードと Retry-After ヘッダー、およびエラーメッセージを返すようになります。これにより、Pi、OpenCode、Claude Codeなどのエージェントハーネスが自動的に再試行を行えるようになります。また、これまでサイレントに失敗していた推論エンジンからのメモリ圧迫やリクエストの失敗が、ログに記録されるようになりました。
M1/M2 Macでのロード失敗の修正
M1およびM2チップを搭載したMacにおいて、カーネルのデフォルト設定がチップの許容スレッド数を超えてしまい、モデルのロードに失敗する不具合が修正されました。今回の修正により、動作可能な最も近い設定からチューニングが開始されるようになります。M1やM2 Macをお使いのユーザーで、これまで起動に失敗していた場合に有効な修正です。
SSH経由での起動エラーの修正
コンソールに誰もログインしていない状態で、SSHを経由してMacにアクセスした際、magnitude serve コマンドが起動に失敗する問題が解決されました。リモートからMac上のサーバーを起動して利用する開発者にとって、利便性が向上します。
対応モデル・ハードウェア
今回のバージョン0.2.4では、特定のモデルアーキテクチャやハードウェア環境における動作の安定性とパフォーマンスが大幅に向上しています。
対応モデル
本バージョンにおいて、以下のモデルの動作や最適化が確認されています。
-
Gemma 4 26B
Gemma 4 26Bのような大型モデルにおいて、初回ロード時のカーネルチューニングが1分以内に収まるように最適化されました。テストデータの準備プロセスが効率化され、時間内に処理が完了しないカーネルについてはデフォルト設定を維持する仕組みが導入されたことで、大型モデルでもスムーズに起動できるようになっています。 -
Qwen3.5-4B
Qwen3.5-4Bにおいて、メモリ効率が劇的に改善されました。動作に必要なワーキングメモリや実行用予約メモリが大幅に削減され、推論速度を犠牲にすることなく、より省メモリでの動作が可能となっています。 -
Q6_K量子化モデル
Q6_Kの重みを持つモデルについて、x86アーキテクチャのCPU上での推論速度が向上しました。
対応ハードウェア
magnitudedev/magnitudeは、Apple Silicon、NVIDIA、AMD、およびCPUのみの環境をサポートしていますが、今回のアップデートでは特に以下のハードウェア環境における修正と最適化が行われています。
-
Apple Silicon(M1、M2、M4 Max)
M1およびM2チップを搭載したMacにおいて、カーネルのデフォルト設定がチップの許容スレッド数を超えてロードに失敗する問題が修正されました。また、M4 Max環境では、Qwen3.5-4Bの初回ロード時のチューニング時間が約50秒に短縮されるなど、最新チップへの最適化も進んでいます。 -
x86 CPU
x86アーキテクチャのCPU環境において、Q6_K量子化モデルの半精度スケール変換処理が高速化され、CPU単体での推論パフォーマンスが向上しています。 -
ヘッドレス環境のMac(SSH経由)
コンソールにユーザーがログインしていない状態のMacに対し、SSH経由でリモートアクセスしてmagnitude serveを起動するユースケースに対応しました。これにより、サーバー用途としてMacをリモート運用する際の利便性が向上しています。
アップデート方法
今回のリリース(@magnitudedev/cli@0.2.4)を導入するための具体的なインストール手順やコマンドラインの指示は、提供された資料には直接記載されていません。
そのため、アップデートを行う際は、プロジェクトの公式リリースページやGitHubリポジトリの指示に従ってください。
通常、本ツールを起動する際は、以下のコマンドが使用されます。
magnitude serve
詳細なインストール手順や最新のCLIツールの取得方法については、GitHubのリポジトリおよび公式リリースページをご確認ください。
前回の記事からの更新履歴
当サイトがGitHubのリリース一覧から機械的にまとめた、この版と前回取り上げた版の間に出た版です(単独記事にはしていません)。 全ての版はエンジン別ページにあります。
関連記事
次に読むなら
- このツールの更新を追う → Magnitude の概要とリリース履歴(記録済み3版)
- 同じ分類(推論エンジン・ランタイム)の他のツール → llama.cpp / Ollama / vLLM
出典
本記事は以下の公式資料およびコミット情報を元に作成されています。
- magnitudedev/magnitude @magnitudedev/cli@0.2.4 リリースノート
- magnitudedev/magnitude 公式リポジトリ
- コミット f0498ce (Gemma 4 26B等の大型モデルにおける初回ロード時のカーネルチューニング改善)
- コミット e38af0e (M1/M2 Macでのロード失敗の修正)
- コミット cef7f3b (メモリ不足等によるリクエスト失敗時のエラーハンドリング改善)
- コミット 4713d97 (SSH経由のMacにおけるmagnitude serveの起動エラー修正)
- コミット 7eabf99 (メモリ使用量の削減、初回チューニング時間の短縮、x86 CPUでのQ6_Kモデル高速化)
