AIエージェント向け推論エンジン「Magnitude」公開、llama.cpp比で最大2倍高速

AIエージェント向け推論エンジン「Magnitude」公開、llama.cpp比で最大2倍高速

基本情報

項目 内容
公開日 2026-10-01
ライセンス Apache-2.0
出典の種類 公開元の一次情報(公式GitHubリポジトリがソースに含まれているため一次情報として裏付け可能)

情報を集めた時点で、当サイトのコードが確定させた値です。日付はJSTで表示しています。

概要

Magnitudeの初期リリースが公開されました。Magnitudeは、Rustで開発されたAIエージェント向けのオープンソース推論エンジン(Apache-2.0ライセンス)であり、実行環境のハードウェアに合わせてカーネルを自動的に最適化する機能を備えています。

本バージョンでは、デバイス上でのカーネルコンパイルとチューニングにより、llama.cppと比較して最大2倍の推論速度を実現しており、ローカル環境でのエージェントの動作を劇的に高速化したいユーザーにとって、非常に強力な選択肢となっています。

主な変更点

デバイスごとのカーネル自動最適化機能の導入

Magnitudeは、一般的な推論エンジンが広範なハードウェア向けに事前コンパイルされたカーネルを配布するのに対し、実行時にユーザーの実際のデバイスに合わせてカーネルをコンパイルおよびチューニングします。

このプロセスにより、特定のチップの特性に完全に適合したコードが生成されます。Apple Silicon、NVIDIA、AMDの各GPU、あるいはCPUのみの環境であっても、そのハードウェアが持つ本来の性能を限界まで引き出すことができます。モデルを実行する前にチューニングが行われるため、初回の起動時に最適化プロセスが走りますが、その後の推論速度は劇的に向上します。既存の汎用エンジンでは性能を出しきれなかった特殊な構成のハードウェアを使用しているユーザーに、特に大きな恩恵があります。

llama.cppを凌駕する推論パフォーマンスの実現

ベンチマークにおいて、llama.cppなどの既存エンジンを大きく上回るスコアを記録しています。具体的には、Metal(Apple Silicon)環境でのデコード速度が92%向上し、CUDA(NVIDIA)環境でも19%の高速化が確認されています。

このパフォーマンス向上は、特に逐次的なトークン生成が重要となるエージェントのタスクにおいて、ユーザー体験を直接的に改善します。汎用的なエンジンでは到達できなかった速度域でオープンウェイトモデルを動かせるようになるため、より複雑な推論を短時間で完了させることが可能です。導入後は、アプリ内の「Discover」セクションから推奨モデルを選択するだけで、この高速な推論環境を利用できます。

エージェント並列実行のためのメモリ最適化とキャッシュ共有

複数のエージェントを同時に動作させるワークロードを想定し、高度なメモリ管理機能が実装されました。1エージェントあたりのメモリ使用量を従来比で27%削減しており、エージェントがタスクを終了すると即座にメモリが解放される仕組みになっています。

また、高速な並列セッションを実現するために、セッション間でプレフィックスキャッシュ(Prefix Cache)を共有する機能を備えています。これにより、同じシステムプロンプトや背景知識を使用する複数のエージェントを起動した際でも、メモリの重複消費を抑え、処理の停滞を防ぐことができます。複数のエージェントをローカルで同時に走らせる開発者にとって、リソース管理の負担を大幅に軽減する機能です。

主要エージェントとのシームレスな連携機能

Pi、OpenCode、Hermes、OpenClaw、Codex、Claude Code、Oh My Pi、Clineといった、現在広く利用されているオープンウェイトモデルベースのエージェントと、ワンクリックで接続できる機能が導入されました。

これらのエージェントを既に利用しているユーザーは、Magnitudeの「Connections」設定から接続するだけで、設定の手間なく高速な推論環境の恩恵を受けられます。また、OpenAI互換のAPIを提供しているため、これら以外の独自エージェントやツールからも、標準的なインターフェースを通じて簡単に利用することができます。

完全ローカルかつプライベートな実行環境の提供

Magnitudeはプライバシーを重視して設計されており、プロンプト、ファイル、モデルのすべてがユーザーのローカルマシン内に留まります。モデルのダウンロード時を除き、インターネット接続は必要ありません。

トークン課金が発生しないだけでなく、機密性の高いデータを扱うエージェントの運用においても、外部サーバーにデータが送信される心配がないため、セキュアな開発環境を構築したい技術者にとって最適なソリューションとなります。導入にあたって特別な外部サービスへの登録は不要で、デスクトップアプリをインストールするだけで、CLIを含めたすべての機能が利用可能になります。

対応モデル・ハードウェア

Magnitudeは、多種多様なハードウェア環境および主要なオープンウェイトモデルに対して最適化された実行環境を提供します。

ハードウェアの面では、動作に必要な固定の最小スペック要件が設定されていません。Apple Silicon(Mac)、NVIDIAのGPU、AMDのGPUといった多様なグラフィックアクセラレータに対応しているほか、GPUを備えていないCPUのみの環境であっても問題なく動作させることができます。実行環境のマシンリソースに合わせて柔軟に動作するため、メモリの少ない小型マシンでは小さめのモデルを実行し、大容量メモリを搭載した高度なマシンでは大型のモデルを実行するといった形で、それぞれの環境に応じた最適な運用を行うことが可能です。

モデル対応においては、すべてのアーキテクチャを一網打尽にする汎用的なアプローチではなく、開発者コミュニティで特に人気を集めているオープンウェイトモデルのファミリーに焦点を当てています。これらのモデルに対して個別に手作業で最適化された専用カーネル(ハンドオプティマイズド・カーネル)を書き起こすことで、汎用推論エンジンを大きく上回る推論速度を実現しています。具体的な対応モデルの完全なリストは、公式Webサイト( magnitude.dev/models )にて順次確認および更新が行われています。

さらに、AIエージェントの利用シーンに対応するため、幅広いエコシステムとの接続性が確保されています。ワンクリックの操作だけで簡単に連携できるエージェントとして、Pi、OpenCode、Hermes、OpenClaw、Codex、Claude Code、Oh My Pi、Clineが対応しています。リストに含まれていないサードパーティ製のエージェントや独自開発されたツールであっても、標準的なOpenAI互換APIを介して通信を行うことで、同様にMagnitudeの高速な推論エンジンを利用することが可能です。

アップデート方法

Magnitudeのセットアップおよび利用開始の手順は極めてシンプルに整理されており、主要なデスクトップOSに対応した統合アプリケーションとして提供されています。

インストールから使い始めるまでの具体的な手順は以下の通りとなります。

  1. デスクトップアプリのダウンロードと起動
    macOS、Windows、Linuxの各オペレーティングシステム向けに提供されている Magnitude をダウンロードし、お使いの環境にインストールした上でアプリケーションを起動します。このデスクトップアプリには magnitude CLI が最初から同梱されているため、ターミナル等で操作するための追加のCLIツールを個別にインストール・設定する手間は一切発生しません。

  2. モデルの選択とダウンロード
    アプリ内のナビゲーションにある「Discover」セクションを開きます。ここで推奨されているモデルの中から、ご自身のハードウェア環境や用途に合ったオープンウェイトモデルを選択し、ローカル環境へダウンロードを行います。

  3. エージェントの接続と実行開始
    アプリ内の「Connections」セクションへ移動し、普段利用しているエージェント(Pi、OpenCode、Hermes、Codexなど)を選択して接続を行います。ワンクリックで連携設定が完了するため、すぐにエージェントを通じた推論処理を開始することができます。

一度モデルのダウンロードを完了すれば、それ以降のプロンプト処理やファイル参照、モデル実行のすべてがローカルマシン内で閉じて行われます。外部ネットワークへのデータ送信は一切発生しないため、プライベートかつ高速な環境でセットアップと運用を即座に開始できます。

次に読むなら

  • 記事に出てくるエンジンを調べる → llama.cpp

出典