ExLlamaV3 1.5.0リリース:MoEモデル推論の高速化と新機能

基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | turboderp-org/exllamav3 |
| 版 | v1.5.0 |
| 公開日 | 2026-09-13 |
| ライセンス | MIT |
| 出典の種類 | 公開元の一次情報(公式GitHubリポジトリのリリースページが出典) |
収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。
概要
ExLlamaV3は、最新のコンシューマー向けGPU上で大規模言語モデル(LLM)をローカル実行するために最適化された、量子化および推論ライブラリです。Pythonで実装されており、MITライセンスの下で提供されています。
最新バージョンである1.5.0がリリースされました。今回のアップデートにおける最大の注目点は、MoE(Mixture of Experts)モデルの推論パフォーマンスの大幅な向上です。特に、MoEモデルのprefill(プリフィル)およびdecode(デコード)速度が改善されたことで、リソースの限られたローカル環境でも、より高度なモデルを実用的な速度で動作させることが可能になります。
主な変更点
MoEモデルの推論性能と投機的デコードの向上
MoE(Mixture of Experts)アーキテクチャを採用したモデルにおいて、prefillおよびdecodeの処理速度が向上しました。さらに、MoEモデル向けの投機的デコード(speculative decoding)の効率も改善されています。
この変更は、Gemma4-26B-A3BやQwen3.8-Flash-NextといったMoEモデルをローカル環境で動かしているユーザーに直接的な恩恵をもたらします。提供されたベンチマークによると、Gemma4-26B-A3BをRTX 5090で実行した場合、prefillで22%、decodeで10%の高速化が確認されています。また、RTX 3090環境でもprefillで26%、decodeで4%の向上が見られます。Qwen3.8-Flash-Nextにおいても、Pro 6000を使用した場合にprefillで27%、decodeで14%の高速化が報告されており、MoEモデルの利用における体感速度の向上が期待できます。利用者はライブラリを更新するだけで、これらの改善を享受できます。
Linux向け実験的なCPUオフロード高速化
Linux環境のユーザーに向けて、CPUオフロード用の実験的な「zero-copy pinned arena mode」が導入されました。
これは、GPUのビデオメモリ(VRAM)が不足している場合に、モデルのレイヤーをシステムメモリ(RAM)にオフロードして実行する際、データの転送効率を高める仕組みです。この機能は、VRAM容量が限られたGPUを使用しながら、大規模なモデルを動かそうとしているユーザーに特に重要です。ベンチマークでは、Qwen3.8-Flash-Nextを80% CPUオフロード状態で動作させた際(Pro 6000 + TR 7960X)、prefillが54%、decodeが20%向上するという極めて高いパフォーマンス改善が示されています。ただし、現時点ではLinuxのみの対応であり、実験的な段階であることに留意してください。
量子化プロセスの高速化
モデルの量子化(quantization)プロセスが高速化されました。
これは、モデルを自身の環境で量子化して使用する、あるいは新しい量子化形式を頻繁に生成する技術者にとって、ワークフローの効率化に直結します。モデルの準備にかかる待ち時間が大幅に短縮されるため、新しいモデルの試行錯誤のサイクルを早めることが可能です。利用者は、最新のライブラリを使用して量子化プロセスを再実行することで、この恩恵を受けることができます。
Nemotron-3-Superのサポート
NemotronHForCausalLMの修正が行われ、Nemotron-3-Superモデルが正式にサポートされました。
Nemotronシリーズのモデルを利用しているユーザーは、このアップデートを適用することで、最新のNemotronモデルをExLlamaV3環境で適切に動作させることができるようになります。既存のモデル使用手順に変更はありませんが、最新モデルを利用する場合はアップデートが必要です。
対応モデル・ハードウェア
今回のアップデートにより、以下のモデルアーキテクチャや環境での改善・サポートが確認されています。
新規サポートモデル
- Nemotron-3-Super (NemotronHForCausalLMの修正により対応)
パフォーマンス改善が確認されたモデル
- Gemma4-26B-A3B (MoEモデル)
- Qwen3.8-Flash-Next (MoEモデル)
- GLM5.3-Flash
- Qwen3.8-27B
- gpt-oss-20b
ハードウェア・環境への影響
- Linuxユーザー: CPUオフロード利用時に「zero-copy pinned arena mode」による大幅な高速化が期待できます。
- NVIDIA GPUユーザー: RTX 5090, 4090, 3090Ti, 3090, および Pro 6000 などの各種コンシューマー向けGPUにおいて、MoEモデルやDenseモデルの推論速度向上が報告されています。
アップデート方法
ExLlamaV3のインストールには、事前に適切なバージョンのPyTorch(CUDA 12.4以降)がインストールされている必要があります。代表的なインストール手順は以下の通りです。
PyPIを使用する場合
pip install exllamav3
※PyPIパッケージにはビルド済みの拡張機能が含まれていないため、CUDA Toolkitおよびビルド環境(Windowsの場合はVS Build Tools、Linuxの場合はgccなど)が必要です。
ソースからインストールする場合
pip install torch --index-url https://download.pytorch.org/whl/cu128
pip install.
関連記事
- ExLlamaV3 v1.4.9リリース:CPUオフロード高速化と新モデル対応
- ExLlamaV3 1.4.8リリース:VRAM最適化とFA-2コードパスの削除
- exllamav3 v1.4.7リリース:CPU MoE性能改善とDRYサンプラー追加
出典
更新履歴
- 2026-09-20: 下書きに戻していた記事を、材料を集め直して書き直し、公開に戻しました。

