EXL2・EXL3形式とは:対応エンジンと入手できるモデルまとめ

EXL2・EXL3 とは

EXL2 と EXL3 は、推論ライブラリ ExLlama の開発者(turboderp)が作った量子化形式です。EXL2 は ExLlamaV2、後継の EXL3 は ExLlamaV3 で読み込みます。Hugging Face では、名前に exl2 exl3 と平均のビット数(4.0bpw など)の付いたリポジトリで配られています。

何がうれしいのか

  • ビット数を細かく選べます。 EXL2 は層ごとに 2〜8bit を混ぜ、平均のビット数を 2.5bpw・4.65bpw のように自由に決められます。GPU のメモリにちょうど収まる大きさを狙えるのが最大の特徴です。
  • EXL3 は、より新しい量子化の研究にもとづいています。 ExLlamaV3 の README は、EXL3 を Cornell RelaxML の QTIP という手法を簡素化したものと説明しており、同じビット数でも精度を落としにくくすることを狙っています。
  • 家庭用の NVIDIA GPU に向けて作られています。 1枚〜数枚の GPU で、大きなモデルを速く動かすことを目的にしています。

手元で動かすときのポイント

  • NVIDIA の GPU(CUDA)が前提です。 CPU や Mac では動きません。その場合は GGUF・MLX を選びます。
  • サーバーとして使うなら TabbyAPI です。 ExLlamaV3 の README は、OpenAI 互換の API を提供する TabbyAPI を公式の推奨サーバーとしています。画面から使うなら TextGen(text-generation-webui)も ExLlamaV3 に対応しています。
  • EXL2 と EXL3 は別の形式です。 新しく選ぶなら、開発の中心が移った EXL3 を優先します。Ollama・LM Studio(llama.cpp 系)ではどちらも読み込めません。
  • リポジトリはビット数ごとにブランチを分けていることがあります。 目的のビット数のブランチ(または別リポジトリ)を指定してダウンロードします。

出典: turboderp-org/exllamav3 の README、turboderp-org/exllamav2 の README、oobabooga/textgen の README(いずれも 2026-09-27 時点)。

当サイトの記録とデータ

当サイトは、EXL2・EXL3形式で入手できるモデルの記事を1本公開しています(記事のリポジトリ自体がEXL2・EXL3形式のもの1本、そのモデルのEXL2・EXL3版を確認したもの0本)。下の一覧は当サイトが確認した範囲(公開元の組織と、実績のある量子化の配布者)に限られます。一覧に無いモデルにもEXL2・EXL3版が存在することがあります。モデル形式別まとめの1ページです。

対応する主なエンジン

エンジン 概要
ExLlamaV3 コンシューマー向けNVIDIA GPUに特化した推論ライブラリ。独自のEXL3量子化形式で、限られたVRAMに大きなモデルを収める。
TextGen ローカルLLM用のデスクトップアプリ(旧称 text-generation-webui)。llama.cpp・ExLlamaV3・Transformers・TensorRT-LLM などのバックエンドを切り替えて使え、OpenAI / Anthropic 互換のAPIを持つ。ブラウザで使うWeb UIとしても起動できる。

EXL2・EXL3形式で入手できるモデル

→ 横にスクロールできます

公開日 モデル 入手先 量子化 最小のVRAM階層 記事
2026-09-28 orcarouter/OrcaSAQ-2-27B このリポジトリ — 16GB 「OrcaSAQ-2-27B」テキスト生成モデル:必要VRAM 16GB〜

「最小のVRAM階層」は各記事の動作環境の表(変換版は、その変換版のファイル。画像・動画・音声のモデルは部品まで数えた記事の表)で最も小さい構成が収まる階層です。コンテキスト長に応じた余裕を見込んでください。

最終更新 2026-09-28(JST)。ページ前半の解説は、出典に挙げた一次資料をもとに AI を用いて執筆したものです。「当サイトの記録とデータ」以降の表は、記事ログからコードが組み立てています。