「OrcaSAQ-2-27B」テキスト生成モデル:必要VRAM 16GB〜

「OrcaSAQ-2-27B」テキスト生成モデル:必要VRAM 16GB〜

基本情報

項目 内容
リポジトリ orcarouter/OrcaSAQ-2-27B
まとめページ Qwen3.8 のまとめ(記事8本)
公開元のまとめ Alibaba(Qwen) のモデルとライセンスのまとめ
公開日 2026-09-24
ライセンス apache-2.0
配布形式 EXL3 / safetensors
出典の種類 未確認(一次情報で裏付けできていない)(非公式のサードパーティ量子化版で、一次情報の裏付けが不十分)

収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。

概要

AI ゲートウェイを運営する OrcaRouter が、Qwen3.8-27B を平均 3.21bit まで圧縮した量子化版 OrcaSAQ2 27B(orcarouter/OrcaSAQ-2-27B)を Hugging Face で公開した。BF16 で 54GB ある元のモデルを、配布ファイルの合計 12.3GB まで縮めている。公開元が掲げる狙いは「27B のモデルを 16GB の GPU 1 枚で動かす」ことで、そのうえで元のモデルとの差が小さいことを、BF16 と直接比べた数値で示している。

公開元はこれを「独自の感度考慮型・混合精度の量子化システム(SAQ2)」と呼び、手法の詳細(較正のやり方・層ごとのビット数の割り振り・詰め方)は公開していない。ただし配布ファイルの設定(quantization_config.json)を見ると、量子化の形式は exl3(ExLlamaV3 の形式、バージョン 1.5.1)である。公開元が同時に出した実行用のカーネルのリポジトリも、中身を「EXL3 のトレリス量子化(QTIP 系)に、探索で決めた混合精度の割り振りを組み合わせたもの」と説明している。つまり新しい形式ではなく、既存の EXL3 形式の中で、層ごとのビット数の配分を工夫したものと読むのが正確である。

土台の Qwen3.8-27B 本体については 「Qwen3.8-27B」マルチモーダル視覚言語モデル:必要VRAM 8GB〜・GGUF版あり で取り上げている。

スペック

  • ベースモデル: Qwen3.8-27B(Qwen3.5 系のハイブリッド構成。64 層のうち 48 層が Gated DeltaNet、16 層が通常のアテンション)
  • 量子化: EXL3 形式、デコーダ部分の平均 3.21bit。出力層(lm_head)は 6bit、埋め込みは int8、MTP のヘッドは 4bit
  • 配布ファイル: safetensors 4 分割、合計 12.27GB
  • コンテキスト長: 262,144 トークン(設計上の上限。16GB の GPU で実際に使える長さは後述)
  • 対応機能: 思考(thinking)モード、ツール呼び出し、MTP(Multi-Token Prediction)による投機的デコード
  • 入力: テキストのみ。土台の Qwen3.8-27B は画像・動画を読めるが、この版には視覚エンコーダが入っていない
  • ライセンス: Apache-2.0(土台の Qwen3.8-27B から引き継ぎ)

性能

元のモデル(BF16)とのずれ

公開元は、配布している重みそのものを BF16 版と同じ評価経路で比べた値を載せている。WikiText-2 の 16,376 トークンで測ったもの。

→ 横にスクロールできます

ビルド サイズ デコーダのビット数 平均 KLD ↓ トップ1一致率 ↑ PPL ↓
Qwen3.8-27B BF16 54GB 16 — 100% 5.6468
OrcaSAQ2 27B 12.3GB 3.21 0.031 93.2% 5.6482

3 つの指標の意味は次のとおり。

  • PPL(Perplexity): 文章の続きをどれだけ迷わず予測できるか。低いほど良い。BF16 からの悪化は +0.02% で、ほぼ差が無い
  • KLD(KL ダイバージェンス): 次のトークンの確率分布が BF16 とどれだけずれたか。0 に近いほど元のモデルに忠実
  • トップ1一致率: 「次に最も選ばれやすいトークン」が BF16 と同じだった割合

この 3 つを並べて読むことが大事である。PPL の差が 0.02% しかないのに、トップ1一致率は 93.2% で、およそ 15 トークンに 1 回は BF16 と違うトークンを最有力として選んでいる。PPL は文章全体で平均した値なので、個々の選択の違いは打ち消し合って表に出にくい。公開元自身も制約の節で「93.2% の一致は、一部のトークンの判断が BF16 と異なることを意味する」「+0.02% の PPL は下流のタスクで同じ性能を保証しない」と書いている。「ほぼ無劣化」と要約するより、「平均的な予測はほとんど変わらないが、個々の判断は一定の割合で変わる」と理解しておくのが正確である。なお、他の量子化版(GGUF や他の EXL3 版)を同じ条件で測った比較は示されていないので、KLD 0.031 が 3bit 台として優れているかどうかは、この資料だけでは判断できない。

エージェント系のベンチマーク(公開元の自己申告)

モデルカードは SWE-bench Verified で 70.0、Terminal-Bench 2.1 で 58.4 というスコアを、Claude Sonnet 4.6・Gemini 3・GPT-5.4 などの公表値と並べた表で示している。ただし次の理由から、この記事では他のモデルとの順位としては扱わない。

  • 公開元自身が、表を「条件をそろえた比較ではなく、公開されている参考値」と断っている。エージェント系のベンチマークは、使う実行環境(ハーネス)・思考の予算・時間制限でスコアが大きく変わる
  • OrcaSAQ2 のスコアをどの実行環境・設定で測ったかが書かれていない
  • 最も知りたい「同じ条件で測った BF16 版のスコア」が無い。そのため、量子化でどれだけ落ちたのかがこの表からは分からない

量子化版の評価として意味があるのは、前の節の「BF16 とのずれ」の方である。エージェント系のスコアは、公開元がそう申告している、という以上には読まないほうがよい。

16GB の GPU での速度

GPU メモリを 15.7GiB に制限して vLLM で測った値。

→ 横にスクロールできます

設定 1ストリーム 8ストリーム 16ストリーム KV キャッシュの容量
MTP なし 65.3 tok/s 332 tok/s 333 tok/s 29,354 トークン
MTP あり 90.1 tok/s 220 tok/s 219 tok/s 14,563 トークン

MTP(投機的デコード)を使うと 1 人で使うときの生成は約 38% 速くなる。その代わり、下書き用のヘッドが同じメモリから KV キャッシュを取るので、文脈に使える量が約半分になり、同時に多数をさばく用途ではむしろ遅くなる。1 人で対話的に使うなら MTP あり、複数の処理を並べるなら MTP なし、という使い分けになる。

実行用カーネルのリポジトリにも同じ趣旨の表があるが、数値が異なる(15.5GiB の制限で、MTP ありの 1 ストリームが 111.2 tok/s、KV キャッシュは MTP なしで 59,753 トークン)。設定や版の違いによるものと見られるが、どちらも公開元の測定で、第三者の再現はまだ無い。

得意なこと・想定用途

公開元が想定するのは、コーディング・端末操作・ブラウザ操作などを長い手順で続けるエージェントである。量子化の小さな誤差でもツールの呼び出しが 1 回変わると、その後の状態がすべて変わっていく ―― だから長い手順のタスクほど量子化の影響が出やすい、というのが公開元の問題意識で、「BF16 とのずれ」を細かく示しているのもそのためである。

手元で使う立場から見ると、このモデルが向いているのは 16GB の GPU(RTX 5080・4080 など)で、27B クラスのモデルをサーバーとして立てたい場合である。OpenAI 互換の API として動くので、コーディング用のエージェントや自作のツールからつなげられる。

注意点も多い。

  • 16GB で 262K の文脈は使えない。 重みで約 12.3GB を使うため、残りは 3〜4GB 程度しかない。公開元も「16GB の GPU では 32K 前後の文脈から始め、用途に合わせて調整する」ことを勧めている
  • 画像は読めない。 土台の Qwen3.8-27B の視覚機能は、この版では外されている
  • 量子化の手法は非公開。 同じ手順を自分で他のモデルに適用することはできない
  • 公開元は AI ゲートウェイを運営する企業で、Hugging Face の公開モデルの多くは既存モデルの検閲解除版(Uncensored)である。この OrcaSAQ2 27B は検閲解除版ではなく、Qwen3.8-27B をそのまま量子化したものとして公開されている

類似モデルとの違い

  • 一般的な GGUF 量子化版(Q3_K_M・IQ3 系など)との違い: 大きさは近いが、動かせるエンジンがまったく違う。GGUF は llama.cpp・Ollama・LM Studio でそのまま動くのに対し、この版はそれらでは動かない(次の節)。代わりに、BF16 とのずれを数値で示している点、vLLM で複数の要求を並べてさばける点が強みになる
  • 他の EXL3 量子化版との違い: EXL3 形式自体は ExLlamaV3 の標準の形式で、3bit 前後の版は他にも作られうる。OrcaSAQ2 の違いは、層ごとにビット数を変える配分の探索と、vLLM で動かすためのプラグインを用意した点にある。ただし同じ条件で他の EXL3 版と比べた数値は示されていない
  • 土台の Qwen3.8-27B(BF16)との違い: 必要なメモリは 4 分の 1 以下になるが、画像入力を失い、トークン単位では 93.2% の一致にとどまる。精度を最優先するなら元のモデル、16GB に収めることを優先するならこの版、という選び方になる

動作環境

動作環境の目安(Local Model Watch 算出) — パラメータ数 27.8B(元モデル Qwen/Qwen3.8-27B の値)

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
RTX 5060 Ti 16GB / 4060 Ti 16GB など 16GB EXL3 11.4GB 13.7GB

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

手元で動かせるか

現時点では Ollama・LM Studio・llama.cpp で動かせません(GGUF版を確認できていない)。

公開元の配布は EXL3 / safetensors のみです。現時点で動かすなら transformers(PyTorch) で読み込む形になり、必要メモリは上の表のとおりです。

ライセンス apache-2.0(商用利用可): 商用利用を含めて自由に利用・改変・再配布できます。再配布時にライセンス文と変更点の告知が必要で、特許の許諾条項があります。

配布形式・当サイトが見つけた変換版・各推論エンジンの登録表を突き合わせた判定です。「確認できていない」は当サイトが見つけていないという意味で、存在しないことの断定ではありません。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。

当サイトでの実測

当サイトのサーバー(GPUなし)で、このモデルのファイルを実際に読み込み・動かして確かめた値です。モデルカードの記載ではなく、当サイトが測った結果です。測り方と全モデルの一覧は観測データにまとめています。

日本語のトークン効率

トークナイザ 日本語1,000字あたりのトークン数 同じ内容の英文との比
このモデル 546 0.99倍
Qwen3 688 1.26倍
Llama 3.2 744 1.36倍
Gemma 3 564 1.03倍
gpt-oss 795 1.45倍
LLM-jp-3 497 0.85倍

Qwen3 のトークナイザより約21%少ないトークンで同じ日本語を表せます。同じ文脈長に入る日本語が約1.26倍になり、生成も1字あたりで速くなります。

orcarouter/OrcaSAQ-2-27B の tokenizer.json で、当サイトが書き下ろした固定の文章(876字。ニュース・会話・技術文書・敬語のメール・紀行文・料理の6種)と、同じ内容の英文を数えました。トークン数が少ないほど、同じ文脈長に長い日本語が入ります。

同クラスの既報モデル

当サイトが最近取り上げた、パラメータ数 15〜40B のモデルを、比較のために記事ログからコードが並べたものです。VRAM階層は当サイトの概算、ライセンスはモデルカードの記載です。

→ 横にスクロールできます

モデル パラメータ数 最小のVRAM階層 ライセンス 記事
XingChen-AGI/Xing4.0-29B-A4B 31.2B 24GB apache-2.0 「Xing4.0-29B-A4B」コーディングエージェントに強い29BのMoEモデル:必要VRAM 24GB〜(2026-09-28)
Edge0/Edge0-35B-A3B-preview 36.0B 24GB apache-2.0 「Edge0-35B-A3B-preview」スマホクラスで動く35BのMoEモデル:必要VRAM 24GB〜(2026-09-11)
bartowski/Gryphe_Pantheon-Reasoning-26B-A4B-1.1-V2-GGUF 26.5B 12GB apache-2.0 「Gryphe_Pantheon-Reasoning-26B-A4B-1.1-V2-GGUF」:必要VRAM 12GB〜(2026-09-11)
nex-agi/Nex-N2.5-mini 35.1B 16GB apache-2.0 「Nex-N2.5-mini」長期タスク向けのエージェントモデル:必要VRAM 16GB〜・GGUF版あり(2026-09-09)
IFM/K2-Horizon-MoVA-36B-A4B-GGUF 37.4B 32GB apache-2.0 「K2-Horizon-MoVA-36B-A4B-GGUF」テキスト生成モデル:必要VRAM 32GB〜(2026-09-06)

入手方法

  • 配布: Hugging Face の orcarouter/OrcaSAQ-2-27B(safetensors、EXL3 形式)
  • llama.cpp・Ollama・LM Studio では動かない。 実行用カーネルのリポジトリは「llama.cpp は独自の量子化の符号表しか読めないため、この重みは使えない。GGUF にするには別の量子化器で量子化し直すことになる」と明言している
  • vLLM で動かす場合: vLLM に加えて、公開元のプラグイン(Continuum-AI-Corp/OrcaSAQ2-kernel)を入れる必要がある。モデルカードは pip install git+https://github.com/Continuum-AI-Corp/OrcaSAQ2-kernel を案内しており、カーネルのリポジトリには 16GB 向けの起動設定と Docker イメージも用意されている。思考の出力とツール呼び出しを正しく受け取るには --reasoning-parser qwen3 と --tool-call-parser qwen3_xml を付ける
  • ExLlamaV3 で動かす場合: カーネルのリポジトリは「1 人で消費者向けの GPU で使うなら vLLM より軽く、こちらの方が向く」としている。ただし int8 で詰めた埋め込みを読むためのパッチを先に当てる必要がある。なお、ExLlamaV3 で MTP を使うと下書き用のヘッドが別にキャッシュを持つため、メモリが約 10GB 増え、16GB の GPU には収まらないとされている
  • 推奨のサンプリング設定: temperature 1.0・top_p 0.95・top_k 20。思考モードは既定で有効
  • 実行用カーネルのリポジトリは 9 月 24 日に作られたばかりで、公開から日が浅い。環境によってはうまく動かない可能性を見込んでおきたい
  • ライセンス: モデルは Apache-2.0(土台の Qwen3.8-27B から引き継ぎ)。利用前にライセンスの原文を確認してほしい

関連記事

次に読むなら

出典

更新履歴

  • 2026-09-28: 当サイトでの実測(日本語のトークン効率)を追加しました。

この記事は未確認情報を含みます。 公式の一次情報で裏が取れ次第、更新履歴を追記して反映します。