「OrcaSAQ-2-27B」テキスト生成モデル:必要VRAM 16GB〜

基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | orcarouter/OrcaSAQ-2-27B |
| まとめページ | Qwen3.8 のまとめ(記事8本) |
| 公開元のまとめ | Alibaba(Qwen) のモデルとライセンスのまとめ |
| 公開日 | 2026-09-24 |
| ライセンス | apache-2.0 |
| 配布形式 | EXL3 / safetensors |
| 出典の種類 | 未確認(一次情報で裏付けできていない)(非公式のサードパーティ量子化版で、一次情報の裏付けが不十分) |
収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。
概要
AI ゲートウェイを運営する OrcaRouter が、Qwen3.8-27B を平均 3.21bit まで圧縮した量子化版 OrcaSAQ2 27B(orcarouter/OrcaSAQ-2-27B)を Hugging Face で公開した。BF16 で 54GB ある元のモデルを、配布ファイルの合計 12.3GB まで縮めている。公開元が掲げる狙いは「27B のモデルを 16GB の GPU 1 枚で動かす」ことで、そのうえで元のモデルとの差が小さいことを、BF16 と直接比べた数値で示している。
公開元はこれを「独自の感度考慮型・混合精度の量子化システム(SAQ2)」と呼び、手法の詳細(較正のやり方・層ごとのビット数の割り振り・詰め方)は公開していない。ただし配布ファイルの設定(quantization_config.json)を見ると、量子化の形式は exl3(ExLlamaV3 の形式、バージョン 1.5.1)である。公開元が同時に出した実行用のカーネルのリポジトリも、中身を「EXL3 のトレリス量子化(QTIP 系)に、探索で決めた混合精度の割り振りを組み合わせたもの」と説明している。つまり新しい形式ではなく、既存の EXL3 形式の中で、層ごとのビット数の配分を工夫したものと読むのが正確である。
土台の Qwen3.8-27B 本体については 「Qwen3.8-27B」マルチモーダル視覚言語モデル:必要VRAM 8GB〜・GGUF版あり で取り上げている。
スペック
- ベースモデル: Qwen3.8-27B(Qwen3.5 系のハイブリッド構成。64 層のうち 48 層が Gated DeltaNet、16 層が通常のアテンション)
- 量子化: EXL3 形式、デコーダ部分の平均 3.21bit。出力層(lm_head)は 6bit、埋め込みは int8、MTP のヘッドは 4bit
- 配布ファイル: safetensors 4 分割、合計 12.27GB
- コンテキスト長: 262,144 トークン(設計上の上限。16GB の GPU で実際に使える長さは後述)
- 対応機能: 思考(thinking)モード、ツール呼び出し、MTP(Multi-Token Prediction)による投機的デコード
- 入力: テキストのみ。土台の Qwen3.8-27B は画像・動画を読めるが、この版には視覚エンコーダが入っていない
- ライセンス: Apache-2.0(土台の Qwen3.8-27B から引き継ぎ)
性能
元のモデル(BF16)とのずれ
公開元は、配布している重みそのものを BF16 版と同じ評価経路で比べた値を載せている。WikiText-2 の 16,376 トークンで測ったもの。
→ 横にスクロールできます
| ビルド | サイズ | デコーダのビット数 | 平均 KLD ↓ | トップ1一致率 ↑ | PPL ↓ |
|---|---|---|---|---|---|
| Qwen3.8-27B BF16 | 54GB | 16 | — | 100% | 5.6468 |
| OrcaSAQ2 27B | 12.3GB | 3.21 | 0.031 | 93.2% | 5.6482 |
3 つの指標の意味は次のとおり。
- PPL(Perplexity): 文章の続きをどれだけ迷わず予測できるか。低いほど良い。BF16 からの悪化は +0.02% で、ほぼ差が無い
- KLD(KL ダイバージェンス): 次のトークンの確率分布が BF16 とどれだけずれたか。0 に近いほど元のモデルに忠実
- トップ1一致率: 「次に最も選ばれやすいトークン」が BF16 と同じだった割合
この 3 つを並べて読むことが大事である。PPL の差が 0.02% しかないのに、トップ1一致率は 93.2% で、およそ 15 トークンに 1 回は BF16 と違うトークンを最有力として選んでいる。PPL は文章全体で平均した値なので、個々の選択の違いは打ち消し合って表に出にくい。公開元自身も制約の節で「93.2% の一致は、一部のトークンの判断が BF16 と異なることを意味する」「+0.02% の PPL は下流のタスクで同じ性能を保証しない」と書いている。「ほぼ無劣化」と要約するより、「平均的な予測はほとんど変わらないが、個々の判断は一定の割合で変わる」と理解しておくのが正確である。なお、他の量子化版(GGUF や他の EXL3 版)を同じ条件で測った比較は示されていないので、KLD 0.031 が 3bit 台として優れているかどうかは、この資料だけでは判断できない。
エージェント系のベンチマーク(公開元の自己申告)
モデルカードは SWE-bench Verified で 70.0、Terminal-Bench 2.1 で 58.4 というスコアを、Claude Sonnet 4.6・Gemini 3・GPT-5.4 などの公表値と並べた表で示している。ただし次の理由から、この記事では他のモデルとの順位としては扱わない。
- 公開元自身が、表を「条件をそろえた比較ではなく、公開されている参考値」と断っている。エージェント系のベンチマークは、使う実行環境(ハーネス)・思考の予算・時間制限でスコアが大きく変わる
- OrcaSAQ2 のスコアをどの実行環境・設定で測ったかが書かれていない
- 最も知りたい「同じ条件で測った BF16 版のスコア」が無い。そのため、量子化でどれだけ落ちたのかがこの表からは分からない
量子化版の評価として意味があるのは、前の節の「BF16 とのずれ」の方である。エージェント系のスコアは、公開元がそう申告している、という以上には読まないほうがよい。
16GB の GPU での速度
GPU メモリを 15.7GiB に制限して vLLM で測った値。
→ 横にスクロールできます
| 設定 | 1ストリーム | 8ストリーム | 16ストリーム | KV キャッシュの容量 |
|---|---|---|---|---|
| MTP なし | 65.3 tok/s | 332 tok/s | 333 tok/s | 29,354 トークン |
| MTP あり | 90.1 tok/s | 220 tok/s | 219 tok/s | 14,563 トークン |
MTP(投機的デコード)を使うと 1 人で使うときの生成は約 38% 速くなる。その代わり、下書き用のヘッドが同じメモリから KV キャッシュを取るので、文脈に使える量が約半分になり、同時に多数をさばく用途ではむしろ遅くなる。1 人で対話的に使うなら MTP あり、複数の処理を並べるなら MTP なし、という使い分けになる。
実行用カーネルのリポジトリにも同じ趣旨の表があるが、数値が異なる(15.5GiB の制限で、MTP ありの 1 ストリームが 111.2 tok/s、KV キャッシュは MTP なしで 59,753 トークン)。設定や版の違いによるものと見られるが、どちらも公開元の測定で、第三者の再現はまだ無い。
得意なこと・想定用途
公開元が想定するのは、コーディング・端末操作・ブラウザ操作などを長い手順で続けるエージェントである。量子化の小さな誤差でもツールの呼び出しが 1 回変わると、その後の状態がすべて変わっていく ―― だから長い手順のタスクほど量子化の影響が出やすい、というのが公開元の問題意識で、「BF16 とのずれ」を細かく示しているのもそのためである。
手元で使う立場から見ると、このモデルが向いているのは 16GB の GPU(RTX 5080・4080 など)で、27B クラスのモデルをサーバーとして立てたい場合である。OpenAI 互換の API として動くので、コーディング用のエージェントや自作のツールからつなげられる。
注意点も多い。
- 16GB で 262K の文脈は使えない。 重みで約 12.3GB を使うため、残りは 3〜4GB 程度しかない。公開元も「16GB の GPU では 32K 前後の文脈から始め、用途に合わせて調整する」ことを勧めている
- 画像は読めない。 土台の Qwen3.8-27B の視覚機能は、この版では外されている
- 量子化の手法は非公開。 同じ手順を自分で他のモデルに適用することはできない
- 公開元は AI ゲートウェイを運営する企業で、Hugging Face の公開モデルの多くは既存モデルの検閲解除版(Uncensored)である。この OrcaSAQ2 27B は検閲解除版ではなく、Qwen3.8-27B をそのまま量子化したものとして公開されている
類似モデルとの違い
- 一般的な GGUF 量子化版(Q3_K_M・IQ3 系など)との違い: 大きさは近いが、動かせるエンジンがまったく違う。GGUF は llama.cpp・Ollama・LM Studio でそのまま動くのに対し、この版はそれらでは動かない(次の節)。代わりに、BF16 とのずれを数値で示している点、vLLM で複数の要求を並べてさばける点が強みになる
- 他の EXL3 量子化版との違い: EXL3 形式自体は ExLlamaV3 の標準の形式で、3bit 前後の版は他にも作られうる。OrcaSAQ2 の違いは、層ごとにビット数を変える配分の探索と、vLLM で動かすためのプラグインを用意した点にある。ただし同じ条件で他の EXL3 版と比べた数値は示されていない
- 土台の Qwen3.8-27B(BF16)との違い: 必要なメモリは 4 分の 1 以下になるが、画像入力を失い、トークン単位では 93.2% の一致にとどまる。精度を最優先するなら元のモデル、16GB に収めることを優先するならこの版、という選び方になる
動作環境
動作環境の目安(Local Model Watch 算出) — パラメータ数 27.8B(元モデル Qwen/Qwen3.8-27B の値)
| 手持ちのVRAM | 選べる量子化 | ファイルサイズ | 必要メモリの目安 |
|---|---|---|---|
| RTX 5060 Ti 16GB / 4060 Ti 16GB など 16GB | EXL3 | 11.4GB | 13.7GB |
必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。
手元で動かせるか
現時点では Ollama・LM Studio・llama.cpp で動かせません(GGUF版を確認できていない)。
公開元の配布は EXL3 / safetensors のみです。現時点で動かすなら transformers(PyTorch) で読み込む形になり、必要メモリは上の表のとおりです。
ライセンス apache-2.0(商用利用可): 商用利用を含めて自由に利用・改変・再配布できます。再配布時にライセンス文と変更点の告知が必要で、特許の許諾条項があります。
配布形式・当サイトが見つけた変換版・各推論エンジンの登録表を突き合わせた判定です。「確認できていない」は当サイトが見つけていないという意味で、存在しないことの断定ではありません。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。
当サイトでの実測
当サイトのサーバー(GPUなし)で、このモデルのファイルを実際に読み込み・動かして確かめた値です。モデルカードの記載ではなく、当サイトが測った結果です。測り方と全モデルの一覧は観測データにまとめています。
日本語のトークン効率
| トークナイザ | 日本語1,000字あたりのトークン数 | 同じ内容の英文との比 |
|---|---|---|
| このモデル | 546 | 0.99倍 |
| Qwen3 | 688 | 1.26倍 |
| Llama 3.2 | 744 | 1.36倍 |
| Gemma 3 | 564 | 1.03倍 |
| gpt-oss | 795 | 1.45倍 |
| LLM-jp-3 | 497 | 0.85倍 |
Qwen3 のトークナイザより約21%少ないトークンで同じ日本語を表せます。同じ文脈長に入る日本語が約1.26倍になり、生成も1字あたりで速くなります。
orcarouter/OrcaSAQ-2-27B の tokenizer.json で、当サイトが書き下ろした固定の文章(876字。ニュース・会話・技術文書・敬語のメール・紀行文・料理の6種)と、同じ内容の英文を数えました。トークン数が少ないほど、同じ文脈長に長い日本語が入ります。
同クラスの既報モデル
当サイトが最近取り上げた、パラメータ数 15〜40B のモデルを、比較のために記事ログからコードが並べたものです。VRAM階層は当サイトの概算、ライセンスはモデルカードの記載です。
→ 横にスクロールできます
| モデル | パラメータ数 | 最小のVRAM階層 | ライセンス | 記事 |
|---|---|---|---|---|
| XingChen-AGI/Xing4.0-29B-A4B | 31.2B | 24GB | apache-2.0 | 「Xing4.0-29B-A4B」コーディングエージェントに強い29BのMoEモデル:必要VRAM 24GB〜(2026-09-28) |
| Edge0/Edge0-35B-A3B-preview | 36.0B | 24GB | apache-2.0 | 「Edge0-35B-A3B-preview」スマホクラスで動く35BのMoEモデル:必要VRAM 24GB〜(2026-09-11) |
| bartowski/Gryphe_Pantheon-Reasoning-26B-A4B-1.1-V2-GGUF | 26.5B | 12GB | apache-2.0 | 「Gryphe_Pantheon-Reasoning-26B-A4B-1.1-V2-GGUF」:必要VRAM 12GB〜(2026-09-11) |
| nex-agi/Nex-N2.5-mini | 35.1B | 16GB | apache-2.0 | 「Nex-N2.5-mini」長期タスク向けのエージェントモデル:必要VRAM 16GB〜・GGUF版あり(2026-09-09) |
| IFM/K2-Horizon-MoVA-36B-A4B-GGUF | 37.4B | 32GB | apache-2.0 | 「K2-Horizon-MoVA-36B-A4B-GGUF」テキスト生成モデル:必要VRAM 32GB〜(2026-09-06) |
入手方法
- 配布: Hugging Face の
orcarouter/OrcaSAQ-2-27B(safetensors、EXL3 形式) - llama.cpp・Ollama・LM Studio では動かない。 実行用カーネルのリポジトリは「llama.cpp は独自の量子化の符号表しか読めないため、この重みは使えない。GGUF にするには別の量子化器で量子化し直すことになる」と明言している
- vLLM で動かす場合: vLLM に加えて、公開元のプラグイン(
Continuum-AI-Corp/OrcaSAQ2-kernel)を入れる必要がある。モデルカードはpip install git+https://github.com/Continuum-AI-Corp/OrcaSAQ2-kernelを案内しており、カーネルのリポジトリには 16GB 向けの起動設定と Docker イメージも用意されている。思考の出力とツール呼び出しを正しく受け取るには--reasoning-parser qwen3と--tool-call-parser qwen3_xmlを付ける - ExLlamaV3 で動かす場合: カーネルのリポジトリは「1 人で消費者向けの GPU で使うなら vLLM より軽く、こちらの方が向く」としている。ただし int8 で詰めた埋め込みを読むためのパッチを先に当てる必要がある。なお、ExLlamaV3 で MTP を使うと下書き用のヘッドが別にキャッシュを持つため、メモリが約 10GB 増え、16GB の GPU には収まらないとされている
- 推奨のサンプリング設定: temperature 1.0・top_p 0.95・top_k 20。思考モードは既定で有効
- 実行用カーネルのリポジトリは 9 月 24 日に作られたばかりで、公開から日が浅い。環境によってはうまく動かない可能性を見込んでおきたい
- ライセンス: モデルは Apache-2.0(土台の Qwen3.8-27B から引き継ぎ)。利用前にライセンスの原文を確認してほしい
関連記事
- 「Hemmingway-1」日常文章特化の言語モデル:必要VRAM 12GB〜・GGUF版あり
- 「Signal-3.8-27B-GGUF」トークン効率を最適化したGGUFモデル:必要VRAM 16GB〜
- 「Qwen3.8-27B」マルチモーダル視覚言語モデル:必要VRAM 8GB〜・GGUF版あり
- Qwen3.8-27BカスタムGGUFモデル「TWIN-TURBO」公開、思考トークンを削減
次に読むなら
- GPUのVRAMから探す(このモデルは16GBの階層から動きます) → 16GBのGPUで動くほかのモデル
- 同じモデル系統を調べる → Qwen3.8 系統のまとめ(記事8本・変換版11件)
- 入手できる形式と、表に出てくる EXL3 の意味を知る → EXL2・EXL3形式の解説と対応モデル / 量子化・モデル形式の用語集
- 公開元について調べる → Alibaba(Qwen) のモデル・ライセンス・記事のまとめ
- 同じ用途の他のモデルを探す → テキスト生成のモデル一覧
出典
- https://huggingface.co/orcarouter/OrcaSAQ-2-27B
- https://github.com/Continuum-AI-Corp/OrcaSAQ2-kernel
- https://huggingface.co/Qwen/Qwen3.8-27B
更新履歴
- 2026-09-28: 当サイトでの実測(日本語のトークン効率)を追加しました。
この記事は未確認情報を含みます。 公式の一次情報で裏が取れ次第、更新履歴を追記して反映します。

