Qwen3.8 まとめ:必要VRAM・GGUF版
このモデルについて
Qwen3.8 は、Qwen チームが「Qwen のオープンモデルのうち、これまでで最も高性能な世代」と位置づけるシリーズです。中核の Qwen3.8-27B は 27B の Dense モデルで、画像と動画を理解できる視覚言語モデル(VLM)として作られています。Qwen3.5 のアーキテクチャを土台に、コーディング・業務タスク・調査・長い手順のエージェント作業を大きく伸ばしたとしています。
構造は、64 層のうち 48 層が線形アテンション(Gated DeltaNet)、16 層が通常のアテンション(Gated Attention)というハイブリッド型です。文脈はネイティブで 262,144 トークン、YaRN で最大 100万トークンまで拡張できます。思考(thinking)は既定でオンで、リクエストごとに切れるほか、reasoning_effort で深さを xhigh・medium・low から選べます。
何がすごいのか
1. 前世代の同じ大きさのモデルから、エージェント型のコーディングが大きく伸びました。 公開元の比較表から抜粋します(太字は各行の最高値)。
→ 横にスクロールできます
| 評価(カードの分類) | Qwen3.8-27B | Qwen3.6-27B(前世代) | Qwen3.7-Plus | Opus4.6 Max |
|---|---|---|---|---|
| SWE-bench Pro(エージェント型コーディング) | 61.7 | 53.5 | 57.6 | 53.4 |
| DeepSWE 1.1(エージェント型コーディング) | 42.2 | 13.3 | 14.2 | — |
| Terminal Bench 2.1(ターミナルでのコーディング) | 73.0 | 63.4 | 64.0 | 78.2 |
| LiveCodeBench v6(競技プログラミング) | 90.3 | 83.9 | 89.6 | 88.8 |
| OSWorld-Verified(コンピューター操作) | 84.3 | 63.9 | 73.3 | 72.7 |
| WebArena-Verified(ブラウザ操作) | 64.8 | 48.8 | 55.3 | — |
| GPQA Diamond(科学の推論) | 89.2 | 87.8 | 90.3 | 91.3 |
| HLE(分野横断の推論) | 30.8 | 24.0 | 34.7 | 40.0 |
- 前世代の Qwen3.6-27B に対しては、カードの全ての行で上回っています。 特に DeepSWE 1.1 は 13.3 から 42.2 へ3倍以上になりました。
- 「実際に手を動かして最後までやり切る」種類の課題に強いモデルです。 実在の GitHub の issue を解決する SWE-bench Pro、実際の OS の画面を操作する OSWorld-Verified、ブラウザ操作の WebArena-Verified では、比較対象の中で最も高い値です。OSWorld-Verified は Qwen3.7-Plus・Opus4.6 Max を 11 ポイント以上引き離しています。
2. 画像・動画を読んで作業するタスクでも伸びています。 画面からウェブページを作る Vision2Web は 62.9(前世代 45.0)、画像付きのソフトウェア開発 SWE-MM は 38.6(同 25.7)で、どちらも比較対象の中で最高値です。
注意したい点・弱み
- 知識と推論の難問では、上位のモデルに届きません。 GPQA Diamond は Qwen3.7-Plus・Opus4.6 Max より低く、HLE では Opus4.6 Max と 9.2 ポイントの差があります。ターミナル操作の Terminal Bench 2.1 でも Opus4.6 Max に 5.2 ポイント及びません。
- 視覚の「読み取り・認識」では、Qwen3.7-Plus と同等かやや下です。 文書の読み取り(OmniDocBench 1.5: 91.1 対 91.4)と実世界の写真の認識(RealWorldQA: 85.9 対 86.9)は1ポイント以内の僅差ですが、身体性を伴う推論(ERQA: 65.5 対 69.8)は 4.3 ポイント下回ります。
- 比べる条件がそろっていない値があります。 SWE-bench Pro は Opus4.6 Max だけが公式に報告された値で、ほかのモデルは Claude Code のハーネスで評価し直した値です。QwenSWEBench・CoWorkBench・RecreationBench は Qwen チームの社内ベンチマークで、第三者が同じ条件で確かめられる評価ではありません。
手元で動かすときのポイント
- 公開元が出しているのは Transformers 形式の重みです。 モデルカードが案内しているのは Transformers・vLLM・SGLang・TokenSpeed で、llama.cpp・Ollama・LM Studio には触れていません。これらで使う GGUF 版・MLX 版は、unsloth や lmstudio-community などの第三者が変換したものです。どの量子化ならどの GPU に収まるかは、このページ下の必要メモリの表を見てください。
- 思考は既定でオンで、出力が長くなります。 モデルカードは、エージェント作業では思考部分に最大 262,144 トークン、最終応答に最大 131,072 トークンを割り当てるよう勧めています。また、複数ターンの作業では
reasoning_effortを下げても、失敗とやり直しが増えて全体としては速くならないことがある、と注意しています。 - 100万トークンへの拡張(YaRN)は、必要なときだけ有効にします。 主要なエンジンの YaRN は倍率が一定(静的)なので、有効にしたままだと短い文章で性能が落ちるおそれがあります。
- ライセンスは Apache-2.0 で、商用利用もできます。
- このシリーズの記事には、第三者が Qwen3.8-27B を元に作ったファインチューン(Qwopus3.8・Signal-3.8・TWIN-TURBO・Salience など)や、三値に作り直した Ternary-Bonsai-2 も含まれます。いずれも重みが公式のモデルとは異なる別物で、上の性能は公式の Qwen3.8-27B の値です。
出典: Qwen/Qwen3.8-27B のモデルカード(2026-09-26 時点)。ベンチマークの数値は公開元が掲載した値です。
当サイトの記録とデータ
当サイトが Qwen3.8 系統について公開した記事(6本)と、記事の公開後に見つかった変換版(GGUF・MLX等)、必要メモリの判定を1ページにまとめたものです。必要メモリはモデルカードの公称値ではなく、当サイトが配布ファイルのサイズから機械的に算出した値です。モデル系統別まとめの1ページです。
基本情報
| 項目 | 内容 |
|---|---|
| 元のモデル | Qwen/Qwen3.8-27B |
| 公開元 | Alibaba(Qwen) |
| パラメータ数 | 27.8B |
| ライセンス(モデルカード) | apache-2.0 |
| 最小のVRAM階層 | 8GB |
| 記事数 | 6本 |
動作環境
動作環境の目安(Local Model Watch 算出) — パラメータ数 27.8B
| 手持ちのVRAM | 選べる量子化 | ファイルサイズ | 必要メモリの目安 |
|---|---|---|---|
| RTX 4060 / 3060 Ti など 8GB | IQ1_M | 6.3GB | 7.5GB |
| RTX 4070 / 3060 12GB など 12GB | Q2_K_XL | 9.2GB | 11.0GB |
| RTX 5060 Ti 16GB / 4060 Ti 16GB など 16GB | IQ4_XS | 13.3GB | 15.9GB |
| RTX 4090 / 3090 など 24GB | Q5_K_XL | 19.4GB | 23.3GB |
| RTX 5090 など 32GB | Q8_K_L | 26.1GB | 31.3GB |
| RTX 6000 Ada / A6000 など 48GB | Q8_K_XL | 29.3GB | 35.2GB |
| A100 / H100 80GB クラス | BF16 | 50.9GB | 61.1GB |
必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 ファイルサイズは変換版 unsloth/Qwen3.8-27B-GGUF の配布ファイルの実測値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。
手元で動かせるか
Ollama・LM Studio・llama.cpp で動かせます(変換版を利用)。
公開元の配布は safetensors ですが、unsloth/Qwen3.8-27B-GGUF が GGUF版を公開しているため、そちらを使えば手元で動きます。
ライセンス apache-2.0(商用利用可): 商用利用を含めて自由に利用・改変・再配布できます。再配布時にライセンス文と変更点の告知が必要で、特許の許諾条項があります。
量子化の圧縮率: IQ4_XS は実測 4.11 bit/weight で、元の16bitの重みの約26%のサイズです(配布ファイルの実サイズから当サイトが算出)。
配布形式・当サイトが見つけた変換版・各推論エンジンの登録表を突き合わせた判定です。「確認できていない」は当サイトが見つけていないという意味で、存在しないことの断定ではありません。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。
派生版・量子化版
→ 横にスクロールできます
| 追記日 | 配布元 | 形式 | リポジトリ | 最小のVRAM階層(量子化・必要メモリの目安) |
|---|---|---|---|---|
| 2026-09-26 | unsloth | GGUF(imatrix) | unsloth/Qwen3.8-27B-GGUF | IQ1_M 7.5GB(8GB VRAMで動作) |
| 2026-09-26 | Qwen | FP8 | Qwen/Qwen3.8-27B-FP8 | – |
| 2026-09-26 | lmstudio-community | MLX | lmstudio-community/Qwen3.8-27B-MLX-4bit | MLX 4bit 17.9GB(24GB VRAMで動作) |
| 2026-09-26 | lmstudio-community | MLX | lmstudio-community/Qwen3.8-27B-MLX-8bit | MLX 8bit 33.0GB(48GB VRAMで動作) |
| 2026-09-26 | unsloth | NVFP4 | unsloth/Qwen3.8-27B-NVFP4 | NVFP4 25.2GB(32GB VRAMで動作) |
| 2026-09-26 | lmstudio-community | GGUF | lmstudio-community/Qwen3.8-27B-GGUF | Q4_K_M 18.8GB(24GB VRAMで動作) |
| 2026-09-24 | prism-ml | MLX | prism-ml/Ternary-Bonsai-2-27B-mlx-2bit | MLX 2bit 9.6GB(12GB VRAMで動作) |
| 2026-09-18 | prism-ml | GGUF | prism-ml/Ternary-Bonsai-2-27B-gguf-dev | Q2_0 8.5GB(12GB VRAMで動作) |
各リポジトリの量子化とファイルサイズ:
- unsloth/Qwen3.8-27B-GGUF の量子化: IQ1_S 5.8GB / IQ1_M 6.3GB / IQ2_XXS 6.8GB / IQ2_S 7.8GB / Q2_K_XL 9.2GB / IQ3_XXS 10.2GB / IQ3_S 11.2GB / Q3_K_XL 12.2GB / IQ4_XS 13.3GB / Q4_K_S 14.3GB / Q4_0 15.0GB / Q4_K_M 15.3GB / Q4_1 16.3GB / Q4_K_XL 16.4GB / Q5_K_S 17.4GB / Q5_K_M 18.4GB / Q5_K_XL 19.4GB / Q6_K 20.5GB / Q6_K_M 21.5GB / Q6_K_L 22.5GB / Q6_K_XL 23.6GB / Q8_K_L 26.1GB / Q8_0 27.1GB / Q8_K_XL 29.3GB / BF16 50.9GB
- lmstudio-community/Qwen3.8-27B-MLX-4bit の量子化: MLX 4bit 15.0GB
- lmstudio-community/Qwen3.8-27B-MLX-8bit の量子化: MLX 8bit 27.5GB
- unsloth/Qwen3.8-27B-NVFP4 の量子化: NVFP4 21.0GB
- lmstudio-community/Qwen3.8-27B-GGUF の量子化: Q4_K_M 15.7GB / Q6_K 20.9GB / Q8_0 27.1GB
- prism-ml/Ternary-Bonsai-2-27B-mlx-2bit の量子化: MLX 2bit 8.0GB
- prism-ml/Ternary-Bonsai-2-27B-gguf-dev の量子化: Q2_0 7.1GB
この節は、記事公開後に見つかった変換版を当サイトが機械的に追記したものです。必要メモリは配布ファイルのサイズから算出した概算です。
記事(シリーズ自身のモデルを先に、新しい順)
| 公開日 | モデル | 種類 | 記事 |
|---|---|---|---|
| 2026-09-26 | Qwen/Qwen3.8-27B | 新モデル | 「Qwen3.8-27B」マルチモーダル視覚言語モデル:必要VRAM 8GB〜・GGUF版あり |
| 2026-09-18 | prism-ml/Ternary-Bonsai-2-27B-gguf | 新モデル | 「Ternary-Bonsai-2-27B-gguf」テキスト生成モデル:必要VRAM 8GB〜 |
| 2026-09-15 | bartowski/vectionlabs_Salience-27B-R6-GGUF | 新モデル | 「vectionlabs_Salience-27B-R6-GGUF」VLMモデル:必要VRAM 12GB〜 |
| 2026-09-13 | DavidAU/Qwen3.8-27B-TWIN-TURBO-Fable-Cold-Fusion-709-L-Uncensored-NM-DAU-NEO-MTP-GGUF | 新モデル | Qwen3.8-27BカスタムGGUFモデル「TWIN-TURBO」公開、思考トークンを削減 |
| 2026-09-12 | agentionai/Signal-3.8-27B-GGUF | 新モデル | 「Signal-3.8-27B-GGUF」トークン効率を最適化したGGUFモデル:必要VRAM 16GB〜 |
| 2026-09-06 | Jackrong/Qwopus3.8-27B-Flash-GGUF | 新モデル | 「Qwopus3.8-27B-Flash-GGUF」エージェント向け軽量化モデル:必要VRAM 16GB〜 |
リポジトリ
- Qwen/Qwen3.8-27B
- prism-ml/Ternary-Bonsai-2-27B-gguf
- bartowski/vectionlabs_Salience-27B-R6-GGUF
- DavidAU/Qwen3.8-27B-TWIN-TURBO-Fable-Cold-Fusion-709-L-Uncensored-NM-DAU-NEO-MTP-GGUF
- agentionai/Signal-3.8-27B-GGUF
- Jackrong/Qwopus3.8-27B-Flash-GGUF
最終更新 2026-09-27(JST)。ページ前半の解説は、出典に挙げた一次資料をもとに AI を用いて執筆したものです。「当サイトの記録とデータ」以降の表と一覧は、記事ログからコードが組み立てています。