「Qwen3.8-27B」マルチモーダル視覚言語モデル:必要VRAM 8GB〜・GGUF版あり

2026年9月27日

「Qwen3.8-27B」マルチモーダル視覚言語モデル:必要VRAM 8GB〜・GGUF版あり

基本情報

項目 内容
リポジトリ Qwen/Qwen3.8-27B
まとめページ Qwen3.8 のまとめ(記事6本)
公開元のまとめ Alibaba(Qwen) のモデルとライセンスのまとめ
公開日 2026-08-05
ライセンス apache-2.0
配布形式 safetensors
出典の種類 公開元の一次情報(公式Qwen組織のHFリポジトリが一次情報)

収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。

概要

Qwen チームが、Qwen のオープンモデルの新世代 Qwen3.8 の中核として、27B の Dense モデル Qwen3.8-27B を Hugging Face で公開している。モデルカードは Qwen3.8 を「Qwen のオープンモデルのうち、これまでで最も高性能な世代」と位置づけており、Qwen3.5 のアーキテクチャを土台に、コーディング・業務タスク・調査・長い手順を要するエージェント作業で大きく伸びたとしている。画像と動画を理解できる視覚言語モデル(VLM)で、思考(thinking)の有無と深さをリクエストごとに切り替えられる。

このモデルを元にした量子化版・ファインチューンが次々と公開されており、当サイトでも派生版を5本取り上げてきたが、元になった本体の記事はこれが最初になる。

スペック

  • パラメータ数: 27B(言語モデル部分。視覚エンコーダを別に持つ)
  • アーキテクチャ: Dense。64 層で、「Gated DeltaNet → FFN」を3回、「Gated Attention → FFN」を1回という4層の組を16回重ねるハイブリッド構成。つまり 64 層のうち 48 層が線形アテンション(Gated DeltaNet)、16 層が通常のアテンション(Gated Attention)になる
  • Gated DeltaNet: 線形アテンションのヘッドは V が 48・QK が 16、ヘッドの次元は 128
  • Gated Attention: アテンションのヘッドは Q が 24・KV が 4、ヘッドの次元は 256、RoPE の次元は 64
  • 隠れ層の次元: 5,120。FFN の中間次元: 17,408
  • 語彙(埋め込み・出力): 248,320(パディング込み)
  • MTP(Multi-Token Prediction): 複数ステップで学習済み
  • コンテキスト長: ネイティブで 262,144 トークン。YaRN で最大 1,000,000 トークンまで拡張できる
  • 入力: テキスト・画像・動画(視覚エンコーダ付きの Causal Language Model)

性能

モデルカードは、テキストと視覚(VL)の2つの比較表を載せている。比較対象は前世代の Qwen3.6-27B、Qwen3.7-Plus、Muse Glimmer-30B、Opus4.6 Max の4つで、いずれも公開元自身が公表した数値である(「–」は結果が無い、または対象外)。

テキストの性能(モデルカードの表をそのまま転記)

→ 横にスクロールできます

Qwen3.8-27B Qwen3.6-27B Qwen3.7-Plus Muse Glimmer-30B Opus4.6 Max
Coding
Agentic terminal coding Terminal Bench 2.1 (Terminus) 73.0 63.4 64.0 51.7 78.2
Agentic coding SWE-bench Pro 61.7 53.5 57.6 51.2 53.4
Repo-level code generation NL2Repo-Bench 42.3 36.2 41.1 — 47.6
Agentic coding DeepSWE 1.1 42.2 13.3 14.2 — —
Software engineering QwenSWEBench 79.0 49.3 59.2 — 63.8
Agent
Long-horizon office work CoWorkBench 70.7 61.0 65.1 — 68.2
Professional job tasks JobBench 33.4 21.8 27.6 — —
Frontier agentic tasks Agents’ Last Exam Pass@1 20.4 Score 42.9 Pass@1 10.6 Score 27.3 Pass@1 13.2 Score 33.6 — —
General
Instruction following IFBench 79.5 69.1 79.1 77.0 62.5
Scientific reasoning GPQA Diamond 89.2 87.8 90.3 83.5 91.3
Multidisciplinary reasoning HLE 30.8 24.0 34.7 22.0 40.0
Competitive coding LiveCodeBench v6 90.3 83.9 89.6 — 88.8

モデルカードによれば、前世代の Qwen3.6-27B に対しては全ての行で上回っている。伸びが大きいのはエージェント型のコーディングで、DeepSWE 1.1 は 13.3 から 42.2 へ3倍以上、公開元の社内ベンチマークである QwenSWEBench は 49.3 から 79.0 へ上がった。SWE-bench Pro(実在の GitHub の issue をリポジトリを編集して解決できたかの割合)は 61.7 で、比較対象の中で最も高い。一方、ターミナルで作業を最後までやり切れるかを見る Terminal Bench 2.1 は 73.0 で Opus4.6 Max(78.2)に 5.2 ポイント及ばず、博士課程レベルの科学の難問 GPQA Diamond(89.2)と専門家が作った超難問集 HLE(30.8)は Qwen3.7-Plus・Opus4.6 Max のどちらよりも低い。HLE では Opus4.6 Max と 9.2 ポイントの差がある。「実際に手を動かしてやり切るコーディング・業務作業」で強く、「知識と推論の難問」では上位のモデルに届かないというのが表から読める傾向である。競技プログラミングの新作問題を集めた LiveCodeBench v6 は 90.3 で、比較対象の中で最高値だった。

ただし、比較の条件には注意が要る。モデルカードの注記によれば、SWE-bench Pro は Opus4.6 Max だけが公式に報告された値で、それ以外のモデルは Claude Code のハーネスで評価し直した値である。QwenSWEBench・CoWorkBench は Qwen チームの社内ベンチマークで、第三者が同じ条件で再現できる評価ではない。

視覚(VL)の性能(同じくモデルカードの表を転記)

→ 横にスクロールできます

Qwen3.8-27B Qwen3.6-27B Qwen3.7-Plus Muse Glimmer-30B Opus4.6 Max
Agentic Multimodal Intelligence
Computer use OSWorld-Verified 84.3 63.9 73.3 65.9 72.7
Browser use WebArena-Verified 64.8 48.8 55.3 — —
Mobile use AndroidWorld 81.9 70.3 81.0 — 62.0
Application recreation RecreationBench 47.1 29.8 30.2 — —
Multimodal tool use ClawEval-MM Pass@3 57.4 Average 56.9 Pass@3 42.6 Average 50.4 Pass@3 57.4 Average 60.1 — Pass@3 52.5 Average 54.7
Multimodal software engineering SWE-MM 38.6 25.7 30.0 — 27.1
Visual web development Vision2Web 62.9 45.0 42.1 — —
General Multimodal Intelligence
Visual math problem solving MathVision Without CI 90.0 With CI 94.6 Without CI 85.1 Without CI 90.3 — Without CI 65.5
General visual reasoning BabyVision Without CI 65.7 With CI 85.6 Without CI 28.9 Without CI 64.7 With CI 70.4 — Without CI 12.6
Scientific chart analysis CharXiv (RQ) Without CI 83.7 With CI 90.2 Without CI 78.4 Without CI 85.8 With CI 85.9 78.8 Without CI 66.0
Document intelligence OmniDocBench 1.5 91.1 89.4 91.4 75.8 86.6
Real-world perception RealWorldQA 85.9 84.1 86.9 — 73.9
Embodied intelligence ERQA 65.5 62.5 69.8 — 40.8

視覚でも傾向は同じで、画面を見て操作する系のタスクで大きく伸びている。実際の OS の画面を操作してタスクを完了できるかを見る OSWorld-Verified は 84.3 で、Qwen3.7-Plus(73.3)・Opus4.6 Max(72.7)を 11 ポイント以上引き離した。ブラウザ操作の WebArena-Verified(64.8)、画像を見ながらのソフトウェア開発 SWE-MM(38.6)、画面からウェブページを作る Vision2Web(62.9)も比較対象の中で最も高い。一方で、文書の読み取り(OmniDocBench 1.5: 91.1 対 91.4)、実世界の写真の認識(RealWorldQA: 85.9 対 86.9)、身体性を伴う推論(ERQA: 65.5 対 69.8)、マルチモーダルのツール利用の平均スコア(ClawEval-MM: 56.9 対 60.1)では Qwen3.7-Plus に及ばない。前者2つは1ポイント以内の僅差だが、ERQA は 4.3 ポイントの差がある。MathVision・BabyVision・CharXiv の「With CI」はコード実行などの道具を使った場合の値で、「Without CI」とは条件が違う。比べるときは同じ条件の値同士で見る必要がある。

得意なこと・想定用途

モデルカードが掲げる強化点は、コーディング・業務タスク・調査・長い手順のエージェント作業の4つで、自律的な計画立てと、環境からのフィードバック(実行結果やエラー)を踏まえて作業を続ける能力の向上をうたっている。上の表でも、伸びが目立つのはリポジトリを編集して issue を解決する・ターミナルやブラウザ、OS の画面を操作するといった「最後までやり切る」種類のタスクであり、コーディングエージェントや PC 操作エージェントの頭脳として使う用途に最も向いている。モデルカードは「よく使われるハーネスや開発ツールへの対応を広げた」ことも強化点に挙げている。

視覚面では、STEM の図・文書から1時間規模の動画までを入力できる。動画を長く扱うときは、配布されている video_preprocessor_config.json の longest_edge を 469,762,048(224k の動画トークンに相当)に上げてフレームの取り方を細かくするよう、モデルカードが勧めている。

思考の制御は、次の3つの仕組みで行う。

  • 思考モードは既定でオン。リクエストごとに chat_template_kwargs の enable_thinking: False で切れる
  • reasoning_effort で思考の深さを xhigh(既定)・medium・low から選ぶ。ただしモデルカードは、複数ターンのエージェント作業では深さを下げても全体の所要時間が縮むとは限らない(分析が浅くなって失敗とやり直しが増え、かえってトークンを使う)と注意している
  • preserve_thinking は既定でオンで、過去のメッセージの思考ブロックを会話全体にわたって残す。エージェントの判断の一貫性を保ち、KV キャッシュの再利用も効きやすくなるとしている。直近の発話の思考だけを残したい場合は False にする

推奨のサンプリング設定は、思考モードで temperature=1.0・top_p=0.95・top_k=20・presence_penalty=0.0、非思考モードで temperature=0.7・top_p=0.80・top_k=20・presence_penalty=1.5 である。同じ文の繰り返しが止まらないときは presence_penalty を 0〜2 の範囲で上げられるが、上げすぎると言語が混ざったり性能がやや落ちたりすることがあるという。エージェント作業では出力の長さを十分に取るよう勧めており、思考部分は最大 262,144 トークン、最終応答は最大 131,072 トークンを目安に挙げている。

類似モデルとの違い

当サイトではこれまで、このモデルを元にした派生版を扱ってきた。たとえば 「Ternary-Bonsai-2-27B-gguf」テキスト生成モデル:必要VRAM 8GB〜 は、Qwen3.8-27B を1重みあたり実効 1.72 ビットの三値表現に作り直し、FP16 との性能差を抑えつつ小さな機材で動かすことを狙ったモデルである。Qwen3.8-27BカスタムGGUFモデル「TWIN-TURBO」公開、思考トークンを削減 は、思考トークンを減らす方向に調整した個人のファインチューンである。いずれも本体の能力を前提に、サイズや思考の長さのどちらかを削っている。本体の Qwen3.8-27B は、上の表の性能を公開元の条件どおりに出せる基準点にあたる。

動作環境

動作環境の目安(Local Model Watch 算出) — パラメータ数 27.8B

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
RTX 4060 / 3060 Ti など 8GB IQ1_M 6.3GB 7.5GB
RTX 4070 / 3060 12GB など 12GB Q2_K_XL 9.2GB 11.0GB
RTX 5060 Ti 16GB / 4060 Ti 16GB など 16GB IQ4_XS 13.3GB 15.9GB
RTX 4090 / 3090 など 24GB Q5_K_XL 19.4GB 23.3GB
RTX 5090 など 32GB Q8_K_L 26.1GB 31.3GB
RTX 6000 Ada / A6000 など 48GB Q8_K_XL 29.3GB 35.2GB
A100 / H100 80GB クラス BF16 50.9GB 61.1GB

推論エンジンの対応状況(各プロジェクトのソースにあるモデル登録表とアーキテクチャ名を当サイトが機械的に照合。2026-09-27 時点): llama.cpp: 登録あり、vLLM: 登録あり、MLX (mlx-lm): 登録あり。

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 ファイルサイズは変換版 unsloth/Qwen3.8-27B-GGUF の配布ファイルの実測値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

手元で動かせるか

Ollama・LM Studio・llama.cpp で動かせます(変換版を利用)。

公開元の配布は safetensors ですが、unsloth/Qwen3.8-27B-GGUF が GGUF版を公開しているため、そちらを使えば手元で動きます。

ライセンス apache-2.0(商用利用可): 商用利用を含めて自由に利用・改変・再配布できます。再配布時にライセンス文と変更点の告知が必要で、特許の許諾条項があります。

量子化の圧縮率: IQ4_XS は実測 4.11 bit/weight で、元の16bitの重みの約26%のサイズです(配布ファイルの実サイズから当サイトが算出)。

配布形式・当サイトが見つけた変換版・各推論エンジンの登録表を突き合わせた判定です。「確認できていない」は当サイトが見つけていないという意味で、存在しないことの断定ではありません。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。

入手方法

  • 配布形式: Hugging Face の Qwen/Qwen3.8-27B に、学習後(post-trained)のモデルの重みと設定ファイルが Transformers 形式(safetensors)で置かれている。ダウンロードに利用規約への同意は要らない
  • 入手コマンドの例: huggingface-cli download Qwen/Qwen3.8-27B
  • 対応エンジン: モデルカードは Transformers・vLLM・SGLang・TokenSpeed での利用を挙げている。本番運用や高スループットが必要な場面では SGLang・vLLM・TokenSpeed のような専用のサーバーを勧めており、推論効率はフレームワークによって大きく違うので最新版を使うよう注意している
  • API として使う場合: 上記のエンジンで立てたサーバーに、OpenAI 互換の Chat Completions API でテキスト・画像(image_url)・動画(video_url)を渡せる。動画のフレームの取り方(fps 等)をリクエストごとに変えられるのは現時点で vLLM だけだという
  • 長文の扱い: 262,144 トークンを超える場合は YaRN を使う。vLLM・SGLang・TokenSpeed は、config.json の text_config にある rope_parameters を書き換えるか、起動時の引数で上書きする方法に対応している。ただし、どのフレームワークも静的な YaRN(入力の長さに関わらず倍率が一定)なので、短い文章では性能が落ちるおそれがある。長い文脈が必要なときだけ有効にし、倍率(factor)は実際に使う長さに合わせる(例: 524,288 トークンなら 2.0)よう、モデルカードは勧めている
  • llama.cpp・Ollama・LM Studio については、モデルカードは触れていない。これらで使う GGUF 版は、上の派生版の記事のように第三者が変換・調整したものが中心なので、使う前に変換元と量子化の方式を確かめたい

派生版・量子化版

→ 横にスクロールできます

追記日 配布元 形式 リポジトリ 最小のVRAM階層(量子化・必要メモリの目安)
2026-09-26 unsloth GGUF(imatrix) unsloth/Qwen3.8-27B-GGUF IQ1_M 7.5GB(8GB VRAMで動作)
2026-09-26 Qwen FP8 Qwen/Qwen3.8-27B-FP8 –
2026-09-26 lmstudio-community MLX lmstudio-community/Qwen3.8-27B-MLX-4bit MLX 4bit 17.9GB(24GB VRAMで動作)
2026-09-26 lmstudio-community MLX lmstudio-community/Qwen3.8-27B-MLX-8bit MLX 8bit 33.0GB(48GB VRAMで動作)
2026-09-26 unsloth NVFP4 unsloth/Qwen3.8-27B-NVFP4 NVFP4 25.2GB(32GB VRAMで動作)
2026-09-26 lmstudio-community GGUF lmstudio-community/Qwen3.8-27B-GGUF Q4_K_M 18.8GB(24GB VRAMで動作)

各リポジトリの量子化とファイルサイズ:

  • unsloth/Qwen3.8-27B-GGUF の量子化: IQ1_S 5.8GB / IQ1_M 6.3GB / IQ2_XXS 6.8GB / IQ2_S 7.8GB / Q2_K_XL 9.2GB / IQ3_XXS 10.2GB / IQ3_S 11.2GB / Q3_K_XL 12.2GB / IQ4_XS 13.3GB / Q4_K_S 14.3GB / Q4_0 15.0GB / Q4_K_M 15.3GB / Q4_1 16.3GB / Q4_K_XL 16.4GB / Q5_K_S 17.4GB / Q5_K_M 18.4GB / Q5_K_XL 19.4GB / Q6_K 20.5GB / Q6_K_M 21.5GB / Q6_K_L 22.5GB / Q6_K_XL 23.6GB / Q8_K_L 26.1GB / Q8_0 27.1GB / Q8_K_XL 29.3GB / BF16 50.9GB
  • lmstudio-community/Qwen3.8-27B-MLX-4bit の量子化: MLX 4bit 15.0GB
  • lmstudio-community/Qwen3.8-27B-MLX-8bit の量子化: MLX 8bit 27.5GB
  • unsloth/Qwen3.8-27B-NVFP4 の量子化: NVFP4 21.0GB
  • lmstudio-community/Qwen3.8-27B-GGUF の量子化: Q4_K_M 15.7GB / Q6_K 20.9GB / Q8_0 27.1GB

このほか、上記以外の投稿者による変換版が 29 件あります(当サイトは公開元自身と、実績のある量子化担当の配布だけを表に載せています)。

この節は、記事公開後に見つかった変換版を当サイトが機械的に追記したものです。必要メモリは配布ファイルのサイズから算出した概算です。 量子化の名前の読み方は用語集にあります。

関連記事

次に読むなら

出典

更新履歴

  • 2026-09-26: 変換版を「派生版・量子化版」に追記しました: unsloth/Qwen3.8-27B-GGUF, Qwen/Qwen3.8-27B-FP8, lmstudio-community/Qwen3.8-27B-MLX-4bit, lmstudio-community/Qwen3.8-27B-MLX-8bit, unsloth/Qwen3.8-27B-NVFP4, lmstudio-community/Qwen3.8-27B-GGUF
  • 2026-09-26: 動作環境の表を unsloth/Qwen3.8-27B-GGUF の実ファイルサイズで更新しました。
  • 2026-09-26: タイトルを、記事で分かる内容(必要VRAM・配布ファイル等)を示す形に変更しました。