Qwen3.8-27BカスタムGGUFモデル「TWIN-TURBO」公開、思考トークンを削減

2026年9月20日

高速化されたオープンウェイトモデルQwen3.8-27B GGUF版が公開

基本情報

項目 内容
リポジトリ DavidAU/Qwen3.8-27B-TWIN-TURBO-Fable-Cold-Fusion-709-L-Uncensored-NM-DAU-NEO-MTP-GGUF
公開日 2026-09-10
ライセンス apache-2.0
配布形式 GGUF
出典の種類 公開元の一次情報(非公式の個人によるファインチューン版であり、一次情報ではないため)

収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。

概要

DavidAUより、Qwen3.8-27BをベースにしたカスタムモデルのGGUF版「DavidAU/Qwen3.8-27B-TWIN-TURBO-Fable-Cold-Fusion-709-L-Uncensored-NM-DAU-NEO-MTP-GGUF」が公開された。本モデルは、思考トークン数を通常の半分から最大1/20にまで大幅に削減しつつ、出力の詳細さと品質を維持することを目指してマルチステージ学習・マージ手法により構築されている。APIやチャット上で即時に切り替え可能な5種類の推論モードと5種類のインストラクトモードを備えており、コンシューマー向けハードウェア上での動作を想定してUnslothを用いてビルドされている。

スペック

  • パラメータ数:27Bクラス(27.8B)
  • アーキテクチャ:Qwen3_5ForConditionalGeneration(元モデル)
  • コンテキスト長:256,144トークン

性能

モデルカードに記載されている元モデル(Qwen3.8-27B)等の各種ベンチマークスコアの比較表から、性能を確認することができる(なお、以下の表では比較対象の列を主要なオープンウェイトモデルなど5つに絞って掲載している)。

Text Performance

→ 横にスクロールできます

Qwen3.8-27B Qwen3.6-27B Qwen3.7-Plus Muse Glimmer-30B Opus4.6 Max
Coding
Agentic terminal coding Terminal Bench 2.1 (Terminus) 73.0 63.4 64.0 51.7 78.2
Agentic coding SWE-bench Pro 61.7 53.5 57.6 51.2 53.4
Repo-level code generation NL2Repo-Bench 42.3 36.2 41.1 47.6
Agentic coding DeepSWE 1.1 42.2 13.3 14.2
Software engineering QwenSWEBench 79.0 49.3 59.2 63.8
Agent
Long-horizon office work CoWorkBench 70.7 61.0 65.1 68.2
Professional job tasks JobBench 33.4 21.8 27.6
Frontier agentic tasks Agents’ Last Exam Pass@1 20.4 Score 42.9 Pass@1 10.6 Score 27.3 Pass@1 13.2 Score 33.6
General
Instruction following IFBench 79.5 69.1 79.1 77.0 62.5
Scientific reasoning GPQA Diamond 89.2 87.8 90.3 83.5 91.3
Multidisciplinary reasoning HLE 30.8 24.0 34.7 22.0 40.0
Competitive coding LiveCodeBench v6 90.3 83.9 89.6 88.8

元モデルの測定値に基づく性能として、コーディング関連の Terminal-Bench 2.1 では73.0を記録し、実リポジトリを修正する SWE-bench Pro でも61.7を示すなど、同規模帯や他モデルと比較して高い水準にある。科学の難問を測る GPQA Diamond では89.2、競技プログラミング系の LiveCodeBench v6 では90.3をマークしている。一方で、超難問を扱う HLE では30.8となっており、難易度の高いタスクにおけるスコアの特性が見て取れる。また、本ファインチューニング版では、思考トークンの過剰消費を抑えながらも、ベースとなる高水準な問題解決能力や指示追従性を維持する設計がなされている。

得意なこと・想定用途

本モデルは、マルチステージの学習・マージ手法である「COLD FUSION」および「FABLE FUSION」を用いて構築されており、元モデルの持つ高い一般知能や問題解決能力を維持しつつ、過剰な思考(over-reasoning)やトークンの消費を大幅に抑制することに特化している。タグには creative writingstoryroleplayingcoderthinkingreasoning などが挙げられており、ストーリーテリングや創作、コーディングを含む幅広い用途に対応する。

また、チャットやAPI上で動的に切り替え可能な5種類の推論モード(spoon、einstein、xhigh、medium、low)および5種類のインストラクトモードを搭載しており、状況に応じた挙動の制御が可能となっている。ライトに検閲が解除された(uncensored)調整が施されているほか、ビジョン機能や最大256kトークンのコンテキスト長もサポートされている。

類似モデルとの違い

当サイトで以前紹介した3値ウェイトモデルのテスト版「prism-ml/Ternary-Bonsai-2-27B-gguf-dev」Qwen3.8-27Bベースの3値ウェイトモデル「Bonsai 2 27B」MLX 2bit版公開が極限までの低ビット化や3値ウェイトによる軽量化・環境適応を狙っているのに対し、今回のモデルはUnslothを用いたコンシューマー向けビルドをベースにしつつ、思考トークンの削減とマルチモードの切り替え機構、および検閲解除(uncensored)の調整に焦点を当てている点が大きな違いである。

動作環境

動作環境の目安(Local Model Watch 算出) — パラメータ数 27.8B(元モデル DavidAU/Qwen3.8-27B-TWIN-TURBO-Fable-Cold-Fusion-709-L-Uncensored の値)

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
RTX 6000 Ada / A6000 など 48GB Q5_K_M 37.9GB 45.5GB
A100 / H100 80GB クラス IQ3_M 50.3GB 60.4GB

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

入手方法

GGUF形式での配布となっており、通常のGGUF量子化版のほか、マルチトークン予測(MTP)に対応した「MTP」版やツール呼び出しに特化した「TOOLS」版の各量子化バリエーションが用意されている。Hugging Faceのリポジトリから huggingface-cli などのツールを用いてダウンロードし、llama.cppやOllama、vLLM、LM Studioなどの標準的なAIアプリや推論エンジンで実行することができる。なお、ビジョン機能を利用する場合は別途専用の mmproj ファイルのダウンロードが必要となる。

関連記事

出典

更新履歴

  • 2026-09-14: 公式の一次情報で内容を確認しました。HFのJSONにGGUFタグとモデル名が一致し、公開事実を確認。
  • 2026-09-20: 下書きに戻していた記事を、材料を集め直して書き直し、公開に戻しました。