「Qwen3.8-Flash-Next」マルチモーダル対応のMoEモデル:必要メモリ約402GB

基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | Qwen/Qwen3.8-Flash-Next |
| 公開元のまとめ | Alibaba(Qwen) のモデルとライセンスのまとめ |
| 公開日 | 2026-08-24 |
| ライセンス | qwen-community-1.0 |
| 配布形式 | safetensors |
| 出典の種類 | 公開元の一次情報(HuggingFaceのQwen公式アカウントが一次情報) |
情報を集めた時点で、当サイトのコードが確定させた値です。日付はJSTで表示しています。
概要
Qwenチームより、次世代アーキテクチャを採用したオープンウェイトモデル「Qwen3.8-Flash-Next」が公開されました。本モデルは将来のQwen4の基盤となる設計を実験的に先行公開したプレビュー版であり、ビジョンエンコーダーを統合したマルチモーダル対応の因果言語モデルです。
マイクロブロック単位でスパース処理を行うQwen Sparse Attention(QSA)とGated DeltaNetを組み合わせたハイブリッドアテンションや、計算負荷を抑えてパラメータを拡張するN-gram Embeddingなどを導入しています。これにより、モデルの大規模化と長文脈化が進む環境において、推論効率の劇的な向上と遅延の削減を狙って開発されています。
スペック
- パラメータ数:総パラメータ125B(活性化パラメータ6B、N-gram Embedding 51B、MTP 4B)
- アーキテクチャ:Mixture of Experts(MoE)
- エキスパート数:512(活性化エキスパート:ルーティング10 + 共有1)
- コンテキスト長:ネイティブで262,144トークン(最大1,000,000トークンまで拡張可能)
- レイヤー数:48層
- 隠れ層レイアウト:12 × (3 × (Gated DeltaNet → MoE) → 1 × (Qwen Sparse Attention → MoE))
性能
モデルカードで公開されている言語タスクのベンチマーク比較は以下の通りです。
→ 横にスクロールできます
| Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek-V4-Flash-0731 | Claude-Opus-4.6 (Max) | |
|---|---|---|---|---|---|
| # Params | 125B | 27B | 397B | 284B | — |
| # Activated params | 6B | 27B | 17B | 13B | — |
| # N-gram embedding params | 51B | — | — | — | — |
| Coding | |||||
| Agentic coding DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | — |
| Agentic coding SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| Multilingual software engineering SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | — | 77.5 |
| Repo-level code generation NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| Agent | |||||
| Long-horizon office work CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| Professional job tasks JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Frontier agentic tasks Agents’ Last Exam | Pass@1 24.3 Score 51.2 | Pass@1 20.4 Score 42.9 | Pass@1 13.2 Score 33.6 | Pass@1 25.2 Score — | — |
| Real-world tool use Toolathlon Verified (Pass@1) | 73.5 | 67.1 | 50.6 | 70.3 | — |
| General | |||||
| Instruction following IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| Scientific reasoning GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| Multidisciplinary reasoning HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| Competitive coding LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
公開元が公表した測定結果によると、Qwen3.8-Flash-Nextは実在のGitHub issueを編集・修正する能力を測るSWE-bench Proで62.5、SWE-bench Multilingualで81.0を記録しており、比較表内の他モデルを上回っています。競技プログラミングの新作問題を扱うLiveCodeBench v6でも91.9、物理・化学・生物の博士課程レベルの問題を扱うGPQA Diamondでも91.7と高いスコアを示しています。一方で、各分野の専門家が作成した超難問集であるHLEでは35.9にとどまり、40.0を記録したClaude-Opus-4.6 (Max)には及んでいません。また、NL2Repo-Benchでは48.1となっており、54.2を示したDeepSeek-V4-Flash-0731を下回っています。
続いて、マルチモーダル(Vision Language)性能の測定結果は以下の通りです。
→ 横にスクロールできます
| Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | Claude-Opus-4.6 (Max) | |
|---|---|---|---|---|
| Agentic Multimodal Intelligence | ||||
| Multimodal tool use ClawEval-MM | Pass@3 64.4 Average 60.4 | Pass@3 57.4 Average 56.9 | Pass@3 57.4 Average 60.1 | Pass@3 52.5 Average 54.7 |
| Application recreation RecreationBench | 49.9 | 47.1 | 30.2 | — |
| Mobile use AndroidWorld | 84.5 | 81.9 | 81.0 | 62.0 |
| Computer use OSWorld 2.0 | Binary 19.4 Partial 52.3 | Binary 19.4 Partial 48.0 | Binary 2.8 Partial 21.5 | — |
| Visual web development Vision2Web | 64.0 | 62.9 | 42.1 | — |
| General Multimodal Intelligence | ||||
| Embodied intelligence ERQA | 72.3 | 65.5 | 69.8 | 40.8 |
| Long video understanding LVBench | 76.6 | 72.4 | 76.2 | 63.0 |
| Real-world perception RealWorldQA | 88.5 | 85.9 | 86.9 | 73.9 |
| Visual math problem solving MathVision | Without CI 90.6 With CI 95.7 | Without CI 90.0 With CI 94.6 | Without CI 90.3 With CI 88.7 | Without CI 65.5 |
| Scientific chart analysis CharXiv (RQ) | Without CI 84.6 With CI 90.6 | Without CI 83.7 With CI 90.2 | Without CI 85.8 With CI 85.9 | Without CI 66.0 |
マルチモーダル領域の測定結果においても、実際のOS画面を操作してタスクを完了できるかを評価するOSWorld 2.0においてBinary 19.4、Partial 52.3を記録しており、過去モデルのQwen3.7-Plus(Binary 2.8、Partial 21.5)から大幅に数値を伸ばしています。また、AndroidWorldでも84.5を達成し、Claude-Opus-4.6 (Max)の62.0を大きく上回っています。しかし、ClawEval-MMのAverageスコアを見ると60.4となっており、Qwen3.7-Plusの60.1との差は0.3とごく僅差にとどまります。
得意なこと・想定用途
Qwen3.8-Flash-Nextは、長時間の自律作業を行うエージェントやソフトウェアエンジニアリング、そして画面操作を伴うマルチモーダルタスクを主眼に置いて設計されています。
具体的な強みとして、以下の領域が挙げられます。
- ソフトウェア開発とリポジトリ編集(エージェントコーディング):実在のリポジトリ課題を解決するSWE-bench ProやSWE-bench Multilingualで高いスコアを記録しており、単一関数の生成にとどまらず、プロジェクト全体を見渡したデバッグや機能追加のエージェントタスクに高い適性を示しています。
- 長時間のオフィス業務・実務タスク(長期間エージェント):長大なステップを要するオフィスワークや専門的な業務を評価するCoWorkBenchやJobBenchで優れた結果を残しており、自律的にツールを呼び出しながら計画・実行を繰り返すワークフローに適しています。
- GUI操作・マルチモーダル対応:ビジョンエンコーダーを統合しており、画像や動画の入力に対応しています。OSWorld 2.0やAndroidWorld、Vision2Webなどのベンチマーク結果が示すように、デスクトップ環境やモバイル端末の画面を視覚的に認識して操作するエージェントや、画像に基づいたウェブ制作などで強みを発揮します。
- 超長文脈の処理と推論プロセスの保持:標準で262,144トークン、拡張により最大1,000,000トークンの文脈長に対応しています。また、思考モード(Thinking Mode)がデフォルトで有効化されており、過去の会話履歴全体にわたって推論の軌跡を保持する「Preserved Thinking」機能が備わっています。これにより、複数ターンのやり取りにおいても判断の一貫性を保ち、無駄な再推論を省くことが可能です。
また、コミュニティプロジェクトの「Strata」においては、コード生成に特化してエキスパート数を絞り込んだ派生版の「Coder」や、思考時間を短縮して素早く応答を返すファインチューン版「Swift 1.5」などのバリエーションも用意されており、プログラミング専用アシスタントや応答速度を重視したチャットなど、用途に合わせた使い分けが想定されています。
動作環境
動作環境の目安(Local Model Watch 算出) — パラメータ数 180.0B
| 手持ちのVRAM | 選べる量子化 | ファイルサイズ | 必要メモリの目安 |
|---|---|---|---|
| 402GB超のVRAMが必要(複数GPUまたはCPUオフロードが前提) | BF16 | 335.3GB | 402.3GB |
推論エンジンの対応状況(各プロジェクトのソースにあるモデル登録表とアーキテクチャ名を当サイトが機械的に照合。2026-10-05 時点): llama.cpp: 登録あり、vLLM: 登録あり、MLX (mlx-lm): 未登録。「未登録」はその時点の登録表に名前が無いという意味で、動かないことの断定ではありません。
必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。
手元で動かせるか
公開元の配布形式は safetensors です。
ライセンス qwen-community-1.0: 公開元の独自ライセンスです。商用利用の可否を含め、条件は公開元の原文を直接確認してください。
配布形式とライセンス表記から当サイトのコードが組み立てた判定です。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。
同クラスの既報モデル
当サイトが最近取り上げた、パラメータ数 40B超 のモデルを、比較のために記事ログからコードが並べたものです。VRAM階層は当サイトの概算、ライセンスはモデルカードの記載です。
→ 横にスクロールできます
| モデル | パラメータ数 | 最小のVRAM階層 | ライセンス | 記事 |
|---|---|---|---|---|
| ggml-org/GLM-5.3-Flash-GGUF | 321.3B | — | other | 「GLM-5.3-Flash-GGUF」VLMモデル:必要メモリ約150GB(2026-10-03) |
| bartowski/Intern-S2-397B-GGUF | 403.4B | — | apache-2.0 | 「Intern-S2-397B-GGUF」科学分野向けマルチモーダル基盤モデル:必要メモリ約102GB(2026-09-15) |
| deepseek-ai/DeepSeek-V4.1-Flash | 763.2B | — | mit | 「DeepSeek-V4.1-Flash」552BのマルチモーダルMoEモデル:必要メモリ約570GB(2026-09-10) |
入手方法
Qwen3.8-Flash-Nextのモデルウェイトは、Hugging Faceにてsafetensors形式で公開されています。ライセンスには「qwen-community-1.0」が適用されており、特定の事前申請を必要としないオープンウェイトモデルとして配布されています。
本モデルを利用・実行するための方法は複数用意されています。
サーバー環境や高性能な実行環境向けには、公式のモデルカードにて以下の推論フレームワークへの対応手順が案内されています。
- SGLang
- vLLM
- TokenSpeed
また、コンシューマー向けの一般的なPC環境で動作させるための推論プロジェクトとして、MITライセンスで開発されたオープンソースソフトウェア「Strata」が公開されています。WindowsおよびLinux環境に対応しており、リポジトリをダウンロードした後に以下のスクリプトを実行することで、セットアップや実行が対話形式で行われます。
- Windowsの場合:
START-HERE.batを実行します。 - Linuxの場合:
./setup.shを実行します。
インストーラーがハードウェアを検出して適切な量子化モデルを選択し、ダウンロードから起動まで自動で処理します。CursorやClaude CodeなどのAIコーディングアシスタントを使用している場合は、リポジトリに用意されている指示文をアシスタントに渡すことで、構成の確認から起動までを代行させる機能も備わっています。
起動後はブラウザからWeb UI(http://127.0.0.1:8080)にアクセスしてチャットや動作ステータスの確認ができるほか、以下の互換エンドポイントを介して各種クライアントや開発ツールから利用できます。
- OpenAI互換API:ベースURLに
http://127.0.0.1:8080/v1を指定します。 - Anthropic互換API:
http://127.0.0.1:8080/v1/messagesを指定します。
なお、モデルの初回起動時にはメインメモリへの読み込みとGPUへの割り当てが行われるため、環境によっては数分程度応答が停止したように見える場合がありますが、バックグラウンドでの正常な処理であると説明されています。
関連記事
- 「Qwen3.8-27B」マルチモーダル視覚言語モデル:当サイトでの回答例・必要VRAM 8GB〜・GGUF版あり
- 画像生成・編集モデル「Qwen-Image-2.1」公開、透過処理や高度なマルチ画像編集に対応
- 「DeepSeek-V4-Pro-0813」エージェント能力を強化した大規模MoEモデル:必要メモリ約998GB
- 「K2-Horizon-32B-NVFP4」長文・推論対応モデル:当サイトでの回答例・必要VRAM 32GB〜
次に読むなら
- GPUのVRAMから探す(このモデルは80GBの階層にも収まりません。最小構成でも約402GB) → 80GB超のモデルも並べたVRAM別の早見表
- このモデルを動かすエンジンを調べる → vLLM
- このモデルを入手できる形式を調べる → Safetensors形式の解説と対応モデル
- 公開元について調べる → Alibaba(Qwen) のモデル・ライセンス・記事のまとめ
- 同じ用途の他のモデルを探す → VLM・マルチモーダルのモデル一覧

