「Qwen3.8-Flash-Next」マルチモーダル対応のMoEモデル:必要メモリ約402GB

「Qwen3.8-Flash-Next」マルチモーダル対応のMoEモデル:必要メモリ約402GB

基本情報

項目 内容
リポジトリ Qwen/Qwen3.8-Flash-Next
公開元のまとめ Alibaba(Qwen) のモデルとライセンスのまとめ
公開日 2026-08-24
ライセンス qwen-community-1.0
配布形式 safetensors
出典の種類 公開元の一次情報(HuggingFaceのQwen公式アカウントが一次情報)

情報を集めた時点で、当サイトのコードが確定させた値です。日付はJSTで表示しています。

概要

Qwenチームより、次世代アーキテクチャを採用したオープンウェイトモデル「Qwen3.8-Flash-Next」が公開されました。本モデルは将来のQwen4の基盤となる設計を実験的に先行公開したプレビュー版であり、ビジョンエンコーダーを統合したマルチモーダル対応の因果言語モデルです。

マイクロブロック単位でスパース処理を行うQwen Sparse Attention(QSA)とGated DeltaNetを組み合わせたハイブリッドアテンションや、計算負荷を抑えてパラメータを拡張するN-gram Embeddingなどを導入しています。これにより、モデルの大規模化と長文脈化が進む環境において、推論効率の劇的な向上と遅延の削減を狙って開発されています。

スペック

  • パラメータ数:総パラメータ125B(活性化パラメータ6B、N-gram Embedding 51B、MTP 4B)
  • アーキテクチャ:Mixture of Experts(MoE)
  • エキスパート数:512(活性化エキスパート:ルーティング10 + 共有1)
  • コンテキスト長:ネイティブで262,144トークン(最大1,000,000トークンまで拡張可能)
  • レイヤー数:48層
  • 隠れ層レイアウト:12 × (3 × (Gated DeltaNet → MoE) → 1 × (Qwen Sparse Attention → MoE))

性能

モデルカードで公開されている言語タスクのベンチマーク比較は以下の通りです。

→ 横にスクロールできます

Qwen3.8-Flash-Next Qwen3.8-27B Qwen3.7-Plus DeepSeek-V4-Flash-0731 Claude-Opus-4.6 (Max)
# Params 125B 27B 397B 284B —
# Activated params 6B 27B 17B 13B —
# N-gram embedding params 51B — — — —
Coding
Agentic coding DeepSWE 1.1 58.7 42.2 16.5 54.4 —
Agentic coding SWE-bench Pro 62.5 61.7 55.8 56.0 53.4
Multilingual software engineering SWE-bench Multilingual 81.0 73.8 75.8 — 77.5
Repo-level code generation NL2Repo-Bench 48.1 42.3 41.1 54.2 47.6
Agent
Long-horizon office work CoWorkBench 73.9 70.7 65.1 45.1 68.2
Professional job tasks JobBench 55.7 33.4 27.6 41.3 36.6
Frontier agentic tasks Agents’ Last Exam Pass@1 24.3 Score 51.2 Pass@1 20.4 Score 42.9 Pass@1 13.2 Score 33.6 Pass@1 25.2 Score — —
Real-world tool use Toolathlon Verified (Pass@1) 73.5 67.1 50.6 70.3 —
General
Instruction following IFBench 81.3 79.5 79.1 79.2 62.5
Scientific reasoning GPQA Diamond 91.7 89.2 90.3 90.8 91.3
Multidisciplinary reasoning HLE 35.9 30.8 34.7 33.8 40.0
Competitive coding LiveCodeBench v6 91.9 90.3 89.6 90.6 88.8

公開元が公表した測定結果によると、Qwen3.8-Flash-Nextは実在のGitHub issueを編集・修正する能力を測るSWE-bench Proで62.5、SWE-bench Multilingualで81.0を記録しており、比較表内の他モデルを上回っています。競技プログラミングの新作問題を扱うLiveCodeBench v6でも91.9、物理・化学・生物の博士課程レベルの問題を扱うGPQA Diamondでも91.7と高いスコアを示しています。一方で、各分野の専門家が作成した超難問集であるHLEでは35.9にとどまり、40.0を記録したClaude-Opus-4.6 (Max)には及んでいません。また、NL2Repo-Benchでは48.1となっており、54.2を示したDeepSeek-V4-Flash-0731を下回っています。

続いて、マルチモーダル(Vision Language)性能の測定結果は以下の通りです。

→ 横にスクロールできます

Qwen3.8-Flash-Next Qwen3.8-27B Qwen3.7-Plus Claude-Opus-4.6 (Max)
Agentic Multimodal Intelligence
Multimodal tool use ClawEval-MM Pass@3 64.4 Average 60.4 Pass@3 57.4 Average 56.9 Pass@3 57.4 Average 60.1 Pass@3 52.5 Average 54.7
Application recreation RecreationBench 49.9 47.1 30.2 —
Mobile use AndroidWorld 84.5 81.9 81.0 62.0
Computer use OSWorld 2.0 Binary 19.4 Partial 52.3 Binary 19.4 Partial 48.0 Binary 2.8 Partial 21.5 —
Visual web development Vision2Web 64.0 62.9 42.1 —
General Multimodal Intelligence
Embodied intelligence ERQA 72.3 65.5 69.8 40.8
Long video understanding LVBench 76.6 72.4 76.2 63.0
Real-world perception RealWorldQA 88.5 85.9 86.9 73.9
Visual math problem solving MathVision Without CI 90.6 With CI 95.7 Without CI 90.0 With CI 94.6 Without CI 90.3 With CI 88.7 Without CI 65.5
Scientific chart analysis CharXiv (RQ) Without CI 84.6 With CI 90.6 Without CI 83.7 With CI 90.2 Without CI 85.8 With CI 85.9 Without CI 66.0

マルチモーダル領域の測定結果においても、実際のOS画面を操作してタスクを完了できるかを評価するOSWorld 2.0においてBinary 19.4、Partial 52.3を記録しており、過去モデルのQwen3.7-Plus(Binary 2.8、Partial 21.5)から大幅に数値を伸ばしています。また、AndroidWorldでも84.5を達成し、Claude-Opus-4.6 (Max)の62.0を大きく上回っています。しかし、ClawEval-MMのAverageスコアを見ると60.4となっており、Qwen3.7-Plusの60.1との差は0.3とごく僅差にとどまります。

得意なこと・想定用途

Qwen3.8-Flash-Nextは、長時間の自律作業を行うエージェントやソフトウェアエンジニアリング、そして画面操作を伴うマルチモーダルタスクを主眼に置いて設計されています。

具体的な強みとして、以下の領域が挙げられます。

  • ソフトウェア開発とリポジトリ編集(エージェントコーディング):実在のリポジトリ課題を解決するSWE-bench ProやSWE-bench Multilingualで高いスコアを記録しており、単一関数の生成にとどまらず、プロジェクト全体を見渡したデバッグや機能追加のエージェントタスクに高い適性を示しています。
  • 長時間のオフィス業務・実務タスク(長期間エージェント):長大なステップを要するオフィスワークや専門的な業務を評価するCoWorkBenchやJobBenchで優れた結果を残しており、自律的にツールを呼び出しながら計画・実行を繰り返すワークフローに適しています。
  • GUI操作・マルチモーダル対応:ビジョンエンコーダーを統合しており、画像や動画の入力に対応しています。OSWorld 2.0やAndroidWorld、Vision2Webなどのベンチマーク結果が示すように、デスクトップ環境やモバイル端末の画面を視覚的に認識して操作するエージェントや、画像に基づいたウェブ制作などで強みを発揮します。
  • 超長文脈の処理と推論プロセスの保持:標準で262,144トークン、拡張により最大1,000,000トークンの文脈長に対応しています。また、思考モード(Thinking Mode)がデフォルトで有効化されており、過去の会話履歴全体にわたって推論の軌跡を保持する「Preserved Thinking」機能が備わっています。これにより、複数ターンのやり取りにおいても判断の一貫性を保ち、無駄な再推論を省くことが可能です。

また、コミュニティプロジェクトの「Strata」においては、コード生成に特化してエキスパート数を絞り込んだ派生版の「Coder」や、思考時間を短縮して素早く応答を返すファインチューン版「Swift 1.5」などのバリエーションも用意されており、プログラミング専用アシスタントや応答速度を重視したチャットなど、用途に合わせた使い分けが想定されています。

動作環境

動作環境の目安(Local Model Watch 算出) — パラメータ数 180.0B

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
402GB超のVRAMが必要(複数GPUまたはCPUオフロードが前提) BF16 335.3GB 402.3GB

推論エンジンの対応状況(各プロジェクトのソースにあるモデル登録表とアーキテクチャ名を当サイトが機械的に照合。2026-10-05 時点): llama.cpp: 登録あり、vLLM: 登録あり、MLX (mlx-lm): 未登録。「未登録」はその時点の登録表に名前が無いという意味で、動かないことの断定ではありません。

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

手元で動かせるか

公開元の配布形式は safetensors です。

ライセンス qwen-community-1.0: 公開元の独自ライセンスです。商用利用の可否を含め、条件は公開元の原文を直接確認してください。

配布形式とライセンス表記から当サイトのコードが組み立てた判定です。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。

同クラスの既報モデル

当サイトが最近取り上げた、パラメータ数 40B超 のモデルを、比較のために記事ログからコードが並べたものです。VRAM階層は当サイトの概算、ライセンスはモデルカードの記載です。

→ 横にスクロールできます

モデル パラメータ数 最小のVRAM階層 ライセンス 記事
ggml-org/GLM-5.3-Flash-GGUF 321.3B — other 「GLM-5.3-Flash-GGUF」VLMモデル:必要メモリ約150GB(2026-10-03)
bartowski/Intern-S2-397B-GGUF 403.4B — apache-2.0 「Intern-S2-397B-GGUF」科学分野向けマルチモーダル基盤モデル:必要メモリ約102GB(2026-09-15)
deepseek-ai/DeepSeek-V4.1-Flash 763.2B — mit 「DeepSeek-V4.1-Flash」552BのマルチモーダルMoEモデル:必要メモリ約570GB(2026-09-10)

入手方法

Qwen3.8-Flash-Nextのモデルウェイトは、Hugging Faceにてsafetensors形式で公開されています。ライセンスには「qwen-community-1.0」が適用されており、特定の事前申請を必要としないオープンウェイトモデルとして配布されています。

本モデルを利用・実行するための方法は複数用意されています。

サーバー環境や高性能な実行環境向けには、公式のモデルカードにて以下の推論フレームワークへの対応手順が案内されています。

  • SGLang
  • vLLM
  • TokenSpeed

また、コンシューマー向けの一般的なPC環境で動作させるための推論プロジェクトとして、MITライセンスで開発されたオープンソースソフトウェア「Strata」が公開されています。WindowsおよびLinux環境に対応しており、リポジトリをダウンロードした後に以下のスクリプトを実行することで、セットアップや実行が対話形式で行われます。

  • Windowsの場合:START-HERE.bat を実行します。
  • Linuxの場合:./setup.sh を実行します。

インストーラーがハードウェアを検出して適切な量子化モデルを選択し、ダウンロードから起動まで自動で処理します。CursorやClaude CodeなどのAIコーディングアシスタントを使用している場合は、リポジトリに用意されている指示文をアシスタントに渡すことで、構成の確認から起動までを代行させる機能も備わっています。

起動後はブラウザからWeb UI(http://127.0.0.1:8080)にアクセスしてチャットや動作ステータスの確認ができるほか、以下の互換エンドポイントを介して各種クライアントや開発ツールから利用できます。

  • OpenAI互換API:ベースURLに http://127.0.0.1:8080/v1 を指定します。
  • Anthropic互換API:http://127.0.0.1:8080/v1/messages を指定します。

なお、モデルの初回起動時にはメインメモリへの読み込みとGPUへの割り当てが行われるため、環境によっては数分程度応答が停止したように見える場合がありますが、バックグラウンドでの正常な処理であると説明されています。

関連記事

次に読むなら

出典