「GLM-5.3-Flash-GGUF」VLMモデル:必要メモリ約150GB

2026年10月5日

「GLM-5.3-Flash-GGUF」VLMモデル:必要メモリ約150GB

基本情報

項目 内容
リポジトリ ggml-org/GLM-5.3-Flash-GGUF
公開元のまとめ Z.ai(Zhipu AI) のモデルとライセンスのまとめ
公開日 2026-10-04
ライセンス other
配布形式 GGUF
出典の種類 公開元の一次情報(ggml-org公式リポジトリのGGUF公開)

情報を集めた時点で、当サイトのコードが確定させた値です。日付はJSTで表示しています。

当サイトで確かめたこと

  • Qwen3 のトークナイザより約7%多いトークンが要ります。同じ文脈長に入る日本語は約0.94倍(少なくなります)で、生成も1字あたりで遅くなります。

詳しい値と条件は、下の「当サイトでの実測」の節にあります。

概要

ggml-orgより、zai-orgが公開したオープンウェイトのマルチモーダルモデル「GLM-5.3-Flash-BF16」のGGUF量子化版となる「ggml-org/GLM-5.3-Flash-GGUF」が公開されました。

元モデルのGLM-5.3-Flashは、GLM-5シリーズ初となるネイティブマルチモーダル対応のモデルです。総パラメータ数320B、活性パラメータ数18BのMoE(Mixture of Experts)構成を採用しており、疎結合アテンションと線形アテンションを組み合わせたハイブリッドアーキテクチャやManifold-Constrained Hyper-Connections(mHC)を取り入れることで、効率的な長文コンテキスト処理と高い性能の両立を目指して設計されています。

本リポジトリは、llama.cppなどの推論環境で利用できるようにGGUF形式へ変換されたものであり、ビジョンエンコーダ用のmmprojや投機的サンプリング向けのMTPサイドカーも含めて提供されています。

スペック

  • 総パラメータ数: 320B
  • 活性パラメータ数: 18B
  • アーキテクチャ: MoE(1層あたり288のrouted expert、1つのshared expert)、mHC + DSA、1 MTP layer

性能

本モデルはGGUF形式への変換版であるため、性能評価は元モデルである「GLM-5.3-Flash-BF16」の公開情報に基づきます。なお、量子化の適用によって元の精度から多少の変動が生じる可能性があります。

元モデルの公開元による説明では、各種ベンチマークおよび実環境のワークロードにおいて前世代のGLM-5.2を上回る性能を発揮するとされています。また、コーディング関連およびエージェント関連のベンチマークにおいては、Claude Opus 4.8に迫る性能水準を達成していると報告されています。

元モデルの評価手順としては、以下の各種ベンチマークが挙げられています。

  • HLE w/ tools (full set)
  • NL2Repo
  • DeepSWE
  • Terminal-Bench 2.1
  • Agent’s Last Exam
  • Toolathlon Verified
  • AutomationBench
  • GDPval-AA v2
  • BabyVision

元モデルは推論時の思考量を制御するパラメータ(reasoning_effort)を備えており、low、high、max(デフォルト)の3段階から指定して推論能力を調整できる仕組みになっています。

得意なこと・想定用途

本モデルのベースとなっている「GLM-5.3-Flash-BF16」は、GLM-5シリーズとして初めてネイティブなマルチモーダル処理に対応したモデルです。画像とテキストを組み合わせた入力・対話処理(image-text-to-text)に対応しており、視覚情報を伴うタスク全般に活用できます。

元モデルの設計および評価内容から読み取れる主な得意分野と想定用途は以下の通りです。

コーディングおよび自律エージェント支援

元モデルはコーディングやエージェント関連のベンチマークにおいて高い能力を発揮するよう最適化されています。評価には、リポジトリ生成を評価する「NL2Repo」や、ソフトウェアエンジニアリングタスクを自律的に解く「DeepSWE」、ターミナル環境での操作を評価する「Terminal-Bench 2.1」、ツールの活用能力を測る「Toolathlon Verified」、自動化ワークフローを検証する「AutomationBench」などが採用されています。これにより、コードの作成・修正だけでなく、開発ツールの実行や自律的なワークフローの自動化といった複雑なエージェント用途への適性が期待されます。

効率的な長文コンテキスト処理

アーキテクチャ面では、疎結合アテンションと線形アテンションを組み合わせたハイブリッド構造が導入されています。これにより、長文コンテキストを扱う際の推論負荷を大幅に抑えつつ、文脈の把握能力を維持することが狙われています。長大なコードベースの解析や、多段階にわたるツール呼び出し履歴を含むエージェントタスクなど、文脈長が長大化しやすいシナリオに適しています。

思考バジェットの制御と対話

元モデルは推論時の思考量を制御できるパラメータ(reasoning_effort)を備えており、用途に合わせて推論コストや深度を調整できます。また、チャットテンプレートには思考プロセスの表示を制御するclear_thinkingオプションが用意されており、一般的な対話用途では明示的にclear_thinking=trueを設定することが推奨されています。対応言語タグとしては英語(en)および中国語(zh)が付与されています。

ローカル環境における高速推論

今回のGGUF版では、ビジョンエンコーダ用のmmprojファイルに加え、投機的サンプリング(Speculative Decoding)を可能にするMTP(Multi-Token Prediction)サイドカーが含まれています。これにより、対応する推論エンジンを用いた際に、通常の推論よりも高速なテキスト生成を行うことが見込まれます。

動作環境

動作環境の目安(Local Model Watch 算出) — パラメータ数 321.3B(元モデル zai-org/GLM-5.3-Flash-BF16 の値)

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
150GB超のVRAMが必要(複数GPUまたはCPUオフロードが前提) Q2_K 124.6GB 149.5GB

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

手元で動かせるか

Ollama・LM Studio・llama.cpp でそのまま動かせます。

GGUF形式で配布されているため、変換を待たずに手元で読み込めます。

ライセンス other: 公開元の独自ライセンスです。商用利用の可否を含め、条件は公開元の原文を直接確認してください。

量子化の圧縮率: Q2_K は実測 3.33 bit/weight で、元の16bitの重みの約21%のサイズです(配布ファイルの実サイズから当サイトが算出)。

配布形式・当サイトが見つけた変換版・各推論エンジンの登録表を突き合わせた判定です。「確認できていない」は当サイトが見つけていないという意味で、存在しないことの断定ではありません。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。

当サイトでの実測

当サイトのサーバー(GPUなし)で、このモデルのファイルを実際に読み込んで(モデルは動かさずに)確かめた値です。モデルカードの記載ではなく、当サイトが測った結果です。測り方と全モデルの一覧は観測データにまとめています。

ライセンスの都合で行っていない実測

このモデルのライセンス(other)の商用利用の条件を、当サイトが満たしていることを確認できていません。広告を掲載している当サイトでは、ライセンスの都合上、モデルを動かす実測(CPU での実行・回答・量子化の比較・変換・生成)は行っていません。トークン数や GGUF ファイルの中身など、モデルを動かさずに確かめた値だけを載せています。

日本語のトークン効率

トークナイザ 日本語1,000字あたりのトークン数 同じ内容の英文との比
このモデル 733 1.34倍
Qwen3 688 1.26倍
Llama 3.2 744 1.36倍
Gemma 3 564 1.03倍
gpt-oss 795 1.45倍
LLM-jp-3 497 0.85倍

Qwen3 のトークナイザより約7%多いトークンが要ります。同じ文脈長に入る日本語は約0.94倍(少なくなります)で、生成も1字あたりで遅くなります。

zai-org/GLM-5.3-Flash-BF16 の tokenizer.json で、当サイトが書き下ろした固定の文章(876字。ニュース・会話・技術文書・敬語のメール・紀行文・料理の6種)と、同じ内容の英文を数えました。トークン数が少ないほど、同じ文脈長に長い日本語が入ります。

GGUFファイルの中身

対象: GLM-5.3-Flash-Q2_K-00001-of-00002.gguf(124.62GB、Q2_K)。ファイルの先頭のメタデータだけを読んで確かめました(重みはダウンロードしていません)。

項目 値
アーキテクチャ(GGUF上の名前) glm5-next
学習時の最大文脈長 1,048,576トークン
層の数 45
エキスパート 288個のうち8個を使用
語彙数 154,880
チャットテンプレート 同梱(ツール呼び出しの記述あり・思考の切り替えの記述あり)
imatrix ファイルに記録なし
重みの型の内訳(パラメータ数の割合) Q2_K 64.8% / Q4_K 32.4% / Q8_0 2.7% / BF16 0.1% / その他 0.0%
平均のビット数 3.42ビット/重み
埋め込み層 / 出力層の型 Q8_0 / Q8_0

ファイル名の量子化名はファイル全体の呼び名で、実際には層ごとに型が混ざっています。平均のビット数は、ファイルのデータの大きさを重みの数で割った実測値です。

同クラスの既報モデル

当サイトが最近取り上げた、パラメータ数 40B超 のモデルを、比較のために記事ログからコードが並べたものです。VRAM階層は当サイトの概算、ライセンスはモデルカードの記載です。

→ 横にスクロールできます

モデル パラメータ数 最小のVRAM階層 ライセンス 記事
Qwen/Qwen3.8-Flash-Next 180.0B — qwen-community-1.0 「Qwen3.8-Flash-Next」マルチモーダル対応のMoEモデル:必要メモリ約402GB(2026-10-04)
bartowski/Intern-S2-397B-GGUF 403.4B — apache-2.0 「Intern-S2-397B-GGUF」科学分野向けマルチモーダル基盤モデル:必要メモリ約102GB(2026-09-15)
deepseek-ai/DeepSeek-V4.1-Flash 763.2B — mit 「DeepSeek-V4.1-Flash」552BのマルチモーダルMoEモデル:必要メモリ約570GB(2026-09-10)

入手方法

本モデルはHugging Faceの「ggml-org/GLM-5.3-Flash-GGUF」リポジトリにて、GGUF形式で配布されています。ゲート付きモデルではないため、事前の利用申請や同意手続きを行わずにダウンロードして利用できます。

公式の推論ツールであるllama.cpp系列のCLIツールを使用する場合、以下のコマンドで直接Hugging Faceリポジトリを指定してサーバーを起動できます。

llama serve -hf ggml-org/GLM-5.3-Flash-GGUF

本リポジトリで提供されている量子化版の内部仕様には以下の特徴があります。

  • Q4_K: すべてのrouted expert(ルーティング対象のエキスパート)がQ4_Kで量子化されています。
  • Q2_K: routed down expertがQ4_K、gate/up expertがQ2_Kで構成されています。
  • 埋め込み層、アテンション層、共有エキスパート(shared expert)、高密度FFNといったエキスパート以外の小さなテンソルは、品質を維持するためにQ8_0のまま保持されています。
  • ビジョンエンコーダ用のmmproj(Q8_0)および、投機的サンプリング用のMTPサイドカー(Q8_0 / Q4_0)が同梱されています。
  • なお、低ビット量子化においてはimatrix(重要度マトリクス)によるキャリブレーションが行われていない旨が注記されています。

ライセンス区分について、変換元のベースモデル「GLM-5.3-Flash-BF16」はMITライセンスが設定されていますが、本GGUFリポジトリ側にはotherタグが付与されています。利用に際してはリポジトリのライセンス条件を事前にご確認ください。

関連記事

次に読むなら

出典

更新履歴

  • 2026-10-05: 当サイトでの実測(日本語のトークン効率・GGUFファイルの中身)を追加しました。