「clef-flash」構造化出力特化型モデル:必要VRAM 4GB〜・GGUF版あり

2026年10月3日

「clef-flash」構造化出力特化型モデル:必要VRAM 4GB〜・GGUF版あり

基本情報

項目 内容
リポジトリ Cloudflare/clef-flash
公開元のまとめ Alibaba(Qwen) のモデルとライセンスのまとめ
公開日 2026-10-01
ライセンス apache-2.0
配布形式 safetensors
出典の種類 公開元の一次情報(Cloudflare公式HFリポジトリ)

情報を集めた時点で、当サイトのコードが確定させた値です。日付はJSTで表示しています。

当サイトで確かめたこと

  • 全ての意思決定モデルに出している当サイトの判定問題20問を、配布元のコードをクラウドの GPU(NVIDIA L4・ネットワーク遮断)で動かして解かせ、日本語で18問・英語で18問正解しました。

詳しい値と条件は、下の「当サイトでの実測」の節にあります。

スペック

  • パラメータ数:9B
  • アーキテクチャ:Qwen3.5-9B(Gated DeltaNet + 混合専門家モデル:MoE)およびビジョンエンコーダ、独自のJoint schema head
  • コンテキスト長:ネイティブ 262,144トークン(YaRN等の手法により最大 1,010,000トークンまで拡張可能)

性能

公開元が実施した「Decision Index 0.2.1」スイートによる内部測定結果を以下に示します。比較対象として、上位モデルのClef、およびJev、Kev 9Bの数値を抜粋して掲載します。

Decision Index 測定結果

→ 横にスクロールできます

Benchmark Clef Clef-flash Jev Kev 9B
BFCL (case exact accuracy) 98.5 98.8 95.8 94.5
ToolRet (nDCG@10) 69.2 66.4 65.3 64.3
API-Bank (accuracy) 91.9 93.1 88.2 56.3
BANKING77 (macro-F1) 94.2 90.9 79.7 84.8
CLINC150+OOS (macro-F1) 97.4 66.8 89.3 79.0
RouterBench (selected quality) 79.7 79.9 79.9 80.0
Home appliance simulator (case exact accuracy) 83.0 97.7 52.3 25.0
SGD/SGD-X (macro-F1) 43.8 34.2 43.0 64.0
ContractNLI (macro-F1) 81.4 84.3 71.7 57.8
ANLI (macro-F1) 69.8 59.1 74.8 56.3
BPoMP (accuracy) 96.9 95.4 90.6 67.0
Humicroedit (accuracy) 66.7 75.1 61.9 55.8
POP909-CL (accuracy) 15.8 1.6 18.1 10.8
cfcolor (accuracy) 66.0 65.8 64.7 56.3
MMLU (accuracy) 90.3 91.8 91.7 75.3
GPQA Diamond (accuracy) 48.0 51.0 78.3 38.8
ARC-Easy (accuracy) 99.0 99.5 99.3 97.7
ARC-Challenge (accuracy) 97.7 98.3 97.8 93.7
WinoGrande (accuracy) 93.5 97.5 92.0 73.2
HellaSwag (accuracy) 98.2 98.6 94.5 81.9
GSM8K (accuracy) 80.8 67.3 79.9 48.7
ChessBench (accuracy) 24.7 23.0 17.2 11.2
MuSR (accuracy) 83.5 86.0 66.1 57.9
SATA-Bench (case exact accuracy) 33.8 36.7 26.4 26.7
BRIGHT (nDCG@10) 45.9 39.3 47.5 38.5
Amazon ESCI (macro-F1) 57.5 57.4 55.2 49.2
ACOS (per-review F1) 33.3 25.9 29.5 18.3
FinEntity (macro-F1) 96.2 97.1 87.0 88.4
VAST (macro-F1) 59.5 49.6 64.6 55.4
NLI4CT (macro-F1) 82.9 78.6 84.1 74.9
CRUXEval (accuracy) 86.7 86.1 73.0 51.2
CLadder (accuracy) 94.0 97.7 72.6 62.0
ForecastBench (Brier, lower is better) 13.9 10.6 17.4 17.6
Habermas Machine (accuracy) 68.7 71.8 45.9 39.4
PhishNChips (accuracy) 79.6 75.0 62.5 50.7
MMLU-Pro (accuracy) 65.9 65.3 82.7 51.1
BBH (accuracy) 73.7 68.9 92.9 65.2
RAGTruth (hallucination F1) 79.4 35.6 76.5 46.2
HoVer (accuracy) 65.2 61.2 72.9 58.8
When2Call MCQ (accuracy) 72.4 65.6 81.0 49.6
New Yorker (accuracy) 69.5 66.1 70.1 58.1
Median latency (ms) 209.3 38.8 524.1 51.4
p95 latency (ms) 238.6 122.4 536.0 187.9

この表から、Clef-Flashはエージェントとしてのツール利用能力を測るBFCLにおいて98.8%という極めて高い正解率を記録しており、上位モデルのClefを僅かに上回る結果を出していることがわかります。また、一般知識を測るMMLUでも91.8%と高い水準にあります。特筆すべきはレイテンシの低さで、p95レイテンシは122.4msと、Clef(238.6ms)やJev(536.0ms)よりも大幅に高速です。

一方で、RAGTruth(ハルシネーションの測定)では35.6%に留まり、Clef(79.4%)やJev(76.5%)と比較して大幅に劣っています。また、意図分類のCLINC150+OOSや、推論を要するBBH、MMLU-Proといった指標でも、Jevなどの他モデルに及ばない分野が存在します。意思決定の速さと特定のツール利用精度には優れるものの、複雑な推論やハルシネーション抑制においてはトレードオフがあるといえます。

ワークフロー評価

実際のビジネスワークフローを想定した「Typesafe Evals」の精度測定結果は以下の通りです。

→ 横にスクロールできます

Workflow Metric Clef Clef-flash Jev
Invoice processing Exact actions 64.7 57.1 61.8
Invoice processing Primary action 86.2 73.3 83.1
Customer service Exact actions 76.3 77.0 76.0
Security incidents Exact actions 62.9 61.7 61.7
Agent trace observability Primary action 68.5 69.8 71.6

実務的なタスクにおいても、カスタマーサービス(Customer service)の正確なアクション選択で77.0%を記録し、上位モデルを僅かに凌駕する性能を見せています。請求書処理(Invoice processing)のような複雑なタスクでは上位モデルに譲るものの、実用的な精度を維持しています。

なお、ベースモデルであるQwen3.5-9Bの公開元測定によれば、画像理解のMMMUで78.4%、図形やグラフを含む数学問題を解くMathVistaで85.7%といった高い視覚言語処理能力を備えています。Clef-Flashはこれらの強力な視覚・言語能力を引き継ぎつつ、構造化された意思決定出力に最適化されています。

得意なこと・想定用途

Clef-Flashが得意とするのは、自由文を生成する通常のチャットではなく、「状態」と「選択式の質問スキーマ」を渡すと、各質問の全選択肢に対する確率を1回の推論で返す構造化された意思決定です。structured-output・classification・image-text-to-typed-outputといったタグが示すとおり、出力のパース処理が不要な点が最大の特徴で、分類・ルーティング・意図判定のような業務処理に向いています。入力は文字列・JSONに加えて画像・動画フレームも受け付けられるため、請求書の画像を読んで判定するような用途にも対応します。

モデルカードによれば、Decision Indexの実測ではBFCL(ツール呼び出しの正解率)で98.8、Home appliance simulator(ケース完全一致)で97.7といった高い値が出ており、業務ワークフロー評価でもカスタマーサービスのアクション選択で77.0と上位モデルのClefやJevを上回っています。加えてp95レイテンシが122.4msと他モデルより大幅に低く、速度が求められるリアルタイムのルーティング・分類処理に適しています。ベースのQwen/Qwen3.5-9Bはマルチモーダル・201言語対応・最大1,010,000トークンの長文脈処理を備えるモデルなので、多言語の文書や長い状態記述を扱う場面でもその素地を引き継いでいると考えられます。

類似モデルとの違い

同じQwen3.5-9Bを土台にした関連モデルとして、当サイトでは「LensVLM-9B」長文を画像として縮小して処理する視覚言語モデルと「MiMo-V2.6-Distill-Qwen-9B-GGUF」を紹介しています。LensVLM-9BはAppleが長文書を画像に圧縮してトークン数を削減する方向にチューニングしたモデル、MiMo-V2.6-Distill-Qwen-9BはXiaomi MiMoがコーディングや汎用エージェントタスクに向けて蒸留・SFTしたモデルで、いずれも自由文生成を前提にしています。これに対しClef-Flashは、自由文生成そのものを排し、スキーマに沿った確率出力に特化している点が大きく異なり、同じベースモデルでも用途の方向性がまったく違う派生と言えます。

動作環境

動作環境の目安(Local Model Watch 算出) — パラメータ数 9.4B

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
4GB(ノートPCの内蔵GPU・スマートフォンなど) IQ2_M 3.3GB 4.0GB
RTX 4060 / 3060 Ti など 8GB Q5_K_M 6.4GB 7.7GB
RTX 4070 / 3060 12GB など 12GB Q8_0 8.9GB 10.7GB
RTX 4090 / 3090 など 24GB BF16 16.7GB 20.0GB

推論エンジンの対応状況(各プロジェクトのソースにあるモデル登録表とアーキテクチャ名を当サイトが機械的に照合。2026-10-03 時点): llama.cpp: 登録あり、vLLM: 登録あり、MLX (mlx-lm): 登録あり。

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 ファイルサイズは変換版 bartowski/Cloudflare_clef-flash-GGUF の配布ファイルの実測値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

手元で動かせるか

Ollama・LM Studio・llama.cpp で動かせます(変換版を利用)。

公開元の配布は safetensors ですが、bartowski/Cloudflare_clef-flash-GGUF が GGUF版を公開しているため、そちらを使えば手元で動きます。

ライセンス apache-2.0(商用利用可): 商用利用を含めて自由に利用・改変・再配布できます。再配布時にライセンス文と変更点の告知が必要で、特許の許諾条項があります。

量子化の圧縮率: IQ2_M は実測 3.01 bit/weight で、元の16bitの重みの約19%のサイズです(配布ファイルの実サイズから当サイトが算出)。

配布形式・当サイトが見つけた変換版・各推論エンジンの登録表を突き合わせた判定です。「確認できていない」は当サイトが見つけていないという意味で、存在しないことの断定ではありません。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。

当サイトでの実測

当サイトのサーバー(GPUなし)で、このモデルのファイルを実際に読み込み・動かして確かめた値です。モデルカードの記載ではなく、当サイトが測った結果です。測り方と全モデルの一覧は観測データにまとめています。

意思決定モデルとしての評価(当サイトの判定問題)

全ての意思決定モデルに出しているのと同じ、当サイトが書いた11の状況・20問の判定問題(はい/いいえ・名前付きの選択肢・順序のある段階。日本語と英語)を解かせました。このモデルの判定の部分は llama.cpp で動かせないため、配布元のコード(joint_schema_model.py とその SystemOne 互換の関数)を、クラウドの GPU を借りて、ネットワークを遮断したコンテナの中で動かしました。どの問いも判定の規則を文に書いて答えが1つに決まるようにし、正誤はコードが判定しています(はい/いいえは「はい」の確率が0.5以上なら「はい」、選択肢と段階は確率が最も高いもの)。ベンチマークの問題ではなく、モデルの総合的な性能の順位でもありません。

条件は Modal・NVIDIA L4(ピーク時の VRAM 17.9GB)・BF16・transformers 5.18.0・torch 2.14.1+cu130・配布元の版 17f0b0ad64 です。1回の判定の時間は、1つの状況(1〜3問)を配布元の関数に渡してから返るまでをその GPU で測った値で、手元の GPU の速さの目安ではなく、当サイトの CPU で測った時間とも比べられません。

→ 横にスクロールできます

モデル 方式 量子化 正解(日本語) 正解(英語) 正解に付けた確率の平均(日本語 / 英語) 1回の判定の時間の中央値(日本語 / 英語) ピーク時のメモリ
clef-flash joint_schema_model.py BF16 18/20 18/20 0.88 / 0.88 170ms / 167ms (GPU: NVIDIA L4) VRAM 17.9GB
Kev-4B(参考) kev Q4_K_M 18/20 19/20 0.87 / 0.87 7,616ms / 7,409ms 6.3GB
clef joint_schema_model.py BF16 20/20 19/20 0.98 / 0.94 190ms / 189ms (GPU: NVIDIA A100 80GB PCIe) VRAM 51.4GB
lev(参考) lev Q4_K_M 16/20 16/20 0.76 / 0.80 14,061ms / 13,186ms 6.0GB
Laya(参考) laya Q8_0 10/20 15/20 0.47 / 0.68 968ms / 678ms 0.9GB
Julia-1(参考) laya Q8_0 13/20 10/20 0.60 / 0.45 136ms / 107ms 0.5GB

日本語と英語で同じ数を正解しました(20問中18問)。

ほかの行は同じ条件で測ったほかの意思決定モデルです(「参考」は比較のために測ったモデル)。方式はモデルごとに違い、量子化もそれぞれの配布のものです。

時間に(GPU)とある行はクラウドの GPU で、それ以外は当サイトの CPU で測ったため、その間で時間は比べられません(正解の数は比べられます)。

問いごとの答え

→ 横にスクロールできます

状況 問い 正解 日本語での答え 英語での答え
問い合わせの振り分け このメッセージはどのチームが担当すべきですか。 billing ✓ billing(正解の確率 0.98) ✓ billing(正解の確率 0.96)
問い合わせの振り分け お客様はお金を返すよう求めていますか。 はい ✓ はい(正解の確率 0.95) ✓ はい(正解の確率 0.80)
問い合わせの振り分け このメッセージは、サービスが止まっていることを伝えていますか。 いいえ ✓ いいえ(正解の確率 1.00) ✓ いいえ(正解の確率 0.99)
返品の可否(期限内) 届いた日から今日までが30日以内ですか。 はい ✓ はい(正解の確率 0.96) ✓ はい(正解の確率 0.95)
返品の可否(期限内) この商品は、規定どおりに返品できますか。 はい ✗ いいえ(正解の確率 0.14) ✗ いいえ(正解の確率 0.17)
返品の可否(期限切れ) 届いた日から今日までが30日以内ですか。 いいえ ✓ いいえ(正解の確率 0.98) ✓ いいえ(正解の確率 0.99)
返品の可否(期限切れ) この商品は、規定どおりに返品できますか。 いいえ ✓ いいえ(正解の確率 0.96) ✓ いいえ(正解の確率 0.95)
請求書の処理(取引先) この請求書をどう扱いますか。 reject ✓ reject(正解の確率 0.97) ✓ reject(正解の確率 0.98)
請求書の処理(取引先) 請求額は1,000米ドルを超えていますか。 いいえ ✓ いいえ(正解の確率 1.00) ✓ いいえ(正解の確率 1.00)
請求書の処理(金額) この請求書をどう扱いますか。 manager ✓ manager(正解の確率 0.94) ✓ manager(正解の確率 0.96)
請求書の処理(金額) 請求額は1,000米ドルを超えていますか。 はい ✓ はい(正解の確率 0.98) ✓ はい(正解の確率 0.98)
障害の深刻度 この障害の影響はどの程度ですか。 3: すべての利用者に影響 ✓ 3: すべての利用者に影響(正解の確率 0.92) ✓ 3: すべての利用者に影響(正解の確率 0.95)
障害の深刻度 サービスは止まっていますか。 はい ✓ はい(正解の確率 0.96) ✓ はい(正解の確率 0.96)
配送の遅れの段階 この配送の遅れは、基準のどの段階ですか。 2: 中程度の遅れ ✗ 1: 軽度の遅れ(正解の確率 0.03) ✗ 1: 軽度の遅れ(正解の確率 0.04)
レビューの評価(否定の言い回し) 投稿者の全体としての評価はどれですか。 positive ✓ positive(正解の確率 1.00) ✓ positive(正解の確率 0.99)
レビューの評価(否定の言い回し) 投稿者は、また買うと言っていますか。 はい ✓ はい(正解の確率 0.97) ✓ はい(正解の確率 0.98)
不審なメール(指示の書き込み) このメールはどれに分類すべきですか。 phishing ✓ phishing(正解の確率 0.98) ✓ phishing(正解の確率 0.98)
不審なメール(指示の書き込み) このメールは、読み手にパスワードの入力を求めていますか。 はい ✓ はい(正解の確率 0.97) ✓ はい(正解の確率 0.96)
予定の重なり 会議の依頼は、カレンダーの予定と時間が重なりますか。 はい ✓ はい(正解の確率 0.93) ✓ はい(正解の確率 0.93)
問い合わせの意図(6択) 利用者がしたいことはどれですか。 change_address ✓ change_address(正解の確率 1.00) ✓ change_address(正解の確率 1.00)

状況と問いの全文と、正解の根拠は観測データに載せています。

環境構築と実行の手順

ダウンロード(GPU の無い別のコンテナ。配布元のコードは実行しません): Python 3.12・pip install huggingface_hub で、Cloudflare/clef-flash の版 17f0b0ad64efb65d273590632833508766b2aae6 の次のファイルを落としました(pickle の重みは落としません)。

chat_template.jinja
config.json
generation_config.json
joint_head.safetensors
joint_head_config.json
joint_schema_model.py
model-00001-of-00004.safetensors
model-00002-of-00004.safetensors
model-00003-of-00004.safetensors
model-00004-of-00004.safetensors
model.safetensors.index.json
processor_config.json
tokenizer.json
tokenizer_config.json

実行(GPU のコンテナ。ネットワーク遮断・モデルのファイルは読み取り専用): Python 3.12・pip install torch transformers accelerate safetensors pillow torchvision。コンテナで実行したコードの全文(decision_remote.py)です。問いは上と同じ要求の本文を渡しています。

"""
Modal のコンテナの中で動く、意思決定モデルの配布元のコードによる評価(2026-10-02、ユーザーの判断「Clef を Modal で動かす」)。
lmw/lab/gpu_modal.py の decision_run から呼ばれる。**標準ライブラリだけを先頭で読み**、torch・transformers は関数の中で読む。

llama.cpp に判定の方式が無い意思決定モデル(Clef は判定ヘッド joint_head.safetensors を配布元の joint_schema_model.py で
読む)を、配布元の SystemOne 互換の関数(systemone)で動かす。このコンテナは**ネットワーク遮断・Modal の機能なし・
Volume は読み取り専用**で、配布元のコードはここでだけ import する(ダウンロードは remote_code_remote.download が
GPU の無い別のコンテナで行い、そちらでは import しない)。

問題(要求の本文)はホストが組んで渡す(lmw/lab/decision.py の request_body。llama.cpp で測るモデルと同じもの)。
正誤はホストのコード(decision.score)が判定する。ここでは応答をそのまま返し、1回の判定にかかった時間を測るだけ。
"""
import os
import platform
import sys
import time
from datetime import datetime, timezone

MOUNT = "/models"
PYTHON_VERSION = "3.12"
# 実行用のコンテナに入れるパッケージ(記事の手順にも同じ値を載せる)。Clef のカードの記載は torch 2.11・
# transformers 5.10.2 で、画像を読む処理(AutoProcessor)のために pillow・torchvision を入れる
RUN_PACKAGES = ("torch", "transformers", "accelerate", "safetensors", "pillow", "torchvision")

def installed_packages() -> list[str]:
    from importlib import metadata
    seen = {}
    for dist in metadata.distributions():
        name = dist.metadata["Name"]
        if name and name.lower() not in seen:
            seen[name.lower()] = f"{name}=={dist.version}"
    return sorted(seen.values(), key=str.lower)

def _keep(answer: dict) -> dict:
    return {k: answer[k] for k in ("type", "choice", "noul", "score", "probabilities", "confidence") if k in answer}

def _log(t0: float, message: str) -> None:
    print(f"[decision {time.time() - t0:6.0f}s] {message}", flush=True)

def run(job: dict) -> dict:
    """
    job: {"dir", "module", "loader", "answer", "warmup": 要求, "requests": {lang: [[状況の id, 要求], ...]}}。
    戻り値は記録の一部({"results", "gpu", "vram_*", "transformers", "torch", "packages", ...})。
    """
    import torch
    import transformers
    os.environ["HF_HUB_OFFLINE"] = "1"
    os.environ["TRANSFORMERS_OFFLINE"] = "1"
    t0 = time.time()
    path = os.path.join(MOUNT, job["dir"])
    gpu = torch.cuda.get_device_name(0)
    _log(t0, f"GPU: {gpu}・transformers {transformers.__version__}・torch {torch.__version__}")
    # 配布元のコード。このコンテナ(ネットワーク遮断)でだけ読む
    sys.path.insert(0, path)
    module = __import__(job["module"])
    model, processor = getattr(module, job["loader"])(path, device="cuda")
    answer = getattr(module, job["answer"])
    torch.cuda.synchronize()
    load_sec = round(time.time() - t0)
    vram_loaded = torch.cuda.memory_allocated()
    _log(t0, f"読み込み {load_sec}秒・VRAM {vram_loaded / 1024 ** 3:.1f}GB")
    torch.cuda.reset_peak_memory_stats()
    answer(model, processor, job["warmup"])  # 1回目は時間を測らない
    results: dict = {}
    for lang, items in job["requests"].items():
        out = {}
        for task_id, body in items:
            torch.cuda.synchronize()
            started = time.perf_counter()
            resp = answer(model, processor, body)
            torch.cuda.synchronize()
            out[task_id] = {"answers": {qid: _keep(a) for qid, a in (resp.get("answers") or {}).items()},
                            "ms": round((time.perf_counter() - started) * 1000, 1),
                            "input_tokens": (resp.get("usage") or {}).get("input_tokens")}
        results[lang] = out
    _log(t0, "全ての状況を解き終えました")
    return {"results": results, "gpu": gpu, "vram_total": int(torch.cuda.get_device_properties(0).total_memory),
            "vram_loaded": int(vram_loaded), "vram_peak": int(torch.cuda.max_memory_allocated()),
            "load_sec": load_sec, "dtype": "bfloat16", "transformers": str(transformers.__version__),
            "torch": str(torch.__version__), "python": platform.python_version(), "packages": installed_packages(),
            "measured_at": datetime.now(timezone.utc).isoformat()}

実行のコンテナに入っていたパッケージ:

accelerate==1.15.0
aiohappyeyeballs==2.6.1
aiohttp==3.12.7
aiosignal==1.3.2
annotated-doc==0.0.5
anyio==4.15.1
attrs==25.3.0
cbor2==5.7.0
certifi==2026.7.22
click==8.5.0
cuda-bindings==13.4.3
cuda-pathfinder==1.8.3
cuda-toolkit==13.0.3.0
filelock==4.0.9
frozenlist==1.6.0
fsspec==2026.9.0
grpclib==0.4.8
h11==0.16.0
h2==4.2.0
hf-xet==1.6.0
hpack==4.1.0
httpcore==1.0.9
httpx==0.28.1
huggingface_hub==1.33.0
hyperframe==6.1.0
idna==3.20
Jinja2==3.1.6
markdown-it-py==4.2.0
MarkupSafe==3.0.3
mdurl==0.1.2
mpmath==1.3.0
multidict==6.4.4
networkx==3.7
numpy==2.5.3
nvidia-cublas==13.1.1.3
nvidia-cuda-cupti==13.0.85
nvidia-cuda-nvrtc==13.0.88
nvidia-cuda-runtime==13.0.96
nvidia-cudnn-cu13==9.24.0.43
nvidia-cufft==12.0.0.61
nvidia-cufile==1.15.1.6
nvidia-curand==10.4.0.35
nvidia-cusolver==12.0.4.66
nvidia-cusparse==12.6.3.3
nvidia-cusparselt-cu13==0.8.1
nvidia-nccl-cu13==2.30.7
nvidia-nvjitlink==13.4.92
nvidia-nvshmem-cu13==3.4.5
nvidia-nvtx==13.0.85
packaging==26.3
pillow==12.3.0
pip==25.1.1
propcache==0.3.1
protobuf==6.31.1
psutil==7.2.2
Pygments==2.21.0
PyYAML==6.0.3
regex==2026.9.29
rich==15.0.0
safetensors==0.8.0
setuptools==84.0.0
shellingham==1.5.4
sympy==1.14.0
tokenizers==0.23.2
torch==2.14.1
torchvision==0.29.1
tqdm==4.70.1
transformers==5.18.0
triton==3.8.0
typer==0.27.2
typing_extensions==4.16.0
uv==0.7.19
wheel==0.45.1
yarl==1.20.0

入手方法

Clef-Flashはsafetensors形式で、Cloudflare/clef-flashとして配布されています。ライセンスはapache-2.0で、ゲート(利用規約への同意)は不要と記載されています。

モデルカードでは次のようにhuggingface_hub経由での取得と、同梱のjoint_schema_model.py(カスタムコード)を使ったロードが示されています。

from huggingface_hub import snapshot_download

path = snapshot_download("Cloudflare/clef-flash")

動作確認はtorch 2.11・transformers 5.10.2・単一のH200 GPUで行われたと記載されています。画像・動画入力を使う場合はpillowも必要です。標準のテキスト生成パイプラインではなく、カード付属のコードで読み込む独自の推論経路(Joint schema head)を使う点に注意してください。

派生版・量子化版

→ 横にスクロールできます

追記日 配布元 形式 リポジトリ 最小のVRAM階層(量子化・必要メモリの目安)
2026-10-01 bartowski GGUF(imatrix) bartowski/Cloudflare_clef-flash-GGUF IQ2_M 4.0GB(4GB VRAMで動作)
2026-10-01 mlx-community MLX mlx-community/clef-flash-4bit MLX 4bit 6.6GB(8GB VRAMで動作)

各リポジトリの量子化とファイルサイズ:

  • bartowski/Cloudflare_clef-flash-GGUF の量子化: IQ2_M 3.3GB / Q2_K 3.4GB / IQ3_XXS 3.9GB / Q3_K_S 4.0GB / IQ3_XS 4.0GB / Q3_K_M 4.2GB / Q3_K_L 4.3GB / IQ3_M 4.5GB / IQ4_XS 4.9GB / Q4_0 5.1GB / Q4_K_S 5.1GB / IQ4_NL 5.4GB / Q4_K_M 5.4GB / Q4_1 5.5GB / Q4_K_L 5.8GB / Q5_K_S 6.0GB / Q5_K_M 6.4GB / Q6_K_S 7.0GB / Q6_K 7.3GB / Q6_K_L 7.5GB / Q8_0 8.9GB / BF16 16.7GB
  • mlx-community/clef-flash-4bit の量子化: MLX 4bit 5.5GB

このほか、上記以外の投稿者による変換版が 6 件あります(当サイトは公開元自身と、実績のある量子化担当の配布だけを表に載せています)。

この節は、記事公開後に見つかった変換版を当サイトが機械的に追記したものです。必要メモリは配布ファイルのサイズから算出した概算です。 量子化の名前の読み方は用語集にあります。

関連記事

次に読むなら

出典

更新履歴

  • 2026-10-02: 変換版を「派生版・量子化版」に追記しました: bartowski/Cloudflare_clef-flash-GGUF, mlx-community/clef-flash-4bit
  • 2026-10-02: 動作環境の表を bartowski/Cloudflare_clef-flash-GGUF の実ファイルサイズで更新しました。
  • 2026-10-02: タイトルを、記事で分かる内容(必要VRAM・配布ファイル等)を示す形に変更しました。
  • 2026-10-03: 当サイトでの実測(意思決定モデルとしての判定の評価)を追加しました。