長文・推論対応モデル「IFM/K2-Horizon-32B-NVFP4」公開

長文・推論対応モデル「IFM/K2-Horizon-32B-NVFP4」公開

基本情報

項目 内容
リポジトリ IFM/K2-Horizon-32B-NVFP4
公開日 2026-09-22
ライセンス apache-2.0
配布形式 safetensors
出典の種類 公開元の一次情報(公式HFリポジトリとGitHubリンクが存在し一次情報)

収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。

概要

IFMは、オープンウェイトの大規模言語モデル「K2-Horizon-32B」のStage1チェックポイントをNVFP4形式に量子化したモデル「IFM/K2-Horizon-32B-NVFP4」を公開しました。

本モデルは、32BのDense(高密度)構成で512K(524,288トークン)の長大なコンテキスト長を備えたdecoder-onlyモデルです。lm_headを除くすべての線形層で重みと活性化(Activations)の両方がNVFP4に量子化されており、ネイティブなNVFP4サポートを持つNVIDIA Blackwell世代(Bシリーズ)以降のGPU向けに最適化されています。

スペック

  • パラメータ数: 32B(総パラメータ 32B / 活性パラメータ 32B)
  • アーキテクチャ: Dense(decoder-only)
  • コンテキスト長: 512K(524,288トークン)

性能

公開元が公開したモデルカードには、オープンウェイトのDenseモデル群との比較表、およびBF16版とNVFP4版の量子化比較表が掲載されています。

まず、同規模帯のオープンウェイトDenseモデルとの比較結果は以下の通りです。

→ 横にスクロールできます

K2-Horizon-32B-Stage1 Open-weight dense models / Qwen3.8-27B Open-weight dense models / Muse Glimmer-30B Open-weight dense models / IBM Granite 4.2 30B
# Params 32B 27B 30B 30B
# Activated params 32B 27B 30B 30B
Architecture Dense Dense Dense Dense
Agents
tau3-Banking Agentic tool use 22.5 48.0 23.5 14.4
Coding
Terminal-Bench 2.1 Agentic terminal use 36.6 79.8 51.7 26.6
SciCode Scientific coding 30.2 44.7 43.6 36.6
Scientific Reasoning
Humanity’s Last Exam (without tools) Expert-level reasoning 22.8 33.9 22.0 11.2
GPQA Diamond Graduate-level science QA 82.3 90.5 83.5 64.4
CritPt Frontier physics reasoning 1.4 5.4 2.6 0.3
General
AA-LCR Long-context reasoning 65.3 77.3 80.0 46.7
AA-Omniscience Accuracy Factual accuracy 16.8 15.6 27.0 10.1
AA-Omniscience Non-Hallucination Non-hallucination rate 58.3 69.7 18.1 74.4

この表から、K2-Horizon-32B-Stage1は専門家レベルの超難問を集めたHumanity’s Last Exam(22.8%)や博士課程レベルの科学問題を問うGPQA Diamond(82.3%)においてMuse Glimmer-30Bと同等の高水準な推論能力を示し、IBM Granite 4.2 30Bを上回っていることが分かります。一方で、ターミナル操作の完遂度を測るTerminal-Bench 2.1(36.6%)やtau3-Banking(22.5%)、SciCode(30.2%)といったエージェント機能やコーディング分野の指標ではQwen3.8-27B(79.8%、48.0%、44.7%)に及ばず、明確な差をつけられています。

続いて、元モデルのBF16版と本NVFP4版の直接比較データです(コンテキスト長65,536トークン、0-shot評価)。

→ 横にスクロールできます

K2-Horizon-32B-Stage1 IFEval (Prompt) GSM8K MBPP MMLU-Pro GPQA-Diamond BBH (3-shot) AIME 26 (avg @ 32) Average
BF16 86.69 96.21 94.40 81.52 81.76 93.20 92.60 89.5
NVFP4 85.40 96.59 93.20 80.47 78.82 93.30 91.15 88.4

公開元の測定によると、平均スコアはBF16版の89.5%からNVFP4版の88.4%へとわずか1.1ポイントの低下にとどまっています。算数の文章題を解くGSM8K(96.59%)や推論タスクのBBH(93.30%)ではBF16と同等以上の数値を維持している一方、GPQA-Diamond(81.76% → 78.82%)、数学オリンピック予選レベルを問うAIME 26(92.60% → 91.15%)、Python課題を解くMBPP(94.40% → 93.20%)、指示追従性を測るIFEval(86.69% → 85.40%)などの難関分野では僅かなスコア低下が見られます。なお、現時点でNVFP4版の評価は非エージェントタスクに限定されており、エージェントタスクの結果は後日公開予定とされています。

得意なこと・想定用途

「IFM/K2-Horizon-32B-NVFP4」は、32Bという扱いやすい規模でありながら、極めて長大なコンテキスト処理能力と高度な推論能力、そして柔軟なツール利用(Tool Use)機能を兼ね備えており、以下のような用途で特に強みを発揮します。

長大なコンテキスト処理(512Kトークン対応)

本モデルは、中間トレーニング(midtraining)ステージ以降で524,288トークン(512K)のネイティブなコンテキストウィンドウに対応しています。これにより、学術論文の束や大規模なソースコードベース、長大な契約書といった膨大なドキュメントを丸ごと入力し、その内容に基づいた高度な分析、要約、Q&Aを行うことが可能です。

思考プロセスを伴う高度な推論

本モデルは、思考プロセス(Reasoning)を出力する機能を備えています。API経由で利用する際、推奨設定である reasoning_effort="high" を指定することで、モデルは回答に至るまでの思考プロセスを reasoning_content に、最終的な回答を content に分けて出力します。これにより、数学や科学、複雑な論理パズルなどの難解なタスクにおいて、ステップバイステップで正確な思考を重ねた高品質な回答を得ることができます。

柔軟なツール利用(Tool Use)とエージェント連携

本モデルは、外部ツールとの連携において複数のフォーマットをサポートしています。具体的には、jsonxmlxml_typed の3種類のツール呼び出しフォーマットに対応しており、デフォルトでは xml が使用されます。これらは chat_template_kwargs を通じてリクエストごとに切り替えることができ、システムの要件に合わせた柔軟なエージェント構築が可能です。

Blackwell世代GPUでの高速・省メモリ推論

本モデルの最大の特徴は、lm_head を除くすべての線形層の重み(Weights)と活性化(Activations)がNVFP4形式に量子化されている点です。これにより、NVIDIA Blackwell世代(Bシリーズ)以降のネイティブなNVFP4サポートを備えたGPUにおいて、メモリ使用量を大幅に削減しつつ、非常に高速な推論を実行することができます。BF16版と比較して性能低下はごくわずか(平均スコアで1.1ポイントの低下)に抑えられているため、Blackwell世代のハードウェアを所有する技術者にとって、極めて実用的な選択肢となります。

動作環境

動作環境の目安(Local Model Watch 算出) — パラメータ数 20.7B

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
RTX 5090 など 32GB NVFP4 21.7GB 26.0GB

推論エンジンの対応状況(各プロジェクトのソースにあるモデル登録表とアーキテクチャ名を当サイトが機械的に照合。2026-09-22 時点): llama.cpp: 未登録、vLLM: 登録あり、MLX (mlx-lm): 未登録。「未登録」はその時点の登録表に名前が無いという意味で、動かないことの断定ではありません。

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

同クラスの既報モデル

当サイトが最近取り上げた、パラメータ数 15〜40B のモデルを、比較のために記事ログからコードが並べたものです。VRAM階層は当サイトの概算、ライセンスはモデルカードの記載です。

→ 横にスクロールできます

モデル パラメータ数 最小のVRAM階層 ライセンス 記事
prism-ml/Ternary-Bonsai-2-27B-gguf 27.8B 8GB apache-2.0 三値量子化された27Bモデル「Bonsai 2 27B GGUF」公開(2026-09-18)
prism-ml/Ternary-Bonsai-2-27B-mlx-2bit 27.4B 12GB apache-2.0 Qwen3.8-27Bベースの3値ウェイトモデル「Bonsai 2 27B」MLX 2bit版公開(2026-09-18)
prism-ml/Ternary-Bonsai-2-27B-gguf-dev 27.8B 12GB apache-2.0 3値ウェイトモデルのテスト版「prism-ml/Ternary-Bonsai-2-27B-gguf-dev」公開(2026-09-18)
Edge0/Edge0-35B-A3B-preview 34.7B 24GB apache-2.0 Edge0、スマホクラスで動く35BのMoEモデル「Edge0-35B-A3B-preview」公開(2026-09-11)
bartowski/Gryphe_Pantheon-Reasoning-26B-A4B-1.1-V2-GGUF 26.5B 12GB apache-2.0 Pantheon-Reasoning-26B-A4B-1.1-V2 GGUF版が公開、ローカル実行向け量子化を提供(2026-09-11)

入手方法

本モデルは、Hugging Faceのリポジトリから自由にダウンロードして利用することができます。ライセンスは「Apache-2.0」が適用されており、利用にあたって事前の同意が必要なゲート付き(Gated)モデルではないため、誰でも即座に入手可能です。

配布形式は safetensors となっており、サービングエンジンとして vLLM や SGLang、および Hugging Faceの Transformers ライブラリに対応しています。

以下に、公開元が提示している各エンジンでの利用方法およびコード例を示します。なお、以下のコード例はBF16版(IFM/K2-Horizon-32B)を基準に書かれていますが、NVFP4版を動かす際も同様の設定やパーサーの指定が推奨されます。

vLLMでのサービング

vLLMを使用してサーバーを起動する場合のコマンド例です。チャット用の k2_horizon 推論パーサーおよびエージェント用のツールコールパーサーを有効にすることが推奨されています。

vllm serve IFM/K2-Horizon-32B \
  --revision main \
  --model-impl vllm \
  --tensor-parallel-size 2 \
  --trust-remote-code \
  --dtype bfloat16 \
  --max-model-len 131072 \
  --reasoning-parser k2_horizon \
  --enable-auto-tool-choice \
  --tool-call-parser k2_horizon

SGLangでのサービング

SGLangを使用する場合のコマンド例です。こちらは 2× H200 環境で検証されたレシピに基づいています。

python3 -m sglang.launch_server \
  --model-path IFM/K2-Horizon-32B \
  --revision main \
  --tp 2 \
  --dtype bfloat16 \
  --attention-backend fa3 \
  --reasoning-parser k2_horizon \
  --tool-call-parser k2_horizon \
  --host 0.0.0.0 --port 30000

APIの利用例(Python)

サービング起動後、OpenAI互換APIを介して思考プロセス付きの回答を取得するPythonコード例です。推奨設定として temperature=1.0top_p=0.95reasoning_effort="high" を指定しています。

from openai import OpenAI

client = OpenAI(base_url="http://localhost:30000/v1", api_key="EMPTY")
response = client.chat.completions.create(
    model="IFM/K2-Horizon-32B",
    messages=[{"role": "user", "content": "Explain the result step by step."}],
    temperature=1.0,
    top_p=0.95,
    max_tokens=32768,
    extra_body={"chat_template_kwargs": {"reasoning_effort": "high", "tool_call_format": "xml"}},
)
message = response.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print("Answer:", message.content)

Transformersでの利用例

Transformers(バージョン 5.15.0、PyTorch 2.13.0、Safetensors 0.8.0 で検証済み)を使用して直接モデルをロードし、テキストを生成するコード例です。

from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "IFM/K2-Horizon-32B"
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
    model_id, device_map="auto", dtype="bfloat16", low_cpu_mem_usage=True, trust_remote_code=True
)

inputs = tokenizer("Explain why long-context evaluation is difficult.", return_tensors="pt").to(model.device)
inputs.pop("token_type_ids", None)
outputs = model.generate(**inputs, max_new_tokens=32768, temperature=1.0, top_p=0.95, do_sample=True)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

関連記事

出典