IFM、MoEモデル「K2-Horizon-375B-A23B-NVFP4」公開

IFM、MoEモデル「K2-Horizon-375B-A23B-NVFP4」公開

基本情報

項目 内容
リポジトリ IFM/K2-Horizon-375B-A23B-NVFP4
公開日 2026-09-22
ライセンス apache-2.0
配布形式 safetensors
出典の種類 公開元の一次情報(HuggingFace公式リポジトリが一次情報)

収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。

概要

IFMは、MoE(Mixture-of-Experts)アーキテクチャを採用したフラッグシップモデル「K2-Horizon-375B-A23B」のNVFP4量子化版である「K2-Horizon-375B-A23B-NVFP4」を公開しました。このモデルは、routed-expertの線形層(重みおよび活性化)をNVFP4形式に量子化することで、メモリ使用量の削減と推論の高速化を実現しています。一方で、Attention、共有エキスパート、ルーター、最初の3つのDense層、およびlm_headはBF16の精度を維持しています。本モデルは、ネイティブにNVFP4をサポートするNVIDIA Blackwell世代(Bシリーズ)以降のGPUでの使用を想定しています。

スペック

  • 総パラメータ数: 375B
  • 活性パラメータ数: 23B
  • アーキテクチャ: MoE
  • コンテキスト長: 512K (524,288 tokens)

性能

NVFP4 vs. BF16

量子化による性能への影響については、モデルカードに記載された評価結果によれば、NVFP4版は元のBF16版と比較してわずかに性能が低下しています。具体的には、平均スコアが91.7から91.2へと低下しており、数学分野のGSM8Kでも96.06から95.53へと僅かに下がっています。しかし、この性能低下は極めて軽微であり、NVFP4対応ハードウェアにおけるメモリフットプリントの削減と推論速度の向上というメリットが、この僅かな精度差を補う設計となっています。

→ 横にスクロールできます

K2-Horizon-375B-A23B IFEval (Prompt) GSM8K MBPP MMLU-Pro GPQA-Diamond BBH (3-shot) AIME 26 (avg @ 32) Average
BF16 90.02 96.06 97.00 84.22 85.80 94.73 94.38 91.7
NVFP4 88.72 95.53 96.60 83.98 85.45 94.26 93.65 91.2

Benchmark Results

元モデルである「K2-Horizon-375B-A23B」の性能について、公開元の測定結果に基づき、主要な比較対象を絞った表を以下に示します。

→ 横にスクロールできます

K2-Horizon-375B-A23B Open-weight models / Nemotron 3 Ultra Open-weight models / Inkling (xhigh) Open-weight models / MiniMax-M3 Closed models / Claude Sonnet5 (max)
# Params 375B 550B 975B 428B
# Activated params 23B 55B 41B 23B
Architecture MoE MoE MoE MoE Closed
Agents
GDPVal-AA Real-world professional tasks (Elo) 1,441 1,162 1,234 1,380 1,584
tau3-Banking Agentic tool use 34.0 14.2 29.1 15.3 37.3
Coding
Terminal-Bench 2.1 Agentic terminal use 70.2 53.9 55.1 65.2 80.5
SciCode Scientific coding 42.7 39.9 46.1 45.4 53.6
Scientific Reasoning
Humanity’s Last Exam (without tools) Expert-level reasoning 32.0 28.4 31.9 39.0 41.3
GPQA Diamond Graduate-level science QA 87.3 86.7 87.2 92.9 91.1
CritPt Frontier physics reasoning 8.6 3.1 5.4 3.7 16.9
General
AA-LCR Long-context reasoning 76.0 71.0 73.3 80.3 77.0
AA-Omniscience Accuracy Factual accuracy 23.0 23.0 42.0 17.0 40.0
AA-Omniscience Non-Hallucination Non-hallucination rate 74.7 70.0 32.0 82.0 61.0
Agentic Evaluations
Toolathlon Verified Agentic tool use 65.3 34.3 45.5 53.7 71.6
Automation Bench Public Workflow automation 25.3 8.0 12.8 20.5 34.7
Apex-Agents (pass@1) Long-horizon professional workflows 24.8 9.0 19.0 23.8 31.7
MCPMark MCP tool use 67.7 45.7 51.2 48.8 65.3
BrowseComp Deep web research 72.8 44.4 77.1 83.5 84.7
WildClawBench In-the-wild agentic tasks 50.9 34.2 52.3 56.4
SWE-Atlas-QnA Repo-level code Q&A (strict) 48.4 25.5 42.3
SWE Bench Pro Software engineering (strict) 42.6 38.7 43.1 43.8

この表から、本モデルはエージェント性能において非常に高い水準にあることが分かります。特に「Agents」カテゴリのGDPVal-AA(Elo)では1,441を記録しており、オープンウェイトのMoEモデルの中では極めて強力です。「Coding」分野のTerminal-Bench 2.1では70.2をマークしており、ターミナル操作を伴うエージェントタスクで高い能力を示しています。また、「Scientific Reasoning」のGPQA Diamondでも87.3という高いスコアを記録しています。

一方で、一部の指標ではクローズドモデルに及ばない場面も見られます。例えば、ToolathlonではClaude Sonnet5 (max)の71.6に対し、本モデルは65.3となっており、最高水準のクローズドモデルと比較すると、エージェントとしてのツール利用能力にはまだ改善の余地があることが示唆されています。しかし、自身のサイズに対して最大2.6倍の規模を持つオープンウェイトMoEモデルを凌駕する性能を見せており、非常に効率的なモデルと言えます。

得意なこと・想定用途

元モデルの特性に基づき、本モデルはエージェントとしての高度なタスク実行、コーディング、および長文読解に特化した能力を持っています。具体的には、以下のような用途での活用が想定されます。

  • エージェント・ツール利用: ターミナル操作や、複雑なワークフローを伴うエージェントタスク、MCP(Model Context Protocol)を用いたツール利用において高い性能を発揮します。
  • コーディング: ターミナル上での操作を伴うエージェント的なコーディングタスクや、リポジトリレベルでのコードに関するQ&A、ソフトウェアエンジニアリングタスクに適しています。
  • 科学的推論・高度な推論: 博士課程レベルの科学知識を問う問題や、専門家レベルの推論が必要なタスク、および数学的な推論にも対応しています。
  • 長文コンテキスト処理: 512K(524,288トークン)という非常に長いコンテキストウィンドウをネイティブにサポートしており、大量の情報を一度に扱うタスクが可能です。

また、モデルは「reasoning_effort="high"」の設定、温度(temperature)1.0、top_p 0.95といった特定のサンプリングパラメータでの使用が推奨されています。推論プロセス(Thinking)は reasoning_content として、最終的な回答は content として出力される仕組みを持っています。

動作環境

動作環境の目安(Local Model Watch 算出) — パラメータ数 218.2B

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
257GB超のVRAMが必要(複数GPUまたはCPUオフロードが前提) NVFP4 213.8GB 256.6GB

推論エンジンの対応状況(各プロジェクトのソースにあるモデル登録表とアーキテクチャ名を当サイトが機械的に照合。2026-09-22 時点): llama.cpp: 未登録、vLLM: 登録あり、MLX (mlx-lm): 未登録。「未登録」はその時点の登録表に名前が無いという意味で、動かないことの断定ではありません。

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

同クラスの既報モデル

当サイトが最近取り上げた、パラメータ数 40B超 のモデルを、比較のために記事ログからコードが並べたものです。VRAM階層は当サイトの概算、ライセンスはモデルカードの記載です。

→ 横にスクロールできます

モデル パラメータ数 最小のVRAM階層 ライセンス 記事
nvidia/DeepSeek-V4-Pro-0813-nvfp4-DSpark 1650.5B mit NVIDIA、DeepSeek-V4-ProのNVFP4量子化版「DeepSeek-V4-Pro-0813-nvfp4…(2026-09-10)
nex-agi/Nex-N2.5-Pro 396.8B apache-2.0 Nex-AGI、エージェント向けモデル「Nex-N2.5-Pro」を公開(2026-09-09)

入手方法

  • 配布形式: safetensors
  • 対応エンジン: vLLM, SGLang, Transformers

SGLangでの検証済みレシピやvLLMでのサービング方法が公開されています。なお、本モデルはApache 2.0ライセンスの下で公開されています。

関連記事

出典