375B MoEモデルのNVFP4量子化版「IFM/K2-Horizon-375B-A23B-NVFP4」公開

375B MoEモデルのNVFP4量子化版「IFM/K2-Horizon-375B-A23B-NVFP4」公開

基本情報

項目 内容
リポジトリ IFM/K2-Horizon-375B-A23B-NVFP4
公開日 2026-09-22
ライセンス apache-2.0
配布形式 safetensors
出典の種類 公開元の一次情報(公式HuggingFaceリポジトリが一次情報)

収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。

概要

IFMは、sparse Mixture-of-Experts (MoE) モデルである IFM/K2-Horizon-375B-A23B のNVFP4量子化版である IFM/K2-Horizon-375B-A23B-NVFP4 を公開しました。このモデルは、NVIDIA Blackwell世代(Bシリーズ)以降のGPUでネイティブにNVFP4をサポートしている環境において、メモリ使用量の削減と推論の高速化を実現することを目的としています。

量子化の対象は、routed-expert linear layersの重みと活性化のみに限定されており、attention、shared experts、routers、最初の3つのdense layers、およびlm_headなどの他の全ての線形層はBF16のまま保持されています。

スペック

  • 総パラメータ数: 375B
  • アーキテクチャ: MoE (総パラメータ 375B, 活性化パラメータ 23B)
  • コンテキスト長: 512K

性能

公開元の測定によれば、NVFP4版は元のBF16版と比較して性能がわずかに低下しますが、メモリ使用量を削減し、NVFP4対応ハードウェアでの高速な推論を可能にします。なお、NVFP4版の評価は現時点では非エージェントタスクのみで行われており、エージェントタスクの結果は後日公開される予定です。

NVFP4版とBF16版の比較(列を絞っています):

→ 横にスクロールできます

K2-Horizon-375B-A23B IFEval (Prompt) GSM8K MBPP MMLU-Pro GPQA-Diamond BBH (3-shot) AIME 26 (avg @ 32) Average
BF16 90.02 96.06 97.00 84.22 85.80 94.73 94.38 91.7
NVFP4 88.72 95.53 96.60 83.98 85.45 94.26 93.65 91.2

ベースモデルである K2-Horizon-375B-A23B のベンチマーク結果を、他のモデルと比較した表を以下に示します(列を絞っています)。

→ 横にスクロールできます

K2-Horizon-375B-A23B Nemotron 3 Ultra MiniMax-M3 Claude Sonnet5 (max)
# Params 375B 550B 428B
# Activated params 23B 55B 23B
Architecture MoE MoE MoE Closed
Agents
GDPVal-AA (Elo) 1,441 1,162 1,380 1,584
tau3-Banking 34.0 14.2 15.3 37.3
Coding
Terminal-Bench 2.1 70.2 53.9 65.2 80.5
SciCode 42.7 39.9 45.4 53.6
Scientific Reasoning
Humanity’s Last Exam 32.0 28.4 39.0 41.3
GPQA Diamond 87.3 86.7 92.9 91.1
CritPt 8.6 3.1 3.7 16.9
General
AA-LCR 76.0 71.0 80.3 77.0
AA-Omniscience Accuracy 23.0 23.0 17.0 40.0
AA-Omniscience Non-Hallucination 74.7 70.0 82.0 61.0
Agentic Evaluations
Toolathlon 65.3 34.3 53.7 71.6
Automation Bench 25.3 8.0 20.5 34.7
Apex-Agents (pass@1) 24.8 9.0 23.8 31.7
MCPMark 67.7 45.7 48.8 65.3
BrowseComp 72.8 44.4 83.5 84.7
WildClawBench 50.9 34.2 56.4 60.0
SWE-Atlas-QnA 48.4 42.3
SWE Bench Pro 42.6 38.7 43.8

公開元の測定によれば、このモデルはエージェント性能において、自身の2.6倍のサイズを持つオープンウェイトのMoEモデルに匹敵、あるいはそれらを上回る性能を示し、クローズドなフロンティアモデルとも競争力を持つとされています。具体的には、MCPMark (67.7) や Toolathlon (65.3) といったエージェント系のタスクで高いスコアを記録しています。一方で、GPQA Diamond (87.3) では MiniMax-M3 (92.9) に及ばず、BrowseComp (72.8) においても MiniMax-M3 (83.5) や Claude Sonnet5 (84.7) と比較すると差が見られます。また、CritPt (8.6) のような物理学の推論タスクでは、比較対象のモデルよりも低いスコアとなっています。

得意なこと・想定用途

ベースモデルである K2-Horizon-375B-A23B は、エージェントとしての高い性能を特徴としています。モデルカードによれば、エージェント的なツール利用、ターミナル操作、および長期的なワークフローのベンチマークにおいて、自身の2.6倍のサイズを持つオープンウェイトのMoEモデルに匹敵または上回る性能を発揮し、クローズドなフロンティアモデルとも競争力を持つとされています。特に MCPMark (67.7) や Toolathlon (65.3) といったエージェント系のタスク、および Terminal-Bench 2.1 (70.2) でのターミナル操作において高い能力を示しています。

また、512Kという非常に長いコンテキストウィンドウをネイティブにサポートしており、長文の読解や複雑なコンテキストを必要とするタスクにも適しています。コーディング分野においても、SWE-Atlas-QnA (48.4) や SWE Bench Pro (42.6) といったリポジトリレベルのタスクで一定の性能を示しています。

今回の NVFP4 量子化版は、これらの高い能力を維持しつつ、NVIDIA Blackwell世代以降のハードウェアにおいて、メモリ使用量の削減と推論の高速化を実現することに特化しています。

動作環境

動作環境の目安(Local Model Watch 算出) — パラメータ数 218.2B

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
257GB超のVRAMが必要(複数GPUまたはCPUオフロードが前提) NVFP4 213.8GB 256.6GB

推論エンジンの対応状況(各プロジェクトのソースにあるモデル登録表とアーキテクチャ名を当サイトが機械的に照合。2026-09-22 時点): llama.cpp: 未登録、vLLM: 登録あり、MLX (mlx-lm): 未登録。「未登録」はその時点の登録表に名前が無いという意味で、動かないことの断定ではありません。

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

同クラスの既報モデル

当サイトが最近取り上げた、パラメータ数 40B超 のモデルを、比較のために記事ログからコードが並べたものです。VRAM階層は当サイトの概算、ライセンスはモデルカードの記載です。

→ 横にスクロールできます

モデル パラメータ数 最小のVRAM階層 ライセンス 記事
nvidia/DeepSeek-V4-Pro-0813-nvfp4-DSpark 1650.5B mit NVIDIA、DeepSeek-V4-ProのNVFP4量子化版「DeepSeek-V4-Pro-0813-nvfp4…(2026-09-10)
nex-agi/Nex-N2.5-Pro 396.8B apache-2.0 Nex-AGI、エージェント向けモデル「Nex-N2.5-Pro」を公開(2026-09-09)

入手方法

  • 配布形式: safetensors (NVFP4量子化版)
  • 入手コマンド: huggingface-cli download IFM/K2-Horizon-375B-A23B-NVFP4
  • 対応するエンジン: vLLM (推奨レシピあり), SGLang (推奨レシピあり)

本モデルは Apache 2.0 ライセンスで公開されています。

関連記事

出典