IFM、MoEモデル「K2-Horizon-375B-A23B-NVFP4」公開

基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | IFM/K2-Horizon-375B-A23B-NVFP4 |
| 公開日 | 2026-09-22 |
| ライセンス | apache-2.0 |
| 配布形式 | safetensors |
| 出典の種類 | 公開元の一次情報(HuggingFace公式リポジトリが一次情報) |
収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。
概要
IFMは、MoE(Mixture-of-Experts)アーキテクチャを採用したフラッグシップモデル「K2-Horizon-375B-A23B」のNVFP4量子化版である「K2-Horizon-375B-A23B-NVFP4」を公開しました。このモデルは、routed-expertの線形層(重みおよび活性化)をNVFP4形式に量子化することで、メモリ使用量の削減と推論の高速化を実現しています。一方で、Attention、共有エキスパート、ルーター、最初の3つのDense層、およびlm_headはBF16の精度を維持しています。本モデルは、ネイティブにNVFP4をサポートするNVIDIA Blackwell世代(Bシリーズ)以降のGPUでの使用を想定しています。
スペック
- 総パラメータ数: 375B
- 活性パラメータ数: 23B
- アーキテクチャ: MoE
- コンテキスト長: 512K (524,288 tokens)
性能
NVFP4 vs. BF16
量子化による性能への影響については、モデルカードに記載された評価結果によれば、NVFP4版は元のBF16版と比較してわずかに性能が低下しています。具体的には、平均スコアが91.7から91.2へと低下しており、数学分野のGSM8Kでも96.06から95.53へと僅かに下がっています。しかし、この性能低下は極めて軽微であり、NVFP4対応ハードウェアにおけるメモリフットプリントの削減と推論速度の向上というメリットが、この僅かな精度差を補う設計となっています。
→ 横にスクロールできます
| K2-Horizon-375B-A23B | IFEval (Prompt) | GSM8K | MBPP | MMLU-Pro | GPQA-Diamond | BBH (3-shot) | AIME 26 (avg @ 32) | Average |
|---|---|---|---|---|---|---|---|---|
| BF16 | 90.02 | 96.06 | 97.00 | 84.22 | 85.80 | 94.73 | 94.38 | 91.7 |
| NVFP4 | 88.72 | 95.53 | 96.60 | 83.98 | 85.45 | 94.26 | 93.65 | 91.2 |
Benchmark Results
元モデルである「K2-Horizon-375B-A23B」の性能について、公開元の測定結果に基づき、主要な比較対象を絞った表を以下に示します。
→ 横にスクロールできます
| K2-Horizon-375B-A23B | Open-weight models / Nemotron 3 Ultra | Open-weight models / Inkling (xhigh) | Open-weight models / MiniMax-M3 | Closed models / Claude Sonnet5 (max) | |
|---|---|---|---|---|---|
| # Params | 375B | 550B | 975B | 428B | — |
| # Activated params | 23B | 55B | 41B | 23B | — |
| Architecture | MoE | MoE | MoE | MoE | Closed |
| Agents | |||||
| GDPVal-AA Real-world professional tasks (Elo) | 1,441 | 1,162 | 1,234 | 1,380 | 1,584 |
| tau3-Banking Agentic tool use | 34.0 | 14.2 | 29.1 | 15.3 | 37.3 |
| Coding | |||||
| Terminal-Bench 2.1 Agentic terminal use | 70.2 | 53.9 | 55.1 | 65.2 | 80.5 |
| SciCode Scientific coding | 42.7 | 39.9 | 46.1 | 45.4 | 53.6 |
| Scientific Reasoning | |||||
| Humanity’s Last Exam (without tools) Expert-level reasoning | 32.0 | 28.4 | 31.9 | 39.0 | 41.3 |
| GPQA Diamond Graduate-level science QA | 87.3 | 86.7 | 87.2 | 92.9 | 91.1 |
| CritPt Frontier physics reasoning | 8.6 | 3.1 | 5.4 | 3.7 | 16.9 |
| General | |||||
| AA-LCR Long-context reasoning | 76.0 | 71.0 | 73.3 | 80.3 | 77.0 |
| AA-Omniscience Accuracy Factual accuracy | 23.0 | 23.0 | 42.0 | 17.0 | 40.0 |
| AA-Omniscience Non-Hallucination Non-hallucination rate | 74.7 | 70.0 | 32.0 | 82.0 | 61.0 |
| Agentic Evaluations | |||||
| Toolathlon Verified Agentic tool use | 65.3 | 34.3 | 45.5 | 53.7 | 71.6 |
| Automation Bench Public Workflow automation | 25.3 | 8.0 | 12.8 | 20.5 | 34.7 |
| Apex-Agents (pass@1) Long-horizon professional workflows | 24.8 | 9.0 | 19.0 | 23.8 | 31.7 |
| MCPMark MCP tool use | 67.7 | 45.7 | 51.2 | 48.8 | 65.3 |
| BrowseComp Deep web research | 72.8 | 44.4 | 77.1 | 83.5 | 84.7 |
| WildClawBench In-the-wild agentic tasks | 50.9 | 34.2 | 52.3 | 56.4 | — |
| SWE-Atlas-QnA Repo-level code Q&A (strict) | 48.4 | — | 25.5 | 42.3 | — |
| SWE Bench Pro Software engineering (strict) | 42.6 | 38.7 | 43.1 | 43.8 | — |
この表から、本モデルはエージェント性能において非常に高い水準にあることが分かります。特に「Agents」カテゴリのGDPVal-AA(Elo)では1,441を記録しており、オープンウェイトのMoEモデルの中では極めて強力です。「Coding」分野のTerminal-Bench 2.1では70.2をマークしており、ターミナル操作を伴うエージェントタスクで高い能力を示しています。また、「Scientific Reasoning」のGPQA Diamondでも87.3という高いスコアを記録しています。
一方で、一部の指標ではクローズドモデルに及ばない場面も見られます。例えば、ToolathlonではClaude Sonnet5 (max)の71.6に対し、本モデルは65.3となっており、最高水準のクローズドモデルと比較すると、エージェントとしてのツール利用能力にはまだ改善の余地があることが示唆されています。しかし、自身のサイズに対して最大2.6倍の規模を持つオープンウェイトMoEモデルを凌駕する性能を見せており、非常に効率的なモデルと言えます。
得意なこと・想定用途
元モデルの特性に基づき、本モデルはエージェントとしての高度なタスク実行、コーディング、および長文読解に特化した能力を持っています。具体的には、以下のような用途での活用が想定されます。
- エージェント・ツール利用: ターミナル操作や、複雑なワークフローを伴うエージェントタスク、MCP(Model Context Protocol)を用いたツール利用において高い性能を発揮します。
- コーディング: ターミナル上での操作を伴うエージェント的なコーディングタスクや、リポジトリレベルでのコードに関するQ&A、ソフトウェアエンジニアリングタスクに適しています。
- 科学的推論・高度な推論: 博士課程レベルの科学知識を問う問題や、専門家レベルの推論が必要なタスク、および数学的な推論にも対応しています。
- 長文コンテキスト処理: 512K(524,288トークン)という非常に長いコンテキストウィンドウをネイティブにサポートしており、大量の情報を一度に扱うタスクが可能です。
また、モデルは「reasoning_effort="high"」の設定、温度(temperature)1.0、top_p 0.95といった特定のサンプリングパラメータでの使用が推奨されています。推論プロセス(Thinking)は reasoning_content として、最終的な回答は content として出力される仕組みを持っています。
動作環境
動作環境の目安(Local Model Watch 算出) — パラメータ数 218.2B
| 手持ちのVRAM | 選べる量子化 | ファイルサイズ | 必要メモリの目安 |
|---|---|---|---|
| 257GB超のVRAMが必要(複数GPUまたはCPUオフロードが前提) | NVFP4 | 213.8GB | 256.6GB |
推論エンジンの対応状況(各プロジェクトのソースにあるモデル登録表とアーキテクチャ名を当サイトが機械的に照合。2026-09-22 時点): llama.cpp: 未登録、vLLM: 登録あり、MLX (mlx-lm): 未登録。「未登録」はその時点の登録表に名前が無いという意味で、動かないことの断定ではありません。
必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。
同クラスの既報モデル
当サイトが最近取り上げた、パラメータ数 40B超 のモデルを、比較のために記事ログからコードが並べたものです。VRAM階層は当サイトの概算、ライセンスはモデルカードの記載です。
→ 横にスクロールできます
| モデル | パラメータ数 | 最小のVRAM階層 | ライセンス | 記事 |
|---|---|---|---|---|
| nvidia/DeepSeek-V4-Pro-0813-nvfp4-DSpark | 1650.5B | — | mit | NVIDIA、DeepSeek-V4-ProのNVFP4量子化版「DeepSeek-V4-Pro-0813-nvfp4…(2026-09-10) |
| nex-agi/Nex-N2.5-Pro | 396.8B | — | apache-2.0 | Nex-AGI、エージェント向けモデル「Nex-N2.5-Pro」を公開(2026-09-09) |
入手方法
- 配布形式: safetensors
- 対応エンジン: vLLM, SGLang, Transformers
SGLangでの検証済みレシピやvLLMでのサービング方法が公開されています。なお、本モデルはApache 2.0ライセンスの下で公開されています。
関連記事
- NVIDIA、DeepSeek-V4-ProのNVFP4量子化版「DeepSeek-V4-Pro-0813-nvfp4…
- IFM、K2-Horizon-MoVA-36B-A4BのGGUF版を公開:llama.cppに対応
- OpenBMB、2BクラスでSOTAを達成したオンデバイスモデル「MiniCPM5-2B」公開

