K2-Horizon まとめ:必要VRAM・GGUF版

2026年9月27日

このモデルについて

K2-Horizon は、IFM が公開した言語モデルのファミリーです。重みだけでなく、事前学習・中間学習のデータ、学習コード、学習途中のチェックポイントまで公開する「完全オープン」を掲げている点が、多くのオープンウェイトのモデル(重みだけを公開)との大きな違いです。どのサイズも 524,288 トークン(512K)の文脈長に対応し、推論(思考)モードと、ツール呼び出しを前提にしたエージェント用途を重視しています。

ファミリーは大きさの違う3つのモデルでできています。

モデル 構成 1トークンあたりに動くパラメータ 位置づけ
K2-Horizon-375B-A23B MoE(全体 375B) 23B 旗艦モデル
K2-Horizon-MoVA-36B-A4B MoE(全体 36B、MoVA という独自のアテンション) 4B 軽量な疎モデル
K2-Horizon-32B(Stage 1) 密モデル 32B 32B 学習途中の版(最終版は今後公開)

当サイトが記事にしたモデルと、その必要メモリは、下の「当サイトの記録とデータ」の表にまとめています。

何がすごいのか

  • 旗艦の 375B-A23B は、エージェント系の課題に強いとされています。 公開元の比較表では、Terminal-Bench 2.1(ターミナル操作)70.2%、Toolathlon Verified(ツール利用)65.3%、MCPMark(MCP 経由のツール利用)67.7% などを記録し、「最大 2.6倍の規模のオープンな MoE モデルと互角以上で、クローズドな最前線モデルとも競える」と主張しています。
  • MoVA-36B-A4B は、動くのが 4B だけという軽さに対して成績が高いモデルです。 Terminal-Bench 2.1 で 58.6%、tau3-Banking(業務でのツール利用)で 26.8% を記録し、公開元は「約30Bの密モデルや、最大15倍の規模の MoE を上回る」としています。1トークンごとの計算量が小さいので、同じ規模の密モデルより速く動かせる見込みがあります。
  • 32B(Stage 1)は、正直に言えばまだ途中段階です。 公開元の表でも、同じくらいの規模の他社モデルに多くの項目で及んでいません。学習途中のチェックポイントを公開して、能力が学習の過程でどう変わるかを研究できるようにする、という位置づけです。
  • NVFP4 版の性能低下は小さく抑えられています。 公開元が同じ条件で測った7種類の評価の平均は、次のとおりです。
モデル 元の精度(BF16) NVFP4 量子化版 差
K2-Horizon-375B-A23B 91.7 91.2 −0.5
K2-Horizon-32B(Stage 1) 89.5 88.4 −1.1

重みを 4bit 相当まで小さくしても、平均で 1ポイント前後しか下がっていません。ただし NVFP4 版の評価は、エージェント系ではない課題だけで行われています(エージェント系は後日公開予定)。

手元で動かすときのポイント

  • NVFP4 版は、NVFP4 にネイティブ対応した Blackwell 世代以降の NVIDIA GPU が必須です。 RTX 40 シリーズや、データセンター向けでも H100・H200(Hopper 世代)では NVFP4 版は動きません。
  • 375B-A23B は個人の環境では現実的ではありません。 元の精度(BF16)版について公開元が検証しているのは、H200 を8枚載せた1ノードです。手元で試すなら、MoVA-36B-A4B の GGUF 版がいちばん現実的な選択肢です。
  • 推論モードは常に reasoning_effort="high" で使うことが推奨されており、vLLM・SGLang では専用のパーサー(k2_horizon)を有効にします。
  • ライセンスは Apache-2.0 で、商用利用もできます。

出典: IFM/K2-Horizon-375B-A23B-NVFP4・IFM/K2-Horizon-32B-NVFP4・IFM/K2-Horizon-MoVA-36B-A4B のモデルカード(2026-09-25 時点)。ベンチマークの数値は公開元が掲載した値です。

当サイトの記録とデータ

当サイトが K2-Horizon 系統について公開した記事(3本)と、記事の公開後に見つかった変換版(GGUF・MLX等)、必要メモリの判定を1ページにまとめたものです。必要メモリはモデルカードの公称値ではなく、当サイトが配布ファイルのサイズから機械的に算出した値です。モデル系統別まとめの1ページです。

基本情報

項目 内容
元のモデル IFM/K2-Horizon-32B-NVFP4, IFM/K2-Horizon-375B-A23B-NVFP4, IFM/K2-Horizon-MoVA-36B-A4B
公開元 IFM(MBZUAI)
ライセンス(モデルカード) apache-2.0
最小のVRAM階層 32GB
記事数 3本

動作環境

動作環境の目安(Local Model Watch 算出)

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
RTX 5090 など 32GB NVFP4 21.7GB 26.0GB

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

数値は IFM/K2-Horizon-32B-NVFP4 のものです。大きさの違う他のモデルは下の記事を参照してください。

手元で動かせるか

現時点では Ollama・LM Studio・llama.cpp で動かせません。

公開元の配布は safetensors のみで、llama.cpp の登録表にもこのモデルのアーキテクチャ名がありません。これらのツールで動かせるようになるには、まず llama.cpp 側が対応する必要があります。現時点で動かすなら transformers(PyTorch)・vLLM で読み込む形になり、必要メモリは上の表のとおりです。

ライセンス apache-2.0(商用利用可): 商用利用を含めて自由に利用・改変・再配布できます。再配布時にライセンス文と変更点の告知が必要で、特許の許諾条項があります。

配布形式・当サイトが見つけた変換版・各推論エンジンの登録表を突き合わせた判定です。「確認できていない」は当サイトが見つけていないという意味で、存在しないことの断定ではありません。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。

判定は IFM/K2-Horizon-32B-NVFP4 についてのものです。

記事(シリーズ自身のモデルを先に、新しい順)

公開日 モデル 種類 記事
2026-09-23 IFM/K2-Horizon-32B-NVFP4 新モデル 「K2-Horizon-32B-NVFP4」長文・推論対応モデル:必要VRAM 32GB〜
2026-09-23 IFM/K2-Horizon-375B-A23B-NVFP4 新モデル 「K2-Horizon-375B-A23B-NVFP4」NVFP4量子化の巨大MoEモデル:必要メモリ約257GB
2026-09-06 IFM/K2-Horizon-MoVA-36B-A4B-GGUF 新モデル 「K2-Horizon-MoVA-36B-A4B-GGUF」テキスト生成モデル:必要VRAM 32GB〜

リポジトリ

最終更新 2026-09-27(JST)。ページ前半の解説は、出典に挙げた一次資料をもとに AI を用いて執筆したものです。「当サイトの記録とデータ」以降の表と一覧は、記事ログからコードが組み立てています。