K2-Horizon まとめ:必要VRAM・GGUF版
このモデルについて
K2-Horizon は、IFM が公開した言語モデルのファミリーです。重みだけでなく、事前学習・中間学習のデータ、学習コード、学習途中のチェックポイントまで公開する「完全オープン」を掲げている点が、多くのオープンウェイトのモデル(重みだけを公開)との大きな違いです。どのサイズも 524,288 トークン(512K)の文脈長に対応し、推論(思考)モードと、ツール呼び出しを前提にしたエージェント用途を重視しています。
ファミリーは大きさの違う3つのモデルでできています。
| モデル | 構成 | 1トークンあたりに動くパラメータ | 位置づけ |
|---|---|---|---|
| K2-Horizon-375B-A23B | MoE(全体 375B) | 23B | 旗艦モデル |
| K2-Horizon-MoVA-36B-A4B | MoE(全体 36B、MoVA という独自のアテンション) | 4B | 軽量な疎モデル |
| K2-Horizon-32B(Stage 1) | 密モデル 32B | 32B | 学習途中の版(最終版は今後公開) |
当サイトが記事にしたモデルと、その必要メモリは、下の「当サイトの記録とデータ」の表にまとめています。
何がすごいのか
- 旗艦の 375B-A23B は、エージェント系の課題に強いとされています。 公開元の比較表では、Terminal-Bench 2.1(ターミナル操作)70.2%、Toolathlon Verified(ツール利用)65.3%、MCPMark(MCP 経由のツール利用)67.7% などを記録し、「最大 2.6倍の規模のオープンな MoE モデルと互角以上で、クローズドな最前線モデルとも競える」と主張しています。
- MoVA-36B-A4B は、動くのが 4B だけという軽さに対して成績が高いモデルです。 Terminal-Bench 2.1 で 58.6%、tau3-Banking(業務でのツール利用)で 26.8% を記録し、公開元は「約30Bの密モデルや、最大15倍の規模の MoE を上回る」としています。1トークンごとの計算量が小さいので、同じ規模の密モデルより速く動かせる見込みがあります。
- 32B(Stage 1)は、正直に言えばまだ途中段階です。 公開元の表でも、同じくらいの規模の他社モデルに多くの項目で及んでいません。学習途中のチェックポイントを公開して、能力が学習の過程でどう変わるかを研究できるようにする、という位置づけです。
- NVFP4 版の性能低下は小さく抑えられています。 公開元が同じ条件で測った7種類の評価の平均は、次のとおりです。
| モデル | 元の精度(BF16) | NVFP4 量子化版 | 差 |
|---|---|---|---|
| K2-Horizon-375B-A23B | 91.7 | 91.2 | −0.5 |
| K2-Horizon-32B(Stage 1) | 89.5 | 88.4 | −1.1 |
重みを 4bit 相当まで小さくしても、平均で 1ポイント前後しか下がっていません。ただし NVFP4 版の評価は、エージェント系ではない課題だけで行われています(エージェント系は後日公開予定)。
手元で動かすときのポイント
- NVFP4 版は、NVFP4 にネイティブ対応した Blackwell 世代以降の NVIDIA GPU が必須です。 RTX 40 シリーズや、データセンター向けでも H100・H200(Hopper 世代)では NVFP4 版は動きません。
- 375B-A23B は個人の環境では現実的ではありません。 元の精度(BF16)版について公開元が検証しているのは、H200 を8枚載せた1ノードです。手元で試すなら、MoVA-36B-A4B の GGUF 版がいちばん現実的な選択肢です。
- 推論モードは常に
reasoning_effort="high"で使うことが推奨されており、vLLM・SGLang では専用のパーサー(k2_horizon)を有効にします。 - ライセンスは Apache-2.0 で、商用利用もできます。
出典: IFM/K2-Horizon-375B-A23B-NVFP4・IFM/K2-Horizon-32B-NVFP4・IFM/K2-Horizon-MoVA-36B-A4B のモデルカード(2026-09-25 時点)。ベンチマークの数値は公開元が掲載した値です。
当サイトの記録とデータ
当サイトが K2-Horizon 系統について公開した記事(3本)と、記事の公開後に見つかった変換版(GGUF・MLX等)、必要メモリの判定を1ページにまとめたものです。必要メモリはモデルカードの公称値ではなく、当サイトが配布ファイルのサイズから機械的に算出した値です。モデル系統別まとめの1ページです。
基本情報
| 項目 | 内容 |
|---|---|
| 元のモデル | IFM/K2-Horizon-32B-NVFP4, IFM/K2-Horizon-375B-A23B-NVFP4, IFM/K2-Horizon-MoVA-36B-A4B |
| 公開元 | IFM(MBZUAI) |
| ライセンス(モデルカード) | apache-2.0 |
| 最小のVRAM階層 | 32GB |
| 記事数 | 3本 |
動作環境
動作環境の目安(Local Model Watch 算出)
| 手持ちのVRAM | 選べる量子化 | ファイルサイズ | 必要メモリの目安 |
|---|---|---|---|
| RTX 5090 など 32GB | NVFP4 | 21.7GB | 26.0GB |
必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。
数値は IFM/K2-Horizon-32B-NVFP4 のものです。大きさの違う他のモデルは下の記事を参照してください。
手元で動かせるか
現時点では Ollama・LM Studio・llama.cpp で動かせません。
公開元の配布は safetensors のみで、llama.cpp の登録表にもこのモデルのアーキテクチャ名がありません。これらのツールで動かせるようになるには、まず llama.cpp 側が対応する必要があります。現時点で動かすなら transformers(PyTorch)・vLLM で読み込む形になり、必要メモリは上の表のとおりです。
ライセンス apache-2.0(商用利用可): 商用利用を含めて自由に利用・改変・再配布できます。再配布時にライセンス文と変更点の告知が必要で、特許の許諾条項があります。
配布形式・当サイトが見つけた変換版・各推論エンジンの登録表を突き合わせた判定です。「確認できていない」は当サイトが見つけていないという意味で、存在しないことの断定ではありません。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。
判定は IFM/K2-Horizon-32B-NVFP4 についてのものです。
記事(シリーズ自身のモデルを先に、新しい順)
| 公開日 | モデル | 種類 | 記事 |
|---|---|---|---|
| 2026-09-23 | IFM/K2-Horizon-32B-NVFP4 | 新モデル | 「K2-Horizon-32B-NVFP4」長文・推論対応モデル:必要VRAM 32GB〜 |
| 2026-09-23 | IFM/K2-Horizon-375B-A23B-NVFP4 | 新モデル | 「K2-Horizon-375B-A23B-NVFP4」NVFP4量子化の巨大MoEモデル:必要メモリ約257GB |
| 2026-09-06 | IFM/K2-Horizon-MoVA-36B-A4B-GGUF | 新モデル | 「K2-Horizon-MoVA-36B-A4B-GGUF」テキスト生成モデル:必要VRAM 32GB〜 |
リポジトリ
- IFM/K2-Horizon-32B-NVFP4
- IFM/K2-Horizon-375B-A23B-NVFP4
- IFM/K2-Horizon-MoVA-36B-A4B
- IFM/K2-Horizon-MoVA-36B-A4B-GGUF
最終更新 2026-09-27(JST)。ページ前半の解説は、出典に挙げた一次資料をもとに AI を用いて執筆したものです。「当サイトの記録とデータ」以降の表と一覧は、記事ログからコードが組み立てています。