「Naive-N0.5-Flash」AI研究とコーディング向けMoEモデル:必要メモリ約690GB

2026年10月6日

「Naive-N0.5-Flash」AI研究とコーディング向けMoEモデル:必要メモリ約690GB

基本情報

項目 内容
リポジトリ NaiveAI/Naive-N0.5-Flash
まとめページ Naive-N0.5 のまとめ(記事1本)
公開日 2026-09-27
ライセンス mit
配布形式 safetensors
出典の種類 公開元の一次情報(HuggingFace公式リポジトリが一次情報)

情報を集めた時点で、当サイトのコードが確定させた値です。日付はJSTで表示しています。

当サイトで確かめたこと

  • 同じ日本語を表すのに要るトークン数は、Qwen3 のトークナイザとほぼ同じです。

詳しい値と条件は、下の「当サイトでの実測」の節にあります。

概要

新興の研究組織 NaiveAI が、最初のモデル Naive-N0.5-Flash を Hugging Face で公開しました。総パラメータ 309B のうち、1トークンの処理で働くのは 15.5B の MoE(Mixture of Experts)モデルで、コーディングと「AI の研究開発(AI R&D)」の作業に向けて作られています。文脈はネイティブで 100万トークンまで扱えます。ライセンスは MIT で、重みと推論のコードを商用利用も含めて自由に使えます。

土台は Xiaomi が公開した MiMo-V2.5 Base です。NaiveAI はこの重みのアテンションの一部を作り替え、3.25T(3兆2,500億)トークンの追加学習を行いました。最大の特徴は、全体を見渡す通常のアテンション(フルアテンション)の層を1つも持たないことです。ほとんどの層は直前の 128 トークンだけを見るスライディングウィンドウ・アテンション(SWA)で、残りの層を DeepSeek が考案した疎なアテンション(DSA、DeepSeek Sparse Attention)に置き換えています。100万トークンの文脈でも、1トークンを生成する計算が文脈の長さにほとんど引きずられない構成です。

もう1つの特徴は作り方です。技術ブログによれば、NaiveAI は「AI に AI を作らせる」ことを掲げ、アーキテクチャの候補の実装と比較実験、学習システムの不具合の発見と修正を AI モデルに担わせ、研究者は目標・制約・最終判断を受け持ったといいます。公開元は本体と同時に FP8 版(NaiveAI/Naive-N0.5-Flash-FP8)と、名前に Draft の付く FP8 のリポジトリも公開しています。

同じ 309B / 活性 15B の規模の Xiaomi のモデルとしては、当サイトでは 「MiMo-V2.6-Flash-RL-GGUF」マルチモーダル対応のMoEモデル:必要メモリ約141GB を取り上げています。

スペック

モデルカードの構成表と config.json から抜き出しました。

  • パラメータ数: 総 309B / 活性 15.5B(MoE)
  • 層の数: 48(うち 39 層が SWA、9 層が DSA)
  • 層の並び: 6 層を1組とするモジュールが 8 つあり、標準のモジュールは SWA 5 層の後に DSA 1 層を置きます。最初のモジュールだけは先頭の層も DSA です
  • SWA の窓: 128 トークン
  • DSA: 軽量な「インデクサ」が過去の全トークンに点数を付け、上位 2,048 トークンだけを本体のアテンションの計算に使います。インデクサの問い合わせヘッドは 16
  • DSA の KV: 元の DSA が使う MLA ではなく、KV を 4 グループにまとめる GQA(GQA4)に置き換えています
  • エキスパート: 256 個のうち 8 個を使います(config.json)。MoE の層は 48 層中 47 層で、先頭の1層は密な FFN です
  • 隠れ層の次元: 4,096(config.json)
  • コンテキスト長: ネイティブで 1M トークン
  • 重みの精度: 本体は BF16 で配布しています。推論は FP8 の混合精度に対応しています

注意したいのは、DSA で減るのは計算とメモリの読み出しであって、KV キャッシュそのものではないことです。モデルカードは「インデクサは過去の全体を走査し、KV キャッシュは全て保持する」と明記しています。長い文脈で速くなっても、KV キャッシュのメモリは文脈に応じて増えます。

性能

モデルカードの評価は図で示されています。同梱の PDF から数値を読み取り、表に直しました。「-」はその項目に結果が無いことを示します。Naive-N0.5-Flash の値は公開元が Claude Code(2.1.207、100万トークンの文脈、ファイル操作と Bash だけを使う構成)で測ったもので、他のモデルの値は各社の発表やリーダーボードから引用されています。測った条件が同じとは限りません。

コーディング

→ 横にスクロールできます

Benchmark Naive-N0.5-Flash DeepSeek-V4.1-Flash Kimi-K3 GLM-5.3 Hy4-preview Opus-5 Opus-5.5 GPT-5.6-Sol
DeepSWE v1.1 67.8 74.2 67.5 66.9 64.3 73.6 74.2 72.7
Agents’ Last Exam (ALE-CLI) 32.4 – 28.3 28.5 22.8 29.5 34.3 28.6
Terminal-Bench 2.1 86.7 90.6 88.3 88.2 85.4 – – 88.8
SWE-bench Pro 73.6 – – – 65.7 79.2 89.9 64.6
ProgramBench 17.5 20.3 – 19.0 17.5 37.0 – 23.0
NL2Repo-Bench 71.9 64.0 – 58.0 58.9 – – –
FrontierSWE v1 78.2 – 81.2 78.1 – – – –

図にはこのほか、Muse-Spark-1.3(DeepSWE 75.4・ALE-CLI 33.3・Terminal-Bench 2.1 88.8)、Step-5-Preview(DeepSWE 67.7・ALE-CLI 29.5)、GLM-5.3-Flash(DeepSWE 63.4・ALE-CLI 26.3・Terminal-Bench 2.1 84.3)、Qwen-3.8-Max(DeepSWE 56.6・SWE-bench Pro 67.7・NL2Repo-Bench 55.9・FrontierSWE 73.5)、GPT-6-Astra(ALE-CLI 33.3)、Fable-5(フォールバックあり。DeepSWE 69.7・ALE-CLI 23.8・Terminal-Bench 2.1 88.0・ProgramBench 33.0・FrontierSWE 88.2)が載っています。

AI の研究開発

Benchmark Naive-N0.5-Flash 比較対象
PostTrainBench 37.5 GPT-5.6-Sol 41.8 / GLM-5.3 39.8 / Kimi-K3 36.6 / Fable-5(フォールバックあり)36.2 / Hy4-preview 35.6
MLE-bench-30 73.7% Sonnet-5 66.9% / Gemini-3.6-Flash 63.9% / Gemini-3.5-Flash 49.7% / GPT-5.6-Luna 47.6% / Grok-4.5 43.2%
PaperBench 63.2 Opus-4.7 58.5 / GPT-5.5 57.5 / MiniMax-M3 52.6 / Gemini-3.1-Pro 46.7
SOL-ExecBench(Mean SOL Score、高いほど良い) 72.81 Recursive Superintelligence, Inc.(非公開の他社モデル)67.56
NanoChat AutoResearch(Validation BPB、低いほど良い) 0.9051 同上 0.9109
NanoGPT SpeedRun(学習時間・秒、低いほど良い) 73.8 同上 77.5

長い手順を最後までやり切る種類のタスクでは、オープンなモデルの中で上位に入ります。 自然言語の仕様からリポジトリ全体を作る NL2Repo-Bench は 71.9 で、図の中の最高です(2位は DeepSeek-V4.1-Flash の 64.0)。多様な分野の長い業務タスクを集めた ALE-CLI は 32.4 で、図に載るオープンなモデル(Step-5-Preview 29.5・GLM-5.3 28.5・Kimi-K3 28.3 など)をいずれも上回り、Opus-5(29.5)より高く、Opus-5.5(34.3)との差は 1.9 ポイントです。GitHub の実際のリポジトリの課題を解く SWE-bench Pro も 73.6 で、GPT-5.6-Sol(64.6)と Qwen-3.8-Max(67.7)を上回ります。

一方で、同じくらいの大きさのモデルと比べて弱い項目もはっきりあります。 図の凡例では DeepSeek-V4.1-Flash が Naive-N0.5-Flash と同じ「600B 未満」の区分ですが、DeepSWE(74.2 対 67.8)・Terminal-Bench 2.1(90.6 対 86.7)・ProgramBench(20.3 対 17.5)では DeepSeek-V4.1-Flash の方が高い値です。Terminal-Bench 2.1 の 86.7 は図の 9 モデル中 7 位で、実行ファイルと文書からプログラムを作り直す ProgramBench の 17.5 は図の最下位(Hy4-preview と同点)です。「仕様から新しく大きなものを組み立てる」課題には強く、「既にあるものを解析して再現する」課題には弱い、という傾向が表から読めます。

AI の研究開発の項目は、比較の相手と測り方に注意が要ります。 MLE-bench-30(73.7%)と PaperBench(63.2)は図の首位ですが、比較対象は Gemini 3.6 Flash と MiniMax M3 のモデルカードに載っていた他社のモデルで、Opus-5.5 などの最新の上位モデルは入っていません。MLE-bench-30 は Gemini 3.6 Flash の評価の手順に従った平均の順位スコア(average position score)です。SOL-ExecBench・NanoChat AutoResearch・NanoGPT SpeedRun の3項目は、Naive-N0.5-Flash を NaiveAI の社内のハーネスで動かした結果で、比較の相手は非公開の他社モデル1つだけです。この3項目はどれも Naive-N0.5-Flash の方が良い値ですが、差は小さく(NanoChat の BPB で 0.0058、NanoGPT の学習時間で 3.7 秒)、第三者が同じ条件で再現した値でもありません。PostTrainBench の 37.5 は GPT-5.6-Sol(41.8)と GLM-5.3(39.8)に届いていません。

得意なこと・想定用途

モデルカードと技術ブログが示す狙いは、大きなリポジトリや長い作業履歴を丸ごと読ませるコーディングエージェントと、機械学習の実験を自分で回す研究エージェントです。追加学習の 3.25T トークンは、AI の研究開発とコーディングを中心にしたデータで、学習の全体を 100万トークンの文脈のまま行っています。

追加学習は3段階です。

  • インデクサのウォームアップ(500億トークン): 新しく足した DSA のインデクサだけを学習し、他の重みは固定します。DSA に置き換える層は、この段階ではまだ全体を見るアテンションで計算し、その注意の分布にインデクサの選び方を KL ダイバージェンスで合わせます
  • 疎なアテンションでの学習(3兆トークン): 疎なアテンションに切り替え、学習率を固定して継続事前学習を行います
  • 減衰の段階(2,000億トークン): 教師ありの微調整(SFT)を行いながら学習率を下げていきます

技術ブログは、AI モデルが学習システムの改良に関わった具体例も挙げています。インデクサの上位 2,048 件の選び方の数値の不安定さを見つけて直したこと、DSA の層と SWA の層で別々の並列化(DSA は全系列を集める Ulysses、SWA は隣の分割と窓の分だけを交換する方式)を提案して通信量を減らしたこと、100万トークンで位置符号の精度の問題を見つけたことなどです。インデクサは元の DSA の実装より選択にかかる時間を 44% 減らしたとしています。こうした AI の関与の度合いは公開元の説明で、外部から確かめる手段はありません。

推論の速さについて、モデルカードは自社の推論システム NaiveRT で、標準のモードで1ユーザーあたり毎秒 50 トークン、Ultrafast モードで最大毎秒 2,000 トークンとしています。これはデータセンターの GPU で自社のシステムを使ったときの値で、手元の機材の目安にはなりません。

類似モデルとの違い

  • MiMo-V2.5 Base(土台): Xiaomi が公開した MIT ライセンスの重みです。モデルカードによれば、ほとんどの層が SWA で、少数の全体を見るアテンションの層が遠くの情報を保っています。100万トークンの文脈では、この全体を見る層が生成の負荷の大半を占めるため、Naive-N0.5-Flash はそこを DSA に置き換えました
  • MiMo-V2.6-Flash-RL: 同じ Xiaomi の系統の次の世代で、規模は同じ総 309B / 活性 15B です。こちらは強化学習でエージェントの能力を伸ばす方向で、アテンションの構成は MiMo の設計のままです。当サイトの GGUF 版の記事: 「MiMo-V2.6-Flash-RL-GGUF」マルチモーダル対応のMoEモデル:必要メモリ約141GB。上位モデルの記事: 「MiMo-V2.6-Pro-RL」テキスト生成モデル:必要メモリ約417GB・GGUF版あり
  • DeepSeek-V4.1-Flash: 評価の図で同じ「600B 未満」の区分に入るモデルです。上の表のとおり、DeepSWE・Terminal-Bench 2.1・ProgramBench では DeepSeek-V4.1-Flash が上回り、NL2Repo-Bench では Naive-N0.5-Flash が上回ります

既存の重みのアテンションを別の方式に作り替え、追加学習で性能を保ったまま長い文脈を軽くする、という手法の実例として見ると、このモデルの価値が分かりやすくなります。ゼロから学習したモデルではなく、公開された重みを土台に組織が独自の方向へ伸ばした派生のモデルです。

動作環境

動作環境の目安(Local Model Watch 算出)

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
690GB超のVRAMが必要(複数GPUまたはCPUオフロードが前提) そのままの精度 575.4GB 690.5GB

推論エンジンの対応状況(各プロジェクトのソースにあるモデル登録表とアーキテクチャ名を当サイトが機械的に照合。2026-10-06 時点): llama.cpp: 未登録、vLLM: 未登録、MLX (mlx-lm): 未登録。「未登録」はその時点の登録表に名前が無いという意味で、動かないことの断定ではありません。

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

手元で動かせるか

現時点では Ollama・LM Studio・llama.cpp で動かせません。

公開元の配布は safetensors のみで、llama.cpp の登録表にもこのモデルのアーキテクチャ名がありません。これらのツールで動かせるようになるには、まず llama.cpp 側が対応する必要があります。公開元と実績のある量子化担当以外による変換版は 4 件あります。現時点で動かすなら transformers(PyTorch) で読み込む形になり、必要メモリは上の表のとおりです。

ライセンス mit(商用利用可): 商用利用を含めて自由に利用・改変・再配布できます。再配布時に著作権表示とライセンス文を残すことが条件です。

配布形式・当サイトが見つけた変換版・各推論エンジンの登録表を突き合わせた判定です。「確認できていない」は当サイトが見つけていないという意味で、存在しないことの断定ではありません。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。

当サイトでの実測

当サイトのサーバー(GPUなし)で、このモデルのファイルを実際に読み込み・動かして確かめた値です。モデルカードの記載ではなく、当サイトが測った結果です。測り方と全モデルの一覧は観測データにまとめています。

日本語のトークン効率

トークナイザ 日本語1,000字あたりのトークン数 同じ内容の英文との比
このモデル 688 1.26倍
Qwen3 688 1.26倍
Llama 3.2 744 1.36倍
Gemma 3 564 1.03倍
gpt-oss 795 1.45倍
LLM-jp-3 497 0.85倍

同じ日本語を表すのに要るトークン数は、Qwen3 のトークナイザとほぼ同じです。

NaiveAI/Naive-N0.5-Flash の tokenizer.json で、当サイトが書き下ろした固定の文章(876字。ニュース・会話・技術文書・敬語のメール・紀行文・料理の6種)と、同じ内容の英文を数えました。トークン数が少ないほど、同じ文脈長に長い日本語が入ります。

入手方法

  • 配布形式: Hugging Face の NaiveAI/Naive-N0.5-Flash に BF16 の safetensors(49 ファイル)、NaiveAI/Naive-N0.5-Flash-FP8 に FP8 版があります。ダウンロードに利用規約への同意は要りません
  • 入手コマンドの例: huggingface-cli download NaiveAI/Naive-N0.5-Flash-FP8
  • 必要な環境: モデルカードは「FP8 に対応した NVIDIA の GPU が必要」とし、FP8 版の重みだけで約 315GB、推論にはさらに GPU のメモリが要るとしています
  • 実行の方法: モデルカードの例は Transformers(5.17.0 以上)で FP8 版を読み込むもので、trust_remote_code=True を指定します。アーキテクチャが独自(NaiveN05FlashForCausalLM)なので、配布元のモデルのコードを読み込んで動かす形になります。謝辞には SGLang の名前がありますが、SGLang・vLLM の起動例はモデルカードにありません
  • 推奨のサンプリング設定: temperature=1.0・top_p=0.95
  • 手元の機材で動かす場合: モデルカードは llama.cpp・Ollama・LM Studio に触れていません。公開元以外による量子化版(GGUF・EXL3・NVFP4 など)も出ています。ただし、例えば Baekpica の GGUF 版はモデルカードが対象の実行環境に llama.cpp ではなく独自のランタイム(ds4-dfm-rs)を挙げており、GGUF という形式でも llama.cpp で読めるとは限りません。個人の機材で試すのは、現時点では難しい規模と形です
  • API: モデルカードは API も提供予定とし、料金を 100万トークンあたり入力 $0.10・出力 $0.40・キャッシュの読み出し $0.01 と示しています

派生版・量子化版

→ 横にスクロールできます

追記日 配布元 形式 リポジトリ 最小のVRAM階層(量子化・必要メモリの目安)
2026-10-05 NaiveAI FP8 NaiveAI/Naive-N0.5-Flash-FP8-Draft FP8 1.5GB(4GB VRAMで動作)
2026-10-05 NaiveAI FP8 NaiveAI/Naive-N0.5-Flash-FP8 FP8 352.2GB(単体のGPUには収まらない)

各リポジトリの量子化とファイルサイズ:

  • NaiveAI/Naive-N0.5-Flash-FP8-Draft の量子化: FP8 1.2GB
  • NaiveAI/Naive-N0.5-Flash-FP8 の量子化: FP8 293.5GB

このほか、上記以外の投稿者による変換版が 4 件あります(当サイトは公開元自身と、実績のある量子化担当の配布だけを表に載せています)。

この節は、記事公開後に見つかった変換版を当サイトが機械的に追記したものです。必要メモリは配布ファイルのサイズから算出した概算です。 量子化の名前の読み方は用語集にあります。

同じ用途の既報モデル

当サイトが取り上げたテキスト生成のモデルを新しい順に並べています。用途は配布元がHugging Faceに付けたタスク(pipeline_tag)から機械的に分けたもので、最小のVRAM階層は当サイトの概算です。

テキスト生成のモデルをすべて見る →

次に読むなら

出典

更新履歴

  • 2026-10-05: 変換版を「派生版・量子化版」に追記しました: NaiveAI/Naive-N0.5-Flash-FP8-Draft, NaiveAI/Naive-N0.5-Flash-FP8
  • 2026-10-06: 当サイトでの実測(日本語のトークン効率)を追加しました。