週次まとめ: MiMo-V2.6一族や軽量意思決定モデルが登場

週次まとめ: MiMo-V2.6一族や軽量意思決定モデルが登場

今週の数字

当サイトが今週公開した記事から機械的に集計した値です。

項目 値
公開した記事 47本
 新モデル 12本
 エンジン・ツール 10本
 技術解説 9本
 画像・動画・音声 7本
 企業・資金調達 6本
 コミュニティ 3本
取り上げた新モデル 19本
 8GBのGPUで動く(目安) 5本
 12GBのGPUで動く(目安) 7本
 16GBのGPUで動く(目安) 8本
 24GBのGPUで動く(目安) 8本
 パラメータ数 4〜15B 5本
 パラメータ数 〜4B 3本
 パラメータ数 15〜40B 1本
 パラメータ数 40B超 1本
過去記事に追記した変換版 17件(MLX 3件、GGUF 9件、FP8 3件、NVFP4 1件、MXFP4 1件)
記事数の多かった発信元 nvidia developer(5)、hugging face blog(3)、xiaomimimo(3)
未確認のまま残っている記事 2本

単独記事にしなかった急上昇モデル

今週 Hugging Face で注目を集めたものの、単独記事にしなかったリポジトリです。参考として一覧にするだけで、モデルカードの内容は確認していません。

モデル いいね ダウンロード 記事にしなかった理由
XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B 522 8,839 著名リスト外の発信元
XiaomiMiMo/MiMo-V2.6-Flash-RL 491 25,661 著名リスト外の発信元
Contrastive-LM/CLM-v0.1-8B 408 766 著名リスト外の発信元
pottokao/Qwen-Image-2.1-Text-Encoder-Heretic-GGUF 299 145,246 著名リスト外の発信元
apple/LensVLM-9B 243 1,740 著名リスト外の発信元
orcarouter/OrcaSAQ-2-27B 169 1,330 著名リスト外の発信元
ukisai/Swift-1.5-Qwen3.8-27B-GSQ-RCO-GGUF 117 28,802 著名リスト外の発信元
cua-ai/cua-s1-forms 111 0 著名リスト外の発信元
bottlecapai/ThinkingCap-Qwen3.8-27B 110 609 著名リスト外の発信元
orcarouter/OrcaSAQ-2-Cyber-27B-Uncensored-GGUF 99 313 著名リスト外の発信元

単独記事にしなかったパッチ版

監視しているプロジェクトのリリースのうち、パッチ版・リリースノートが短いものです。全ての版はエンジン別ページにあります。

プロジェクト 版 リリースノート
LostRuins/koboldcpp v1.122.1 GitHub
ggml-org/ggml v0.25.1 GitHub
ggml-org/ggml v0.25.3 GitHub
ollama/ollama v0.34.4 GitHub
turboderp-org/exllamav3 v1.5.2 GitHub
turboderp-org/exllamav3 v1.5.3 GitHub
unslothai/unsloth prebuilt-wheels-cu13 GitHub
unslothai/unsloth v0.1.815-beta GitHub

今週のハイライト

今週もっとも目立ったのは、Xiaomi の MiMo-V2.6 一族がまとまって出そろったことです。1.02T パラメータの MoE マルチモーダルモデル「MiMo-V2.6-Pro-RL」に加え、ggml-org が GGUF 版として「MiMo-V2.6-Flash-RL-GGUF」(必要メモリ約141GB)と「MiMo-V2.6-Distill-Qwen-9B-GGUF」(9.4B、必要VRAM 12GB〜)を公開し、MiMo-V2.6-MOPDや、エージェント向け強化学習環境「MiMo-V2.6-RL-oss」も続きました。サーバー級の本体から 12GB 帯で動く蒸留版までが同じ週に並び、llama.cpp の公式組織による GGUF 版が早い段階で用意された点は、手元で試す読者にとって大きな意味があります。

推論基盤の面では、Hugging Face transformersがGGUFモデルの直接実行に対応した動きが挙げられます(Hugging Face transformers、GGUFモデルの直接実行をサポート)。これまでllama.cppのエコシステムに閉じがちだったGGUF形式が、Pythonの主要フレームワークとシームレスに結合し始めたことで、開発や活用の幅が大きく広がります。

さらに、特定タスクに絞り込んだ軽量意思決定モデルの台頭も見逃せません。Together AIが発表した「Tev1-4B-experimental」や「Tev1-0.8B-experimental」は、最小4GB VRAMという極めて小さいリソースで構造化データの意思決定を行えるよう設計されています。巨大化一辺倒ではなく、手元で実用的に動かすための小型化・特化型アプローチが明確な潮流となっています。

分野別トレンド

テキスト生成

テキスト生成分野では、手元のPCや単一GPUで動かせる小規模モデルの充実が際立ちました。今週取り上げたモデルのうち4本が 4GB の VRAM に収まり、エッジやローカル環境での利用が強く意識されています。

特に目立ったのが、意思決定や分類に特化した小型モデルの流れです。「Tev1-4B-experimental」や873Mの「Tev1-0.8B-experimental」に加え、コミュニティからもQwen3.5派生の「Kev」が登場しました。また、Together AIはQwen3.5 4Bをベースに低コストでモデルを構築する手法を共有しています(Together AI、Qwen3.5 4BをベースにJev風分類モデルを約17ドルで訓練・構築する手法を公開)。これらに呼応するように、意思決定モデル向けローカルランタイム「Ollaya」のような取り組みも現れていますが、Ollayaについてはコミュニティ発の未確認情報を含んでおり、今後の動向を慎重に見極める必要があります。

言語・ドメイン特化モデルとしては、Preferred Networksから日本語金融特化の「plamo-3-610m-fin-instruct」(890Mパラメータ、必要VRAM 4GB〜)が公開され、軽量な日本語LLMの実用的な選択肢が加わりました。

一方でサーバー級の領域では、NVFP4量子化を採用した「K2-Horizon-375B-A23B-NVFP4」や「K2-Horizon-32B-NVFP4」、前述の MiMo-V2.6-Pro-RL など、MoE構造と新しい量子化形式を組み合わせた大規模モデルの公開も続いています。

なお、今週は8月に公開済みだった「Qwen3.8-27B」と「DeepSeek-V4-Pro-0813」の本体の記事も掲載しました。どちらも派生版を先に取り上げていたモデルで、今週新たに登場したものではありません。

画像・動画・音声

メディア生成分野では、Qwen-Imageエコシステムの急速な広がりと、タスク特化型アーキテクチャの多様化が同時に進んでいます。

Qwen-Image-2.1関連では、ComfyUIで扱いやすいGGUF量子化版「Qwen-Image-2.1-Uncensored-GGUF」(必要VRAM 16GB〜)や、4ステップで高速生成を行う「Qwen-Image-2.1-viggle-turbo」(必要VRAM 48GB〜)が投入されました。また、UIデザイン生成に特化したモデルとして「Ming-Image」が登場するなど、単なる汎用画像生成にとどまらない専門化が進んでいます。

音声領域においても、Google DeepMindによる音声合成モデル「Gemini 3.8 Flash TTS」の公開や、4.1Bパラメータでストリーミング音声認識に対応する「Audio8-ASR-Infinite」(必要VRAM 12GB〜)のリリースがあり、視覚・音声の各モダリティで実用的なローカル向けモデルの整備が進んだ一週間でした。

エンジン・ツール

モデルの多様化を支える推論エンジンや開発ツールのアップデートも相次ぎました。共通しているのは、軽量化・高速化とモデル対応の迅速さです。

推論基盤では、C/C++系ライブラリの更新が目立ちました。「llama.cpp v0.5.0」がリリースされたほか、その基盤となるggmlでも「ggml v0.25.0」および「ggml v0.25.2」が相次いで公開され、FlashAttentionやMoE、各バックエンドの最適化が強化されています。また、フロントエンドツールである「KoboldCpp v1.122」ではエージェント機能が追加され、コンテナベースでモデルを実行する「ramalama v0.25.0」も最新のllama.cppを取り込んでいます。

UIおよびフレームワーク環境では、「ComfyUI v0.37.0」が高速ディスクの自動最適化やQwen対応を実装し、「Unsloth」もQwen-Image-2.1対応とAgent Skills機能を追加しました。さらにWebUI環境の「Open WebUI v0.11.4」ではDockerイメージが約175MBへと大幅に軽量化されるなど、ローカルでAI環境を構築・運用する際の摩擦を減らす改善が全体として着実に積み重ねられています。

関連記事

今週の記事

当サイトの記事ログからコードが組み立てた一覧です。同じ話題の記事は1行にまとめています。

新モデル

→ 横にスクロールできます

公開日 モデル パラメータ数 最小のVRAM階層 ライセンス 変換版 記事
2026-09-28 XiaomiMiMo/MiMo-V2.6-Flash-MOPD — — mit — Xiaomi MiMo-V2.6-MOPDモデル公開:マルチモーダル対応MoE
2026-09-27 XiaomiMiMo/MiMo-V2.6-Pro-RL — — mit 1 XiaomiMiMo-V2.6-Pro-RL公開:1.02TのMoEマルチモーダルモデル
2026-09-26 deepseek-ai/DeepSeek-V4-Pro-0813 1650.5B — mit 3 「DeepSeek-V4-Pro-0813」エージェント能力を強化した大規模MoEモデル:必要メモリ約998GB
2026-09-26 Qwen/Qwen3.8-27B 27.8B 8GB apache-2.0 6 「Qwen3.8-27B」マルチモーダル視覚言語モデル:必要VRAM 8GB〜・GGUF版あり
2026-09-26 togethercomputer/Tev1-0.8B-experimental 873M 4GB — — 「Tev1-0.8B-experimental」構造化データの選択肢選定に特化した意思決定モデル:必要VRAM 4GB〜
2026-09-25 LiquidAI/LFM2.5-VL-3B-DSpark 279M 4GB — 1 「LFM2.5-VL-3B-DSpark」ビジョン言語モデル向けドラフトモデル:必要VRAM 4GB〜・GGUF版あり
2026-09-24 pfnet/plamo-3-610m-fin-instruct 890M 4GB other 1 「plamo-3-610m-fin-instruct」金融特化型の軽量日本語言語モデル:必要VRAM 4GB〜
2026-09-24 togethercomputer/Tev1-4B-experimental 4.7B 4GB — 1 「Tev1-4B-experimental」構造化データの意思決定に特化した4Bモデル:必要VRAM 4GB〜
2026-09-23 IFM/K2-Horizon-32B-NVFP4 — 32GB apache-2.0 — 「K2-Horizon-32B-NVFP4」長文・推論対応モデル:必要VRAM 32GB〜
2026-09-23 IFM/K2-Horizon-375B-A23B-NVFP4 — — apache-2.0 — 「K2-Horizon-375B-A23B-NVFP4」NVFP4量子化の巨大MoEモデル:必要メモリ約257GB
2026-09-22 ggml-org/MiMo-V2.6-Flash-RL-GGUF — — mit — 「MiMo-V2.6-Flash-RL-GGUF」マルチモーダル対応のMoEモデル:必要メモリ約141GB
2026-09-22 ggml-org/MiMo-V2.6-Distill-Qwen-9B-GGUF 9.4B 12GB mit — 「MiMo-V2.6-Distill-Qwen-9B-GGUF」VLMモデル:必要VRAM 12GB〜

画像・動画・音声

→ 横にスクロールできます

公開日 モデル パラメータ数 最小のVRAM階層 ライセンス 変換版 記事
2026-09-26 MiniMaxAI/MiniMax-H3 — 32GB other 1 「MiniMax-H3」音声付き動画生成モデル:必要VRAM 32GB〜・配布ファイル一覧
2026-09-24 Comfy-Org/Ming-Image — — mit — 「Ming-Image」UIデザイン特化の画像生成モデル:ComfyUIの配置先
2026-09-24 Edge0/Audio8-ASR-Infinite 4.1B 12GB apache-2.0 — 「Audio8-ASR-Infinite」音声認識モデル:必要VRAM 12GB〜・配布ファイル一覧
2026-09-24 — — — — — Google DeepMind、音声生成モデル「Gemini 3.8 Flash TTS」公開
2026-09-23 Viggle/Qwen-Image-2.1-viggle-turbo 7.1B 48GB other — 「Qwen-Image-2.1-viggle-turbo」4ステップの高速画像生成・編集モデル:必要VRAM 48GB〜
2026-09-23 SupraLabs/Supra2-IMG — — apache-2.0 — 「Supra2-IMG」軽量なテキストから画像への生成モデル:配布ファイル一覧
2026-09-21 abenzerps/Qwen-Image-2.1-Uncensored-GGUF 7.1B 16GB other 2 「Qwen-Image-2.1-Uncensored-GGUF」画像生成モデル:必要VRAM 16GB〜

エンジン・ツール

コミュニティ

企業・資金調達

技術解説