週次まとめ: MiMo-V2.6一族や軽量意思決定モデルが登場

今週の数字
当サイトが今週公開した記事から機械的に集計した値です。
| 項目 | 値 |
|---|---|
| 公開した記事 | 47本 |
| 新モデル | 12本 |
| エンジン・ツール | 10本 |
| 技術解説 | 9本 |
| 画像・動画・音声 | 7本 |
| 企業・資金調達 | 6本 |
| コミュニティ | 3本 |
| 取り上げた新モデル | 19本 |
| 8GBのGPUで動く(目安) | 5本 |
| 12GBのGPUで動く(目安) | 7本 |
| 16GBのGPUで動く(目安) | 8本 |
| 24GBのGPUで動く(目安) | 8本 |
| パラメータ数 4〜15B | 5本 |
| パラメータ数 〜4B | 3本 |
| パラメータ数 15〜40B | 1本 |
| パラメータ数 40B超 | 1本 |
| 過去記事に追記した変換版 | 17件(MLX 3件、GGUF 9件、FP8 3件、NVFP4 1件、MXFP4 1件) |
| 記事数の多かった発信元 | nvidia developer(5)、hugging face blog(3)、xiaomimimo(3) |
| 未確認のまま残っている記事 | 2本 |
単独記事にしなかった急上昇モデル
今週 Hugging Face で注目を集めたものの、単独記事にしなかったリポジトリです。参考として一覧にするだけで、モデルカードの内容は確認していません。
| モデル | いいね | ダウンロード | 記事にしなかった理由 |
|---|---|---|---|
| XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B | 522 | 8,839 | 著名リスト外の発信元 |
| XiaomiMiMo/MiMo-V2.6-Flash-RL | 491 | 25,661 | 著名リスト外の発信元 |
| Contrastive-LM/CLM-v0.1-8B | 408 | 766 | 著名リスト外の発信元 |
| pottokao/Qwen-Image-2.1-Text-Encoder-Heretic-GGUF | 299 | 145,246 | 著名リスト外の発信元 |
| apple/LensVLM-9B | 243 | 1,740 | 著名リスト外の発信元 |
| orcarouter/OrcaSAQ-2-27B | 169 | 1,330 | 著名リスト外の発信元 |
| ukisai/Swift-1.5-Qwen3.8-27B-GSQ-RCO-GGUF | 117 | 28,802 | 著名リスト外の発信元 |
| cua-ai/cua-s1-forms | 111 | 0 | 著名リスト外の発信元 |
| bottlecapai/ThinkingCap-Qwen3.8-27B | 110 | 609 | 著名リスト外の発信元 |
| orcarouter/OrcaSAQ-2-Cyber-27B-Uncensored-GGUF | 99 | 313 | 著名リスト外の発信元 |
単独記事にしなかったパッチ版
監視しているプロジェクトのリリースのうち、パッチ版・リリースノートが短いものです。全ての版はエンジン別ページにあります。
| プロジェクト | 版 | リリースノート |
|---|---|---|
| LostRuins/koboldcpp | v1.122.1 | GitHub |
| ggml-org/ggml | v0.25.1 | GitHub |
| ggml-org/ggml | v0.25.3 | GitHub |
| ollama/ollama | v0.34.4 | GitHub |
| turboderp-org/exllamav3 | v1.5.2 | GitHub |
| turboderp-org/exllamav3 | v1.5.3 | GitHub |
| unslothai/unsloth | prebuilt-wheels-cu13 | GitHub |
| unslothai/unsloth | v0.1.815-beta | GitHub |
今週のハイライト
今週もっとも目立ったのは、Xiaomi の MiMo-V2.6 一族がまとまって出そろったことです。1.02T パラメータの MoE マルチモーダルモデル「MiMo-V2.6-Pro-RL」に加え、ggml-org が GGUF 版として「MiMo-V2.6-Flash-RL-GGUF」(必要メモリ約141GB)と「MiMo-V2.6-Distill-Qwen-9B-GGUF」(9.4B、必要VRAM 12GB〜)を公開し、MiMo-V2.6-MOPDや、エージェント向け強化学習環境「MiMo-V2.6-RL-oss」も続きました。サーバー級の本体から 12GB 帯で動く蒸留版までが同じ週に並び、llama.cpp の公式組織による GGUF 版が早い段階で用意された点は、手元で試す読者にとって大きな意味があります。
推論基盤の面では、Hugging Face transformersがGGUFモデルの直接実行に対応した動きが挙げられます(Hugging Face transformers、GGUFモデルの直接実行をサポート)。これまでllama.cppのエコシステムに閉じがちだったGGUF形式が、Pythonの主要フレームワークとシームレスに結合し始めたことで、開発や活用の幅が大きく広がります。
さらに、特定タスクに絞り込んだ軽量意思決定モデルの台頭も見逃せません。Together AIが発表した「Tev1-4B-experimental」や「Tev1-0.8B-experimental」は、最小4GB VRAMという極めて小さいリソースで構造化データの意思決定を行えるよう設計されています。巨大化一辺倒ではなく、手元で実用的に動かすための小型化・特化型アプローチが明確な潮流となっています。
分野別トレンド
テキスト生成
テキスト生成分野では、手元のPCや単一GPUで動かせる小規模モデルの充実が際立ちました。今週取り上げたモデルのうち4本が 4GB の VRAM に収まり、エッジやローカル環境での利用が強く意識されています。
特に目立ったのが、意思決定や分類に特化した小型モデルの流れです。「Tev1-4B-experimental」や873Mの「Tev1-0.8B-experimental」に加え、コミュニティからもQwen3.5派生の「Kev」が登場しました。また、Together AIはQwen3.5 4Bをベースに低コストでモデルを構築する手法を共有しています(Together AI、Qwen3.5 4BをベースにJev風分類モデルを約17ドルで訓練・構築する手法を公開)。これらに呼応するように、意思決定モデル向けローカルランタイム「Ollaya」のような取り組みも現れていますが、Ollayaについてはコミュニティ発の未確認情報を含んでおり、今後の動向を慎重に見極める必要があります。
言語・ドメイン特化モデルとしては、Preferred Networksから日本語金融特化の「plamo-3-610m-fin-instruct」(890Mパラメータ、必要VRAM 4GB〜)が公開され、軽量な日本語LLMの実用的な選択肢が加わりました。
一方でサーバー級の領域では、NVFP4量子化を採用した「K2-Horizon-375B-A23B-NVFP4」や「K2-Horizon-32B-NVFP4」、前述の MiMo-V2.6-Pro-RL など、MoE構造と新しい量子化形式を組み合わせた大規模モデルの公開も続いています。
なお、今週は8月に公開済みだった「Qwen3.8-27B」と「DeepSeek-V4-Pro-0813」の本体の記事も掲載しました。どちらも派生版を先に取り上げていたモデルで、今週新たに登場したものではありません。
画像・動画・音声
メディア生成分野では、Qwen-Imageエコシステムの急速な広がりと、タスク特化型アーキテクチャの多様化が同時に進んでいます。
Qwen-Image-2.1関連では、ComfyUIで扱いやすいGGUF量子化版「Qwen-Image-2.1-Uncensored-GGUF」(必要VRAM 16GB〜)や、4ステップで高速生成を行う「Qwen-Image-2.1-viggle-turbo」(必要VRAM 48GB〜)が投入されました。また、UIデザイン生成に特化したモデルとして「Ming-Image」が登場するなど、単なる汎用画像生成にとどまらない専門化が進んでいます。
音声領域においても、Google DeepMindによる音声合成モデル「Gemini 3.8 Flash TTS」の公開や、4.1Bパラメータでストリーミング音声認識に対応する「Audio8-ASR-Infinite」(必要VRAM 12GB〜)のリリースがあり、視覚・音声の各モダリティで実用的なローカル向けモデルの整備が進んだ一週間でした。
エンジン・ツール
モデルの多様化を支える推論エンジンや開発ツールのアップデートも相次ぎました。共通しているのは、軽量化・高速化とモデル対応の迅速さです。
推論基盤では、C/C++系ライブラリの更新が目立ちました。「llama.cpp v0.5.0」がリリースされたほか、その基盤となるggmlでも「ggml v0.25.0」および「ggml v0.25.2」が相次いで公開され、FlashAttentionやMoE、各バックエンドの最適化が強化されています。また、フロントエンドツールである「KoboldCpp v1.122」ではエージェント機能が追加され、コンテナベースでモデルを実行する「ramalama v0.25.0」も最新のllama.cppを取り込んでいます。
UIおよびフレームワーク環境では、「ComfyUI v0.37.0」が高速ディスクの自動最適化やQwen対応を実装し、「Unsloth」もQwen-Image-2.1対応とAgent Skills機能を追加しました。さらにWebUI環境の「Open WebUI v0.11.4」ではDockerイメージが約175MBへと大幅に軽量化されるなど、ローカルでAI環境を構築・運用する際の摩擦を減らす改善が全体として着実に積み重ねられています。
関連記事
- 「Signal-3.8-27B-GGUF」トークン効率を最適化したGGUFモデル:必要VRAM 16GB〜
- 「Qwopus3.8-27B-Flash-GGUF」エージェント向け軽量化モデル:必要VRAM 16GB〜
今週の記事
当サイトの記事ログからコードが組み立てた一覧です。同じ話題の記事は1行にまとめています。
新モデル
→ 横にスクロールできます
| 公開日 | モデル | パラメータ数 | 最小のVRAM階層 | ライセンス | 変換版 | 記事 |
|---|---|---|---|---|---|---|
| 2026-09-28 | XiaomiMiMo/MiMo-V2.6-Flash-MOPD | — | — | mit | — | Xiaomi MiMo-V2.6-MOPDモデル公開:マルチモーダル対応MoE |
| 2026-09-27 | XiaomiMiMo/MiMo-V2.6-Pro-RL | — | — | mit | 1 | XiaomiMiMo-V2.6-Pro-RL公開:1.02TのMoEマルチモーダルモデル |
| 2026-09-26 | deepseek-ai/DeepSeek-V4-Pro-0813 | 1650.5B | — | mit | 3 | 「DeepSeek-V4-Pro-0813」エージェント能力を強化した大規模MoEモデル:必要メモリ約998GB |
| 2026-09-26 | Qwen/Qwen3.8-27B | 27.8B | 8GB | apache-2.0 | 6 | 「Qwen3.8-27B」マルチモーダル視覚言語モデル:必要VRAM 8GB〜・GGUF版あり |
| 2026-09-26 | togethercomputer/Tev1-0.8B-experimental | 873M | 4GB | — | — | 「Tev1-0.8B-experimental」構造化データの選択肢選定に特化した意思決定モデル:必要VRAM 4GB〜 |
| 2026-09-25 | LiquidAI/LFM2.5-VL-3B-DSpark | 279M | 4GB | — | 1 | 「LFM2.5-VL-3B-DSpark」ビジョン言語モデル向けドラフトモデル:必要VRAM 4GB〜・GGUF版あり |
| 2026-09-24 | pfnet/plamo-3-610m-fin-instruct | 890M | 4GB | other | 1 | 「plamo-3-610m-fin-instruct」金融特化型の軽量日本語言語モデル:必要VRAM 4GB〜 |
| 2026-09-24 | togethercomputer/Tev1-4B-experimental | 4.7B | 4GB | — | 1 | 「Tev1-4B-experimental」構造化データの意思決定に特化した4Bモデル:必要VRAM 4GB〜 |
| 2026-09-23 | IFM/K2-Horizon-32B-NVFP4 | — | 32GB | apache-2.0 | — | 「K2-Horizon-32B-NVFP4」長文・推論対応モデル:必要VRAM 32GB〜 |
| 2026-09-23 | IFM/K2-Horizon-375B-A23B-NVFP4 | — | — | apache-2.0 | — | 「K2-Horizon-375B-A23B-NVFP4」NVFP4量子化の巨大MoEモデル:必要メモリ約257GB |
| 2026-09-22 | ggml-org/MiMo-V2.6-Flash-RL-GGUF | — | — | mit | — | 「MiMo-V2.6-Flash-RL-GGUF」マルチモーダル対応のMoEモデル:必要メモリ約141GB |
| 2026-09-22 | ggml-org/MiMo-V2.6-Distill-Qwen-9B-GGUF | 9.4B | 12GB | mit | — | 「MiMo-V2.6-Distill-Qwen-9B-GGUF」VLMモデル:必要VRAM 12GB〜 |
画像・動画・音声
→ 横にスクロールできます
| 公開日 | モデル | パラメータ数 | 最小のVRAM階層 | ライセンス | 変換版 | 記事 |
|---|---|---|---|---|---|---|
| 2026-09-26 | MiniMaxAI/MiniMax-H3 | — | 32GB | other | 1 | 「MiniMax-H3」音声付き動画生成モデル:必要VRAM 32GB〜・配布ファイル一覧 |
| 2026-09-24 | Comfy-Org/Ming-Image | — | — | mit | — | 「Ming-Image」UIデザイン特化の画像生成モデル:ComfyUIの配置先 |
| 2026-09-24 | Edge0/Audio8-ASR-Infinite | 4.1B | 12GB | apache-2.0 | — | 「Audio8-ASR-Infinite」音声認識モデル:必要VRAM 12GB〜・配布ファイル一覧 |
| 2026-09-24 | — | — | — | — | — | Google DeepMind、音声生成モデル「Gemini 3.8 Flash TTS」公開 |
| 2026-09-23 | Viggle/Qwen-Image-2.1-viggle-turbo | 7.1B | 48GB | other | — | 「Qwen-Image-2.1-viggle-turbo」4ステップの高速画像生成・編集モデル:必要VRAM 48GB〜 |
| 2026-09-23 | SupraLabs/Supra2-IMG | — | — | apache-2.0 | — | 「Supra2-IMG」軽量なテキストから画像への生成モデル:配布ファイル一覧 |
| 2026-09-21 | abenzerps/Qwen-Image-2.1-Uncensored-GGUF | 7.1B | 16GB | other | 2 | 「Qwen-Image-2.1-Uncensored-GGUF」画像生成モデル:必要VRAM 16GB〜 |
エンジン・ツール
| 公開日 | プロジェクト | 版 | 記事 |
|---|---|---|---|
| 2026-09-28 | invoke-ai/InvokeAI | v6.14.2 | 画像生成WebUI「InvokeAI v6.14.2」公開、Z-Imageのエンコーダー制限やVRAM管理を改善 |
| 2026-09-26 | LostRuins/koboldcpp | v1.122 | 推論エンジン「KoboldCpp v1.122」公開:エージェント機能追加 |
| 2026-09-25 | containers/ramalama | v0.25.0 | AIモデル実行ツール「ramalama v0.25.0」公開、セキュリティ強化とllama.cpp更新 |
| 2026-09-24 | ggml-org/ggml | v0.25.2 | C++テンソルライブラリ「ggml v0.25.2」公開、各バックエンドの最適化を実施 |
| 2026-09-24 | ggml-org/llama.cpp | v0.5.0 | C/C++ LLM推論ライブラリ「llama.cpp v0.5.0」リリース |
| 2026-09-23 | ggml-org/ggml | v0.25.0 | 機械学習ライブラリ「ggml v0.25.0」公開、FlashAttentionやMoEの最適化を拡充 |
| 2026-09-23 | unslothai/unsloth | v0.1.812-beta | UnslothがQwen-Image-2.1対応とAgent Skills機能を追加 |
| 2026-09-22 | vllm-project/vllm | v0.30.0 | LLM推論エンジン「vllm-project/vllm v0.30.0」公開 – Fast Start機能や新モデル対応 |
| 2026-09-22 | open-webui/open-webui | v0.11.4 | AIインターフェース「Open WebUI v0.11.4」公開、Dockerイメージが約175MBへ大幅軽量化 |
| 2026-09-21 | Comfy-Org/ComfyUI | v0.37.0 | ComfyUI v0.37.0公開:高速ディスクの自動最適化とQwen・MoGe 3対応 |
コミュニティ
| 公開日 | 記事 |
|---|---|
| 2026-09-26 | オープンソース意思決定モデル向けローカルランタイム「Ollaya」登場 |
| 2026-09-21 | 8GB VRAMで継続学習するバイトレベルモデル「mini-AGI」公開 |
| 2026-09-21 | Qwen3.5ベースの軽量意思決定モデル「Kev」公開、ローカル実行と実装を検証 |
企業・資金調達
| 公開日 | 記事 |
|---|---|
| 2026-09-28 | 合成医療対話データセット「opus5-5-doctor-patient-conversations-all-human…(未確認) |
| 2026-09-24 | inclusionAI、Ling・Ring・Mingシリーズの学習内容要約を公開 |
| 2026-09-24 | Together AI、Qwen3.5 4BをベースにJev風分類モデルを約17ドルで訓練・構築する手法を公開 |
| 2026-09-23 | NVIDIA Topograph公開、クラスターのネットワークトポロジーを自動発見し最適配置 |
| 2026-09-22 | Hugging Face transformers、GGUFモデルの直接実行をサポート |
| 2026-09-22 | NVIDIA Dynamo-Triton 26.07公開、TensorRTのマルチGPU統合機能に対応 |
技術解説
| 公開日 | 記事 |
|---|---|
| 2026-09-27 | XiaomiMiMoがLLMエージェント向け強化学習環境「MiMo-V2.6-RL-oss」公開 |
| 2026-09-27 | 大規模エージェント訓練向け基盤「DeepSeek Elastic Compute (DSec)」論文公開 |
| 2026-09-26 | 小規模モデル向けRLタスクセット「SmolDataEnvs」公開 |
| 2026-09-25 | NVIDIA、Transformer Engineを活用した生物系MoEモデルの効率的学習手法を公開 |
| 2026-09-24 | Microsoft Research、物理AIロボットの推論オフロード手法「Physical AI Toolchain… |
| 2026-09-24 | NVIDIA、推論エンジニアリング用ベンチマーク「SWE-Serve」発表 |
| 2026-09-23 | Together AI、モデルの段階的更新手法「Canary Rollouts」を公開 |
| 2026-09-23 | NVIDIA Blackwell GPUの機密コンピューティングで安全なAI推論 |
| 2026-09-21 | 物理学的アプローチでLLMを高速化するブロック削除手法「CBO」公開 |

