DeepSeek-V4.1-FlashとMiniCPM5-2Bの登場:週次オープンモデルまとめ

今週のハイライト
- DeepSeek-V4.1-Flashの登場とNVFP4量子化の進展: 552BクラスのMoEマルチモーダルモデル「DeepSeek-V4.1-Flash」が公開されたほか、NVIDIAから「DeepSeek-V4-Pro」のNVFP4量子化版が提供されるなど、巨大MoEモデルのローカル推論環境への最適化が加速しています。
- オンデバイス・小型モデルの実用性向上: OpenBMBの「MiniCPM5-2B」およびそのGGUF版、スマートフォン環境を意識したMoEモデル「Edge0-35B-A3B-preview」など、手元の限られたリソースで動作するモデルのリリースが相次ぎました。
- 推論・学習エンジンの最適化と対応ハードウェアの拡大: vLLM v0.29.0でのModel Runner V2デフォルト化や、ExLlamaV3でのVRAM最適化・CPUオフロード高速化、UnslothにおけるVulkan対応やStrix Halo環境への最適化など、実行基盤のアップデートが進んでいます。
分野別トレンド
テキスト生成
今週のテキスト生成モデルは、超巨大MoEモデルからオンデバイス向けの軽量モデル、そして推論・エージェント特化型モデルまで幅広い規模で動きがありました。
大規模分野では、552BのMoEマルチモーダルモデル「DeepSeek-V4.1-Flash」が公開され、NVIDIAからは「DeepSeek-V4-Pro」のNVFP4量子化版が登場しました。小型・オンデバイス分野では、OpenBMBが2Bクラスの「MiniCPM5-2B」およびGGUF版を公開したほか、Edge0から「Edge0-35B-A3B-preview」が公開されています。また、Nex-AGIの「Nex-N2.5-mini」「Nex-N2.5-Pro」や、強化学習・報酬ハッキング研究を目的としたEleutherAIの「qwen3-8b-djinnsdf-dolci」、推論特化の「Pantheon-Reasoning-26B-A4B-1.1-V2」のGGUF版など、特定用途にフォーカスしたモデル提供も活発です。
コミュニティでは、Qwen3.8 27Bの4bitと1bitの量子化比較検証が行われたほか、未確認の情報として「Qwen 3.8とGPT-5.5 Proの推論プレフィル実験に関する議論」や「大規模言語モデルが適応的探索で新しい社会的バイアスを形成する研究」なども話題となりました。さらに、文章執筆における知的信頼性(Hacker Newsでの議論、未確認)や、Bluesky上で展開された出力提示とプロンプトインジェクションに関する議論(未確認)など、運用の安全性や影響を巡る対話も見られます。
画像・動画・音声
メディア生成分野では、動画生成エコシステムの拡張と音声・音楽生成モデルの公開が目立ちました。
動画領域では、Lightricksによる「LTX-2.5」向けの各種LoRAおよびIC-LoRAが公開されたほか、MiniMax-H3とLTX-2.5を接続する「H3-to-LTX Latent Adapter」が登場し、モジュール間の連携が進んでいます。画像・空間表現関連では、単一画像からカメラパラメータを推定する「Pi3X」モジュールが公開されました。
音声分野では、キャラクター・アニメ風音声に対応した「Irodori-TTS-v4.1-Anime」や、歌詞とスタイル指定から楽曲を生成できる「YuE2-3B」が登場しています。また、音声認識エンジンであるwhisper.cppはv1.9.4へアップデートされ、言語自動検出とバックエンド最適化が図られました。
エンジン・ツール
推論エンジンおよびファインチューニングフレームワークでは、ハードウェアリソースを最大限に活用するための最適化が継続して行われています。
推論基盤では、vLLMがv0.29.0をリリースし、Model Runner V2をデフォルト化しました。ExLlamaV3はv1.4.8およびv1.4.9が公開され、VRAM消費の最適化や新モデル対応、CPUオフロードの高速化が施されています。ComfyUIもv0.35.0へ更新され、新モデルのサポートとメモリ管理の改善が行われました。
学習・チューニング領域では、Unslothがv0.1.807-betaおよびv0.1.808-betaを相次いでリリースし、Vulkan対応やAMD Strix Haloでの高速化を実現しています。
来週の注目点
- Edge0-35B-A3B-previewの正式展開と検証: 今週プレビュー版として公開された「Edge0-35B-A3B-preview」について、ローカル環境やMLX等での追加ベンチマークや実環境運用の検証が進むかどうかが注目されます。
今週の記事
- ExLlamaV3 1.4.8リリース:VRAM最適化とFA-2コードパス削除
- LLMによる文章執筆と知的信頼性に関するHacker Newsの議論
- アニメ風音声対応のTTSモデル「Irodori-TTS-v4.1-Anime」公開
- AstraとFableを用いた自動演奏ピアノデータ解析と法制の議論
- OpenBMB、2BクラスでSOTAを達成したオンデバイスモデル「MiniCPM5-2B」公開
- LLMの出力提示とプロンプトインジェクションを巡る議論【Bluesky】
- OpenBMB、2Bクラスのオンデバイス向けモデル「MiniCPM5-2B-GGUF」公開
- EleutherAI、報酬ハッキング研究用モデル「qwen3-8b-djinnsdf-dolci」公開
- Mistral AI、シリーズDで30億ユーロを調達しオープンウェイトAI開発を加速
- Mistral AI、30億ユーロの資金調達を実施しオープンウェイトAIのフロンティアへ
- マルチエージェント金融取引フレームワーク「TradingAgents」の仕組みと議論
- Unsloth v0.1.807-betaリリース:Vulkan対応やパフォーマンス向上
- Qwen3.8 27B量子化モデルの性能検証:4bitと1bitの比較
- 大規模言語モデルが適応的探索で新しい社会的バイアスを形成する研究に注目
- Nex-AGI、長期タスク向けオープンウェイトモデル「Nex-N2.5-mini」を公開
- LLMのアテンション機構をブラウザ上で可視化するツールが公開
- Nex-AGI、エージェント向けモデル「Nex-N2.5-Pro」を公開
- vLLM v0.29.0リリース:Model Runner V2がデフォルト化、新モデルや破壊的変更まとめ
- DeepSeek V4.1 Flashの噂と特徴:V4 Proを上回る性能と価格について
- Unsloth v0.1.808-beta公開、拡散モデルやStrix Haloでの高速化を実現
- Goodfire、Ai2のオープン後学習スタックでOlmoモデルの挙動を追跡
- Mistral AI、AIエージェントを活用したFortranレガシーコードのC++移行事例を発表
- ComfyUI v0.35.0リリース:新モデルサポートとメモリ管理の改善
- NVIDIA Dynamo、マルチモーダルモデル向けEPD分散サービングの活用法を公開
- Qwen 3.8とGPT-5.5 Proの推論プレフィル実験に関する議論まとめ
- H3-to-LTX Latent Adapter公開:MiniMax-H3とLTX-2.5を接続
- Pi3Xカメラ内部パラメータ推定モジュール公開、単一画像から推定
- DeepSeek-V4.1-Flash公開、552BのMoEマルチモーダルモデル
- DeepSeek-V4.1-Flash公開:552B MoE・非対称アーキテクチャ採用オープンモデル
- ExLlamaV3 v1.4.9リリース:新モデル対応とCPUオフロード高速化
- Mistral AIとClouderaが提携、オンプレミス環境向け主権型AIを提供
- NVIDIA、DeepSeek-V4-ProのNVFP4量子化版モデルを公開
- 音楽生成モデル「YuE2-3B」公開、歌詞とスタイルから楽曲制作
- Together AI、オープンソースAIスタックの構造とMIGHTスタックを解説
- NVIDIA NIM最適化でNemotron 3 Ultraのスループットが2.5倍に向上
- NVIDIA BioNeMo Inference Runtime発表、Boltz-2の推論を高速化
- Lightricks、動画生成モデル「LTX-2.5」向けのLoRA・IC-LoRA複数種を公開
- Edge0、スマホクラスで動く35BのMoEモデル「Edge0-35B-A3B-preview」公開
- whisper.cpp v1.9.4リリース:言語自動検出の改善とバックエンド最適化
- Pantheon-Reasoning-26B-A4B-1.1-V2 GGUF版が公開、ローカル実行向け量子化を提供
関連記事
出典
- https://localmodelwatch.tsuchitsuchi.com/2026/09/07/exllamav3-v1-4-8-release/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/07/llm-author-post-2025/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/07/irodori-tts-v4-1-anime/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/07/astra-fable-piano-disc-prodigy/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/08/minicpm5-2b-openbmb/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/08/llm-output-bluesky-discussion/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/08/minicpm5-2b-gguf/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/08/eleutherai-qwen3-8b-djinnsdf-dolci/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/08/mistral-raises-3b-open-weight-ai/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/08/mistral-raises-3b-euros/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/08/trading-agents-multi-agent-financial-framework/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/09/unsloth-v0-1-807-beta-update/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/09/qwen38-27b-quantizations-benchmark/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/09/llm-novel-social-biases/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/09/nex-n25-mini/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/09/llm-attention-visualization/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/09/nex-n25-pro/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/09/vllm-v0-29-0-release/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/09/deepseek-v4-1-flash/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/10/unsloth-v0-1-808-beta-update/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/10/goodfire-ai2-open-post-training-stack-olmo/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/10/mistral-ai-legacy-code-modernization/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/10/comfyui-v0350-update/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/10/nvidia-dynamo-epd-disaggregation-multimodal-serving/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/10/qwen-3-8-gpt-5-5-pro-reasoning-prefill/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/10/h3-to-ltx-latent-adapter/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/10/pi3x-intrinsics-estimator/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/10/deepseek-v4-1-flash-2/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/10/deepseek-v4-1-flash-3/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/10/exllamav3-v1-4-9-release/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/10/mistral-cloudera-enterprise-partnership/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/10/nvidia-deepseek-v4-pro-nvfp4/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/10/yue2-3b/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/10/together-ai-open-source-ai-stack/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/11/nvidia-nim-nemotron-3-ultra-2-5x-throughput/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/11/nvidia-bionemo-inference-runtime/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/11/lightricks-ltx-2-5-lora-ic-lora/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/11/edge0-35b-a3b-preview/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/11/whisper-cpp-v1-9-4-released/
- https://localmodelwatch.tsuchitsuchi.com/2026/09/11/pantheon-reasoning-26b-a4b-gguf/

