3値量子化モデルとARM・Apple最適化が加速【週次まとめ】

今週の数字
当サイトが今週公開した記事から機械的に集計した値です。
| 項目 | 値 |
|---|---|
| 公開した記事 | 39本 |
| 新モデル | 12本 |
| エンジン・ツール | 10本 |
| 技術解説 | 7本 |
| コミュニティ | 4本 |
| 画像・動画・音声 | 3本 |
| 企業・資金調達 | 3本 |
| 取り上げた新モデル | 15本 |
| 8GBのGPUで動く(目安) | 4本 |
| 12GBのGPUで動く(目安) | 10本 |
| 16GBのGPUで動く(目安) | 10本 |
| 24GBのGPUで動く(目安) | 12本 |
| パラメータ数 〜4B | 3本 |
| パラメータ数 15〜40B | 5本 |
| パラメータ数 40B超 | 1本 |
| パラメータ数 4〜15B | 2本 |
| 過去記事に追記した変換版 | 15件(GGUF 9件、MLX 4件、GPTQ 1件、NVFP4 1件) |
| 記事数の多かった発信元 | bartowski(3)、unslothai/unsloth(3)、prism-ml(3) |
単独記事にしなかった急上昇モデル
今週 Hugging Face で注目を集めたものの、単独記事にしなかったリポジトリです。参考として一覧にするだけで、モデルカードの内容は確認していません。
| モデル | いいね | ダウンロード | 記事にしなかった理由 |
|---|---|---|---|
| XingChen-AGI/Xing4.0-29B-A4B | 872 | 12,617 | 著名リスト外の発信元 |
| dealignai/Bonsai-2-27B-Ternary-CRACK-GGUF | 108 | 25,385 | 著名リスト外の発信元 |
| empero-ai/Qwen3.8-35B-A3B-Distill-GGUF | 107 | 52,476 | 著名リスト外の発信元 |
| Altworld/Hemmingway-1 | 97 | 0 | 著名リスト外の発信元 |
単独記事にしなかったパッチ版
監視しているプロジェクトのリリースのうち、パッチ版・リリースノートが短いものです。全ての版はエンジン別ページにあります。
今週のハイライト
-
27Bクラスにおける3値(Ternary)量子化モデルの相次ぐ登場
Prism MLからQwen3.8-27Bをベースとした3値量子化モデルが複数のフォーマットで一挙に公開され、VRAM容量の限られたローカル環境で中型モデルを運用する選択肢が大きく広がりました。 -
Apple SiliconおよびARM64環境に向けた専用推論・学習環境の拡充
LM StudioによるQwen3.8高速化エンジン「Splash Engine」の公開や、UnslothによるWindows ARM64バイナリのリリースなど、エッジや非x86環境でのローカル実行環境が一段と整備されました。 -
主要なローカル推論バックエンド・基盤ツールの同期的なアップデート
ggml、llama.cpp、llamafile、SGLang、LocalAIといったコアエンジンが相次いで更新され、精度制御APIの機能追加やロード方式の最適化が図られました。
分野別トレンド
テキスト生成
今週は15〜40Bの中型パラメータ帯を中心に、極端な量子化やスパースアテンション技術を取り入れた高効率なモデル展開が目立ちました。
特筆すべきは3値(Ternary)ウェイトを用いたモデルの集中リリースです。三値量子化された27Bモデル「Bonsai 2 27B GGUF」公開をはじめ、Qwen3.8-27Bベースの3値ウェイトモデル「Bonsai 2 27B」MLX 2bit版公開や開発版の3値ウェイトモデルのテスト版「prism-ml/Ternary-Bonsai-2-27B-gguf-dev」公開が報告されており、12GB以下のVRAM環境でも動作可能な27Bモデルの実用化が進んでいます。理論的背景として、1.58ビットの極限に挑む手法を示す3値LLMの1.58ビットの壁を破る「BITCOS」論文公開も話題となりました(未確認情報)。
また、マルチモーダルや思考最適化を施したモデルの量子化版も拡充しており、Orion-26B-A4B-v1.1のGGUF量子化版が公開、マルチモーダル対応やSalience-27B-R6のGGUF量子化版公開、思考最適化された27Bマルチモーダルモデル、超大型帯ではマルチモーダル基盤モデル「Intern-S2-397B」のGGUF量子化版公開が提供されています。
オンデバイスや特定用途向けの軽量モデルでは、harshatheg/Qwen-2.5-1B-RLCD公開:Apple Silicon向け並列制約付きデコーディングや超小型のCactus Compute、8〜29MBの自動化モデル「Needle 3」公開、OCR用途のTencent、ドキュメント解析モデル「WeVisDoc-2B/4B」公開などが登場しました。
画像・動画・音声
メディア生成領域では、リアルタイム性と対話性能の強化が進んでいます。
音声分野では、音楽生成モデルYuE2-3B向け実音声トークナイザーv4公開による音質向上のほか、inclusionAI、全二重音声・動画対話モデル「Realtime-Venus」公開のように音声と動画を統合したリアルタイム対話モデルが提供されました。
画像分野では、透過処理や高度なマルチ画像編集に対応した画像生成・編集モデル「Qwen-Image-2.1」公開、透過処理や高度なマルチ画像編集に対応およびその小型化モデル画像生成モデル「Qwen-Image-2.1」公開、7Bへの小型化と透過処理対応がリリースされ、オープンウェイトの画像編集環境が改善されています。
エンジン・ツール
推論基盤からUIツールに至るまで、幅広いレイヤーで環境整備が行われた週となりました。
低レイヤーの推論エンジンでは、ggml v0.24.0リリース:精度制御APIの追加とバックエンド強化やllama.cpp v0.4.1公開:ロード方式の変更と新モデルサポート、llamafile 0.10.6公開、llama.cpp更新とCUDA/HIPのグラフ機能強化が順次公開されました。サービング側でも大規模型サービングフレームワーク「SGLang v0.5.20」リリースが更新されています。
ハードウェア最適化の面では、Apple Silicon向けローカル推論エンジン「Splash Engine」公開、Qwen3.8を高速化が注目されるほか、ファインチューニングの定番ツールであるUnslothがUnsloth、Windows ARM64バイナリ版をリリースに加えて「unsloth」v0.1.810-beta公開:マルチユーザー対応とDocker刷新およびUnsloth v0.1.811-beta公開、Docker・AMD・マルチユーザー対応を発表し、ARM対応やコンテナ環境での利用やすさを向上させています。
フロントエンド・UI関連では、koboldcpp v1.121公開:Minimax H3メディアリファレンスやSDUIのLoRAセレクターに対応、ComfyUI v0.36.0公開:汎用ループやYue2・Marigold v2に対応、ローカルAI実行エンジン「LocalAI v4.10.0」公開、ダッシュボード刷新などがリリースされています。
今週の記事
当サイトの記事ログからコードが組み立てた一覧です。同じ話題の記事は1行にまとめています。
新モデル
→ 横にスクロールできます
| 公開日 | モデル | パラメータ数 | 最小のVRAM階層 | ライセンス | 変換版 | 記事 |
|---|---|---|---|---|---|---|
| 2026-09-19 | Cactus-Compute/needle3 | — | 4GB | apache-2.0 | — | Cactus Compute、8〜29MBの自動化モデル「Needle 3」公開 |
| 2026-09-18 | prism-ml/Ternary-Bonsai-2-27B-gguf-dev | 27.8B | 12GB | apache-2.0 | — | 3値ウェイトモデルのテスト版「prism-ml/Ternary-Bonsai-2-27B-gguf-dev」公開 |
| 2026-09-18 | prism-ml/Ternary-Bonsai-2-27B-mlx-2bit | 27.4B | 12GB | apache-2.0 | — | Qwen3.8-27Bベースの3値ウェイトモデル「Bonsai 2 27B」MLX 2bit版公開 |
| 2026-09-18 | prism-ml/Ternary-Bonsai-2-27B-gguf | 27.8B | 8GB | apache-2.0 | 1 | 三値量子化された27Bモデル「Bonsai 2 27B GGUF」公開 |
| 2026-09-18 | tencent/WeVisDoc-4B | 4.4B | 4GB | apache-2.0 | 2 | Tencent、ドキュメント解析モデル「WeVisDoc-2B/4B」公開 |
| 2026-09-17 | harshatheg/Qwen-2.5-1B-RLCD | 1.5B | 4GB | apache-2.0 | — | harshatheg/Qwen-2.5-1B-RLCD公開:Apple Silicon向け並列制約付きデコーディング |
| 2026-09-16 | EleutherAI/olmo3-7b-sdf-sft-clean150 | 7.3B | 24GB | apache-2.0 | — | EleutherAI、OLMo-3-7Bのハッキング耐性検証用モデル2種公開 |
| 2026-09-15 | bartowski/vectionlabs_Salience-27B-R6-GGUF | 27.8B | 12GB | apache-2.0 | — | Salience-27B-R6のGGUF量子化版公開、思考最適化された27Bマルチモーダルモデル |
| 2026-09-15 | bartowski/Intern-S2-397B-GGUF | 403.4B | — | apache-2.0 | — | マルチモーダル基盤モデル「Intern-S2-397B」のGGUF量子化版公開 |
| 2026-09-15 | EleutherAI/bergson-wikitext-gpt2-leaderboard | — | — | apache-2.0 | — | EleutherAI、データ帰属の基準モデル「bergson-wikitext-gpt2-leaderboard」公開 |
| 2026-09-14 | bartowski/TheDrummer_Orion-26B-A4B-v1.1-GGUF | 25.8B | 12GB | — | — | Orion-26B-A4B-v1.1のGGUF量子化版が公開、マルチモーダル対応 |
| 2026-09-14 | tencent/Simple-Attention-Sparsification | 4.0B | 12GB | — | — | Tencent、Qwen3向けSASスパースアテンションチェックポイント公開 |
画像・動画・音声
→ 横にスクロールできます
| 公開日 | モデル | パラメータ数 | 最小のVRAM階層 | ライセンス | 変換版 | 記事 |
|---|---|---|---|---|---|---|
| 2026-09-20 | Qwen/Qwen-Image-2.1-PE-I2I | — | — | other | — | 画像生成・編集モデル「Qwen-Image-2.1」公開、透過処理や高度なマルチ画像編集に対応 |
| 2026-09-19 | inclusionAI/Realtime-Venus | — | 24GB | apache-2.0 | — | inclusionAI、全二重音声・動画対話モデル「Realtime-Venus」公開 |
| 2026-09-15 | Mothersuperior/yue2-mothersuperior-realaudio-tokenizer-v4 | 3.6B | 12GB | cc-by-nc-4.0 | — | 音楽生成モデルYuE2-3B向け実音声トークナイザーv4公開 |
エンジン・ツール
| 公開日 | プロジェクト | 版 | 記事 |
|---|---|---|---|
| 2026-09-19 | sgl-project/sglang | v0.5.20 | 大規模型サービングフレームワーク「SGLang v0.5.20」リリース |
| 2026-09-19 | unslothai/unsloth | v0.1.811-beta | Unsloth v0.1.811-beta公開、Docker・AMD・マルチユーザー対応 |
| 2026-09-18 | mudler/LocalAI | v4.10.0 | ローカルAI実行エンジン「LocalAI v4.10.0」公開、ダッシュボード刷新 |
| 2026-09-18 | unslothai/unsloth | v0.1.810-beta | 「unsloth」v0.1.810-beta公開:マルチユーザー対応とDocker刷新 |
| 2026-09-16 | unslothai/unsloth | Windows-ARM64 | Unsloth、Windows ARM64バイナリ版をリリース |
| 2026-09-16 | comfyanonymous/ComfyUI | v0.36.0 | ComfyUI v0.36.0公開:汎用ループやYue2・Marigold v2に対応 |
| 2026-09-16 | Mozilla-Ocho/llamafile | 0.10.6 | llamafile 0.10.6公開、llama.cpp更新とCUDA/HIPのグラフ機能強化 |
| 2026-09-16 | LostRuins/koboldcpp | v1.121 | koboldcpp v1.121公開:Minimax H3メディアリファレンスやSDUIのLoRAセレクターに対応 |
| 2026-09-15 | ggml-org/llama.cpp | v0.4.1 | llama.cpp v0.4.1公開:ロード方式の変更と新モデルサポート |
| 2026-09-14 | ggml-org/ggml | v0.24.0 | ggml v0.24.0リリース:精度制御APIの追加とバックエンド強化 |
コミュニティ
| 公開日 | 記事 |
|---|---|
| 2026-09-21 | 画像生成モデル「Qwen-Image-2.1」公開、7Bへの小型化と透過処理対応 |
| 2026-09-17 | 3値LLMの1.58ビットの壁を破る「BITCOS」論文公開 |
| 2026-09-16 | LLMの限界と仕様定義コスト:ナビエ–ストークス解決後の弱気な視点 |
| 2026-09-15 | ClaudeからOllamaへのプロンプト移行:コンテキストと空転問題 |
企業・資金調達
| 公開日 | 記事 |
|---|---|
| 2026-09-20 | Apple Silicon向けローカル推論エンジン「Splash Engine」公開、Qwen3.8を高速化 |
| 2026-09-16 | IEEE Spectrum: 2026年の推論ハードウェア革命とオープンモデルへの影響 |
| 2026-09-16 | Mistral AIとMozillaが提携、Firefox Smart WindowにAIモデル採用 |
技術解説
| 公開日 | 記事 |
|---|---|
| 2026-09-19 | Together AI、金融企業のコーディングエージェント向けGLM-5.2運用事例を公開 |
| 2026-09-19 | NVIDIA AIPerf公開:大規模LLM推論ベンチマークツール |
| 2026-09-18 | LM Studio、会話履歴を自己検索する「Introspection」とセッション参照機能を発表 |
| 2026-09-17 | GLMが独自推論インフラ構築を発表、中国製アクセラレータ活用と大規模MoEのローカル実行手法 |
| 2026-09-17 | TensorRT Edge-LLMとQwen3.6-27BでMLPerf Edge Agenticベンチマークを高速化 |
| 2026-09-16 | NVIDIA Groq 3 LPXの決定的実行とVera Rubinでの高効率推論 |
| 2026-09-15 | JAXとNVIDIA Transformer EngineによるDropless MoE学習の高速化 |

