3値量子化モデルとARM・Apple最適化が加速【週次まとめ】

3値量子化モデルとARM・Apple最適化が加速【週次まとめ】

今週の数字

当サイトが今週公開した記事から機械的に集計した値です。

項目
公開した記事 39本
 新モデル 12本
 エンジン・ツール 10本
 技術解説 7本
 コミュニティ 4本
 画像・動画・音声 3本
 企業・資金調達 3本
取り上げた新モデル 15本
 8GBのGPUで動く(目安) 4本
 12GBのGPUで動く(目安) 10本
 16GBのGPUで動く(目安) 10本
 24GBのGPUで動く(目安) 12本
 パラメータ数 〜4B 3本
 パラメータ数 15〜40B 5本
 パラメータ数 40B超 1本
 パラメータ数 4〜15B 2本
過去記事に追記した変換版 15件(GGUF 9件、MLX 4件、GPTQ 1件、NVFP4 1件)
記事数の多かった発信元 bartowski(3)、unslothai/unsloth(3)、prism-ml(3)

単独記事にしなかった急上昇モデル

今週 Hugging Face で注目を集めたものの、単独記事にしなかったリポジトリです。参考として一覧にするだけで、モデルカードの内容は確認していません。

モデル いいね ダウンロード 記事にしなかった理由
XingChen-AGI/Xing4.0-29B-A4B 872 12,617 著名リスト外の発信元
dealignai/Bonsai-2-27B-Ternary-CRACK-GGUF 108 25,385 著名リスト外の発信元
empero-ai/Qwen3.8-35B-A3B-Distill-GGUF 107 52,476 著名リスト外の発信元
Altworld/Hemmingway-1 97 0 著名リスト外の発信元

単独記事にしなかったパッチ版

監視しているプロジェクトのリリースのうち、パッチ版・リリースノートが短いものです。全ての版はエンジン別ページにあります。

プロジェクト リリースノート
ollama/ollama v0.34.2 GitHub
turboderp-org/exllamav3 v1.5.1 GitHub

今週のハイライト

  • 27Bクラスにおける3値(Ternary)量子化モデルの相次ぐ登場
    Prism MLからQwen3.8-27Bをベースとした3値量子化モデルが複数のフォーマットで一挙に公開され、VRAM容量の限られたローカル環境で中型モデルを運用する選択肢が大きく広がりました。

  • Apple SiliconおよびARM64環境に向けた専用推論・学習環境の拡充
    LM StudioによるQwen3.8高速化エンジン「Splash Engine」の公開や、UnslothによるWindows ARM64バイナリのリリースなど、エッジや非x86環境でのローカル実行環境が一段と整備されました。

  • 主要なローカル推論バックエンド・基盤ツールの同期的なアップデート
    ggml、llama.cpp、llamafile、SGLang、LocalAIといったコアエンジンが相次いで更新され、精度制御APIの機能追加やロード方式の最適化が図られました。

分野別トレンド

テキスト生成

今週は15〜40Bの中型パラメータ帯を中心に、極端な量子化やスパースアテンション技術を取り入れた高効率なモデル展開が目立ちました。

特筆すべきは3値(Ternary)ウェイトを用いたモデルの集中リリースです。三値量子化された27Bモデル「Bonsai 2 27B GGUF」公開をはじめ、Qwen3.8-27Bベースの3値ウェイトモデル「Bonsai 2 27B」MLX 2bit版公開や開発版の3値ウェイトモデルのテスト版「prism-ml/Ternary-Bonsai-2-27B-gguf-dev」公開が報告されており、12GB以下のVRAM環境でも動作可能な27Bモデルの実用化が進んでいます。理論的背景として、1.58ビットの極限に挑む手法を示す3値LLMの1.58ビットの壁を破る「BITCOS」論文公開も話題となりました(未確認情報)。

また、マルチモーダルや思考最適化を施したモデルの量子化版も拡充しており、Orion-26B-A4B-v1.1のGGUF量子化版が公開、マルチモーダル対応Salience-27B-R6のGGUF量子化版公開、思考最適化された27Bマルチモーダルモデル、超大型帯ではマルチモーダル基盤モデル「Intern-S2-397B」のGGUF量子化版公開が提供されています。

オンデバイスや特定用途向けの軽量モデルでは、harshatheg/Qwen-2.5-1B-RLCD公開:Apple Silicon向け並列制約付きデコーディングや超小型のCactus Compute、8〜29MBの自動化モデル「Needle 3」公開、OCR用途のTencent、ドキュメント解析モデル「WeVisDoc-2B/4B」公開などが登場しました。

画像・動画・音声

メディア生成領域では、リアルタイム性と対話性能の強化が進んでいます。

音声分野では、音楽生成モデルYuE2-3B向け実音声トークナイザーv4公開による音質向上のほか、inclusionAI、全二重音声・動画対話モデル「Realtime-Venus」公開のように音声と動画を統合したリアルタイム対話モデルが提供されました。

画像分野では、透過処理や高度なマルチ画像編集に対応した画像生成・編集モデル「Qwen-Image-2.1」公開、透過処理や高度なマルチ画像編集に対応およびその小型化モデル画像生成モデル「Qwen-Image-2.1」公開、7Bへの小型化と透過処理対応がリリースされ、オープンウェイトの画像編集環境が改善されています。

エンジン・ツール

推論基盤からUIツールに至るまで、幅広いレイヤーで環境整備が行われた週となりました。

低レイヤーの推論エンジンでは、ggml v0.24.0リリース:精度制御APIの追加とバックエンド強化llama.cpp v0.4.1公開:ロード方式の変更と新モデルサポートllamafile 0.10.6公開、llama.cpp更新とCUDA/HIPのグラフ機能強化が順次公開されました。サービング側でも大規模型サービングフレームワーク「SGLang v0.5.20」リリースが更新されています。

ハードウェア最適化の面では、Apple Silicon向けローカル推論エンジン「Splash Engine」公開、Qwen3.8を高速化が注目されるほか、ファインチューニングの定番ツールであるUnslothがUnsloth、Windows ARM64バイナリ版をリリースに加えて「unsloth」v0.1.810-beta公開:マルチユーザー対応とDocker刷新およびUnsloth v0.1.811-beta公開、Docker・AMD・マルチユーザー対応を発表し、ARM対応やコンテナ環境での利用やすさを向上させています。

フロントエンド・UI関連では、koboldcpp v1.121公開:Minimax H3メディアリファレンスやSDUIのLoRAセレクターに対応ComfyUI v0.36.0公開:汎用ループやYue2・Marigold v2に対応ローカルAI実行エンジン「LocalAI v4.10.0」公開、ダッシュボード刷新などがリリースされています。

今週の記事

当サイトの記事ログからコードが組み立てた一覧です。同じ話題の記事は1行にまとめています。

新モデル

→ 横にスクロールできます

公開日 モデル パラメータ数 最小のVRAM階層 ライセンス 変換版 記事
2026-09-19 Cactus-Compute/needle3 4GB apache-2.0 Cactus Compute、8〜29MBの自動化モデル「Needle 3」公開
2026-09-18 prism-ml/Ternary-Bonsai-2-27B-gguf-dev 27.8B 12GB apache-2.0 3値ウェイトモデルのテスト版「prism-ml/Ternary-Bonsai-2-27B-gguf-dev」公開
2026-09-18 prism-ml/Ternary-Bonsai-2-27B-mlx-2bit 27.4B 12GB apache-2.0 Qwen3.8-27Bベースの3値ウェイトモデル「Bonsai 2 27B」MLX 2bit版公開
2026-09-18 prism-ml/Ternary-Bonsai-2-27B-gguf 27.8B 8GB apache-2.0 1 三値量子化された27Bモデル「Bonsai 2 27B GGUF」公開
2026-09-18 tencent/WeVisDoc-4B 4.4B 4GB apache-2.0 2 Tencent、ドキュメント解析モデル「WeVisDoc-2B/4B」公開
2026-09-17 harshatheg/Qwen-2.5-1B-RLCD 1.5B 4GB apache-2.0 harshatheg/Qwen-2.5-1B-RLCD公開:Apple Silicon向け並列制約付きデコーディング
2026-09-16 EleutherAI/olmo3-7b-sdf-sft-clean150 7.3B 24GB apache-2.0 EleutherAI、OLMo-3-7Bのハッキング耐性検証用モデル2種公開
2026-09-15 bartowski/vectionlabs_Salience-27B-R6-GGUF 27.8B 12GB apache-2.0 Salience-27B-R6のGGUF量子化版公開、思考最適化された27Bマルチモーダルモデル
2026-09-15 bartowski/Intern-S2-397B-GGUF 403.4B apache-2.0 マルチモーダル基盤モデル「Intern-S2-397B」のGGUF量子化版公開
2026-09-15 EleutherAI/bergson-wikitext-gpt2-leaderboard apache-2.0 EleutherAI、データ帰属の基準モデル「bergson-wikitext-gpt2-leaderboard」公開
2026-09-14 bartowski/TheDrummer_Orion-26B-A4B-v1.1-GGUF 25.8B 12GB Orion-26B-A4B-v1.1のGGUF量子化版が公開、マルチモーダル対応
2026-09-14 tencent/Simple-Attention-Sparsification 4.0B 12GB Tencent、Qwen3向けSASスパースアテンションチェックポイント公開

画像・動画・音声

→ 横にスクロールできます

公開日 モデル パラメータ数 最小のVRAM階層 ライセンス 変換版 記事
2026-09-20 Qwen/Qwen-Image-2.1-PE-I2I other 画像生成・編集モデル「Qwen-Image-2.1」公開、透過処理や高度なマルチ画像編集に対応
2026-09-19 inclusionAI/Realtime-Venus 24GB apache-2.0 inclusionAI、全二重音声・動画対話モデル「Realtime-Venus」公開
2026-09-15 Mothersuperior/yue2-mothersuperior-realaudio-tokenizer-v4 3.6B 12GB cc-by-nc-4.0 音楽生成モデルYuE2-3B向け実音声トークナイザーv4公開

エンジン・ツール

コミュニティ

企業・資金調達

技術解説