エンジン・ツール

大規模型サービングフレームワーク「SGLang v0.5.20」リリース

LLM・マルチモーダル向けサービングフレームワークSGLang v0.5.20が公開。Responses APIの変更やRLロールアウト向けサンプリングマスクのサポート、各種新モデルへの対応内容を解説。

エンジン・ツール

Unsloth v0.1.811-beta公開、Docker・AMD・マルチユーザー対応

ローカルLLM学習ツール「Unsloth v0.1.811-beta」が公開。NVIDIA/AMD両対応Dockerイメージ、マルチユーザー機能、Qwen3.8-Flash-Next高速化などアップデート内容を解説。

新モデル

3値ウェイトモデルのテスト版「prism-ml/Ternary-Bonsai-2-27B-gguf-dev」公開

Qwen3.8-27Bをベースにした3値量子化モデルのGGUF開発用ビルド「prism-ml/Ternary-Bonsai-2-27B-gguf-dev」の概要や利用条件を解説します。

新モデル

三値量子化された27Bモデル「Bonsai 2 27B GGUF」公開

Prism MLによるQwen3.8-27Bベースの三値言語モデル「Bonsai 2 27B GGUF」のスペックや推論性能、専用llama.cppでの実行方法を解説します。

エンジン・ツール

「unsloth」v0.1.810-beta公開:マルチユーザー対応とDocker刷新

オープンソースのLLM実行・微調整ツール「unsloth」の最新版v0.1.810-betaが公開。マルチユーザーアカウント機能の追加やDockerイメージの刷新、ハードウェア対応の拡大について解説します。

コミュニティ

3値LLMの1.58ビットの壁を破る「BITCOS」論文公開

3値大規模言語モデルの重み分布の偏りに着目し、1.485ビット/重みを達成した研究「Breaking the 1.58-bit Barrier for Ternary LLMs」の概要とコミュニティの議論を紹介します。

エンジン・ツール

llamafile 0.10.6公開、llama.cpp更新とCUDA/HIPのグラフ機能強化

単一ファイルでLLMを実行できる「llamafile」のバージョン0.10.6がリリース。llama.cppのb10441への更新やCUDA/HIPのグラフ機能有効化、セキュリティ強化などの変更点を解説します。

エンジン・ツール

koboldcpp v1.121公開:Minimax H3メディアリファレンスやSDUIのLoRAセレクターに対応

GGUF実行ツール「koboldcpp v1.121」が公開されました。Minimax H3のメディアリファレンス対応やSDUIへのランタイムLoRAセレクター追加、MusicUIの刷新など、マルチメディア生成とUI機能が大幅に強化さ ...

新モデル

Salience-27B-R6のGGUF量子化版公開、思考最適化された27Bマルチモーダルモデル

Vction Labs開発のSalience-27B-R6のGGUF量子化版が公開。思考効率化と100万トークン対応を備えたマルチモーダル27Bモデルのスペックと動作環境を解説。

新モデル

マルチモーダル基盤モデル「Intern-S2-397B」のGGUF量子化版公開

上海AIラボのマルチモーダル基盤モデル「Intern-S2-397B」のGGUF量子化版が公開。llama.cppやLM Studio等でのローカル実行手順やスペックを解説。