エンジン・ツール

大規模型サービングフレームワーク「SGLang v0.5.20」リリース

LLM・マルチモーダル向けサービングフレームワークSGLang v0.5.20が公開。Responses APIの変更やRLロールアウト向けサンプリングマスクのサポート、各種新モデルへの対応内容を解説。

新モデル

Cactus Compute、8〜29MBの自動化モデル「Needle 3」公開

Cactus Computeが公開したスマートフォンやIoT向けの超軽量自動化モデル「Needle 3」のスペック、ツール呼び出し性能、Hacker Newsでの反応を解説します。

技術解説

NVIDIA AIPerf公開:大規模LLM推論ベンチマークツール

NVIDIAが大規模LLM推論の性能測定ツール「NVIDIA AIPerf」を発表。マルチプロセス構成による高並行環境の正確なベンチマーク測定手順を解説します。

エンジン・ツール

Unsloth v0.1.811-beta公開、Docker・AMD・マルチユーザー対応

ローカルLLM学習ツール「Unsloth v0.1.811-beta」が公開。NVIDIA/AMD両対応Dockerイメージ、マルチユーザー機能、Qwen3.8-Flash-Next高速化などアップデート内容を解説。

新モデル

3値ウェイトモデルのテスト版「prism-ml/Ternary-Bonsai-2-27B-gguf-dev」公開

Qwen3.8-27Bをベースにした3値量子化モデルのGGUF開発用ビルド「prism-ml/Ternary-Bonsai-2-27B-gguf-dev」の概要や利用条件を解説します。

新モデル

Qwen3.8-27Bベースの3値ウェイトモデル「Bonsai 2 27B」MLX 2bit版公開

Prism MLによるQwen3.8-27Bをベースにした3値(Ternary)ウェイトのMLX 2bit版モデル「Bonsai 2 27B」のスペックやベンチマーク結果を速報でお伝えします。

新モデル

三値量子化された27Bモデル「Bonsai 2 27B GGUF」公開

Prism MLによるQwen3.8-27Bベースの三値言語モデル「Bonsai 2 27B GGUF」のスペックや推論性能、専用llama.cppでの実行方法を解説します。

技術解説

LM Studio、会話履歴を自己検索する「Introspection」とセッション参照機能を発表

LM Studioは、Bionicにおける過去の会話セッションの検索・参照機能「Introspection」および「@」メンション機能を発表しました。コンパクションによる情報の損失を防ぐエージェントの自己省察の仕組みを解説します。

エンジン・ツール

ローカルAI実行エンジン「LocalAI v4.10.0」公開、ダッシュボード刷新

オープンソースのローカルAI実行エンジン「LocalAI v4.10.0」が公開。フリート運用ダッシュボードやCLIベンチマーク機能の追加、Apple M5の起動修正などを解説します。

新モデル

Tencent、ドキュメント解析モデル「WeVisDoc-2B/4B」公開

Tencentがページ画像から構造化Markdownを抽出するエンドツーエンドのドキュメント解析モデル「WeVisDoc-2B」および「WeVisDoc-4B」を公開しました。特徴やベンチマーク結果、導入方法を解説します。