大規模型サービングフレームワーク「SGLang v0.5.20」リリース
LLM・マルチモーダル向けサービングフレームワークSGLang v0.5.20が公開。Responses APIの変更やRLロールアウト向けサンプリングマスクのサポート、各種新モデルへの対応内容を解説。
Tencent、Qwen3向けSASスパースアテンションチェックポイント公開
Tencentが公開したQwen3モデル向けSAS(Simple Attention Sparsification)チェックポイントの仕様や導入方法、動作環境を解説します。
Nex-AGI、エージェント向けモデル「Nex-N2.5-Pro」を公開
Nex-AGIが長期タスク向けエージェントモデル「Nex-N2.5」ファミリーを発表。mini、Pro、MaxのウェイトがHugging Face等で公開されており、スペックやベンチマーク結果を解説します。
OpenBMB、2BクラスでSOTAを達成したオンデバイスモデル「MiniCPM5-2B」公開
OpenBMBが公開した2Bクラスのオンデバイス向け大規模言語モデル「MiniCPM5-2B」のスペック、ベンチマーク性能、動作環境、利用方法を解説します。
推論エンジンの更新とQwopus等の実用GGUFモデル登場
ggml v0.23.0やExLlamaV3などの推論エンジンアップデートと、QwopusやK2-Horizon-MoVAのGGUF版公開など、ローカルAIの最新動向をまとめます。
SGLang v0.5.19リリース:Qwen3.8や新規拡散モデルに対応
SGLang v0.5.19がリリース。Qwen3.8や各種拡散モデルへの対応、ビームサーチ機能の追加、DeepEP v2の導入、AMD GPU向け最適化などのアップデート内容を解説します。