LLM推論エンジン「vllm-project/vllm v0.30.0」公開 – Fast Start機能や新モデル対応
LLM推論・サービングエンジン「vllm-project/vllm v0.30.0」が公開されました。GPUメモリによる重みキャッシュ「Fast Start」機能の導入や、初期化・グラフキャプチャの高速化、最新モデルのサポート状況など ...
AIインターフェース「Open WebUI v0.11.4」公開、Dockerイメージが約175MBへ大幅軽量化
Open WebUI v0.11.4が公開されました。Dockerのslimイメージが約175MBへと約89%軽量化されたほか、破壊的変更やターミナル連携、パフォーマンス改善の詳細を解説します。
軽量LLMルーティングライブラリ「litelm」公開、vLLMやOllamaに対応
軽量なLLMルーティングライブラリ「litelm」が公開されました。litellmのコア機能のみを抽出し、約2,900行のコードと最小限の依存関係でvLLMやOllama、各社APIへのルーティングやメッセージ変換を実現します。
exllamav3 v1.4.7リリース:CPU MoE性能改善とDRYサンプラー追加
推論ライブラリ「exllamav3 v1.4.7」が公開されました。CPUでのMoEモデルのパフォーマンス改善や、DRYサンプラーの追加、Trellis量子化の高速化などの変更点と導入方法を解説します。