エンジン・ツール

LLM推論エンジン「vllm-project/vllm v0.30.0」公開 - Fast Start機能や新モデル対応

LLM推論・サービングエンジン「vllm-project/vllm v0.30.0」が公開されました。GPUメモリによる重みキャッシュ「Fast Start」機能の導入や、初期化・グラフキャプチャの高速化、最新モデルのサポート状況など ...

エンジン・ツール

llama.cpp v0.4.1リリース:ロード方式の変更と新モデルサポート

llama.cpp v0.4.1がリリース。モデルロード方式の変更やMaple 20B、Tencent Hy 4などの新モデルアーキテクチャのサポート情報を解説します。