LLM推論エンジン「vllm-project/vllm v0.30.0」公開 – Fast Start機能や新モデル対応
LLM推論・サービングエンジン「vllm-project/vllm v0.30.0」が公開されました。GPUメモリによる重みキャッシュ「Fast Start」機能の導入や、初期化・グラフキャプチャの高速化、最新モデルのサポート状況など ...
llama.cpp v0.4.1公開:ロード方式の変更と新モデルサポート
llama.cpp v0.4.1がリリース。モデルロード方式の変更やMaple 20B、Tencent Hy 4などの新モデルアーキテクチャのサポート情報を解説します。