ggml v0.24.0リリース:精度制御APIの追加とバックエンド強化
機械学習テンソルライブラリggmlのv0.24.0がリリース。新しい精度制御APIの導入や、Vulkan、CUDA、Metalなど各種バックエンドの改善・パフォーマンス向上の詳細をお伝えします。
Orion-26B-A4B-v1.1のGGUF量子化版が公開、マルチモーダル対応
bartowski氏によるマルチモーダル対応モデル「Orion-26B-A4B-v1.1」のGGUF量子化版公開について、ファイルサイズや必要メモリ、対応環境を解説します。
DeepSeek-V4.1-FlashとMiniCPM5-2Bの登場:週次オープンモデルまとめ
DeepSeek-V4.1-FlashやMiniCPM5-2Bなどの新型モデルの公開、vLLM v0.29.0やUnslothのアップデートなど、ローカル推論・学習環境の最新動向を振り返ります。
Qwen3.8-27Bの高速化ファインチューン「Signal-3.8-27B-GGUF」公開
Qwen3.8-27Bをベースに回答品質を維持したままトークン数を大幅削減し高速化したGGUFモデル「Signal-3.8-27B-GGUF」のスペックや動作環境を解説します。
bartowski、Nex-N2.5-mini-GGUFを公開、llama.cpp向け量子化モデル
bartowski氏が公開したエージェント向けマルチモーダルモデル「nex-agi_Nex-N2.5-mini-GGUF」のスペック、ベンチマーク、動作環境に必要なVRAM容量を解説します。
Pantheon-Reasoning-26B-A4B-1.1-V2 GGUF版が公開、ローカル実行向け量子化を提供
Grypheの推論・ロールプレイ特化型26Bモデル「Pantheon-Reasoning-26B-A4B-1.1-V2」のGGUF版がbartowski氏より公開。必要メモリや対応環境を速報。
NVIDIA Dynamo、マルチモーダルモデル向けEPD分散サービングの活用法を公開
NVIDIA Developerが公開したマルチモーダルモデルのサービングを加速する「Encode-Prefill-Decode (EPD) disaggregation」の活用法について解説します。NVIDIA DynamoによるT ...
OpenBMB、2Bクラスのオンデバイス向けモデル「MiniCPM5-2B-GGUF」公開
OpenBMBが公開した2Bクラスのオープンウェイトモデル「MiniCPM5-2B-GGUF」のスペック、ベンチマーク性能、動作環境、入手方法を解説します。
OpenBMB、2BクラスでSOTAを達成したオンデバイスモデル「MiniCPM5-2B」公開
OpenBMBが公開した2Bクラスのオンデバイス向け大規模言語モデル「MiniCPM5-2B」のスペック、ベンチマーク性能、動作環境、利用方法を解説します。
推論エンジンの更新とQwopus等の実用GGUFモデル登場
ggml v0.23.0やExLlamaV3などの推論エンジンアップデートと、QwopusやK2-Horizon-MoVAのGGUF版公開など、ローカルAIの最新動向をまとめます。