llamafile 0.10.6公開、llama.cpp更新とCUDA/HIPのグラフ機能強化
単一ファイルでLLMを実行できる「llamafile」のバージョン0.10.6がリリース。llama.cppのb10441への更新やCUDA/HIPのグラフ機能有効化、セキュリティ強化などの変更点を解説します。
koboldcpp v1.121公開:Minimax H3メディアリファレンスやSDUIのLoRAセレクターに対応
GGUF実行ツール「koboldcpp v1.121」が公開されました。Minimax H3のメディアリファレンス対応やSDUIへのランタイムLoRAセレクター追加、MusicUIの刷新など、マルチメディア生成とUI機能が大幅に強化さ ...
Salience-27B-R6のGGUF量子化版公開、思考最適化された27Bマルチモーダルモデル
Vction Labs開発のSalience-27B-R6のGGUF量子化版が公開。思考効率化と100万トークン対応を備えたマルチモーダル27Bモデルのスペックと動作環境を解説。
マルチモーダル基盤モデル「Intern-S2-397B」のGGUF量子化版公開
上海AIラボのマルチモーダル基盤モデル「Intern-S2-397B」のGGUF量子化版が公開。llama.cppやLM Studio等でのローカル実行手順やスペックを解説。
EleutherAI、データ帰属の基準モデル「bergson-wikitext-gpt2-leaderboard」公開
EleutherAIによる学習データ帰属のベンチマーク基準モデル「EleutherAI/bergson-wikitext-gpt2-leaderboard」の概要やスペック、各種影響度評価手法のスコアを解説します。
音楽生成モデルYuE2-3B向け実音声トークナイザーv4公開
音楽生成モデル「YuE2-3B」向けのリアル音声用ツールキット「Mothersuperior/yue2-mothersuperior-realaudio-tokenizer-v4」の公開情報を速報。自身の音源のトークン化やアーティスト ...
ggml v0.24.0リリース:精度制御APIの追加とバックエンド強化
機械学習テンソルライブラリggmlのv0.24.0がリリース。新しい精度制御APIの導入や、Vulkan、CUDA、Metalなど各種バックエンドの改善・パフォーマンス向上の詳細をお伝えします。
Orion-26B-A4B-v1.1のGGUF量子化版が公開、マルチモーダル対応
bartowski氏によるマルチモーダル対応モデル「Orion-26B-A4B-v1.1」のGGUF量子化版公開について、ファイルサイズや必要メモリ、対応環境を解説します。
Tencent、Qwen3向けSASスパースアテンションチェックポイント公開
Tencentが公開したQwen3モデル向けSAS(Simple Attention Sparsification)チェックポイントの仕様や導入方法、動作環境を解説します。
DeepSeek-V4.1-FlashとMiniCPM5-2Bの登場:週次オープンモデルまとめ
DeepSeek-V4.1-FlashやMiniCPM5-2Bなどの新型モデルの公開、vLLM v0.29.0やUnslothのアップデートなど、ローカル推論・学習環境の最新動向を振り返ります。