エンジン・ツール

llamafile 0.10.6公開、llama.cpp更新とCUDA/HIPのグラフ機能強化

単一ファイルでLLMを実行できる「llamafile」のバージョン0.10.6がリリース。llama.cppのb10441への更新やCUDA/HIPのグラフ機能有効化、セキュリティ強化などの変更点を解説します。

エンジン・ツール

koboldcpp v1.121公開:Minimax H3メディアリファレンスやSDUIのLoRAセレクターに対応

GGUF実行ツール「koboldcpp v1.121」が公開されました。Minimax H3のメディアリファレンス対応やSDUIへのランタイムLoRAセレクター追加、MusicUIの刷新など、マルチメディア生成とUI機能が大幅に強化さ ...

新モデル

Salience-27B-R6のGGUF量子化版公開、思考最適化された27Bマルチモーダルモデル

Vction Labs開発のSalience-27B-R6のGGUF量子化版が公開。思考効率化と100万トークン対応を備えたマルチモーダル27Bモデルのスペックと動作環境を解説。

新モデル

マルチモーダル基盤モデル「Intern-S2-397B」のGGUF量子化版公開

上海AIラボのマルチモーダル基盤モデル「Intern-S2-397B」のGGUF量子化版が公開。llama.cppやLM Studio等でのローカル実行手順やスペックを解説。

新モデル

EleutherAI、データ帰属の基準モデル「bergson-wikitext-gpt2-leaderboard」公開

EleutherAIによる学習データ帰属のベンチマーク基準モデル「EleutherAI/bergson-wikitext-gpt2-leaderboard」の概要やスペック、各種影響度評価手法のスコアを解説します。

画像・動画・音声

音楽生成モデルYuE2-3B向け実音声トークナイザーv4公開

音楽生成モデル「YuE2-3B」向けのリアル音声用ツールキット「Mothersuperior/yue2-mothersuperior-realaudio-tokenizer-v4」の公開情報を速報。自身の音源のトークン化やアーティスト ...

エンジン・ツール

ggml v0.24.0リリース:精度制御APIの追加とバックエンド強化

機械学習テンソルライブラリggmlのv0.24.0がリリース。新しい精度制御APIの導入や、Vulkan、CUDA、Metalなど各種バックエンドの改善・パフォーマンス向上の詳細をお伝えします。

新モデル

Orion-26B-A4B-v1.1のGGUF量子化版が公開、マルチモーダル対応

bartowski氏によるマルチモーダル対応モデル「Orion-26B-A4B-v1.1」のGGUF量子化版公開について、ファイルサイズや必要メモリ、対応環境を解説します。

新モデル

Tencent、Qwen3向けSASスパースアテンションチェックポイント公開

Tencentが公開したQwen3モデル向けSAS(Simple Attention Sparsification)チェックポイントの仕様や導入方法、動作環境を解説します。

週次まとめ

DeepSeek-V4.1-FlashとMiniCPM5-2Bの登場:週次オープンモデルまとめ

DeepSeek-V4.1-FlashやMiniCPM5-2Bなどの新型モデルの公開、vLLM v0.29.0やUnslothのアップデートなど、ローカル推論・学習環境の最新動向を振り返ります。