NVIDIA Groq 3 LPXの決定的実行とVera Rubinでの高効率推論
NVIDIA Vera Rubinプラットフォーム向け「NVIDIA Groq 3 LPX」の決定的実行モデルと電力効率化技術の詳細を解説。サイクル単位のスケジューリングにより高対話型推論を最適化する仕組みを紹介します。
koboldcpp v1.121公開:Minimax H3メディアリファレンスやSDUIのLoRAセレクターに対応
GGUF実行ツール「koboldcpp v1.121」が公開されました。Minimax H3のメディアリファレンス対応やSDUIへのランタイムLoRAセレクター追加、MusicUIの刷新など、マルチメディア生成とUI機能が大幅に強化さ ...
Salience-27B-R6のGGUF量子化版公開、思考最適化された27Bマルチモーダルモデル
Vction Labs開発のSalience-27B-R6のGGUF量子化版が公開。思考効率化と100万トークン対応を備えたマルチモーダル27Bモデルのスペックと動作環境を解説。
ggml v0.24.0リリース:精度制御APIの追加とバックエンド強化
機械学習テンソルライブラリggmlのv0.24.0がリリース。新しい精度制御APIの導入や、Vulkan、CUDA、Metalなど各種バックエンドの改善・パフォーマンス向上の詳細をお伝えします。
Tencent、Qwen3向けSASスパースアテンションチェックポイント公開
Tencentが公開したQwen3モデル向けSAS(Simple Attention Sparsification)チェックポイントの仕様や導入方法、動作環境を解説します。
Pantheon-Reasoning-26B-A4B-1.1-V2 GGUF版が公開、ローカル実行向け量子化を提供
Grypheの推論・ロールプレイ特化型26Bモデル「Pantheon-Reasoning-26B-A4B-1.1-V2」のGGUF版がbartowski氏より公開。必要メモリや対応環境を速報。
NVIDIA Dynamo、マルチモーダルモデル向けEPD分散サービングの活用法を公開
NVIDIA Developerが公開したマルチモーダルモデルのサービングを加速する「Encode-Prefill-Decode (EPD) disaggregation」の活用法について解説します。NVIDIA DynamoによるT ...
Goodfire、Ai2のオープン後学習スタックでOlmoモデルの挙動を追跡
GoodfireがAllen Institute for AI (Ai2)のオープンなポストトレーニングスタックを利用し、Olmoモデルの望ましくない挙動の追跡や予測を行った事例を解説します。
Mistral AI、シリーズDで30億ユーロを調達しオープンウェイトAI開発を加速
Mistral AIがシリーズDで30億ユーロの資金調達を実施。フロンティア研究の拡張やオープンウェイトモデルの開発継続についてお伝えします。
OpenBMB、2Bクラスのオンデバイス向けモデル「MiniCPM5-2B-GGUF」公開
OpenBMBが公開した2Bクラスのオープンウェイトモデル「MiniCPM5-2B-GGUF」のスペック、ベンチマーク性能、動作環境、入手方法を解説します。