GLMが独自推論インフラ構築を発表、中国製アクセラレータ活用と大規模MoEのローカル実行手法
GLMが10万台超の中国製AIアクセラレータを用いた独自推論インフラと「GLM-5.3-Flash」の稼働を発表。さらに744B MoEモデルをMacBookで動かすNVMeストリーミング手法も解説します。
DeepSeek-V4.1-FlashとMiniCPM5-2Bの登場:週次オープンモデルまとめ
DeepSeek-V4.1-FlashやMiniCPM5-2Bなどの新型モデルの公開、vLLM v0.29.0やUnslothのアップデートなど、ローカル推論・学習環境の最新動向を振り返ります。
DeepSeek-V4.1-Flashの検閲解除版FP8モデルがHugging Faceに公開
552BのMoEマルチモーダルモデル「DeepSeek-V4.1-Flash」の重みレベルで検閲解除(abliteration)を行ったFP8版の特徴やスペック、動作環境を解説します。
Together AI、オープンウェイトモデルのファインチューニング機能を拡充し値下げも実施
Together AIがオープンウェイトモデル向けファインチューニングサービスをアップデート。新モデルの追加、ライブメトリクス追跡、Expert LoRAの導入、早期停止機能や最大70%の値下げを発表しました。
Edge0、スマホクラスで動く35BのMoEモデル「Edge0-35B-A3B-preview」公開
Edge0が公開した、35BクラスのスパースMoEモデル「Edge0-35B-A3B-preview」のスペック、ベンチマーク性能、動作環境を解説。4-bit量子化とストリーミング推論で省メモリ動作を実現。
NVIDIA NIM最適化でNemotron 3 Ultraのスループットが2.5倍に向上
NVIDIA Nemotron 3 Ultra向けNIM 2.0.12の最適化により、B200システム上でのスループットが2.5倍に向上した技術詳細とローカル環境での活用法を解説します。
DeepSeek-V4.1-Flash公開、552BのMoEマルチモーダルモデル
deepseek-aiが最大100万トークン対応のマルチモーダルMoEモデル「DeepSeek-V4.1-Flash」をHugging Faceに公開。スペックや動作環境を解説します。
NVIDIA Dynamo、マルチモーダルモデル向けEPD分散サービングの活用法を公開
NVIDIA Developerが公開したマルチモーダルモデルのサービングを加速する「Encode-Prefill-Decode (EPD) disaggregation」の活用法について解説します。NVIDIA DynamoによるT ...
Nex-AGI、長期タスク向けオープンウェイトモデル「Nex-N2.5-mini」を公開
Nex-AGIがコンピュータ操作やウェブブラウジングなどの長期タスク向けに開発したマルチモーダルオープンウェイトモデル「Nex-N2.5-mini」のスペック、性能、動作環境を解説します。
推論エンジンの更新とQwopus等の実用GGUFモデル登場
ggml v0.23.0やExLlamaV3などの推論エンジンアップデートと、QwopusやK2-Horizon-MoVAのGGUF版公開など、ローカルAIの最新動向をまとめます。