Tencent、Qwen3向けSASスパースアテンションチェックポイント公開

2026年9月18日

Tencent、Qwen3向けSASスパースアテンションチェックポイント公開

基本情報

項目 内容
リポジトリ tencent/Simple-Attention-Sparsification
公開日 2026-09-14
配布形式 PyTorch (pth)
論文 arXiv:2609.13141
出典の種類 公開元の一次情報(tencent公式アカウントによる公開で、一次情報として裏付けが取れている)

収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。

概要

Tencentは、Qwen3モデル向けのSimple Attention Sparsification (SAS) チェックポイントを公開した。SASは、連続的なゲートを使用してKVブロックを選択・ランク付けし、言語モデリング損失によってエンドツーエンドで最適化できるようにするスパースアテンションの手法である。公開されたチェックポイントはルーター部分のみであり、実行には対応するQwen3のベースモデルと専用のバックエンドが必要となる。

スペック

  • ベースモデル: Qwen/Qwen3-4B
  • タグ: qwen3, sparse-attention, long-context, sglang, sas, text-generation
  • チェックポイントの種類: ルーター専用チェックポイント (Qwen3のバックボーンは凍結され同梱されていない)

スペック・構成表

Directory Base model Gate parameters Gate checkpoint size
Qwen3-4B-AttnGates Qwen3-4B 33.0M 64 MiB
Qwen3-8B-AttnGates Qwen3-8B 33.0M 64 MiB
Qwen3-14B-AttnGates Qwen3-14B 42.0M 81 MiB
Setting Value
KV block size 64 tokens
Training Top-K 31 historical blocks
Gate hidden size 128
Query projection Qproj
Key block pooling max + min + average
Q/K normalization enabled
Gate RoPE enabled
Training sequence length 32,768 tokens
Training data OpenR1-Math-220k

得意なこと・想定用途

本モデルの基盤となっている元モデル(Qwen/Qwen3-4B)は、複雑な論理推論、数学、コーディングを行う「思考モード」と、効率的な汎用対話を行う「非思考モード」を1つのモデル内で切り替えられる特徴を持つ。また、ツール呼び出しにおける高いエージェント能力や、100以上の言語・方言のサポート、ネイティブで32,768トークンのコンテキスト長対応(YaRNを用いた長文脈対応も可能)を備えている。

SASチェックポイントの導入により、SGLangベースのスパースアテンション環境において効率的なコンテキスト処理と推論が可能になる。

動作環境

動作環境の目安(Local Model Watch 算出) — パラメータ数 4.0B(元モデル Qwen/Qwen3-4B の値)

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
RTX 4070 / 3060 12GB など 12GB BF16 7.5GB 9.0GB

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

同クラスの既報モデル

当サイトが最近取り上げた、パラメータ数 〜4B のモデルを、比較のために記事ログからコードが並べたものです。VRAM階層は当サイトの概算、ライセンスはモデルカードの記載です。

→ 横にスクロールできます

モデル パラメータ数 最小のVRAM階層 ライセンス 記事
harshatheg/Qwen-2.5-1B-RLCD 1.5B 8GB apache-2.0 harshatheg/Qwen-2.5-1B-RLCD公開:Apple Silicon向け並列制約付きデコーディング(2026-09-16)
openbmb/MiniCPM5-2B 2.5B 4GB apache-2.0 OpenBMB、2BクラスでSOTAを達成したオンデバイスモデル「MiniCPM5-2B」公開(2026-09-07)

入手方法

リポジトリのクローンと専用の環境構築を行った上で利用する。

git clone https://github.com/Tencent-Hunyuan/Simple-Attention-Sparsification.git
cd Simple-Attention-Sparsification

git submodule update --init --recursive

curl -fsSL https://pixi.sh/install.sh | bash
pixi install

cd third_party/sglang-blocksparse
pixi install
cd../..

推論にはsglang-blocksparseフォーク内のseer_attnバックエンドを利用する。

関連記事

出典