Tencent、Qwen3向けSASスパースアテンションチェックポイント公開

基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | tencent/Simple-Attention-Sparsification |
| 公開日 | 2026-09-14 |
| 配布形式 | PyTorch (pth) |
| 論文 | arXiv:2609.13141 |
| 出典の種類 | 公開元の一次情報(tencent公式アカウントによる公開で、一次情報として裏付けが取れている) |
収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。
概要
Tencentは、Qwen3モデル向けのSimple Attention Sparsification (SAS) チェックポイントを公開した。SASは、連続的なゲートを使用してKVブロックを選択・ランク付けし、言語モデリング損失によってエンドツーエンドで最適化できるようにするスパースアテンションの手法である。公開されたチェックポイントはルーター部分のみであり、実行には対応するQwen3のベースモデルと専用のバックエンドが必要となる。
スペック
- ベースモデル: Qwen/Qwen3-4B
- タグ: qwen3, sparse-attention, long-context, sglang, sas, text-generation
- チェックポイントの種類: ルーター専用チェックポイント (Qwen3のバックボーンは凍結され同梱されていない)
スペック・構成表
| Directory | Base model | Gate parameters | Gate checkpoint size |
|---|---|---|---|
Qwen3-4B-AttnGates |
Qwen3-4B | 33.0M | 64 MiB |
Qwen3-8B-AttnGates |
Qwen3-8B | 33.0M | 64 MiB |
Qwen3-14B-AttnGates |
Qwen3-14B | 42.0M | 81 MiB |
| Setting | Value |
|---|---|
| KV block size | 64 tokens |
| Training Top-K | 31 historical blocks |
| Gate hidden size | 128 |
| Query projection | Qproj |
| Key block pooling | max + min + average |
| Q/K normalization | enabled |
| Gate RoPE | enabled |
| Training sequence length | 32,768 tokens |
| Training data | OpenR1-Math-220k |
得意なこと・想定用途
本モデルの基盤となっている元モデル(Qwen/Qwen3-4B)は、複雑な論理推論、数学、コーディングを行う「思考モード」と、効率的な汎用対話を行う「非思考モード」を1つのモデル内で切り替えられる特徴を持つ。また、ツール呼び出しにおける高いエージェント能力や、100以上の言語・方言のサポート、ネイティブで32,768トークンのコンテキスト長対応(YaRNを用いた長文脈対応も可能)を備えている。
SASチェックポイントの導入により、SGLangベースのスパースアテンション環境において効率的なコンテキスト処理と推論が可能になる。
動作環境
動作環境の目安(Local Model Watch 算出) — パラメータ数 4.0B(元モデル Qwen/Qwen3-4B の値)
| 手持ちのVRAM | 選べる量子化 | ファイルサイズ | 必要メモリの目安 |
|---|---|---|---|
| RTX 4070 / 3060 12GB など 12GB | BF16 | 7.5GB | 9.0GB |
必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。
同クラスの既報モデル
当サイトが最近取り上げた、パラメータ数 〜4B のモデルを、比較のために記事ログからコードが並べたものです。VRAM階層は当サイトの概算、ライセンスはモデルカードの記載です。
→ 横にスクロールできます
| モデル | パラメータ数 | 最小のVRAM階層 | ライセンス | 記事 |
|---|---|---|---|---|
| harshatheg/Qwen-2.5-1B-RLCD | 1.5B | 8GB | apache-2.0 | harshatheg/Qwen-2.5-1B-RLCD公開:Apple Silicon向け並列制約付きデコーディング(2026-09-16) |
| openbmb/MiniCPM5-2B | 2.5B | 4GB | apache-2.0 | OpenBMB、2BクラスでSOTAを達成したオンデバイスモデル「MiniCPM5-2B」公開(2026-09-07) |
入手方法
リポジトリのクローンと専用の環境構築を行った上で利用する。
git clone https://github.com/Tencent-Hunyuan/Simple-Attention-Sparsification.git
cd Simple-Attention-Sparsification
git submodule update --init --recursive
curl -fsSL https://pixi.sh/install.sh | bash
pixi install
cd third_party/sglang-blocksparse
pixi install
cd../..
推論にはsglang-blocksparseフォーク内のseer_attnバックエンドを利用する。

