「Xing4.0-29B-A4B」コーディングエージェントに強い29BのMoEモデル:必要VRAM 24GB〜

「Xing4.0-29B-A4B」コーディングエージェントに強い29BのMoEモデル:必要VRAM 24GB〜

基本情報

項目 内容
リポジトリ XingChen-AGI/Xing4.0-29B-A4B
まとめページ Xing4.0 のまとめ(記事1本)
公開元のまとめ 中国電信(Xing・TeleChat) のモデルとライセンスのまとめ
公開日 2026-09-16
ライセンス apache-2.0
配布形式 safetensors
論文 arXiv:2512.24157, arXiv:2507.18013
出典の種類 公開元の一次情報(公式HFリポジトリの一次情報)

収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。

概要

中国電信(China Telecom)の AI 子会社である中国電信人工智能科技有限公司が、新しい大規模言語モデル Xing4.0-29B-A4B を Hugging Face で公開した。総パラメータ 29B のうち、1トークンの処理で働くのは 4B だけの MoE(Mixture of Experts)モデルで、標準で 256K トークン、拡張すれば 512K トークンの文脈を扱える。ライセンスは Apache-2.0 で、商用利用を含めて自由に使える。

Xing(星辰)は、同社がこれまで「TeleChat」の名前で公開してきたモデルの後継にあたる。今回の最大の特徴は学習の基盤にある。モデルカードによれば、Xing4.0-29B-A4B は Huawei の Ascend NPU(Ascend 910C のクラスタ)と MindSpore フレームワークだけで学習を終えた、この規模で初めてのモデルである。NVIDIA の GPU を使わずに、コーディングエージェントのベンチマークで同クラスの主要なオープンモデルと並ぶ結果を出したことになる。

公開元は重みと同時に、FP8 版と GGUF 版も自ら公開している(XingChen-AGI/Xing4.0-29B-A4B-FP8・XingChen-AGI/Xing4.0-29B-A4B-GGUF)。公式の GGUF があるため、llama.cpp 系のツールで試すまでの距離が短い。

スペック

モデルカードの構成表から。

  • パラメータ数: 総 29B / 活性 4B(MoE)
  • 層の数: 40
  • 隠れ層の次元: 3,584
  • FFN の中間次元: 密な FFN が 9,216、エキスパート1つあたりが 1,024
  • エキスパート: 振り分け先 64 個のうち 4 個を使う。ほかに常に働く共有エキスパートが 1 個
  • アテンション: MLA(Multi-head Latent Attention)
  • コンテキスト長: 256K トークン(512K まで拡張可能)
  • 構成の要素: モデルカードは「mHC + MLA + MTP」と書いている。MLA は KV キャッシュを圧縮して長い文脈のメモリ消費を抑えるアテンション、MTP(Multi-Token Prediction)は後続の複数トークンを同時に予測する仕組みで、投機的デコードの高速化にも使われる。mHC については、モデルカードに正式名称と説明が無い
  • 思考モード: チャットテンプレートの enable_thinking で、推論の過程を出力するかどうかを切り替えられる

学習の効率化についても数字が出ている。MoE の通信の細かな最適化、選択的な再計算、演算の自動融合、mHC 向けの専用演算子(Ascend C)を組み合わせ、Ascend 上での学習スループットを、何も調整しない状態に比べて約 96% 上げたという。

性能

モデルカードの評価表をそのまま転記する。比較対象は、活性パラメータがほぼ同じ規模の Gemma4-26B-A4B と Qwen3.6-35B-A3B で、いずれも公開元自身が測った数値である。

Benchmark Xing4.0-29B-A4B Gemma4-26B-A4B Qwen3.6-35B-A3B
IFBench 69.67 72.67 65.50
AIME2026 90.00 88.30 92.70
AA.LCR 61.00 66.00 62.00
Tau3-Bench 64.63 58.90 67.20
Claw-Eval 76.55 71.49 74.54
SWE-bench Verified 75.00 53.00 76.00
Terminal-Bench 2.1 57.50 30.00 51.50
SWE-bench Multilingual 66.00 51.00 67.20
DeepresearchBII 60.80 39.30 59.70

強いのは、ツールを使って手順を踏むエージェント型の作業である。 ターミナルで作業を完遂できるかを見る Terminal-Bench 2.1 は 57.50 で、Qwen3.6-35B-A3B(51.50)を 6 ポイント、Gemma4-26B-A4B(30.00)を 27.5 ポイント上回り、表の中で最も高い。エージェントの総合評価 Claw-Eval(76.55)と、調べ物を重ねてレポートを作る DeepresearchBII(60.80)も 3 モデルの中で最高である。実在のリポジトリの不具合を直す SWE-bench Verified は 75.00 で、Qwen3.6-35B-A3B の 76.00 とほぼ並び、Gemma4-26B-A4B(53.00)には 22 ポイントの差を付けた。

一方で、表の中で最下位の項目もある。 長い文書を読んで推論する AA.LCR は 61.00 で、Gemma4-26B-A4B(66.00)と Qwen3.6-35B-A3B(62.00)のどちらにも届かない。256K〜512K の長い文脈を扱えることと、長い文脈を正確に読み解けることは別で、この表を見る限り後者は同クラスの2モデルより弱い。数学の AIME2026(90.00)は Qwen3.6-35B-A3B(92.70)を下回り、指示への従い方を見る IFBench(69.67)は Gemma4-26B-A4B(72.67)に及ばない。顧客対応のようなツール利用の対話を見る Tau3-Bench(64.63)も Qwen3.6-35B-A3B(67.20)より低い。

まとめると、コーディングエージェントとしては Qwen3.6-35B-A3B と同等以上、Gemma4-26B-A4B よりはっきり上で、数学・長文読解・指示追従では同クラスの2モデルとほぼ並ぶか、やや下回る。活性パラメータは3モデルとも 3B〜4B の同じ帯にあり、手元の機材で動かすときの速度の感覚は近い。

評価の条件には注意が要る。モデルカードの脚注によれば、SWE-bench は SWE-agent の枠組みと 210K トークンの文脈で、Terminal-Bench 2.1 は terminus-2 の枠組みで 3 回の平均を取っている。比較対象の2モデルが同じ条件で測られたかどうかは書かれていない。

得意なこと・想定用途

モデルカードが想定しているのは、コーディングエージェントや汎用エージェントの中核として使うことである。複数の手順の計画・ツールの呼び出し・長い推論の連鎖を、長い文脈の中でも崩さずに続けられるよう設計したとしている。実際に、OpenCode・Claude Code・OpenClaw・Hermes といったエージェントの枠組みに合わせた調整と、出力形式の整合を済ませていると明記している。

もう一つの想定用途が、自社データでの追加学習である。意図の分類・表の理解・契約書のチェック・知識ベースへの質問応答のような特定分野の用途に、少ない費用で合わせ込めるとしている。追加学習の手段として LLaMA-Factory と MindFormers に対応し、BAAI の FlagOS を通じて複数のチップ(GPU 以外を含む)への配置にも対応したという。

推奨のサンプリング設定も用途別に示されている。

用途 temperature top_p repetition_penalty
複雑な推論・一般的な用途 1.0 0.95 1.05
コーディング・エージェント 0.8 0.95 1.05

類似モデルとの違い

  • Gemma4-26B-A4B との違い: 活性パラメータは同じ 4B だが、コーディングエージェントの項目(SWE-bench Verified・Terminal-Bench 2.1・SWE-bench Multilingual)で 15〜27 ポイント上回る。逆に指示追従(IFBench)と長文読解(AA.LCR)は Gemma の方が高い
  • Qwen3.6-35B-A3B との違い: 総パラメータは Xing の方が 6B 小さい。SWE-bench はほぼ同点で、Terminal-Bench 2.1・Claw-Eval・DeepresearchBII は Xing が、AIME2026・Tau3-Bench・SWE-bench Multilingual は Qwen が上回る。得意分野が分かれており、どちらかが全面的に上というわけではない
  • 学習基盤の違い: 比較した2モデルは GPU で学習されているのに対し、Xing4.0 は Ascend NPU だけで学習した。利用者から見れば推論の手順は変わらないが、GPU 以外の学習基盤でも同クラスのモデルが作れることを示した例として意味がある

今回は Apache-2.0 で、公式の FP8 版・GGUF 版まで同時に出しており、エージェントの枠組みへの対応も明記している。重みを置くだけでなく、外部の開発者がすぐ使える状態で出すことを意識した公開になっている。

動作環境

動作環境の目安(Local Model Watch 算出) — パラメータ数 31.2B

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
RTX 4090 / 3090 など 24GB IQ4_NL 18.7GB 22.5GB

推論エンジンの対応状況(各プロジェクトのソースにあるモデル登録表とアーキテクチャ名を当サイトが機械的に照合。2026-09-28 時点): llama.cpp: 未登録、vLLM: 未登録、MLX (mlx-lm): 未登録。「未登録」はその時点の登録表に名前が無いという意味で、動かないことの断定ではありません。

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 ファイルサイズは変換版 XingChen-AGI/Xing4.0-29B-A4B-GGUF の配布ファイルの実測値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

手元で動かせるか

Ollama・LM Studio・llama.cpp で動かせます(変換版を利用)。

公開元の配布は safetensors ですが、XingChen-AGI/Xing4.0-29B-A4B-GGUF が GGUF版を公開しているため、そちらを使えば手元で動きます。

ライセンス apache-2.0(商用利用可): 商用利用を含めて自由に利用・改変・再配布できます。再配布時にライセンス文と変更点の告知が必要で、特許の許諾条項があります。

量子化の圧縮率: IQ4_NL は実測 5.15 bit/weight で、元の16bitの重みの約32%のサイズです(配布ファイルの実サイズから当サイトが算出)。

配布形式・当サイトが見つけた変換版・各推論エンジンの登録表を突き合わせた判定です。「確認できていない」は当サイトが見つけていないという意味で、存在しないことの断定ではありません。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。

当サイトでの実測

当サイトのサーバー(GPUなし)で、このモデルのファイルを実際に読み込み・動かして確かめた値です。モデルカードの記載ではなく、当サイトが測った結果です。測り方と全モデルの一覧は観測データにまとめています。

GGUFファイルの中身

対象: xing4_0-29b-IQ4_NL.gguf(18.72GB、IQ4_NL)。ファイルの先頭のメタデータだけを読んで確かめました(重みはダウンロードしていません)。

項目 値
アーキテクチャ(GGUF上の名前) xing4_0
学習時の最大文脈長 262,144トークン
層の数 41
エキスパート 64個のうち4個を使用
語彙数 131,072
チャットテンプレート 同梱(ツール呼び出しの記述あり・思考の切り替えの記述あり)
imatrix 使用(calibration.txt・8チャンク)
重みの型の内訳(パラメータ数の割合) IQ4_NL 93.1% / BF16 5.3% / Q6_K 1.5% / F32 0.0%
平均のビット数 5.15ビット/重み
埋め込み層 / 出力層の型 BF16 / Q6_K

ファイル名の量子化名はファイル全体の呼び名で、実際には層ごとに型が混ざっています。平均のビット数は、ファイルのデータの大きさを重みの数で割った実測値です。

同クラスの既報モデル

当サイトが最近取り上げた、パラメータ数 15〜40B のモデルを、比較のために記事ログからコードが並べたものです。VRAM階層は当サイトの概算、ライセンスはモデルカードの記載です。

→ 横にスクロールできます

モデル パラメータ数 最小のVRAM階層 ライセンス 記事
Altworld/Hemmingway-1 26.9B 12GB cc-by-nc-4.0 「Hemmingway-1」日常文章特化の言語モデル:必要VRAM 12GB〜・GGUF版あり(2026-09-28)
orcarouter/OrcaSAQ-2-27B 27.8B 16GB apache-2.0 「OrcaSAQ-2-27B」テキスト生成モデル:必要VRAM 16GB〜(2026-09-28)
prism-ml/Ternary-Bonsai-2-27B-gguf 27.8B 8GB apache-2.0 「Ternary-Bonsai-2-27B-gguf」テキスト生成モデル:必要VRAM 8GB〜(2026-09-18)
Edge0/Edge0-35B-A3B-preview 36.0B 24GB apache-2.0 「Edge0-35B-A3B-preview」スマホクラスで動く35BのMoEモデル:必要VRAM 24GB〜(2026-09-11)
bartowski/Gryphe_Pantheon-Reasoning-26B-A4B-1.1-V2-GGUF 26.5B 12GB apache-2.0 「Gryphe_Pantheon-Reasoning-26B-A4B-1.1-V2-GGUF」:必要VRAM 12GB〜(2026-09-11)

入手方法

  • 配布形式: Hugging Face の XingChen-AGI/Xing4.0-29B-A4B に Transformers 形式(safetensors)の重みがある。公式の FP8 版と GGUF 版は別のリポジトリにある。ModelScope・Modelers でも配布されている
  • 入手コマンドの例: huggingface-cli download XingChen-AGI/Xing4.0-29B-A4B
  • 対応エンジン: モデルカードは vLLM・SGLang・KTransformers を挙げ、起動手順は GitHub リポジトリに置いている。GitHub の Transformers での推論例は trust_remote_code=True を指定しており、リポジトリに同梱されたコードを実行する点に注意が要る
  • 手元の機材で動かす場合: 公式の GGUF 版を使えば llama.cpp 系のツールで試せる。1トークンあたりの計算量は活性パラメータの 4B 分なので、同じ総パラメータの密なモデルより生成は速い。ただしメモリには 29B 分の重みがすべて載る必要がある。必要なメモリの目安は下の表を参照してほしい

派生版・量子化版

→ 横にスクロールできます

追記日 配布元 形式 リポジトリ 最小のVRAM階層(量子化・必要メモリの目安)
2026-09-28 XingChen-AGI GGUF(imatrix) XingChen-AGI/Xing4.0-29B-A4B-GGUF IQ4_NL 22.5GB(24GB VRAMで動作)
2026-09-28 XingChen-AGI FP8 XingChen-AGI/Xing4.0-29B-A4B-FP8 FP8 37.1GB(48GB VRAMで動作)
2026-09-28 mlx-community MLX mlx-community/Xing4.0-29B-A4B-OptiQ-4bit MLX 4bit 23.0GB(24GB VRAMで動作)

各リポジトリの量子化とファイルサイズ:

  • XingChen-AGI/Xing4.0-29B-A4B-GGUF の量子化: IQ4_NL 18.7GB
  • XingChen-AGI/Xing4.0-29B-A4B-FP8 の量子化: FP8 30.9GB
  • mlx-community/Xing4.0-29B-A4B-OptiQ-4bit の量子化: MLX 4bit 19.2GB

このほか、上記以外の投稿者による変換版が 10 件あります(当サイトは公開元自身と、実績のある量子化担当の配布だけを表に載せています)。

この節は、記事公開後に見つかった変換版を当サイトが機械的に追記したものです。必要メモリは配布ファイルのサイズから算出した概算です。 量子化の名前の読み方は用語集にあります。

同じ用途の既報モデル

当サイトが取り上げたテキスト生成のモデルを新しい順に並べています。用途は配布元がHugging Faceに付けたタスク(pipeline_tag)から機械的に分けたもので、最小のVRAM階層は当サイトの概算です。

テキスト生成のモデルをすべて見る →

次に読むなら

出典

更新履歴

  • 2026-09-28: 変換版を「派生版・量子化版」に追記しました: XingChen-AGI/Xing4.0-29B-A4B-GGUF, XingChen-AGI/Xing4.0-29B-A4B-FP8, mlx-community/Xing4.0-29B-A4B-OptiQ-4bit
  • 2026-09-28: 動作環境の表を XingChen-AGI/Xing4.0-29B-A4B-GGUF の実ファイルサイズで更新しました。
  • 2026-09-28: タイトルを、記事で分かる内容(必要VRAM・配布ファイル等)を示す形に変更しました。
  • 2026-09-28: 当サイトでの実測(GGUFファイルの中身)を追加しました。