Edge0、スマホクラスで動く35BのMoEモデル「Edge0-35B-A3B-preview」公開

2026年9月18日

Edge0、スマホクラスで動く35BのMoEモデル「Edge0-35B-A3B-preview」公開

基本情報

項目 内容
リポジトリ Edge0/Edge0-35B-A3B-preview
公開日 2026-09-08
ライセンス apache-2.0
配布形式 MLX / safetensors
論文 arXiv:2609.18063
出典の種類 公開元の一次情報(公式組織Edge0のHFリポジトリ)

収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。

概要

Edge0は、スマホクラスのメモリ環境で動作する35BクラスのスパースMoEモデル「Edge0-35B-A3B-preview」を公開した。配信用のストリーミング推論フレームワーク「edge0」を利用し、4-bit量子化モデルとLoRA・prerouterアダプターを統合して動作させるプレビュー版となっている。

スペック

  • アーキテクチャ: Qwen3_5MoeForConditionalGeneration (Qwen3_5_MoE)
  • パラメータ数: 34.7B
  • 層数: 40
  • エキスパート数 / 1トークンあたりのアクティブ数: 256 / 4 (K=4)
  • 隠れ層サイズ: 2048
  • ライセンス: Apache 2.0
  • フレームワーク: edge0 (MLXバックエンド)

性能

公開元による測定では、fp16のベースモデルであるQwen3.5-MoE 35B-A3Bと比較して平均3.9ポイントの低下に抑えられている。各種ベンチマークのスコアは以下の通り。

Benchmark edge0-35b (int4) Qwen3.5-MoE 35B-A3B (fp16)
AIME 2026 86.6 92.7
HumanEval 90.9 95.1
GPQA-Diamond 79.8 81.8
MMLU-Pro 81.0 84.6
IFBench 57.9 61.7
Average 79.2 83.2

実測されたパフォーマンスは以下の通り。

Decode speed Prefill throughput (cold / warm) Peak active memory*
14.9–17.7 tok/s 113 / 140 tok/s 2.9 GiB

※短いコンテキストでの計測値。長文ではKVキャッシュが追加される。エキスパートウェイトはSSDからオンデマンドでストリーミングされ常駐しない。

これらのスコアから、int4化による量子化ロスが少なく抑えられており、競技数学(AIME)やコーディング(HumanEval)、科学の難問(GPQA Diamond)、一般知識・推論(MMLU-Pro)の各分野においてベースモデルと近い水準の性能を維持していることがわかる。一方で、プレビュー版の制限としてエージェント系タスクへの最適化はまだ進んでいない。

得意なこと・想定用途

  • GPU VRAMが枯渇しつつも高速なストレージ(NVMeや内蔵フラッシュ)が利用可能なエッジ・オンデバイス推論
  • 単一のホストマシンでのバッチサービング(1つの読み取り専用ベースで複数のLoRAアダプターセットを再量子化なしで共有)
  • 付属のチャットテンプレートによる多言語チャットおよび推論(思考モード有効)

動作環境

動作環境の目安(Local Model Watch 算出) — パラメータ数 34.7B

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
A100 / H100 80GB クラス U32 64.6GB 77.5GB

推論エンジンの対応状況(各プロジェクトのソースにあるモデル登録表とアーキテクチャ名を当サイトが機械的に照合。2026-09-18 時点): llama.cpp: 登録あり、vLLM: 登録あり、MLX (mlx-lm): 登録あり。

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

同クラスの既報モデル

当サイトが最近取り上げた、パラメータ数 15〜40B のモデルを、比較のために記事ログからコードが並べたものです。VRAM階層は当サイトの概算、ライセンスはモデルカードの記載です。

→ 横にスクロールできます

モデル パラメータ数 最小のVRAM階層 ライセンス 記事
bartowski/Gryphe_Pantheon-Reasoning-26B-A4B-1.1-V2-GGUF 26.5B 12GB apache-2.0 Pantheon-Reasoning-26B-A4B-1.1-V2 GGUF版が公開、ローカル実行向け量子化を提供(2026-09-11)
nex-agi/Nex-N2.5-mini 35.1B 16GB apache-2.0 Nex-AGI、長期タスク向けオープンウェイトモデル「Nex-N2.5-mini」を公開(2026-09-09)
IFM/K2-Horizon-MoVA-36B-A4B-GGUF 37.4B apache-2.0 IFM、K2-Horizon-MoVA-36B-A4BのGGUF版を公開:llama.cppに対応(2026-09-06)

入手方法

pip install -e 'git+https://github.com/Edge0-AI/edge0.git#egg=edge0[fetch]'

# Download this repository into a local directory
huggingface-cli download Edge0/Edge0-35b-a3b-preview --local-dir./Edge0-35b-a3b-preview

# Run it
export EDGE0_35B_MODEL=$PWD/Edge0-35b-a3b-preview
edge0 chat --name edge0-35b --prompt "Introduce yourself"

# Or serve an OpenAI-compatible HTTP API
edge0 serve --name edge0-35b --port 8085

出典