Edge0、スマホクラスで動く35BのMoEモデル「Edge0-35B-A3B-preview」公開

基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | Edge0/Edge0-35B-A3B-preview |
| 公開日 | 2026-09-08 |
| ライセンス | apache-2.0 |
| 配布形式 | MLX / safetensors |
| 論文 | arXiv:2609.18063 |
| 出典の種類 | 公開元の一次情報(公式組織Edge0のHFリポジトリ) |
収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。
概要
Edge0は、スマホクラスのメモリ環境で動作する35BクラスのスパースMoEモデル「Edge0-35B-A3B-preview」を公開した。配信用のストリーミング推論フレームワーク「edge0」を利用し、4-bit量子化モデルとLoRA・prerouterアダプターを統合して動作させるプレビュー版となっている。
スペック
- アーキテクチャ: Qwen3_5MoeForConditionalGeneration (Qwen3_5_MoE)
- パラメータ数: 34.7B
- 層数: 40
- エキスパート数 / 1トークンあたりのアクティブ数: 256 / 4 (K=4)
- 隠れ層サイズ: 2048
- ライセンス: Apache 2.0
- フレームワーク: edge0 (MLXバックエンド)
性能
公開元による測定では、fp16のベースモデルであるQwen3.5-MoE 35B-A3Bと比較して平均3.9ポイントの低下に抑えられている。各種ベンチマークのスコアは以下の通り。
| Benchmark | edge0-35b (int4) | Qwen3.5-MoE 35B-A3B (fp16) |
|---|---|---|
| AIME 2026 | 86.6 | 92.7 |
| HumanEval | 90.9 | 95.1 |
| GPQA-Diamond | 79.8 | 81.8 |
| MMLU-Pro | 81.0 | 84.6 |
| IFBench | 57.9 | 61.7 |
| Average | 79.2 | 83.2 |
実測されたパフォーマンスは以下の通り。
| Decode speed | Prefill throughput (cold / warm) | Peak active memory* |
|---|---|---|
| 14.9–17.7 tok/s | 113 / 140 tok/s | 2.9 GiB |
※短いコンテキストでの計測値。長文ではKVキャッシュが追加される。エキスパートウェイトはSSDからオンデマンドでストリーミングされ常駐しない。
これらのスコアから、int4化による量子化ロスが少なく抑えられており、競技数学(AIME)やコーディング(HumanEval)、科学の難問(GPQA Diamond)、一般知識・推論(MMLU-Pro)の各分野においてベースモデルと近い水準の性能を維持していることがわかる。一方で、プレビュー版の制限としてエージェント系タスクへの最適化はまだ進んでいない。
得意なこと・想定用途
- GPU VRAMが枯渇しつつも高速なストレージ(NVMeや内蔵フラッシュ)が利用可能なエッジ・オンデバイス推論
- 単一のホストマシンでのバッチサービング(1つの読み取り専用ベースで複数のLoRAアダプターセットを再量子化なしで共有)
- 付属のチャットテンプレートによる多言語チャットおよび推論(思考モード有効)
動作環境
動作環境の目安(Local Model Watch 算出) — パラメータ数 34.7B
| 手持ちのVRAM | 選べる量子化 | ファイルサイズ | 必要メモリの目安 |
|---|---|---|---|
| A100 / H100 80GB クラス | U32 | 64.6GB | 77.5GB |
推論エンジンの対応状況(各プロジェクトのソースにあるモデル登録表とアーキテクチャ名を当サイトが機械的に照合。2026-09-18 時点): llama.cpp: 登録あり、vLLM: 登録あり、MLX (mlx-lm): 登録あり。
必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。
同クラスの既報モデル
当サイトが最近取り上げた、パラメータ数 15〜40B のモデルを、比較のために記事ログからコードが並べたものです。VRAM階層は当サイトの概算、ライセンスはモデルカードの記載です。
→ 横にスクロールできます
| モデル | パラメータ数 | 最小のVRAM階層 | ライセンス | 記事 |
|---|---|---|---|---|
| bartowski/Gryphe_Pantheon-Reasoning-26B-A4B-1.1-V2-GGUF | 26.5B | 12GB | apache-2.0 | Pantheon-Reasoning-26B-A4B-1.1-V2 GGUF版が公開、ローカル実行向け量子化を提供(2026-09-11) |
| nex-agi/Nex-N2.5-mini | 35.1B | 16GB | apache-2.0 | Nex-AGI、長期タスク向けオープンウェイトモデル「Nex-N2.5-mini」を公開(2026-09-09) |
| IFM/K2-Horizon-MoVA-36B-A4B-GGUF | 37.4B | — | apache-2.0 | IFM、K2-Horizon-MoVA-36B-A4BのGGUF版を公開:llama.cppに対応(2026-09-06) |
入手方法
pip install -e 'git+https://github.com/Edge0-AI/edge0.git#egg=edge0[fetch]'
# Download this repository into a local directory
huggingface-cli download Edge0/Edge0-35b-a3b-preview --local-dir./Edge0-35b-a3b-preview
# Run it
export EDGE0_35B_MODEL=$PWD/Edge0-35b-a3b-preview
edge0 chat --name edge0-35b --prompt "Introduce yourself"
# Or serve an OpenAI-compatible HTTP API
edge0 serve --name edge0-35b --port 8085

