推論モデル「ELYZA-Thinking-1.0」の32B/33Bモデル公開

基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | elyza/ELYZA-Thinking-1.0-llm-jp-4-32b-a3b |
| 公開元のまとめ | ELYZA のモデルとライセンスのまとめ |
| 公開日 | 2026-10-02 |
| ライセンス | apache-2.0 |
| 配布形式 | safetensors |
| 出典の種類 | 公開元の一次情報(公式HFリポジトリが一次情報) |
情報を集めた時点で、当サイトのコードが確定させた値です。日付はJSTで表示しています。
概要
ELYZA, Inc.は、完全国内産の基盤モデルであるllm-jp-4シリーズをベースにした推論モデル「ELYZA-Thinking-1.0」の32B/33Bモデルを公開しました。公開されたモデルのうち、32Bモデル(elyza/ELYZA-Thinking-1.0-llm-jp-4-32b-a3b)はMoEアーキテクチャを採用しており、日本語と英語の言語理解および生成能力の向上を目的として、ミッドトレーニングとポストトレーニングが実施されています。日本語固有の知識想起や、複雑な制約を持つ指示追従、数学・コーディング・STEM分野の推論能力に特化しています。
スペック
- パラメータ数: 32.1B (32B-A3B) / 33B (33Bモデル)
- アーキテクチャ: Qwen3MoeForCausalLM (32B) / LlamaForCausalLM (33B)
- コンテキスト長: 65,536
- 活性パラメータ: 3,827,476,992 (32B)
- ルートエキスパート: 128 (32B)
- アクティブエキスパート: 8 (32B)
- 隠れサイズ: 2,560 (32B) / 5,120 (33B)
- レイヤー: 32 (32B) / 64 (33B)
- ヘッド: 40 (32B) / 40 (33B)
性能
モデルカードに記載されている、MoEモデル(ELYZA-thinking-1.0-llm-jp-4-32b-a3b)のベンチマーク比較表は以下のとおりです。比較対象として、同系統のモデルや他のオープンウェイトモデルのスコアが示されています。
→ 横にスクロールできます
| Benchmark | ELYZA-thinking-1.0- llm-jp-4- 32b-a3b | llm-jp-4- 32b-a3b- thinking | llm-jp-4.1- 32b-a3b- thinking | Qwen3- 30B-A3B | gpt-oss-20b | Nemotron 3.5 Lightning 30B-A3B | Qwen3.5- 35B-A3B | Gemma 4 26B-A4B |
|---|---|---|---|---|---|---|---|---|
| Knowledge & STEM | ||||||||
| MMLU-Pro (en) | 73.14 | 69.70 | 73.90 | 78.29 | 75.50 | 79.70 | 84.12 | 82.90 |
| JMMLU (ja) | 81.05 | 81.32 | 83.09 | 84.25 | 82.79 | 85.88 | 89.76 | 88.33 |
| GPQA-Diamond (en) | 63.86 | 51.93 | 60.80 | 63.26 | 68.59 | 75.98 | 84.38 | 78.60 |
| GPQA (ja) | 57.24 | 51.03 | 57.06 | 56.57 | 63.80 | 67.30 | 77.08 | 74.82 |
| Math | ||||||||
| MATH-500 (en) | 95.20 | 84.20 | 93.80 | 97.20 | 97.40 | 98.00 | 99.00 | 98.80 |
| JMATH-500 (ja) | 88.20 | 83.20 | 87.40 | 91.60 | 92.20 | 94.00 | 93.20 | 92.00 |
| AIME 2024+2025 (en) | 62.29 | 34.48 | 57.71 | 76.25 | 88.23 | 89.90 | 92.92 | 90.62 |
| PolyMath (ja, high+top) | 34.60 | 12.80 | 27.40 | 43.45 | 55.10 | 58.20 | 56.40 | 65.10 |
| Japanese QA | ||||||||
| JamC-QA (ja) | 59.51 | 53.75 | 53.79 | 45.30 | 41.10 | 55.17 | 60.29 | 66.18 |
| JEMHopQA (ja) | 71.59 | 62.71 | 65.51 | 55.20 | 54.16 | 55.17 | 58.88 | 61.93 |
| Instruction Following | ||||||||
| IFEval (en) | 93.70 | 83.12 | 92.75 | 89.21 | 88.85 | 94.96 | 88.13 | 95.35 |
| IFBench (en) | 59.16 | 49.64 | 56.18 | 36.55 | 60.10 | 71.95 | 59.96 | 71.95 |
| M-IFEval-ja (ja) | 81.75 | 63.05 | 77.32 | 63.72 | 73.12 | 79.76 | 76.88 | 87.72 |
| JFBench (ja) | 38.15 | 27.14 | 30.87 | 24.23 | 18.38 | 34.39 | 28.83 | 30.30 |
| Translation | ||||||||
| WMT20 en→ja (ja) | 23.98 | 23.53 | 23.76 | 22.17 | 23.20 | 20.29 | 24.89 | 27.90 |
| WMT20 ja→en (en) | 22.00 | 20.28 | 20.41 | 21.58 | 21.35 | 20.34 | 23.70 | 26.22 |
| Coding | ||||||||
| LiveCodeBench v6 (en) | 53.66 | 26.86 | 32.40 | 56.40 | 59.94 | 75.94 | 74.91 | 77.09 |
| JHumanEval (ja) | 95.37 | 91.52 | 92.38 | 93.72 | 74.63 | 96.83 | 93.54 | 98.35 |
| Function Calling | ||||||||
| BFCL v4 (en) | 36.31 | 13.29 | 27.96 | 42.65 | 48.09 | 62.37 | 67.03 | 66.88 |
| Nejumi BFCL (ja) | 41.89 | 11.58 | 39.19 | 49.03 | 47.10 | 52.12 | 60.62 | 57.34 |
| Average | ||||||||
| Overall | 58.46 | 46.38 | 53.89 | 56.31 | 57.26 | 64.52 | 66.37 | 68.58 |
| Japanese | 59.61 | 49.16 | 56.65 | 56.73 | 55.04 | 62.02 | 64.24 | 66.68 |
| English | 55.94 | 41.16 | 49.72 | 56.84 | 61.45 | 68.98 | 69.98 | 71.55 |
公開元の測定によれば、ELYZA-Thinking-1.0-llm-jp-4-32b-a3bは日本語関連のタスクで高いパフォーマンスを発揮しています。特に指示追従能力を測るIFEvalやM-IFEval-ja、日本語コーディングのJHumanEvalにおいて優れた数値を記録しており、ベースとなったモデル群と比較して全体的なスコアが向上しています。一方で、Function Callingや英語の高度な数学・競技プログラミング系のベンチマーク(AIMEやLiveCodeBench v6など)では、一部の海外製大規模モデルや他モデルと比較して低い数値となっており、英語圏の特定タスクやツール選択の正確さにおいては改善の余地が見られます。
得意なこと・想定用途
ELYZA-Thinking-1.0シリーズは、日本語と英語の言語理解および生成能力を高めるため、ミッドトレーニング、SFT(教師あり微調整)、強化学習(RLVR)の3段階のトレーニングを経て構築されています。数学、コーディング、STEM分野の推論データを日本語にローカライズして学習しており、特に日本語の指示追従や知識想起に特化しています。また、日本語のWikipediaやWikidataから合成した知識データを活用することで、日本語固有の知識の理解と想起を強化しています。さらに、ツール呼び出し(Function Calling)やエージェントとしての利用にも対応しており、エージェント用データはツール呼び出し、関数名、引数、JSON構造を維持したまま日本語にローカライズされています。
動作環境
動作環境の目安(Local Model Watch 算出) — パラメータ数 32.1B
| 手持ちのVRAM | 選べる量子化 | ファイルサイズ | 必要メモリの目安 |
|---|---|---|---|
| A100 / H100 80GB クラス | BF16 | 59.9GB | 71.8GB |
推論エンジンの対応状況(各プロジェクトのソースにあるモデル登録表とアーキテクチャ名を当サイトが機械的に照合。2026-10-03 時点): llama.cpp: 登録あり、vLLM: 登録あり、MLX (mlx-lm): 登録あり。
必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。
手元で動かせるか
現時点では Ollama・LM Studio・llama.cpp で動かせません(GGUF版を確認できていない)。
公開元の配布は safetensors のみです。ただし llama.cpp の登録表にはこのモデルのアーキテクチャ名があるため、GGUFへの変換自体は可能な状態で、変換版が公開されれば動くようになります。現時点で動かすなら transformers(PyTorch)・vLLM で読み込む形になり、必要メモリは上の表のとおりです。
ライセンス apache-2.0(商用利用可): 商用利用を含めて自由に利用・改変・再配布できます。再配布時にライセンス文と変更点の告知が必要で、特許の許諾条項があります。
配布形式・当サイトが見つけた変換版・各推論エンジンの登録表を突き合わせた判定です。「確認できていない」は当サイトが見つけていないという意味で、存在しないことの断定ではありません。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。
同クラスの既報モデル
当サイトが最近取り上げた、パラメータ数 15〜40B のモデルを、比較のために記事ログからコードが並べたものです。VRAM階層は当サイトの概算、ライセンスはモデルカードの記載です。
→ 横にスクロールできます
| モデル | パラメータ数 | 最小のVRAM階層 | ライセンス | 記事 |
|---|---|---|---|---|
| XingChen-AGI/Xing4.0-29B-A4B | 31.2B | 24GB | apache-2.0 | 「Xing4.0-29B-A4B」テキスト生成モデル:当サイトでの回答例・必要VRAM 24GB〜(2026-09-28) |
| Altworld/Hemmingway-1 | 26.9B | 12GB | cc-by-nc-4.0 | 「Hemmingway-1」日常文章特化の言語モデル:必要VRAM 12GB〜・GGUF版あり(2026-09-28) |
| orcarouter/OrcaSAQ-2-27B | 27.8B | 16GB | apache-2.0 | 「OrcaSAQ-2-27B」テキスト生成モデル:当サイトでの回答例・必要VRAM 16GB〜(2026-09-28) |
| prism-ml/Ternary-Bonsai-2-27B-gguf | 27.8B | 8GB | apache-2.0 | 「Ternary-Bonsai-2-27B-gguf」テキスト生成モデル:必要VRAM 8GB〜(2026-09-18) |
| Edge0/Edge0-35B-A3B-preview | 36.0B | 24GB | apache-2.0 | 「Edge0-35B-A3B-preview」スマホクラスで動く35BのMoEモデル:必要VRAM 24GB〜(2026-09-11) |
入手方法
配布形式としてはsafetensors形式が採用されており、Hugging Faceから入手可能です。ライセンスはApache-2.0です。利用にあたってHugging Face上でアクセス制限や追加のライセンス同意(gated)は設定されていません。
vLLMやTransformers等のエンジンに対応しており、推奨されるvLLMを用いたサーバー起動のコマンド例は以下のとおりです。
vllm serve elyza/ELYZA-Thinking-1.0-llm-jp-4-32b-a3b \
--max-model-len 65536 \
--trust-remote-code \
--moe-backend triton \
--reasoning-parser-plugin vllm_plugins/multi_parser_loader.py \
--reasoning-parser llmjp4 \
--tool-parser-plugin vllm_plugins/llmjp_harmony_tool_parser.py \
--tool-call-parser llmjp_harmony \
--enable-auto-tool-choice
同じ用途の既報モデル
当サイトが取り上げたテキスト生成のモデルを新しい順に並べています。用途は配布元がHugging Faceに付けたタスク(pipeline_tag)から機械的に分けたもので、最小のVRAM階層は当サイトの概算です。
- Xiaomi MiMo-V2.6-MOPDモデル公開:マルチモーダル対応MoE
- 「MiMo-V2.6-Pro-RL」テキスト生成モデル:必要メモリ約417GB・GGUF版あり(80GB超)
- 「DeepSeek-V4-Pro-0813」エージェント能力を強化した大規模MoEモデル:必要メモリ約998GB(1650.5B・80GB超)
- 「Tev1-0.8B-experimental」構造化データの選択肢選定に特化した意思決定モデル:必要VRAM 4GB〜(873M・4GB)
次に読むなら
- GPUのVRAMから探す(このモデルは80GBの階層から動きます) → VRAM別 ローカルモデル早見表
- このモデルを動かすエンジンを調べる → vLLM
- このモデルを入手できる形式を調べる → Safetensors形式の解説と対応モデル
- 公開元について調べる → ELYZA のモデル・ライセンス・記事のまとめ
- 記事に出てくる MMLU-Pro・GPQA Diamond・MATH の読み方を知る → ベンチマーク用語集

