音楽生成モデル「YuE2-3B」公開、歌詞とスタイルから楽曲制作

2026年9月18日

音楽生成モデル「YuE2-3B」公開、歌詞とスタイルから楽曲制作

作例は配布元のモデルカードで公開されています。

基本情報

項目 内容
リポジトリ m-a-p/YuE2-3B
公開日 2026-09-10
ライセンス cc-by-nc-4.0
配布形式 safetensors
論文 arXiv:2503.08638
出典の種類 公開元の一次情報(公式HFリポジトリで確認可能)

収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。

作例は配布元のモデルカードで公開されています。

作例は配布元のモデルカードで公開されています。

作例は配布元のモデルカードで公開されています。

作例は配布元のモデルカードで公開されています。

作例は配布元のモデルカードで公開されています。

作例は配布元のモデルカードで公開されています。

作例は配布元のモデルカードで公開されています。

作例は配布元のモデルカードで公開されています。

作例は配布元のモデルカードで公開されています。

作例は配布元のモデルカードで公開されています。

概要

m-a-pは、歌詞とスタイルプロンプトからボーカルと伴奏付きの完全な楽曲を生成するオープンな音楽生成モデル「YuE2-3B」を公開した。AR-NAR Mixture-of-Transformersバックボーンでスコアとセマンティックトークンを記述し、フローマッチングを介して音響的潜在表現を生成、VAEによってステレオ音声へと変換する仕組みを採用している。

スペック

  • アーキテクチャ: AR-NAR Mixture-of-Transformers (YuE2ForCausalLM)
  • 出力の仕様: 48 kHz ステレオ音声
  • 対応言語: 中国語 (zh)、英語 (en)
  • ライセンス: cc-by-nc-4.0 (商用利用不可)
  • パラメータ数: 3.6B

性能・品質

モデルカードでは、WildSongBenchおよびSHS100Kにおける評価結果が公表されている。

→ 横にスクロールできます

Model Musicality ↑ SongBench Avg ↑ MuLan ↑ AllMusicCaps ↑ Q3O ↑ PER ↓
YuE 1 4.0847 4.9165 0.2623 0.2882 3.7301 36.38%
SongBloom 3.4493 4.2350 0.2697 0.1926 3.0287 19.19%
LeVo 2 5.4590 6.3247 0.3542 0.2680 3.9458 26.12%
ACE-Step 1.5 5.1588 6.0118 0.4372 0.3869 4.5809 7.46%
HeartMuLa 5.4963 6.2483 0.3823 0.2786 3.4907 10.71%
DiffRhythm 2 4.4775 5.2428 0.3782 0.3255 4.0870 18.41%
Muse 5.1692 6.0349 0.3937 0.3466 4.4038 33.42%
MiniMax Music 3 5.3482 6.2830 0.3928 0.3609 4.4362 6.27%
YuE2 5.9075 6.7316 0.5068 0.4054 4.6819 8.44%
YuE2 (best-of-8) 6.2666 6.9632 0.5051 0.3980 4.7009 9.79%

→ 横にスクロールできます

Model Musicality ↑ SongBench Avg ↑ MuLan ↑ AllMusicCaps ↑ Q3O ↑ PER ↓
Suno v5 5.9918 6.8721 0.5428 0.4353 4.5907 8.10%
Suno v4.5 5.8317 6.6995 0.5022 0.3873 4.4149 5.80%
Suno v5.5 5.8087 6.7150 0.5089 0.3917 4.5914 5.96%
MiniMax Music 2.6 5.4437 6.3222 0.4251 0.3670 4.5688 24.55%
Mureka 9 6.0488 6.9377 0.4394 0.4102 4.6368 11.69%
YuE2 5.9075 6.7316 0.5068 0.4054 4.6819 8.44%
YuE2 (best-of-8) 6.2666 6.9632 0.5051 0.3980 4.7009 9.79%

WildSongBenchの評価において、YuE2 (best-of-8)はSongBench平均で6.9632を記録し、比較されたオープンおよびプロプライエタリモデルの中で最高値を達成していると報告されている。一方で、PER(低いほど良い指標)などの項目では一部のモデルに及ばない数値も見られる。

得意なこと・想定用途

  • テキストからの楽曲生成(歌詞とスタイルプロンプトの入力による完全な楽曲制作)
  • 既存楽曲のカバー制作(既存の曲を新しいスタイルに再構築)
  • 編集可能なスコア(メロディとコード、メロディのみ、あるいはABCスコアの持ち込みによる構成と編集)
  • エージェントを活用した編集(音楽的フィードバックをスコア、スタイル、歌詞のリビジョンに反映させ、次バージョンをレンダリング)

動作環境

動作環境の目安(Local Model Watch 算出) — パラメータ数 3.6B

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
RTX 4070 / 3060 12GB など 12GB BF16 6.8GB 8.1GB

推論エンジンの対応状況(各プロジェクトのソースにあるモデル登録表とアーキテクチャ名を当サイトが機械的に照合。2026-09-18 時点): llama.cpp: 未登録、vLLM: 未登録、MLX (mlx-lm): 未登録。「未登録」はその時点の登録表に名前が無いという意味で、動かないことの断定ではありません。

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

入手方法

  • 配布形式: safetensors
  • 入手先・関連リポジトリ: Hugging Face上の m-a-p/YuE2-3B

関連記事

出典