「DiarizationLM-Gemma-4-E4B-v1」音声処理向け大規模言語モデル:必要VRAM 8GB〜

「DiarizationLM-Gemma-4-E4B-v1」音声処理向け大規模言語モデル:必要VRAM 8GB〜

基本情報

項目 内容
リポジトリ google/DiarizationLM-Gemma-4-E4B-v1
公開元のまとめ Google のモデルとライセンスのまとめ
公開日 2026-10-04
ライセンス apache-2.0
配布形式 GGUF / safetensors
論文 arXiv:2401.03506
出典の種類 公開元の一次情報(公式アカウントgoogleがHuggingFaceに公開した一次情報)

情報を集めた時点で、当サイトのコードが確定させた値です。日付はJSTで表示しています。

概要

Googleが開発した音声処理向けの大規模言語モデル「DiarizationLM-Gemma-4-E4B-v1」が公開されました。本モデルは、Googleの「Gemma 4 E4B」をベースモデルとして採用し、Locality-Preserving Oracle Supervision手法を用いてファインチューニングされたモデルです。なお、Googleの公式サポート製品ではないことが明記されています。

本モデルは、自動音声認識(ASR)および話者ダイアライゼーション(話者分離)システムが出力したテキストを受け取り、ターンの境界や相づちの誤りを後処理・修正して最適化された話者ラベル付きテキストを出力します。従来の2話者電話音声に特化したモデルとは異なり、複数話者(最大9人)の会議データセットを含む4つの標準コーパス全域で最適化されている点が特徴です。

スペック

公開されているスペックおよび学習条件は以下の通りです。

  • ベースモデル: google/gemma-4-E4B(アーキテクチャ: Gemma4ForConditionalGeneration、4B dense parameters / 有効パラメータ4.5B、埋め込みを含め8B)
  • タスク・入出力形式: テキスト(話者タグ付きASR仮説)を入力とし、修正後の話者タグ付きテキストを出力します。プロンプト形式は <speaker:N> {text} --> {text} [eod] の構造をとります
  • 最大シーケンス長: プロンプト分割長4,000文字、最大シーケンス長2,560トークン
  • 学習データセット: 計71,825ペア(Fisherデータセット51,063件、Callhome/ICSI/AMIのマルチコーパスデータ20,762件)
  • 学習最適化設定: 10,000ステップ、グローバルバッチサイズ8、オプティマイザはAdamW(beta1 = 0.9、beta2 = 0.99)、ピーク学習率1.5e-4(500ステップの線形ウォームアップおよびコサイン減衰を適用)、Google Cloud TPU v5p 8基で実施
  • ライセンス条件: Apache 2.0(商用利用や改変が可能なオープンライセンス)

性能・品質

公開元が実施した評価結果として、USM + turn-to-diarizeをベースラインとした4つの代表的ダイアライゼーションベンチマークでの評価結果がモデルカードに掲載されています。評価はハンガリアンマッチング動的計画法(diarizationlm.compute_metrics_on_json_dict)を用いて算出されています。

→ 横にスクロールできます

コーパス 評価セット ベースライン (USM + Turn-to-Diarize) DiarizationLM-8b-Fisher-v2 (Llama 3 8B) DiarizationLM-Gemma-4-E4B-v1 (4B)
Fisher (2話者 電話音声) TEST FULL (172セッション) 5.32 [4.93, 5.74] 3.28 2.99 [2.65, 3.37]
Callhome (2〜5話者 電話音声) TEST FULL (20通話) 7.74 [6.07, 9.65] 6.66 4.92 [3.46, 6.75]
ICSI (3〜9話者 会議音声) TEST FULL (3会議) 14.70 [11.65, 20.29] 記載なし 14.10 [10.77, 19.94]
AMI (4話者 会議音声) TEST WORD FULL (16会議) 15.68 [10.64, 21.11] 記載なし 14.89 [9.80, 20.38]

※値はWDER(Word Diarization Error Rate: 単語ダイアライゼーション誤り率、低いほど優秀)。角括弧内の数値は10,000回のリサンプリングによる95%ブートストラップ信頼区間を示します。

本モデルは、先行モデルであるLlama 3 8Bベースの「DiarizationLM-8b-Fisher-v2」と比較して半分のパラメータ数でありながら、Fisherにおいて2.99%、Callhomeにおいて4.92%へと誤り率を低下させています。また、先行モデルでは評価が困難であったマルチ話者会議コーパス(ICSIおよびAMI)に対しても、ベースラインを有意に下回るスコアを達成しています。

なお、ベースモデルである「google/gemma-4-E4B」自体のベンチマーク結果は以下の通り公表されています。

→ 横にスクロールできます

ベンチマーク Gemma 4 31B Gemma 4 26B A4B Gemma 4 12B Unified Gemma 4 E4B Gemma 4 E2B Gemma 3 27B (no think)
MMLU Pro 85.2% 82.6% 77.2% 69.4% 60.0% 67.6%
AIME 2026 no tools 89.2% 88.3% 77.5% 42.5% 37.5% 20.8%
LiveCodeBench v6 80.0% 77.1% 72.0% 52.0% 44.0% 29.1%
Codeforces ELO 2150 1718 1659 940 633 110
GPQA Diamond 84.3% 82.3% 78.8% 58.6% 43.4% 42.4%
Tau2 (average over 3) 76.9% 68.2% 69.0% 42.2% 24.5% 16.2%
BigBench Extra Hard 74.4% 64.8% 53.0% 33.1% 21.9% 19.3%
MMMLU 88.4% 86.3% 83.4% 76.6% 67.4% 70.7%
MMMU Pro 76.9% 73.8% 69.1% 52.6% 44.2% 49.7%
MATH-Vision 85.6% 82.4% 79.7% 59.5% 52.4% 46.0%
CoVoST – – 38.5* 35.54 33.47 –
FLEURS (低いほど良い) – – 0.069* 0.08 0.09 –

ベースモデルのGemma 4 E4Bは、軽量級モデルでありながらMMLU Proで69.4%、GPQA Diamondで58.6%を記録しており、旧世代の大型モデルであるGemma 3 27B(思考なし)を上回る推論性能を備えています。一方で、31Bや26B A4Bなどの上位モデルと比較すると、難関数学(AIME 2026)や競技プログラミング(Codeforces)などの高度な推論タスクでは差がつけられています。

得意なこと・想定用途

本モデルは、自動音声認識(ASR)や既存の話者ダイアライゼーションシステムが出力したテキストに対して、話者ターンの境界判定やラベル付けの誤りを高精度に修正する後処理タスクを得意としています。

具体的には、1〜5単語程度の短い相づち(バックチャネル)や語彙的な発話交代の境界を的確に補正できる一方、6単語以上の長い発言(モノローグ)においては音響的な話者アンカーを維持し、話者ラベルが途中で入れ替わるドリフト現象を防ぐ設計となっています。これにより、以下のような対話・会議音声処理での活用が想定されています。

  • 電話対話のテキスト最適化: 2話者による通話(Fisherなど)から2〜5名程度のくだけた電話対話(Callhomeなど)において、発話交代の重なりや相づちを正確に整理します。
  • 複数人参加の会議録作成: 4名程度の対面会議(AMI)や、最大9名が参加する学術研究会議(ICSI)など、多人数が活発に発言する複雑な環境下での会議録作成および話者同定に適しています。
  • 既存ASRパイプラインの精度向上: 既存の音声認識モデルやダイアライゼーション処理を再学習することなく、出力テキストのフォーマット変換と軽量な推論を追加するだけで単語ダイアライゼーション誤り率(WDER)を改善できます。

なお、ベースモデルである「google/gemma-4-E4B」は画像や音声のネイティブ処理に対応したマルチモーダル基盤モデルですが、本派生モデル「DiarizationLM-Gemma-4-E4B-v1」はテキスト入力されたASR仮説を受け取り、最適化された話者ラベル付きテキストを生成するテキスト処理に特化してファインチューニングされています。

動作環境

動作環境の目安(Local Model Watch 算出) — パラメータ数 8.0B

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
RTX 4060 / 3060 Ti など 8GB Q4_K_M 4.9GB 5.9GB

推論エンジンの対応状況(各プロジェクトのソースにあるモデル登録表とアーキテクチャ名を当サイトが機械的に照合。2026-10-05 時点): llama.cpp: 登録あり、vLLM: 登録あり、MLX (mlx-lm): 登録あり。

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

手元で動かせるか

Ollama・LM Studio・llama.cpp でそのまま動かせます。

GGUF形式で配布されているため、変換を待たずに手元で読み込めます。

ライセンス apache-2.0(商用利用可): 商用利用を含めて自由に利用・改変・再配布できます。再配布時にライセンス文と変更点の告知が必要で、特許の許諾条項があります。

量子化の圧縮率: Q4_K_M は実測 5.26 bit/weight で、元の16bitの重みの約33%のサイズです(配布ファイルの実サイズから当サイトが算出)。

配布形式・当サイトが見つけた変換版・各推論エンジンの登録表を突き合わせた判定です。「確認できていない」は当サイトが見つけていないという意味で、存在しないことの断定ではありません。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。

配布ファイル

google/DiarizationLM-Gemma-4-E4B-v1 で配布されている重みファイルを、Hugging FaceのAPIから当サイトが並べたものです。サイズは実ファイルの値です。

ファイル サイズ
DiarizationLM-Gemma-4-E4B-v1-q4_0.gguf 5.15GB
DiarizationLM-Gemma-4-E4B-v1-q4_k_m.gguf 5.30GB
model.safetensors 15.99GB

入手方法

本モデルはHugging Faceリポジトリ「google/DiarizationLM-Gemma-4-E4B-v1」にて公開されています。ゲート付きモデル(Gated Model)ではないため、追加の利用申請や事前承認を待つことなく直接ダウンロードして利用できます。

重みファイルは以下の形式で提供されています。

  • safetensors: Hugging Faceのtransformersでそのまま読み込み可能な16ビット(bfloat16)形式です。
  • GGUF: 推奨フォーマットである4ビットK-quant Medium(Q4_K_M)およびレガシーな4ビット(Q4_0)が用意されています。推奨版のQ4_K_Mは、256要素のスーパーブロックを採用しつつ、感度の高いattn_vやffn_down、埋め込み行列を6ビット(Q6_K)で保持する構成となっています。

Python(transformers + diarizationlm)での実行手順

Python環境で利用する場合は、関連ライブラリをインストールした上でGPU推論を行います。専用ライブラリdiarizationlmを組み合わせることで、LLMの出力結果を元の仮説テキストへ反映させる後処理がスムーズに行えます。

まず、必要なパッケージを導入します。

pip install transformers diarizationlm

続いて、以下のコードでモデルの読み込みと推論を実行します。

from diarizationlm import utils
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

MODEL_ID = "google/DiarizationLM-Gemma-4-E4B-v1"

HYPOTHESIS = (
    "<speaker:1> Hello, how are you doing <speaker:2> today? I am doing well."
    " What about <speaker:1> you? I'm doing well, too. Thank you."
)

tokenizer = AutoTokenizer.from_pretrained(MODEL_ID, device_map="cuda")
model = AutoModelForCausalLM.from_pretrained(
    MODEL_ID, torch_dtype=torch.bfloat16, device_map="cuda"
)

inputs = tokenizer([HYPOTHESIS + " --> "], return_tensors="pt").to("cuda")

outputs = model.generate(
    **inputs,
    max_new_tokens=int(inputs.input_ids.shape[1] * 1.2),
    do_sample=False,
    use_cache=True,
)

completion = tokenizer.batch_decode(
    outputs[:, inputs.input_ids.shape[1]:], skip_special_tokens=True
)[0]
completion = utils.truncate_suffix_and_tailing_text(completion, " [eod]")

transferred_completion = utils.transfer_llm_completion(completion, HYPOTHESIS)

print("Hypothesis:", HYPOTHESIS)
print("Transferred completion:", transferred_completion)

llama.cppでの実行手順

llama.cppやOllama、llama-cpp-pythonなどの推論エンジンを利用してGGUF版を直接実行することも可能です。llama-cliを用いる場合は、以下のようにコマンドを実行します。

llama-cli \
  -m DiarizationLM-Gemma-4-E4B-v1-q4_k_m.gguf \
  -p "<speaker:1> Hello, how are you doing <speaker:2> today? I am doing well. What about <speaker:1> you? I'm doing well, too. Thank you. --> " \
  --temp 0.0 \
  -n 128

同じ用途の既報モデル

当サイトが取り上げたVLM・マルチモーダルのモデルを新しい順に並べています。用途は配布元がHugging Faceに付けたタスク(pipeline_tag)から機械的に分けたもので、最小のVRAM階層は当サイトの概算です。

VLM・マルチモーダルのモデルをすべて見る →

次に読むなら

出典