ネイティブストリーミング音声認識モデル「Edge0/Audio8-ASR-Infinite」公開

ネイティブストリーミング音声認識モデル「Edge0/Audio8-ASR-Infinite」公開

作例は配布元のモデルカードで公開されています。

基本情報

項目 内容
リポジトリ Edge0/Audio8-ASR-Infinite
公開日 2026-09-22
ライセンス apache-2.0
配布形式 safetensors
出典の種類 公開元の一次情報(Hugging Faceの公式モデルページが一次情報として存在する)

収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。

概要

Edge0は、応答性を極限まで高めるために設計されたネイティブ・ストリーミング音声認識モデル「Audio8-ASR-Infinite」を公開しました。このモデルは、音声入力をリアルタイムでテキストに変換する音声認識(ASR)モデルであり、中国語と英語のバイリンガルに対応しています。

スペック

  • アーキテクチャ: Voxtral realtime audio architectureおよびDSM-style streamingを継承
  • Audio tower: 32 layers, hidden 1280, 128 mel bins, sliding window 750 – Text decoder: 36 layers, hidden 2048, 16 query heads / 2 KV heads – Projector: max frame len 8 → projection size 10240, gelu
  • 出力仕様: 中国語および英語のテキスト
  • ストリーミング設定:
  • 選択可能なオーディオクロック: 80ms / 120ms / 160ms – 設定可能な書き起こし遅延 (target_delay_ms): 240ms〜560ms (クロック設定により異なる)
  • 推奨動作条件(最適化されたポイント):
  • 80msクロック時: frame_len 4, target_delay_ms 240 / 320 / 480 / 560 – 120msクロック時: frame_len 6, target_delay_ms 240 / 480 – 160msクロック時: frame_len 8, target_delay_ms 320 / 480
  • ライセンス: Apache 2.0

性能・品質

480 ms Delay, 80ms frame length(Greedy decode, EOS suppressed)における評価結果は以下の通りです。

→ 横にスクロールできます

test set metric Audio8 ASR Infinite Voxtral-Mini-4B-Realtime-2602 nemotron-3.5-asr-streaming-0.6b
aishell1/test CER 1.750 16.795 12.927@560ms
aishell4/test CER 2.893 16.456 14.677@560ms
librispeech test.clean WER 3.042 2.210 3.353@560ms
librispeech test.other WER 6.808 5.552 7.140@560ms
average 3.623 10.253 (2 sets) 9.524

Audio8 ASR Infiniteは、aishell1/testおよびaishell4/testのCER(文字単位の誤り率)において、比較対象のモデルよりも大幅に低い(優れた)数値を記録しています。一方で、librispeechのtest.cleanおよびtest.otherにおけるWER(単語単位の誤り率)については、Voxtral-Mini-4B-Realtime-2602に劣る結果となっています。全体的な平均値では、Audio8 ASR Infiniteが最も優れたスコアを示しています。

得意なこと・想定用途

本モデルは、応答性を最優先したリアルタイムの音声書き起こしに特化しています。ネイティブなストリーミングアーキテクチャを採用しており、1秒間に12.5回のデコードを行うことで、極めて高いレスポンスを実現しています。また、Rolling KV Cacheを用いることで、メモリ使用量とレイテンシを一定に保ったまま、24時間365日の連続稼働(unlimited-length transcription)が可能です。

主な用途や特徴は以下の通りです。

  • バイリンガル対応: 中国語と英語の書き起こしに対応しています。
  • 柔軟なストリーミング制御: オーディオクロック(80/120/160 ms)と書き起こし遅延(target_delay_ms)を選択でき、認識の粒度とリソースコストのバランスを調整できます。
  • Semantic VAD: 従来の音響的なVAD(発話区間検出)では困難だった、思考によるポーズ、吃音、および実際の発話終了の区別が可能です。
  • 用途: リアルタイムの字幕生成、常時稼働型の音声インターフェースなど。

現在はプレビューリリース版であり、ストリーミング書き起こしのベース機能を提供しています。今後は、同じフレームグリッドと音響フォワードパスを用いた、フレームレベルのセマンティック認識機能の実装がロードマップとして掲げられています。

動作環境

動作環境の目安(Local Model Watch 算出) — パラメータ数 4.1B

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
RTX 4070 / 3060 12GB など 12GB BF16 7.6GB 9.1GB

推論エンジンの対応状況(各プロジェクトのソースにあるモデル登録表とアーキテクチャ名を当サイトが機械的に照合。2026-09-23 時点): llama.cpp: 未登録、vLLM: 未登録、MLX (mlx-lm): 未登録。「未登録」はその時点の登録表に名前が無いという意味で、動かないことの断定ではありません。

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

入手方法

  • 配布形式: safetensors
  • リポジトリ: Edge0/Audio8-ASR-Infinite
  • 対応ツール:
  • transformers ライブラリ(trust_remote_code=True が必要) – vLLM を用いた24/7推論(Docker Composeによるデプロイが推奨されています) – torch によるシミュレーション・ストリーミング・デコード

なお、本モデルはアダプター形式や部分的に変換された重みには対応しておらず、フルマージされた重みディレクトリのみがサポートされています。

関連記事

出典