inclusionAI、全二重音声・動画対話モデル「Realtime-Venus」公開

作例は配布元のモデルカードで公開されています。
基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | inclusionAI/Realtime-Venus |
| 公開日 | 2026-09-16 |
| ライセンス | apache-2.0 |
| 配布形式 | ONNX / safetensors |
| 論文 | arXiv:2609.13814 |
| 出典の種類 | 公開元の一次情報(公式HFリポジトリ) |
収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。
作例は配布元のモデルカードで公開されています。
作例は配布元のモデルカードで公開されています。
作例は配布元のモデルカードで公開されています。
作例は配布元のモデルカードで公開されています。
概要
inclusionAIは、非同期委任と能動的な全二重対話を特徴とするマルチモーダル対話システム「Realtime-Venus」を公開しました。入力された動画や音声、テキストを継続的に知覚しながら、共有された因果タイムライン上でテキストと音声波形を出力できるモデル群です。
リポジトリには、映像と音声を統合して処理する9B規模の「Realtime-Venus-Omni」と、音声対話に特化した9B規模の「Realtime-Venus-Audio」の2種類のチェックポイントが含まれています。双方がネイティブな全二重ストリーミング対話に対応しており、モデル自身が発話している最中も外部入力を聞き続け、ユーザーの相槌や割り込み、発言の訂正などを判別して自律的に応答タイミングを制御します。
スペック
公開されたモデルカードおよび技術資料に基づく主なスペックは以下の通りです。
- パラメータ数: 9B(Realtime-Venus-Omni、Realtime-Venus-Audioともに)
- ベースアーキテクチャ: MiniCPM-o 4.5 / Omni-Flow
- 言語バックボーン: Qwen3-8B
- ビジュアルエンコーダ: SigLIP2(Realtime-Venus-Omniで使用。Realtime-Venus-Audioでは推論時に使用されません)
- オーディオエンコーダ: Whisper-Medium
- 音声生成デコーダ: 離散S3音声トークン(Discrete S3 speech tokens)とストリーミングFlow Matchingデコーダを採用
- 入力仕様:
- Realtime-Venus-Omni: 動画、静止画像、音声、テキスト – Realtime-Venus-Audio: 音声、テキスト(入力音声は16kHzモノラル)
- 出力仕様: テキストおよび音声波形(全二重ストリーミング時の生成音声は24kHzで出力)
- コンテキスト長: 最大40,960トークン(オフラインチャット時の入力トークン上限設定は32,768トークン)
- 重み精度: BF16
- 長尺動画機能: 追加学習なしで過去の視覚的瞬間を保持・検索する「Training-free long-video Memory」を搭載(Realtime-Venus-Omni)
- ライセンス条件: Apache 2.0(商用利用および改変が認められているオープンソースライセンス)
性能・品質
公開元が発表した技術報告(arXiv:2609.13814)において、動画理解、音声理解・音声質問応答、全二重対話の各ベンチマークスコアが報告されています。
Realtime-Venus-Omniは、オンラインで評価されたモデルの中で、全8種類の動画ベンチマークのうち6つで最高スコアを記録したと公表されています。具体的なスコアは以下の通りです。
- StreamingBench: 70.2%
- OVO-Bench: 64.7%
- Daily-Omni: 81.3%
Realtime-Venus-Audioについては、8種類の音声理解および音声質問応答ベンチマークにおいて、比較対象のモデルをリードする結果が示されています。
- MMAU: 78.0%
- MMAU-Pro: 63.2%
- Llama Questions: 83.8%
- Speech CMMLU: 67.8%
- VoiceBench AlpacaEval: 4.81(比較対象中の最高スコアと同等)
また、全二重対話のインタラクション性能を評価する「Full-Duplex-Bench v1.5」において、Realtime-Venus-Audioはユーザーからの割り込みに対して75%の確率で適切に応答しました。さらに、ユーザーが単なる相槌(backchannels)を打った際の発話継続率は97%、第三者への話しかけ(other-directed speech)時の継続率は88%、環境雑音などの背景音声(background speech)下での継続率は86%に達しています。公開元によると、これら3つの発話継続指標すべてにおいてGemini 3.1 LiveおよびGPT-4oのスコアを上回る耐性を示したと報告されています。
得意なこと・想定用途
Realtime-Venusは、連続的な音声・映像ストリームのリアルタイム処理と能動的な応答機能を備えており、以下のようなマルチモーダル対話や自動化タスクで威力を発揮します。
- 能動的なマルチモーダル監視と応答 (Omni): ユーザーから明示的にプロンプトが入力されるのを待つだけでなく、カメラ映像やマイク音声をリアルタイムで監視し、特定のイベント(例:お湯が沸く、スポーツのハイライト、人物の動きなど)を検出したタイミングでモデル自らが自律的に発話を開始できます。
- 高度な全二重音声会話: 自身が発話している最中もマイク入力を連続して受け付けます。ユーザーが打つ相槌(バックチャネル)や周囲の雑音、第三者への話しかけを正確に判別し、発話を途切れさせずに会話を維持します。一方で、ユーザーからの割り込みや指示の変更、質問の訂正には即座に反応して発話を切り替えることが可能です。
- 長尺動画に対する文脈保持と検索 (Memory): Realtime-Venus-Omniには追加のトレーニングを必要としない「Training-free long-video Memory」が搭載されています。最長40分までの長尺動画ストリームにおいて、過去の重要な視覚的・音声的瞬間をアーカイブおよび検索し、過去の出来事に関する質問に対して正確な証拠を再構成して回答できます。
- 非同期での外部ツール実行 (Delegation): 会話ストリームの途中でインストリーム呼び出しリクエストを発行し、バックグラウンドで外部ツールの実行や高度なタスクを非同期処理させることができます。ユーザーとの会話をブロックすることなく、バックエンドの処理結果をシームレスに会話の流れへ統合できます(外部タスク実行には「Realtime-Venus-Harness」を使用)。
- 音声対話および理解への特化 (Audio): Realtime-Venus-Audioを使用することで、映像処理を行わずに16kHzモノラル音声からの直接的な全二重対話や音声理解、音声質問応答を実行できます。出力音声は24kHzで生成されます。
動作環境
動作環境の目安(Local Model Watch 算出)
| 手持ちのVRAM | 選べる量子化 | ファイルサイズ | 必要メモリの目安 |
|---|---|---|---|
| RTX 4090 / 3090 など 24GB | そのままの精度(Realtime-Venus-Audio) | 17.5GB | 20.9GB |
必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。
入手方法
Realtime-Venusのモデル重みおよびカスタムコードは、Hugging Faceのリポジトリ(inclusionAI/Realtime-Venus)からsafetensorsおよびONNX形式でダウンロード可能です。入手時にライセンスへの事前同意手続き(Gated)は不要です。
動作前提条件として、Python 3.10、CUDA環境、および音声・映像処理のためのFFmpegが必要となります。
入手およびセットアップ手順は以下の通りです。
- リポジトリのダウンロード:
huggingface-cliまたはModelScopeを使用してリポジトリ全体(サブディレクトリのRealtime-Venus-OmniおよびRealtime-Venus-Audioを含む)を取得します。
huggingface-cli download inclusionAI/Realtime-Venus --local-dir.
- 依存ライブラリのインストール:
python -m pip install -r Realtime-Venus-Omni/requirements.txt
- モデルの初期化:
Hugging Face TransformersのAutoModelを用い、trust_remote_code=Trueを指定してローカルのサブディレクトリからモデルを読み込みます。
- Realtime-Venus-Omniのロード例:
import torch
from transformers import AutoModel
model = AutoModel.from_pretrained(
"./Realtime-Venus-Omni",
trust_remote_code=True,
local_files_only=True,
attn_implementation="sdpa",
torch_dtype=torch.bfloat16,
).eval().cuda()
- Realtime-Venus-Audioのロード例:
from transformers import AutoModel, AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained(
"./Realtime-Venus-Audio",
trust_remote_code=True,
local_files_only=True,
fix_mistral_regex=True,
)
model = AutoModel.from_pretrained(
"./Realtime-Venus-Audio",
trust_remote_code=True,
local_files_only=True,
attn_implementation="sdpa",
torch_dtype=torch.bfloat16,
init_vision=False,
init_audio=True,
init_tts=True,
).eval().cuda()
ストリーミング全二重処理を行う場合は、読み込んだモデルに対して model.as_duplex() を呼び出して全二重モードに切り替えます。非同期委任(Delegation)やツール連携を行うランタイム「Realtime-Venus-Harness」および各種サンプルコードは、公式のGitHubリポジトリで提供されています。

