トルコ語の合成音声データセット「alania-synthetic-speech-tr」公開

基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | cloud0day3/alania-synthetic-speech-tr |
| 公開日 | 2026-09-30 |
| 出典の種類 | 未確認(一次情報で裏付けできていない)(個人ユーザーのHFデータセットで、公式一次情報ではないため未確認) |
情報を集めた時点で、当サイトのコードが確定させた値です。日付はJSTで表示しています。
概要
トルコ語の合成音声データセット「alania-synthetic-speech-tr」が公開されたと報告されています。ただし、本記事の執筆時点では公式な発表が確認されていない未確認の情報であることにご注意ください。本データセットは、テキストから音声を生成する(TTS)および音声をテキストに変換する(ASR)モデルの訓練を目的とした、合計3.451時間に及ぶ大規模なトルコ語音声データ群であるとされています。
収録されている音声のすべてはAIによって生成されており、データセット内に実在する人物の音声は一切含まれていないと報告されています。トルコ語のオープンなTTSデータセットが非常に少ない現状を改善するため、PatientDesk AIのトルコ語音声モデル「Alania-2」の開発過程で作成されたデータの一部を、コミュニティが広く利用できるように公開したものとされています。
スペック
資料から確認できる本データセットの主な仕様は以下の通りです。
- 合計収録時間: 3.451時間(2.051.810レコード)
- サンプリングレート: 48 kHz
- 音声構成: 設計された2.752種類の音声ID、および1回限りの設計音声
- 性別バランス: 女性 約53,5%、男性 約46,5%
- 生成モデル:
openbmb/VoxCPM2(Apache-2.0) - 生成設定: 10ディフュージョンステップ、2,0ガイダンススケール(2026年9月時点)
- 読み上げ形式:
reference: 設計された音声による通常の読み上げ –reference+instruction: 「落ち着いた看護師のように、ゆっくりと柔らかく」といったスタイル指示に従った読み上げ –voice-design: テキストによる記述のみから生成された新しい音声- 収録テキスト: 予約、銀行、配送、サポート等の日常的なサービス用語、数字、日付、時刻、住所、名前、およびウェブや百科事典のテキスト
- ライセンスの条件:
cc-byおよびvoices設定は CC BY 4.0、cc-by-sa設定はトルコ語版Wikipediaを含むため CC BY-SA 4.0。商用利用やモデル訓練を含むあらゆる目的で使用可能ですが、PatientDesk AIへの帰属表示(アトリビューション)が必須とされています。
性能・品質
公開元によるデータセットの構成と品質管理の結果として、以下の内容が報告されています。
→ 横にスクロールできます
| 構成 | テキスト内容 | ライセンス | レコード数 | 時間 |
|---|---|---|---|---|
cc-by (デフォルト) |
音声アシスタント用文章および FineWeb-2 トルコ語 | CC BY 4.0 | 1.671.085 | 2.592 |
cc-by-sa |
トルコ語 Wikipedia | CC BY-SA 4.0 | 380.725 | 859 |
voices |
各設計音声のリファレンス録音、テキスト、記述 | CC BY 4.0 | 2.752 音声 |
データの品質を担保するため、すべてのレコードに対して以下の自動品質チェックが実施されたとされています。
Whisper large-v3 (turbo)による検証: 文字誤り率(CER)が最大5%以内、または修正が1箇所のみであることUTMOS22: スコアが2,5以上であること- 音声の類似性と性別の整合性チェック:
ECAPAによるリファレンス音声との類似性確認、およびピッチによる性別判定 - 話速: 1秒あたり7–25文字の範囲内
- フィルタリング: 生成器に由来する7–12 kHz帯のわずかなノイズを除去
これらの自動チェックの結果、中央値としてCER 0,0、UTMOS 3,59という高い品質スコアが確保されていると報告されています。なお、CERは音声認識の文字単位の誤り率を示す指標であり、数値が低いほど優秀であることを意味します。
一方で、2026年10月1日に判明した既知の問題(v1.0)として、140.338レコード(約343時間、全体の約7%)において、略語をアルファベット名で読み上げてしまう(例:「KDV」を「kadeve」ではなく「ke de ve」と読む)、あるいはローマ数字を文字として読んでしまう不具合が含まれていると報告されています。これらのレコードはフィルタリング用のリストが提供されており、次バージョンのv1.1で修正される予定とされています。
また、本データセットはあくまで合成音声であるため、生成モデルである VoxCPM2 特有のアクセントや抑揚が含まれ、実際の肉声よりも均質でクリーンすぎる傾向があるとされています。そのため、実用的なモデルの訓練においては、本データセット単体ではなく実際の肉声データと組み合わせて使用することが推奨されています。
得意なこと・想定用途
本データセットは、トルコ語における音声合成(TTS)および音声認識(ASR)の基盤モデルや派生モデルの学習を主な用途として想定しています。特に、オープンライセンスで利用できる高品質なトルコ語音声コーパスが不足している領域において、大規模な訓練リソースとしての活用が期待されています。
具体的には、以下のような開発や実験に向いているとされています。
- 多様な話者とスタイル指示に対応したTTSの構築: 2.752種類の固定された音声IDに加えて、「落ち着いた看護師のように」といった自然言語の指示(instruction)による発話スタイル制御や、テキストの記述から新たな声を設計するボイスデザイン機能の訓練に適しています。
- 日常サービス領域に特化した対話エージェント: 予約受付、銀行業務、配送状況の確認、カスタマーサポートなどで頻出する数字、日時、金額、電話番号、住所、人名といった正規化が必要な表現が豊富に含まれており、実務的な音声アシスタントの開発に役立ちます。
- 現実の音響環境を想定したASRや頑健なTTSの学習: 全レコードの約45%には、シミュレートされた部屋の反響、各種マイク(ヘッドセット、ピンマイク、ノートPC、スマートフォン)、背景ノイズ、音量変動が適用された
audio_channelデータが含まれています。これにより、クリーンな音声だけでなく、ノイズ環境下での認識・生成モデルの耐性強化に利用できます。 - ライセンス上の懸念を抑えたデータ拡張: 実在する人物の音声を含まない完全な合成データであるため、肖像権や声の権利に関する制約を回避しながら、既存の肉声データセットの不足分を補う拡張データとして活用できます。
なお、公開元は責任ある利用として、生成された音声を実在の人物のなりすましや人間の肉声と偽って使用しないこと、また法令(EU AI法など)で義務付けられている場合はAI生成であることを明示することを求めています。
入手方法
本データセットは、Hugging Faceのデータセットリポジトリ cloud0day3/alania-synthetic-speech-tr にてParquet形式で公開されていると報告されています。
Gatedデータセット(利用規約の事前同意が必要な制限)には指定されていないため、Hugging Faceのアカウントがあれば直接ダウンロードや読み込みが可能です。
Python環境からは、Hugging Faceの datasets ライブラリをはじめ、polars や dask などを利用して読み込むことができます。例えば、datasets ライブラリを用いる場合は、以下のように構成を指定してデータを取得できます。
from datasets import load_dataset
# デフォルトの cc-by 構成を読み込む場合
dataset = load_dataset("cloud0day3/alania-synthetic-speech-tr", "cc-by")
用途に応じて、Wikipedia由来のテキストを含む cc-by-sa や、各話者のリファレンス情報がまとまった voices の構成を指定して読み込むことも可能です。また、v1.0に含まれる略語等の読み間違いを避けるためのフィルタリング用ファイル known_issues/initialism_readings_v1.0.csv.gz もリポジトリ内で提供されています。
次に読むなら
- 記事に出てくる CER の読み方を知る → ベンチマーク用語集
出典
この記事は未確認情報を含みます。 公式の一次情報で裏が取れ次第、更新履歴を追記して反映します。
