当社偽音声生成ツールの構成
偽音声検出(FVD)の学習・評価に用いる当社の偽音声生成ツールの構成を、国際的な偽音声検出の評価チャレンジ「ASVspoof 5」の攻撃システム一覧(Table 2)の比較形式に準じて示します。研究用途と商用(有償サービス・製品)用途で、基盤とする音声合成モデルを使い分けています。
| 比較項目 | TTS-NNW 基盤:XTTS v2 |
TTS-VS 基盤:XTTS v2 |
CosyVoice 3版 基盤:Fun-CosyVoice3 |
|---|---|---|---|
| 用途 | 研究・論文 非商用に限定 |
研究・論文 非商用に限定 |
有償の鑑定・解析サービス 商用版の音声合成 商用利用可 |
| 種別Category | ゼロショットTTS (音声クローン) |
ゼロショットTTS (複数音声による話者適応) |
ゼロショットTTS (音声クローン) |
| テキストエンコーダText encoder | Transformer(GPT-2型) 入力:日本語テキストを正規化 → ローマ字化 → BPEトークン |
TTS-NNWと同じ 入力:数字のかな読み変換 → ローマ字化 → BPEトークン |
Transformer言語モデル(約0.5B) 入力:日本語テキストを正規化 → OpenJTalkで発音どおりのカタカナに変換 → テキストトークン |
| 音響デコーダAcoustic decoder | 自己回帰Transformer(GPT-2型)で離散音声トークン(21.5 Hz)を予測 ※音素長は明示的に予測しない |
TTS-NNWと同じ | 自己回帰言語モデルで離散音声トークン(25 Hz)を予測 → flow matching(DiT)でメルスペクトログラムを生成 |
| 話者エンコーダSpeaker encoder | H/ASP(ResNet系、512次元) +Perceiver(話し方の条件付け) |
H/ASP(複数音声の平均) +Perceiver(代表音声) |
CAM++ +参照音声の音響特徴(flow matchingに入力) |
| ボコーダVocoder | HiFi-GAN (潜在表現から直接波形を生成) |
TTS-NNWと同じ | HiFT(NSF+iSTFT型) 位相をiSTFTで明示的に扱う |
| 基盤モデルReference | XTTS v2 | XTTS v2 | Fun-CosyVoice3 |
| FVD用データの作り方Dataset design | パラレル (同一話者・同一テキスト) |
非パラレル (任意テキスト) |
パラレル (同一話者・同一テキスト) |
TTS-NNW・TTS-VSは、非商用ライセンス(Coqui Public Model License)の音声合成モデルXTTS v2を基盤とするため、研究・論文の用途に限定して使用しています。有償の鑑定・解析サービスと、音声合成ソフトウェアの商用版は、Apache-2.0ライセンスで公開されているFun-CosyVoice3を基盤とするCosyVoice 3版で提供しています。いずれのツールも、対象話者の音声によるモデルの再学習は行いません。
比較形式の出典:X. Wang et al., “ASVspoof 5: Design, Collection and Validation of Resources for Spoofing, Deepfake, and Adversarial Attack Detection Using Crowdsourced Speech,” arXiv:2502.08857, 2025(Table 2)。構成の出典:E. Casanova et al., “XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model,” Interspeech, 2024;Z. Du et al., “CosyVoice 3: Towards In-the-wild Speech Generation,” arXiv:2505.17589, 2025。
