当社偽音声作成ツールについて

お知らせ

当社偽音声生成ツールの構成

偽音声検出(FVD)の学習・評価に用いる当社の偽音声生成ツールの構成を、国際的な偽音声検出の評価チャレンジ「ASVspoof 5」の攻撃システム一覧(Table 2)の比較形式に準じて示します。研究用途と商用(有償サービス・製品)用途で、基盤とする音声合成モデルを使い分けています。

比較項目 TTS-NNW
基盤:XTTS v2
TTS-VS
基盤:XTTS v2
CosyVoice 3版
基盤:Fun-CosyVoice3
用途 研究・論文
非商用に限定
研究・論文
非商用に限定
有償の鑑定・解析サービス
商用版の音声合成
商用利用可
種別Category ゼロショットTTS
(音声クローン)
ゼロショットTTS
(複数音声による話者適応)
ゼロショットTTS
(音声クローン)
テキストエンコーダText encoder Transformer(GPT-2型)
入力:日本語テキストを正規化 → ローマ字化 → BPEトークン
TTS-NNWと同じ
入力:数字のかな読み変換 → ローマ字化 → BPEトークン
Transformer言語モデル(約0.5B)
入力:日本語テキストを正規化 → OpenJTalkで発音どおりのカタカナに変換 → テキストトークン
音響デコーダAcoustic decoder 自己回帰Transformer(GPT-2型)で離散音声トークン(21.5 Hz)を予測
※音素長は明示的に予測しない
TTS-NNWと同じ 自己回帰言語モデルで離散音声トークン(25 Hz)を予測 → flow matching(DiT)でメルスペクトログラムを生成
話者エンコーダSpeaker encoder H/ASP(ResNet系、512次元)
+Perceiver(話し方の条件付け)
H/ASP(複数音声の平均)
+Perceiver(代表音声)
CAM++
+参照音声の音響特徴(flow matchingに入力)
ボコーダVocoder HiFi-GAN
(潜在表現から直接波形を生成)
TTS-NNWと同じ HiFT(NSF+iSTFT型)
位相をiSTFTで明示的に扱う
基盤モデルReference XTTS v2 XTTS v2 Fun-CosyVoice3
FVD用データの作り方Dataset design パラレル
(同一話者・同一テキスト)
非パラレル
(任意テキスト)
パラレル
(同一話者・同一テキスト)

TTS-NNW・TTS-VSは、非商用ライセンス(Coqui Public Model License)の音声合成モデルXTTS v2を基盤とするため、研究・論文の用途に限定して使用しています。有償の鑑定・解析サービスと、音声合成ソフトウェアの商用版は、Apache-2.0ライセンスで公開されているFun-CosyVoice3を基盤とするCosyVoice 3版で提供しています。いずれのツールも、対象話者の音声によるモデルの再学習は行いません。
比較形式の出典:X. Wang et al., “ASVspoof 5: Design, Collection and Validation of Resources for Spoofing, Deepfake, and Adversarial Attack Detection Using Crowdsourced Speech,” arXiv:2502.08857, 2025(Table 2)。構成の出典:E. Casanova et al., “XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model,” Interspeech, 2024;Z. Du et al., “CosyVoice 3: Towards In-the-wild Speech Generation,” arXiv:2505.17589, 2025。