世界クラスの音声俳優を構築したいと想像してみてください。通常、これを実現するには、巨大で高価なスタジオ、数百万時間の録音スクリプト、そして超複雑な機械を構築するためのエンジニアチームが必要です。まるで、工場で大量の産業用オーブンと希少で独自の材料を使って、ミシュラン星付きのケーキを焼こうとするようなものです。
PilotTTS はアリババの高德地図(Amap)チームから生まれた新しいレシピであり、「工場は不要だ。本当に質が高く、規律あるキッチンと、手持ちのものを賢く使う方法があれば十分だ」と述べています。
彼らがどのようにしてこれを実現したか、簡単に説明します。
1. 「清潔なキッチン」(データ処理)
ほとんどの AI 音声モデルは、インターネットから収集された散漫なデータで訓練されています。まるで、虫が入った小麦粉を使って焼き菓子を作ろうとするようなものです。
- 従来の方法: チームはしばしば、秘密の高価なツールを使ってデータを整理し、他の研究者を遠ざけています。
- PilotTTS の方法: 彼らは無料のオープンソースツールのみを使用して「クリーニングパイプライン」を構築しました。これは、すべての音声クリップを洗浄、仕分け、検査するコンベアベルトのようなものです。
- 音声がクリアか(雑音や背景ノイズがないか)を確認します。
- 人々が重なって話している部分を切り取ります。
- すべてを完璧にラベル付けします(誰が話しているか、何を言っているか、どのように言っているか)。
- 結果: 彼らは、インターネット上の散漫な音声の山を、20 万時間もの高品質データからなる完璧なライブラリに変えました。これは、廃棄物置き場を完璧に整理された図書館に変えるようなものです。
2. 「賢いシェフ」(モデルアーキテクチャ)
彼らは、千もの可動部品を持つ巨大で複雑なロボットを構築する代わりに、「モジュール式」のアプローチを採用しました。既存の証明済みのツールを取り出し、それらを新しい賢い方法で接続しました。
- 脳: 彼らは強力な言語モデル(Qwen3)を脳として使用し、テキストを理解させました。
- 「デカップリング」のトリック: これが彼らの秘密のソースです。通常、AI が声を模倣しようとすると、その人物が「誰」であるか(固有の音色)と、その人物が「どのように」話しているか(感情や速度)の間で混乱します。
- PilotTTS は 2 つの独立した「センサー」(Q-Former と CAMPPlus エンコーダー)を使用します。一方のセンサーはアイデンティティ(声そのもの)にのみ焦点を当て、もう一方はスタイル(感情、速度、アクセント)に焦点を当てます。
- アナロジー: 画家を想像してください。一つの筆がその人物の顔(アイデンティティ)を描き、もう一つの筆がシーンの雰囲気(スタイル)を描きます。筆を別々に保つことで、画家は人物の顔を偶然に変えることなく、雰囲気を変えることができます(人物を悲しくしたり、幸せにしたり)。
3. 何ができるのか?
彼らが「声」と「スタイル」を分離したため、システムは非常に柔軟です。
- ゼロショットクローン: 見知らぬ人の声を 5 秒間与えるだけで、その声で任意のテキストを話させることができます。これは、はるかに大規模なデータセットで訓練された他のシステムよりも優れていました。
- 感情制御: 「悲しそうに」、「怒って」、「心配そうに」話させることができます。11 種類の異なる感情に対応可能です。
- 副言語: 笑い、泣き声、咳、呼吸などの人間の音を追加できます。さらに、「巻き込まれた笑い」も可能です。これは、話す前にまたは後に笑うのではなく、話しながら笑う状態です。
- 方言: 14 種類の中国語方言を話せます。たとえ標準語(マンダリン)でプロンプトを与えられたとしても、話者の元の声のアイデンティティを維持したまま、特定の方言に出力を切り替えることができます。
4. 結果
彼らはこのシステムを他のトップクラスの音声モデルと比較してテストしました。
- 精度: 発言内容における誤りが非常に少なかった(誤り率が低い)。
- 声の一致: 競合他社が使用した数百万時間と比較して、はるかに少ないデータ(20 万時間)で訓練されたにもかかわらず、ほぼすべてのテストされたシステムよりも元の話者に似ていました。
- 効率性: 独自のデータや巨大で複雑なアーキテクチャを必要とすることなく、これらの結果を達成しました。
結論
PilotTTS は、無限のリソースを持つ巨大なテック企業でなくても、トップクラスの AI 声を構築できることを証明しています。データの質に対して規律を持ち、賢くモジュール化された設計(「誰」と「どのように」を分離する)を使用することで、彼らはこの分野の最大手と競争力のあるシステムを創り出しました。
彼らはその「レシピ」(コードとデータパイプライン)を一般に公開しました。したがって、誰でもこの「清潔なキッチン」と「賢いシェフ」の独自バージョンを構築できます。
技術サマリー:PilotTTS
問題定義
最先端の音声合成(TTS)システムの現在の潮流は、数百万時間規模の巨大な専有データセットと、マルチコードブックトークナイザー、多段階パイプライン、専用サブモデルを含む日益に複雑化するアーキテクチャに大きく依存しています。この傾向は、そのようなデータの取得と処理に大規模なインフラを必要とし、アーキテクチャの複雑さがエンジニアリングの労力と展開コストを膨らませるため、リソース制約のある研究チームや商用展開にとって大きな障壁となっています。さらに、感情、パラ言語、方言といった高度な制御機能は、しばしば別個のシステムとして開発され、専門性が分断されています。本論文は、アーキテクチャの新規性や極端なデータ規模ではなく、厳密なデータエンジニアリングと適切に統合されたオープンソースコンポーネントを通じて競争力のある性能を達成する、より複雑さの少ない再現可能な代替案が必要であると主張しています。
手法
PilotTTS は、オープンソースツールのみを使用して処理された約 20 万時間のトレーニングデータで高い性能を達成するように設計された軽量な自己回帰型 TTS システムです。このシステムは以下の 4 つの主要コンポーネントで構成されます。
1. データ処理パイプライン
公開モジュールから構築された再現可能な 3 段階パイプラインが、生インターネット音声をクリーンで注釈付きのデータセットに変換します。
- 品質評価と強化: 音声は標準化され、音声活動検出(SAD)および話者変化検出(SCD)を介してセグメント化され、DNSMOS、音声/非音声分類、および SNR 推定を用いて品質が評価されます。低品質のセグメントはノイズ除去と強化の対象となります。
- ラベル注釈: 音声はクロスシステムの一貫性のために複数の ASR システム(Paraformer、FireRedASR、Whisper)を使用して文字起こしされます。重複音声検出、強制アライメント、およびプロソディ注釈(Qwen3-Force-Alignment 経由)が適用されます。話者タグ付けは 3D-Speaker-Toolkit を用いて行われ、スペクトルローオフ分析が低帯域幅の録音物をフィルタリングします。
- 品質フィルタリング: サンプリングは、トリミング、合成音声検出、および音響品質、音声有効性、メタデータの包括的な集約に基づいてフィルタリングされます。これにより、高品質な中国語および英語データが約 20 万時間生成されます。
2. モデルアーキテクチャ
- 音声トークナイザー: CosyVoice 3 から単一コードブックの有限スカラー量子化(FSQ)を利用し、25 Hz で動作し、コードブックサイズは 6,561 です。言語的およびパラ言語的属性を符号化するために、多タスク目的(ASR、LID、SER、AED、SA)で事前学習されています。
- 自己回帰型テキストから意味へのモジュール: Qwen3 言語モデル(0.6B パラメータ)を基盤としています。これはデカップリングされた条件付けメカニズムを採用しています。
- 凍結されたCAMPPlusエンコーダーが静的な話者アイデンティティ埋め込みを抽出します。
- Q-Formerベースの意味コンテンツアダプターが、参照音声から(w2v-BERT 埋め込みを使用して)動的な話スタイルとプロソディの手がかりを抽出します。
- クロスサンプル対トレーニングが、条件付け器にコンテンツに依存しない話者アイデンティティを符号化させるために使用され、ゼロショットクローン化と制御性を容易にします。
- 音声デコーダー: 条件付きフローマッチング(CFM)デコーダーであり、拡散トランスフォーマ(DiT)バックボーン(300M パラメータ)を備え、意味トークン、話者埋め込み、および参照メルスペクトログラムからメルスペクトログラムを合成します。
- ボコーダー: HiFi-GAN が生成されたメルスペクトログラムを波形に変換します。
3. 制御戦略
- 感情制御: 約 2,200 時間の感情ラベル付きデータでのポストトレーニングにより達成され、11 カテゴリ(7 つの主要カテゴリ、4 つの拡張カテゴリ)をサポートします。
- パラ言語合成: 約 200 時間のデータでの教師あり微調整により、笑い、呼吸、泣き声、咳をサポートします。「ラフスパラ(wrapped laughter)」モード(LAUGH_SPAN)という独自の機能を含みます。
- 方言合成: データ不足に対処するため、並列の「方言 - 普通話」ペアを構築し、約 16,000 時間の方言データでの微調整中に混合プロンプトサンプリングを採用します。
主要な貢献
- 再現可能なデータパイプライン: 完全にオープンソースツールから組み立てられた多段階パイプラインにより、チームは低コストで生インターネット音声から高品質なトレーニングデータセットを構築できます。
- デカップリングされた条件付けを備えたコンパクトなアーキテクチャ: クロスサンプルトレーニングと組み合わされた Q-Former ベースの条件付けメカニズムにより、話者アイデンティティと話スタイルを効果的に分離し、限られたデータで高い話者類似性と内容の正確性を達成します。
- 多次元制御性: ゼロショット音声クローン化、感情合成(11 カテゴリ)、パラ言語合成(4 カテゴリ+ラフスパラ)、および中国語方言合成(14 方言)をターゲットとしたポストトレーニングを通じてサポートする統一フレームワーク。
実験結果
Seed-TTS Eval ベンチマークおよび特定の制御タスクで評価されました。
- ゼロショット生成: PilotTTS は、中国語(0.862)および英語(0.815)のテストセットの両方で最も高い話者類似性を達成し、はるかに大規模なデータセットでトレーニングされたシステムを上回りました。英語では最低の単語誤り率(WER)1.50% を達成し、中国語では文字誤り率(CER)0.87% を達成し、後者については MiniMax-Speech(0.83%)に次ぐ 2 位となりました。
- 感情制御: 主要な感情において平均成功率 88.1% を達成し、CosyVoice 3(83.8%)を上回りました。感情制御条件下では、中立合成と比較して最小の低下で最も高い話者類似性(0.7329)を維持しました。
- パラ言語: 一般的なカテゴリ全体で 85.1% の総合成功率を達成し、CosyVoice 3(80.4%)および Fish-Speech S2(64.3%)を上回りました。「ラフスパラ(94.6%)」および泣き声(61.9%)において独自の成功を示しました。
- 方言合成: 同方言シナリオで 91.8% の精度、普通話から方言への転移で 86.46%、異方言シナリオで 85.38% の精度を達成しました。
意義と主張
本論文は、PilotTTS が、競争力のある最先端の TTS パフォーマンスが、数百万時間規模の専有データや複雑な多段階アーキテクチャを厳密に必要としないことを実証していると主張しています。データエンジニアリングと確立されたオープンソースコンポーネントの統合を優先することで、著者らは、わずか 20 万時間でトレーニングされたシステムが、話者の忠実度と内容の正確性において、より大規模で複雑なモデルを上回ることを示しました。
その意義は、研究コミュニティおよび商用エンティティへの参入障壁を下げることにあります。完全なデータパイプラインレシピ、事前学習済み重み、およびコードの公開により、リソース制約のあるチームは、現在の最先端トレンドに伴う莫大なコストなしに、競争力のあるシステムを構築したり、既存のアプローチを洗練させたりできます。著者らは、PilotTTS を、表現力とエンジニアリングの実現性のバランスを取った実用的で展開可能なソリューションとして位置づけています。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録