← Nieuwste papers
⚡ electrical engineering

Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS

Dit paper introduceert een twee-fasen strategie voor prompt-selectie die, door het evalueren van prosodie, audio-kwaliteit en tekst-emotie coherentie, de intensiteit van emotie en de consistentie van de spreker in zero-shot spraaksynthese significant verbetert.

Oorspronkelijke auteurs: Haoyu Wang, Chunyu Qiang, Tianrui Wang, Cheng Gong, Yu Jiang, Yuheng Lu, Chen Zhang, Longbiao Wang, Jianwu Dang

Gepubliceerd 2026-04-06
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Haoyu Wang, Chunyu Qiang, Tianrui Wang, Cheng Gong, Yu Jiang, Yuheng Lu, Chen Zhang, Longbiao Wang, Jianwu Dang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een digitale stemkunstenaar hebt die elke stem na kan bootsen die hij hoort. Hij kan precies klinken als een vriend, een nieuwslezer of een cartoonfiguur, en hij kan ook elke emotie aan nemen: van diep verdriet tot pure vreugde. Dit is wat moderne kunstmatige intelligentie (AI) voor tekst-naar-spraak (TTS) doet.

Maar hier zit een addertje onder het gras: De kwaliteit van het resultaat hangt volledig af van het voorbeeld dat je de AI geeft.

Stel je voor dat je deze AI vraagt om een verhaal te vertellen met veel woede.

  • Als je hem een voorbeeld geeft van iemand die zachtjes fluistert terwijl hij zegt "Ik ben boos", zal de AI het verhaal ook zachtjes en saai vertellen.
  • Als je hem een voorbeeld geeft van iemand die schreeuwt van woede, maar de tekst is heel saai, kan de AI verward raken of de emotie niet goed overbrengen.

De onderzoekers van dit paper (Haoyu Wang en zijn team) hebben een slimme oplossing bedacht, genaamd ExpPro. Ze noemen het een "twee-traps raket" voor het kiezen van het perfecte voorbeeld. Laten we het uitleggen met een paar creatieve vergelijkingen.

De Probleemstelling: Het "Willekeurige Gokje"

Vroeger deden mensen dit zo: ze pakten willekeurig een geluidsfragment uit een grote doos met opnames en hoopten dat het wel goed zou werken. Dat is alsof je een kok vraagt om een gerecht te maken, maar je geeft hem willekeurig ingrediënten uit de koelkast. Soms komt er een heerlijk gerecht uit, maar vaak is het een rommeltje.

De Oplossing: ExpPro (De Slimme Keukenchef)

ExpPro is als een super-chef die niet zomaar kiest, maar in twee fases werkt om de perfecte ingrediënten (de stemvoorbeelden) te selecteren.

Fase 1: De "Kwaliteitscontrole" (Statische Selectie)

Voordat de AI überhaupt begint met praten, kijkt deze chef naar alle mogelijke voorbeelden en filtert hij de slechte eruit. Hij doet dit op drie manieren:

  1. De "Toon" van de Stem (Pitch):
    • Vergelijking: Denk aan een piano. Als je verdrietig bent, speel je lage, trage noten. Als je blij bent, speel je hoge, snelle noten.
    • De AI meet of de stem in het voorbeeld de juiste "hoogte" en "variatie" heeft voor de emotie. Een boze stem moet bijvoorbeeld hoger en onrustiger klinken dan een rustige stem.
  2. De "Smaak" van de Audio (Perceptuele Kwaliteit):
    • Vergelijking: Net zoals je geen eten zou eten dat er vies uitziet of naar vuil ruikt, wil je geen audio dat kraakt, ruis heeft of onnatuurlijk klinkt.
    • De AI checkt of het geluid kristalhelder is.
  3. De "Match" tussen Woorden en Gevoel (Text-Coherence):
    • Vergelijking: Stel je voor dat iemand zegt "Wat een prachtige dag!" terwijl hij in tranen uitbarst. Dat klopt niet.
    • De AI (met hulp van een grote taalmodel) kijkt of de tekst in het voorbeeld echt past bij de emotie. Is de tekst "Ik ben zo blij" en klinkt de stem ook echt blij? Dan is het een goed voorbeeld.

Resultaat van Fase 1: De AI houdt alleen de "top 10%" van de beste voorbeelden over.

Fase 2: De "Contextuele Match" (Dynamische Selectie)

Nu we de beste voorbeelden hebben, moeten we het juiste voorbeeld kiezen voor het specifieke verhaal dat we nu willen vertellen.

  • Vergelijking: Stel je hebt een kast met de 10 beste "boze" stemmen. Je wilt nu een verhaal vertellen over een ruzie in een kantoor. Welke van die 10 stemmen past het beste bij die specifieke ruzie? Misschien is er één stem die heel goed klinkt als iemand die boos is op een collega, en een andere die boos is op een kind.
  • De AI vergelijkt de tekst die je nu wilt laten spreken met de teksten in de overgebleven voorbeelden. Hij kiest het voorbeeld dat semantisch het dichtst bij jouw tekst ligt.

Waarom werkt dit zo goed?

De onderzoekers hebben getest of dit werkt met verschillende AI-systemen (zoals CosyVoice en GPT-SoVITS). De resultaten waren indrukwekkend:

  • Sterkere Emoties: De AI sprak niet alleen "een beetje" boos of blij, maar deed het met de juiste intensiteit.
  • Betere Stemherkenning: De stem klonk consistent als de persoon die je wilde nabootsen, zonder dat het geluid "breekt" of verandert.
  • Geen extra training nodig: Ze hoefden de AI niet opnieuw te leren; ze veranderden alleen hoe ze de voorbeelden kiest.

Conclusie

Kort samengevat: ExpPro is als een slimme regisseur die voor elke scène de perfecte acteur kiest. In plaats van te gokken, kijkt hij eerst of de acteur technisch goed is (Fase 1) en vervolgens of hij de juiste chemie heeft met het script (Fase 2).

Hierdoor krijgen we spraak die niet alleen klinkt als een mens, maar ook echt voelt als een mens, met de juiste emotie en kracht.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →