Computational Narrative Understanding for Expressive Text-to-Speech
यह शोधपत्र LibriQuote प्रस्तुत करता है, जो ऑडियोबुक्स से प्राप्त 5.3K घंटों के अभिव्यंजक चरित्र उद्धरणों का एक बड़े पैमाने का डेटासेट है जिसे संदर्भगत छद्म-लेबल (contextual pseudo-labels) से समृद्ध किया गया है, जो यह प्रदर्शित करता है कि इस डेटा पर फाइन-ट्यूनिंग या प्रशिक्षण करने से टेक्स्ट-टू-स्पीच मॉडलों की अभिव्यंजना और बोधगम्यता में महत्वपूर्ण वृद्धि होती है।