How to Leverage Synthetic Speech for LLM-Based ASR Systems?
यह शोध पत्र यह प्रदर्शित करता है कि एक LLM-आधारित ASR आर्किटेक्चर में उन विशिष्ट परतों की पहचान करके जहाँ सिंथेटिक और वास्तविक भाषण भिन्न होते हैं, और वास्तविक दुनिया की ध्वनिक अनियमितताओं की नकल करने के लिए रूम इम्पल्स रिस्पॉन्स के साथ सिंथेटिक डेटा को संवर्धित करके, सिस्टम केवल 25% वास्तविक भाषण रिकॉर्डिंग का उपयोग करके पूर्णतः वास्तविक-डेटा बेसलाइन के बराबर या उससे बेहतर प्रदर्शन प्राप्त कर सकता है।