Speaker Group Encoding in Self-supervised Speech Recognition Models
यह शोध पत्र इस बात की जांच करता है कि स्व-पर्यवेक्षित (self-supervised) वाक् पहचान मॉडल विभिन्न प्रशिक्षण चरणों में वक्ता समूह की जानकारी को कैसे एनकोड करते, यह प्रकट करते हुए कि जहाँ वक्ता पहचान फाइन-ट्यूनिंग ध्वन्यात्मक विविधताओं को बढ़ा देती है और एएसआर (ASR) फाइन-ट्यूनिंग उन्हें ध्वन्यात्मक रूप से हटाते हुए अर्थ संबंधी विविधताओं को बनाए रखती है, वहीं निष्पक्षता बढ़ाने वाले एल्गोरिदम मुख्य रूप से ध्वन्यात्मक पूर्वाग्रहों को कम करते हैं, जिससे अधिक न्यायसंगत एएसआर प्रणालियों को डिजाइन करने के लिए अंतर्दृष्टि प्राप्त होती है।