← नवीनतम पेपर
💬 NLP

Preferences of a Voice-First Nation: Large-Scale Pairwise Evaluation and Preference Analysis for TTS in Indian Languages

यह शोध पत्र 10 भारतीय भाषाओं में बहुभाषी टेक्स्ट-टू-स्पीच (TTS) प्रणालियों के लिए एक नियंत्रित, बहुआयामी युग्म-मूल्यांकन ढांचे को प्रस्तुत करता है, जो एक विश्वसनीय लीडरबोर्ड बनाने, प्रत्यक्ष बोध संबंधी समझौतों का विश्लेषण करने और ब्रैडली-टेरी मॉडलिंग एवं SHAP विश्लेषण के माध्यम से मॉडल प्राथमिकताओं की व्याख्या करने के लिए 120,000 से अधिक मानव तुलनाओं का उपयोग करता है।

मूल लेखक: Srija Anand, Ashwin Sankar, Ishvinder Sethi, Aaditya Pareek, Kartik Rajput, Gaurav Yadav, Nikhil Narasimhan, Adish Pandya, Deepon Halder, Mohammed Safi Ur Rahman Khan, Praveen S V, Shobhit Banga, Mite
प्रकाशित 2026-04-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Srija Anand, Ashwin Sankar, Ishvinder Sethi, Aaditya Pareek, Kartik Rajput, Gaurav Yadav, Nikhil Narasimhan, Adish Pandya, Deepon Halder, Mohammed Safi Ur Rahman Khan, Praveen S V, Shobhit Banga, Mitesh M Khapra

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि भारत एक विशाल, हलचल भरे बाजार की तरह है जहाँ करोड़ों लोग कीबोर्ड पर टाइप करने के बजाय अपनी बातें चिल्लाकर बताने, सवाल पूछने और कहानियाँ सुनाने को प्राथमिकता देते हैं। यही वह चीज़ है जिसे लेखक "वॉयस-फर्स्ट नेशन" (आवाज़-प्रधान राष्ट्र) कहते हैं।

लेकिन समस्या यह है: भारत मसालों के एक बड़े बर्तन की तरह है। इसमें सैकड़ों भाषाएँ हैं, और लोग अक्सर एक ही वाक्य में उन्हें आपस में मिला देते हैं (जैसे कि कहना "मुझे एक chai और एक bus ticket चाहिए")। कंप्यूटर के लिए इन सभी भाषाओं को स्पष्ट रूप, स्वाभाविक रूप से और बिना रोबोट जैसा लगे बोलना अविश्वसनीय रूप से कठिन है।

यह शोध पत्र मूल रूप से कंप्यूटर की आवाजों के लिए एक विशाल "टेस्ट टेस्ट" (स्वाद परीक्षण) है।

यहाँ बताया गया है कि उन्होंने क्या किया, सरल उपमाओं का उपयोग करते हुए:

1. सेटअप: "वॉयस ओलंपिक्स" 🏅

सिर्फ लोगों से यह पूछने के बजाय कि, "1 से 10 के पैमाने पर, यह आवाज़ कितनी अच्छी है?" (जो कि एक जज से किसी जिम्नास्ट को 10 में से स्कोर देने के लिए कहने जैसा है), शोधकर्ताओं ने एक हेड-टू-हेड टूर्नामेंट आयोजित किया।

  • प्रतिस्पर्धी: उन्होंने वर्तमान में उपलब्ध 7 सर्वश्रेष्ठ "टेक्स्ट-टू-स्पीच" (TTS) सिस्टम चुने। इनमें से कुछ प्रसिद्ध व्यावसायिक दिग्गज (जैसे Google का Gemini या ElevenLabs) हैं, और कुछ विशेष रूप से भारतीय भाषाओं के लिए बनाए गए ओपन-सोर्स प्रोजेक्ट्स हैं।
  • जज (निर्णायक): उन्होंने पूरे भारत से 1,900 से अधिक मूल भाषियों (native speakers) को नियुक्त किया। ये केवल साधारण लोग नहीं थे; उन्हें बारीकी से सुनने के लिए प्रशिक्षित किया गया था।
  • एरिना (मैदान): उन्होंने 5,357 अलग-अलग वाक्यों वाला एक "जिम" बनाया। ये वाक्य कठिन डिज़ाइन किए गए थे:
    • द टंग ट्विस्टर्स (जीभ उलझा देने वाले शब्द): उच्चारण में कठिन शब्द।
    • द कोड-मिक्स (मिश्रित भाषा): अंग्रेजी और भारतीय भाषाओं को मिलाने वाले वाक्य (जैसे, "Please book a ticket for Mumbai")।
    • द स्ट्रेस टेस्ट (तनाव परीक्षण): नंबरों, गणितीय सूत्रों और संक्षिप्त रूपों (acronyms) वाले वाक्य।

2. खेल: "ब्लाइंड टेस्ट टेस्ट" (अंधा स्वाद परीक्षण) 🎧

जजों ने दो ऑडियो क्लिप्स (मॉडल A बनाम मॉडल B) को एक साथ सुना, बिना यह जाने कि उन्हें किस कंपनी ने बनाया है।

उन्होंने केवल एक विजेता नहीं चुना। उन्होंने छह अलग-अलग सामग्रियों पर एक व्यंजन को रेट करने वाले फूड क्रिटिक्स (खाद्य समीक्षकों) की तरह काम किया:

  1. स्पष्टता (Intelligibility): क्या मैं शब्दों को समझ सकता हूँ?
  2. अभिव्यक्ति (Expressiveness): क्या यह खुश, दुखी या ऊबा हुआ लगता है?
  3. आवाज की गुणवत्ता (Voice Quality): क्या यह इंसान जैसा लगता है या रोबोट जैसा?
  4. जीवंतता (Liveliness): क्या यह ऊर्जावान है या नीरस?
  5. भ्रम/गलत जानकारी (Hallucinations): क्या AI ने ऐसे शब्द बना दिए जो टेक्स्ट में नहीं थे?
  6. शोर (Noise): क्या बैकग्राउंड में कोई सरसराहट या हिसिंग (hissing) की आवाज़ है?

3. परिणाम: कौन जीता? 🏆

1,20,000 से अधिक तुलनाएँ एकत्र करने के बाद, उन्होंने एक गणितीय सूत्र (एक स्पोर्ट्स रैंकिंग सिस्टम की तरह) का उपयोग करके एक लीडरबोर्ड बनाया।

  • विजेता: Gemini 2.5 Pro TTS ने स्वर्ण पदक जीता। यह लगभग सभी भाषाओं और कठिन वाक्य प्रकारों में सबसे सुसंगत विजेता रहा।
  • उप-विजेता: ElevenLabs V3 और Sonic 3 बहुत करीब थे, जो अक्सर विशिष्ट भाषा के आधार पर अपनी जगह बदलते रहे।
  • द अंडरडॉग (कम अनुमानित विजेता): ओपन-सोर्स मॉडल "Indic F5" सबसे अंत में आया। हालांकि इसने सभी 10 भाषाओं को कवर करने की कोशिश की, लेकिन यह बड़े व्यावसायिक सिस्टमों की चमक और निखार से मुकाबला करने में संघर्ष करता रहा।

बड़ी हैरानी: शोधकर्ताओं ने पाया कि जबकि "शोर" और "भ्रम" (तकनीकी त्रुटियां) महत्वपूर्ण हैं, लेकिन वे मुख्य कारण नहीं हैं जिसकी वजह से लोग एक विजेता चुनते हैं। एक बार जब आवाज़ स्पष्ट हो जाती है और गलतियाँ नहीं करती, तो लोग उस आवाज़ को चुनते हैं जो सबसे अधिक "जीवंत" और "अभिव्यंजक" होती है। यह एक गायक को चुनने जैसा है: यदि वे सही सुर लगाते हैं, तो आप उसे चुनते हैं जिसमें सबसे अधिक आत्मा होती है।

4. भविष्य के परीक्षणों के लिए "हाउ-टू" गाइड 📝

यह शोध पत्र एक व्यावहारिक प्रश्न का उत्तर भी देता है: "एक निष्पक्ष परिणाम प्राप्त करने के लिए हमें कितने जजों और कितने वाक्यों की आवश्यकता है?"

  • जज: आपको स्थिर रैंकिंग प्राप्त करने के लिए हजारों लोगों की आवश्यकता नहीं है। लगभग 200 अच्छे जज यह देखने के लिए पर्याप्त हैं कि कौन स्पष्ट रूप से बेहतर है।
  • वाक्य: आपको एक विविध मिश्रण की आवश्यकता है। लगभग 1,000 अलग-अलग वाक्यों की आवश्यकता होती है जो विभिन्न भाषाओं और विषयों को कवर करते हों ताकि रैंकिंग निष्पक्ष हो सके।

निष्कर्ष (The Takeaway)

यह शोध पत्र AI आवाजों के लिए एक कंज्यूमर रिपोर्ट की तरह है। यह हमें बताता है कि:

  1. हमारे पास जटिल, मिश्रित-भाषा वातावरण में AI आवाजों का निष्पक्षता से परीक्षण करने का एक तरीका है।
  2. वर्तमान में, बड़े व्यावसायिक AI मॉडल भारतीय भाषाओं के लिए दौड़ जीत रहे हैं।
  3. भविष्य के लिए, डेवलपर्स को केवल "त्रुटि-मुक्त" आवाजें बनाने पर ध्यान केंद्रित नहीं करना चाहिए; उन्हें उन्हें मानवीय, भावनात्मक और जीवंत बनाने पर ध्यान देना चाहिए, क्योंकि लोग वास्तव में इसी की परवाह करते हैं।

लेखक अपना सारा डेटा और परीक्षण वाक्य जनता के लिए जारी कर रहे हैं, इस उम्मीद में कि यह अन्य शोधकर्ताओं को दुनिया के 'वॉयस-फर्स्ट' राष्ट्रों के लिए बेहतर, अधिक मानव जैसी आवाजें बनाने में मदद करेगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →