← नवीनतम पेपर
⚡ electrical engineering

Closing the Gap Between Text and Speech Understanding in LLMs

यह शोध पत्र SALAD को प्रस्तुत करता है, जो एक डेटा-कुशल विधि है जो स्पीच-एडेप्टेड लार्ज लैंग्वेज मॉडल्स में टेक्स्ट-स्पीच समझ के अंतर को दूर करने के लिए लक्षित सिंथेटिक डेटा के साथ क्रॉस-मोडल डिस्टिलेशन को जोड़ती है, जिससे क्षमता विस्मृति (capability forgetting) को कम किया जा सके और क्रॉस-मोडल संरेखण में सुधार किया जा सके, तथा काफी कम प्रशिक्षण डेटा के साथ सार्वजनिक कॉर्पोरा पर प्रतिस्पर्धी प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Santiago Cuervo, Skyler Seto, Maureen de Seyssel, Richard He Bai, Zijin Gu, Tatiana Likhomanenko, Navdeep Jaitly, Zakaria Aldeneh

प्रकाशित 2026-02-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Santiago Cuervo, Skyler Seto, Maureen de Seyssel, Richard He Bai, Zijin Gu, Tatiana Likhomanenko, Navdeep Jaitly, Zakaria Aldeneh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार, विश्व स्तरीय लाइब्रेरियन (एक लार्ज लैंग्वेज मॉडल या LLM) है। इस लाइब्रेरियन ने लाइब्रेरी की लगभग हर किताब पढ़ ली है और वह किसी भी सवाल का जवाब दे सकता है, जटिल पहेलियों को सुलझा सकता है और बेहतरीन कहानियाँ सुना सकता है। वह टेक्स्ट (पाठ) पढ़ने में एक जीनियस है।

अब, कल्पना कीजिए कि आप चाहते हैं कि यह लाइब्रेरियन केवल उनके नोट्स ही न पढ़े, बल्कि लोगों की बातें भी सुने। आप चाहते हैं कि वे पढ़ने के साथ-साथ एक बेहतरीन श्रोता भी बनें।

समस्या: "मफल्ड ईयर" (बधिर कान) का प्रभाव

जब शोधकर्ताओं ने इस लाइब्रेरियन को सुनना सिखाने की कोशिश की, तो उन्हें एक बाधा का सामना करना पड़ा। प्रशिक्षण के बाद भी, लिखित रूप में तुलना करने पर, जब बातचीत सुनी जाती थी, तो लाइब्रेरियन उसे समझने में बहुत खराब हो जाता था।

  • टेक्स्ट वर्शन: "फ्रांस की राजधानी क्या है?" -> लाइब्रेरियन तुरंत और सही उत्तर देता है।
  • स्पीच वर्शन: कोई कहता है, "फ्रांस की राजधानी क्या है?" -> लाइब्रेरियन हिचकिचाता है, भ्रमित हो जाता है, या गलत उत्तर देता है।

लेखक इसे "टेक्स्ट-स्पीच अंडरस्टैंडिंग गैप" कहते हैं। यह ऐसा है जैसे लाइब्रेरियन के कान अचानक "मफल्ड" (गूँजने वाले या बंद) हो गए हों। वे नोट्स तो अभी भी पूरी तरह से पढ़ सकते हैं, लेकिन जैसे ही आप उनसे बात करते हैं, उनका दिमाग धुंधला होने लगता है।

ऐसा क्यों हुआ?

पेपर में दो मुख्य कारणों की जांच की गई है जिनकी वजह से लाइब्रेरियन भ्रमित होता है:

  1. बुनियादी बातें भूल जाना (अमेनिया/स्मृति लोप): जब आप लाइब्रेरियन को पूरी तरह से सुनने पर ध्यान केंद्रित करने के लिए मजबूर करते हैं, तो वे उन चीजों को भूलने लगते हैं जो वे पहले से जानते थे। यह वैसा ही है जैसे यदि आप केवल बाएं हाथ से गिटार बजाने का अभ्यास करके सीखना चाहें; अंततः, आपका दाहिना हाथ (पढ़ने का कौशल) जंग खा जाएगा।
  2. "ट्रांसलेशन" ग्लिच (अनुवाद की त्रुटि): लाइब्रेरियन एक ध्वनि (भाषण) सुनता है और उसे अर्थ (टेक्स्ट) से मिलाने की कोशिश करता है। लेकिन कनेक्शन कमजोर है। यह एक गाने को कविता में अनुवाद करने जैसा है, लेकिन अनुवादक शब्दों को मिला देता है क्योंकि गाने की लय कविता की लय से मेल नहीं खाती।

पुराने समाधान (बहुत महंगे या असंभव)

पहले, लोगों ने इसे दो तरीकों से ठीक करने की कोशिश की:

  • "सिंथेटिक वॉयस" विधि: उन्होंने कंप्यूटर का उपयोग करके लाखों टेक्स्ट किताबों को नकली स्पीच रिकॉर्डिंग में बदल दिया और लाइब्रेरियन को उन पर प्रशिक्षित किया। इसने थोड़ा काम किया, लेकिन कंप्यूटर की आवाजें थोड़ी रोबोटिक थीं, इसलिए लाइब्रेरियन ने इंसानों को नहीं, बल्कि रोबोटों को समझना सीख लिया।
  • "सीक्रेट लाइब्रेरी" विधि: कुछ बड़ी कंपनियों ने वास्तविक मानवीय बातचीत के विशाल, गुप्त संग्रहों (लाखों घंटों) का उपयोग किया। यह अच्छा काम करता था, लेकिन कोई भी उनके काम की नकल नहीं कर सकता था क्योंकि वे डेटा देख नहीं सकते थे।

नया समाधान: SALAD

लेखकों ने एक नई विधि बनाई जिसे SALAD (Sample-efficient Alignment with Learning through Active selection and cross-modal Distillation) कहा जाता है। यह बोलने में थोड़ा कठिन है, तो आइए इसे खाना बनाने के उदाहरण से समझते हैं।

कल्पना कीजिए कि आप एक शेफ (AI) को एक विशिष्ट व्यंजन (भाषण समझना) बनाना सिखाने की कोशिश कर रहे हैं जिसका उपयोग वे पहले से जानते हुए एक रेसिपी (टेक्स्ट ज्ञान) के रूप में कर सकते हैं।

चरण 1: "टेस्ट ऑफ टेस्ट" (क्रॉस-मोडल डिस्टिलेशन)
शेफ को केवल रैंडम सामग्री चखने देने के बजाय, आप शेफ को वास्तविक व्यंजन चखने के साथ-साथ एक परफेक्ट रेसिपी देखते हुए सिखाते हैं। आप उनसे कहते हैं: "जब आप यह ध्वनि सुनते हैं, तो इसका मतलब यह शब्द है।"

  • जादू: शेफ रेसिपी को पढ़ना भूले बिना ध्वनि को शब्द से मिलाना सीख जाता है। यह "अमेनिया" को रोकता है और "ट्रांसलेशन ग्लिच" को ठीक करता है।

चरण 2: "स्मार्ट शॉपिंग" (एक्टिव सिलेक्शन)
यहाँ चालाकी भरा हिस्सा है। शेफ अभी भी हर प्रकार के व्यंजन (जैसे उन्नत जीव विज्ञान या अज्ञात इतिहास) बनाना नहीं जानता क्योंकि वास्तविक मानवीय बातचीत आमतौर पर रोजमर्रा के विषयों (मौसम, भोजन, गपशप) तक सीमित रहती है।

  • समस्या: यदि आप शेफ को रैंडम वास्तविक बातचीत खिलाते हैं, तो वे कठिन चीजें कभी नहीं सीख पाएंगे।
  • SALAD का समाधान: सिस्टम एक स्मार्ट शॉपिंग असिस्टेंट की तरह काम करता है। यह देखता है कि शेफ किन चीजों में बुरा है (जैसे, "मैं 'माइटोकॉन्ड्रिया' शब्द को बोलने पर नहीं समझ पाता")। फिर यह लाइब्रेरी में जाता है, माइटोकॉन्ड्रिया के बारे में एक टेक्स्ट ढूंढता है, और केवल उस एक वाक्य को स्पीच में बदल देता है।
  • परिणाम: हजारों टन जेनेरिक सामग्री (विशाल डेटासेट) खरीदने के बजाय, शेफ केवल उन विशिष्ट गायब सामग्रियों को खरीदता है जिनकी उसे आवश्यकता है। यह "एक्टिव सिलेक्शन" है।

यह एक बड़ी बात क्यों है?

  1. दक्षता (Efficiency): पुराने तरीकों को लाखों घंटों के डेटा की आवश्यकता थी। SALAD ने समान (या बेहतर) परिणाम प्राप्त करने के लिए 10 गुना कम डेटा का उपयोग किया। यह एक विशाल गोदाम के बजाय छोटी, सावधानीपूर्वक चुनी गई टोकरी के साथ मिशेलिन-स्टार मील बनाने जैसा है।
  2. कोई अमेनिया नहीं: क्योंकि उन्होंने "टेस्ट ऑफ टेस्ट" विधि (डिस्टिलेशन) का उपयोग किया, लाइब्रेरियन ने पढ़ना नहीं भुलाया। उन्होंने अपनी मूल प्रतिभा बनाए रखी और सुनने की क्षमता भी हासिल की।
  3. ओपन सोर्स: "सीक्रेट लाइब्रेरी" विधियों के विपरीत, यह दृष्टिकोण सार्वजनिक डेटा और स्मार्ट एल्गोरिदम का उपयोग करता है, जिससे कोई भी इन बेहतर सुनने वाले AI सिस्टम को बना सकता है।

निचोड़ (The Bottom Line)

पेपर यह दिखाता है कि AI को भाषण समझने के लिए आपको बहुत अधिक पैसा और डेटा फेंकने की आवश्यकता नहीं है। आपको बस इसे सिखाने के बारे में अधिक स्मार्ट होने की आवश्यकता है। यह सावधानीपूर्वक मिलान करके कि AI क्या सुनता है और वह पहले से क्या जानता है, और केवल उन विशिष्ट कमियों को भरकर जिसे वह पूरा कर सकता है, आप एक ऐसा AI बना सकते हैं जो आपसे बात करते समय उतना ही स्मार्ट हो जितना कि टाइप करते समय।

संक्षेप में: SALAD वह "पर्सनल ट्यूटर" है जो AI को पढ़ना भूले बिना सुनना सीखने में मदद करता है, और यह एक विशाल बुफे के बजाय डेटा के एक छोटे, लक्षित आहार का उपयोग करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →