← नवीनतम पेपर
💬 NLP

Are you speaking my languages? On spoken language adherence in multimodal LLMs

यह शोध पत्र "भाषा अनुपालन" (language adherence) को परिभाषित करके, उल्लंघनों को मापने के लिए एक मीट्रिक पेश करके, और ट्रांसक्रिप्शन गुणवत्ता को बनाए रखते हुए इन त्रुटियों को कम करने के लिए ज़ीरो-शॉट गाइडेंस, सुपरवाइज्ड फाइन-ट्यूनिंग और चेन-ऑफ-थॉट रीजनिंग जैसी सॉफ्ट प्रॉम्प्टिंग रणनीतियोंों का मूल्यांकन करके, मल्टीमॉडल एलएलएम-आधारित ऑटोमैटिक स्पीच रिकग्निशन में भाषा की गलत पहचान के मुद्दे को संबोधित करता है।

मूल लेखक: Hyungwon Kim, Kandarp Joshi, Lillian Zhou, Pavel Golik, Petar Aleksic

प्रकाशित 2026-06-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hyungwon Kim, Kandarp Joshi, Lillian Zhou, Pavel Golik, Petar Aleksic

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट, बहुभाषी रोबोट सहायक है जो आपकी आवाज़ सुन सकता है और जो आपने कहा उसे ठीक वैसे ही टाइप कर सकता है। यह रोबोट एक साथ कई भाषाओं को समझने में माहिर है, भले ही आप वाक्य के बीच में भाषा बदल दें (जैसे कि "I need a café" कहना लेकिन फिर स्पेनिश में स्विच करना)।

हालाँकि, इस रोबोट की एक मज़ेदार खामी है: कभी-कभी, यह इस बात को लेकर भ्रमित हो जाता है कि आप वास्तव में कौन सी भाषा बोल रहे हैं। यदि आप फ्रेंच बोलते हैं, तो यह गलती से शब्दों को जर्मन वर्तनी (spelling) के नियमों का उपयोग करके टाइप कर सकता है, या यदि आप कोरियाई बोलते हैं, तो यह इसमें कुछ यादृच्छिक जापानी अक्षर डाल सकता है। एक इंसान के लिए, यह एक गलती की तरह दिखता है; रोबोट के लिए, यह सिर्फ एक अनुमान है।

यह शोध पत्र, जिसका शीर्षक है "Are you speaking my languages?", इस भ्रम को बिना रोबोट को बहुत अधिक कठोर बनाए ठीक करने के बारे में है। शोधकर्ता चाहते हैं कि रोबोट आपकी भाषा के संकेतों को सुनने के लिए तैयार रहे, लेकिन वे यह भी चाहते हैं कि यह इतना स्मार्ट हो कि यदि संकेत गलत हों, तो वह उन्हें अनदेखा कर सके।

यहाँ उनके दृष्टिकोण का विवरण दिया गया है, जिसमें रोज़मर्रा के उपमाओं (analogies) का उपयोग किया गया है:

समस्या: "गलत रेसिपी" की आपदा

शोधकर्ता इस समस्या को "भाषा पालन उल्लंघन" (Language Adherence Violation) कहते हैं।
इस समस्या को ऐसे समझें जैसे रोबोट एक शेफ (रसोइया) है। यदि आप शेफ से कहते हैं, "मेरे लिए एक फ्रेंच डिश बनाओ," लेकिन काउंटर पर मौजूद सामग्री स्पष्ट रूप से इतालवी (Italian) है, तो एक बुरा शेफ अभी भी इतालवी सामग्री का उपयोग करके फ्रेंच डिश बनाने की कोशिश करेगा, जिसके परिणामस्वरूप एक अजीब, बेस्वाद मिश्रण बनेगा। रोबोट के मामले में, यदि वह सोचता है कि आप स्पेनिश बोल रहे हैं लेकिन आप वास्तव में हिंदी बोल रहे हैं, तो वह हिंदी शब्दों को स्पेनिश वर्तनी के साथ लिख सकता है। यह ट्रांसक्रिप्शन को खराब कर देता है और रोबोट को गैर-पेशेवर या यहाँ तक कि असंवेदनशील भी दिखाता है।

समाधान: शेफ को मार्गदर्शन देने के तीन तरीके

टीम ने इस बात का परीक्षण किया कि रोबोट को वास्तविक ऑडियो को अनदेखा करने के लिए मजबूर किए बिना, आपके संकेतों को बेहतर ढंग से सुनने में मदद करने के तीन अलग-अलग तरीके क्या हैं।

1. ज़ीरो-शॉट प्रॉम्प्टिंग (The "Polite Nudge" या "विनम्र इशारा")
यह शेफ के पास जाकर कहने जैसा है, "हे, मुझे लगता है कि आज हम फ्रेंच खाना बना रहे हैं," इससे पहले कि वे खाना बनाना शुरू करें।

  • यह कैसे काम करता है: शोधकर्ताओं ने बस रोबोट के निर्देशों में एक वाक्य जोड़ा, जैसे "इसे फ्रेंच में ट्रांसक्राइब करें।"
  • चुनौती: कभी-कभी आप गलत संकेत दे सकते हैं (जैसे, आपने रोबोट को "फ्रेंच" बताया लेकिन आप वास्तव में स्पेनिश बोल रहे हैं)। शोधकर्ताओं ने पाया कि यदि आप संकेत को विनम्रता से पेश करते हैं (जैसे, "यह फ्रेंच और अन्य भाषाओं का मिश्रण हो सकता है"), तो रोबोट इतना स्मार्ट होता है कि वह संकेत को सुनेगा जब तक कि ऑडियो स्पष्ट रूप से इसके विपरीत न कहे। यह एक "धक्का" नहीं बल्कि एक "हल्का इशारा" है।

2. सुपरवाइज्ड फाइन-ट्यूनिंग (The "Intensive Training Camp" या "गहन प्रशिक्षण शिविर")
यह शेफ को एक विशेष स्कूल ले जाने जैसा है जहाँ वे बार-बार फ्रेंच व्यंजन बनाना सीखते हैं, विशेष रूप से "फ्रेंच" निर्देश टैग का पालन करना सीखते हैं।

  • यह कैसे काम करता है: उन्होंने रोबोट को हजारों उदाहरणों पर फिर से प्रशिक्षित किया जहाँ निर्देश और ऑडियो मेल खाते थे। उन्होंने इसमें कुछ "ट्रिक" उदाहरण भी डाले जहाँ निर्देश गलत थे, ताकि रोब "लचीला" रहना सीख सके।
  • परिणाम: रोबोट निर्देशों का पालन करने में बहुत अच्छा हो गया, लेकिन यदि आपने उसे कोई निर्देश ही नहीं दिया, तो वह ठीक से काम करना भूल जाता था क्योंकि उसे टैग का पालन करने के लिए बहुत अधिक प्रशिक्षित किया गया था।

3. चेन-ऑफ-थॉट (The "Thinking Pause" या "सोचने का विराम")
यह शेफ से एक सेकंड के लिए रुकने, ज़ोर से सोचने और यह कहने के लिए कहने जैसा है, "ठीक है, मैं फ्रेंच शब्द सुन रहा हूँ, इसलिए मैं फ्रेंच में लिखूँगा," खाना शुरू करने से पहले।

  • यह कैसे काम करता है: शोधकर्ताओं ने रोबोट को ट्रांसक्रिप्शन शुरू करने से पहले रुकने और स्पष्ट रूप से यह बताने के लिए बनाया कि, "भाषा फ्रेंच है।"
  • परिणाम: इसने रोबोट को पहले भाषा का निर्णय लेने के लिए मजबूर किया। यह अच्छी तरह से काम करता था, लेकिन इसने सोचने के समय में थोड़ी सी वृद्धि की (हालांकि शोधकर्ताओं का कहना है कि यह नगण्य है)।

मुख्य निष्कर्ष

शोधकर्ताओं ने वास्तविक दुनिया के डेटा पर इन तरीकों का परीक्षण किया, जिसमें भाषाओं के बीच स्विच करने वाले लोग (code-switching) भी शामिल थे। यहाँ उन्होंने क्या खोजा:

  • "सही संकेत" सर्वोपरि है: यदि आप रोबोट को सही भाषा का संकेत देते हैं (जैसे, "यह फ्रेंच है"), तो यह तीनों में से किसी भी विधि का उपयोग करने पर भी पूरी तरह से काम करता है।
  • "गलत संकेत" पेचीदा है: यदि आप इसे गलत संकेत देते हैं (जैसे, "यह स्पेनिश है" जबकि यह वास्तव में फ्रेंच है), तो रोबोट भ्रमित हो सकता है। हालाँकि, "विनम्र इशारा" (ज़ीरो-शॉट) वाला तरीका गलत संकेत को अनदेखा करने और ऑडियो पर टिके रहने में सबसे अधिक सक्षम था।
  • "मिश्रण" ठीक है: यदि आप रोबोट को कहते हैं, "यह फ्रेंच है और शायद कुछ स्पेनिश भी," और यह वास्तव में केवल फ्रेंच है, तो रोबोट इसे ठीक से संभाल लेता है। अतिरिक्त विकल्प से वह भ्रमित नहीं होता है।
  • कोई संकेत न देना जोखिम भरा है: यदि आप रोबोट को कोई संकेत नहीं देते हैं, तो यह खराब प्रदर्शन करता है, विशेष रूप से यदि आपने इसे संकेतों का पालन करने के लिए बहुत अधिक प्रशिक्षित किया है। ऐसा लगता है कि बिना किसी शुरुआती बिंदु के रोबोट थोड़ा खो जाता है।

निचोड़

शोध पत्र निष्कर्ष निकालता है कि इस समस्या को ठीक करने के लिए आपको आवश्यक रूप से अपने रोबोट को फिर से प्रशिक्षित करने या उसे जटिल चरणों में सोचने की आवश्यकता नहीं है। बस रोबोट को भाषा के बारे में एक स्पष्ट, विनम्र संकेत देना ही अक्सर पर्याप्त होता है।

हालाँकि, सबसे महत्वपूर्ण बात यह है कि शुरुआत में ही भाषा का संकेत सही प्राप्त करना अत्यंत महत्वपूर्ण है। यदि वह सिस्टम जो रोबोट को बताता है कि "आप फ्रेंच बोल रहे हैं" गलत है, तो रोबोट संघर्ष करेगा। सबसे अच्छी रणनीति यह है कि ट्रांसक्रिप्शन शुरू होने से पहले भाषा का सटीक अनुमान लगाने वाला एक विश्वसनीय सिस्टम ऊपर (upstream) मौजूद हो।

संक्षेप में: रोबोट को एक अच्छा नक्शा दें, और वह सही रास्ता ढूंढ लेगा। यदि नक्शा गलत है, तो सबसे स्मार्ट रोबोट भी भटक सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →