← नवीनतम पेपर
💬 NLP

Distill Where the Student Goes: Teacher-Regularized RL for English-Evidence Cross-Lingual RAG

यह शोध पत्र TR-RAG प्रस्तुत करता है, जो एक शिक्षक-नियमित सुदृढीकरण शिक्षण (टीचर-रेगुलराइज्ड रीइन्फोर्समेंट लर्निंग) ढांचा है जो अंग्रेजी-साक्ष्य क्रॉस-लिंगुअल रिट्रीवल-ऑगमेंटेड जनरेशन में भाषा विचलन (लैंग्वेज ड्रिफ्ट) को प्रभावी ढंग से कम करने और साक्ष्य ग्राउंडिंग में सुधार करने के लिए एक फ्रोजन टीचर एंकर और एक डीकंपोज्ड रिवॉर्ड सिग्नल के साथ ऑन-पॉलिसी डिस्टिलेशन को जोड़ता है।

मूल लेखक: Haotian Zhou, Weiran Huang, Siqi Liu, Xiting Wang, Xin Zhang, Zhihao Wen

प्रकाशित 2026-07-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haotian Zhou, Weiran Huang, Siqi Liu, Xiting Wang, Xin Zhang, Zhihao Wen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक टूर गाइड (AI) हैं जो पर्यटकों के एक समूह को एक जटिल कहानी समझाने की कोशिश कर रहे हैं जो इंडोनेशियाई, कोरियाई या थाई बोल रहे हैं। लेकिन यहाँ एक मोड़ है: आपके पास एकमात्र नक्शा और गाइडबुक है जो पूरी तरह से अंग्रेजी में लिखी गई है। यह आज कई AI सिस्टम की दैनिक वास्तविकता है, जिसे यह पेपर "इंग्लिश-एविडेंस क्रॉस-लिंगुअल RAG" कहता है।

समस्या क्या है? जब AI उस अंग्रेजी नक्शे को पढ़ने और दूसरी भाषा में बोलने की कोशिश करता है, तो वह अक्सर भ्रमित हो जाता है। वह गलती से अंग्रेजी बोलना शुरू कर सकता है, या भाषाओं को अजीब तरह से मिला सकता है, या गलत तथ्य बना सकता है क्योंकि वह अंग्रेजी संकेतों को एक सुसंगत उत्तर में अनुवाद करने के लिए संघर्ष कर रहा है। पेपर इसे "लैंग्वेज ड्रिफ्ट" (भाषा का भटकना) और "ब्रिटल एविडेंस यूज़" (भंगुर साक्ष्य उपयोग) कहता है।

बड़ा विचार: एक सख्त कोच और एक बहादुर छात्र

लेखक एक नई प्रशिक्षण पद्धति प्रस्तावित करते हैं जिसे TR-RAG कहा जाता है। इसे एक छात्र (एक छोटे, तेज़ AI मॉडल) के लिए एक अनूठे कोचिंग सत्र के रूप में समझें जो उस अंग्रेजी-मात्र नक्शे का उपयोग करके प्रश्नों के उत्तर देने का सीखने की कोशिश कर रहा है।

आमतौर पर, जब आप एक AI को प्रशिक्षित करते हैं, तो या तो आप उसे सटीक उत्तर दिखाते हैं (जैसे एक पाठ्यपुस्तक) या आप उसे अनुमान लगाने देते हैं और जब वह गलत होता है तो उसे दंडित करते हैं (जैसे एक वीडियो गेम जिसमें स्कोर मिलता है)। यह पेपर तर्क देता है कि दोनों विधियों में खामियां हैं। पाठ्यपुस्तक सीखना इसलिए विफल होता है क्योंकि AI अपने उत्तर के शुरुआत में ही गलतियाँ कर देता है, और जब तक वह अंत तक पहुँचता है, तब तक वह गलत रास्ते पर जा चुका होता है, इसलिए पाठ्यपुस्तक सुधार काम नहीं आता। शुद्ध "अनुमान लगाना और स्कोर देना" (Reinforcement Learning) जोखिम भरा है क्योंकि स्कोर केवल अंत में आता है, और AI एक गलत उत्तर के साथ भाग्यशाली हो सकता है या यह महसूस किए बिना अंग्रेजी में भटक सकता है कि वह कब भटक गया।

TR-RAG समाधान: "रिवर्स-KL" एंकर

TR-RAG एक "टीचर" (एक बहुत अधिक स्मार्ट, फ्रीज़्ड AI मॉडल) पेश करता है जो एक सुरक्षा जाल के रूप में कार्य करता है। चतुर हिस्सा यह है: टीचर उत्तर नहीं लिखता है। इसके बजाय, स्टूडेंट उत्तर बनाता है, और जैसे ही स्टूडेंट टाइप कर रहा होता है, टीचर फुसफुसाता है, "हे, अगर मैं तुम्हारी जगह होता, तो मैं अगला शब्द यह नहीं कहता। मैं यह कहता।"

पेपर इसे "प्रिफिक्स-वाइज रिवर्स-KL एंकर" कहता है। हमारी उपमा में, यह एक कोच की तरह है जो छात्र के ठीक बगल में खड़ा है, उसके द्वारा टाइप किए गए हर एक शब्द को देख रहा है। यदि छात्र अंग्रेजी में भटकने लगता है या कोई गलती करता है, तो कोच उसे तुरंत वापस सही रास्ते पर लाता है इससे पहले कि वह गलती एक आपदा बन जाए। यह वास्तविक समय में, छात्र द्वारा लिए गए सटीक पथ पर होता है, न कि किसी पाठ्यपुस्तक के आदर्श पथ पर।

स्कोरकार्ड: जीतने के तीन तरीके

यह सुनिश्चित करने के लिए कि छात्र अच्छा काम कर रहा है, सिस्टम एक तीन-भाग वाले स्कोरकार्ड का उपयोग करता है, न कि केवल एक ग्रेड का:

  1. भाषा निरंतरता (Language Consistency): क्या आपने पूरे समय सही भाषा बनाए रखी? (अंग्रेजी में फिसलना नहीं!)
  2. कैरेक्टर 3-ग्राम रिकॉल (Character 3-gram Recall): क्या आपने अंग्रेजी नक्शे से महत्वपूर्ण तथ्यों और नामों को बनाए रखा? (इसे यह जाँचने के रूप में सोचें कि क्या आपने अक्षरों के सही "टुकड़े" रखे हैं, जो थाई या कोरियाई जैसी भाषाओं के लिए पूरे शब्दों की तुलना में बेहतर काम करता है)।
  3. LLM-जज स्कोर (LLM-Judge Score): क्या एक सुपर-स्मार्ट AI जज ने कहा कि उत्तर वास्तव में सही था और साक्ष्य पर आधारित था?

पेपर ने क्या पाया (और क्या नहीं पाया)

लेखकों ने तीन अलग-अलग प्रश्न सेटों (BioASQ, HotpotQA, और MKQA) पर इंडोनेशियाई, कोरियाई, थाई, वियतनामी और जापानी जैसी भाषाओं का उपयोग करके परीक्षण किया।

  • अच्छी खबर: TR-RAG ने बहुत अच्छा काम किया। इसने अन्य मजबूत तरीकों को पछाड़ दिया। वास्तव में, कुछ परीक्षणों में, छोटा स्टूडेंट मॉडल अपने विशाल 70-बिलियन-पैरामीटर वाले टीचर से भी बेहतर प्रदर्शन करता है कि उसने महत्वपूर्ण तथ्यों को बनाए रखा (3-ग्राम रिकॉल)।
  • सुरक्षा जाल प्रभाव: यह सबसे महत्वपूर्ण निष्कर्ष है। पेपर दिखाता है कि यदि आप केवल स्कोर-आधारित विधि (Reward-only RL) का उपयोग करते हैं, तो AI कभी-कभी बुरी तरह क्रैश हो सकता है। एक विशिष्ट मामले में, सही भाषा में रहने की AI की क्षमता 27 प्रतिशत अंक गिर गई, जो बुनियादी, बिना प्रशिक्षित मॉडल से भी कम थी। TR-RAG ने इस क्रैश को रोका। इसने एक सीटबेल्ट की तरह काम किया।
  • सीमाएँ: पेपर स्पष्ट रूप से इस विचार को खारिज करता है कि केवल एक "प्रॉम्प्ट" (जैसे "कृपया कोरियाई में बोलें" जैसा निर्देश) देना पर्याप्त है। उन्होंने इसे आजमाया, और इससे केवल मामूली सुधार हुआ। उन्होंने यह भी पाया कि केवल प्रश्नों और उत्तरों का अनुवाद करना ("ट्रांसलेट" पाइपलाइन) चीजों को बदतर बना देता है क्योंकि यह नए त्रुटियों को पेश करता है।
  • "इंश्योरेंस प्रीमियम": लेखक सुझाव देते हैं कि TR-RAG "सुरक्षित" स्थितियों में एक विशिष्ट मीट्रिक (LLM-जज स्कोर) में थोड़ा कम पूर्ण हो सकता है, जो एक जोखिम भरी, अन-एंकर्ड विधि की तुलना में है। हालांकि, वे तर्क देते हैं कि यह एक छोटा बीमा प्रीमियम है जो बाद में बड़े क्रैश से बचने के लिए दिया जाता है। "सुरक्षित" क्षेत्रों में, अन-एंकर्ड विधि TR-RAG से 1-1.5 प्रतिशत अंक आगे निकल सकती है, लेकिन "खतरनाक" क्षेत्रों में (जैसे दूर की भाषाएं या जब AI भटकने लगता है), अन-एंकर्ड विधि पूरी तरह विफल हो जाती है, जबकि TR-RAG काम करना जारी रखता है।

वे कितने आश्वस्त हैं?

पेपर इन परिणामों के बारे में बहुत आश्वस्त है क्योंकि उन्होंने इन्हें केवल सिम्युलेट नहीं किया, बल्कि सीधे वास्तविक बेंचमार्क पर मापा है। उन्होंने मॉडलों को चलाया, स्कोर की गणना की और प्रशिक्षण को चरण-दर-चरण देखा। उन्होंने इसे उन भाषाओं पर भी परखा जिन्हें AI ने पहले कभी नहीं देखा था (जैसे नॉर्वेजियन और खमेर) ताकि यह देखा जा सके कि क्या यह टूट जाएगा। उन चरम मामलों में, अन-एंकर्ड विधि एक "सीलिंग" (छत) पर पहुंच गई जहां वह बिल्कुल भी सुधार नहीं कर सकी, लेकिन TR-RAG अभी भी थोड़ी अधिक सटीकता निकालने में सफल रहा।

निष्कर्ष

पेपर सुझाव देता है कि यदि आप किसी AI को अंग्रेजी संकेतों का उपयोग करके कई भाषाएं बोलने के लिए सिखाना चाहते हैं, तो आप केवल उसे अंत में अनुमान लगाने और ग्रेड देने के लिए नहीं छोड़ सकते। आपको एक "टीचर" की आवश्यकता है जो छात्र द्वारा उठाए गए हर कदम को देखता है और जैसे-जैसे वे आगे बढ़ते हैं, उन्हें धीरे से सुधारता है। यह विधि, TR-RAG, AI को गलत भाषा में भटकने से रोकती है और तथ्यों को थामे रखने में मदद करती है, एक सुरक्षा जाल के रूप में कार्य करती है जो विनाशकारी विफलताओं को रोकता है जबकि AI को सीखने और सुधारने भी देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →