← नवीनतम पेपर
🤖 machine learning

Dense Supervision Is Not Enough: The Readout Blind Spot in Looped Language Models

यह शोध पत्र प्रकट करता है कि डेंस पर-लूप क्रॉस-एन्ट्रॉपी सुपरविजन, स्केल-इनवेरिएंट रीडआउट्स के कारण हिडन-स्टेट स्केल को नियंत्रित करने में विफल रहता है क्योंकि वे इस वेरिएबल को लॉस से छिपा देते हैं, जिससे अनबाउंडेड नॉर्म ग्रोथ को रोकने और परप्लेक्सिटी में सुधार करने के लिए या तो स्केल-विज़िबल रीडआउट्स, स्पष्ट नॉर्म पेनल्टीज़, या स्केल-रिमूविंग रिकरेंस की आवश्यकता होती है।

मूल लेखक: Rituraj Sharma, Tu Vu

प्रकाशित 2026-06-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rituraj Sharma, Tu Vu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक बार में एक शब्द करके कहानी सुनाना सिखा रहे हैं। एक मानक रोबोट में, आप उसे बोलने से पहले सोचने के लिए चरणों की एक निश्चित संख्या देते हैं। लेकिन एक लूप्ड लैंग्वेज मॉडल (Looped Language Model) में, आप रोबोट को एक विशेष "सोचने का लूप" देते हैं। यह एक कदम उठा सकता है, अपने काम की जांच कर सकता है, और यदि वह सुनिश्चित नहीं है, तो वह उसी कदम के बारे में फिर से सोचने के लिए वापस लूप कर सकता है। वाक्य जितना जटिल होगा, यह उतने ही अधिक लूप चलाएगा।

यह पेपर उस समस्या को हल करता है जो रोबोट की दृष्टि में एक अंध बिंदु (blind spot) की तरह है।

सेटअप: "आउटपुट विंडो" बनाम "बैकपैक"

हर बार जब रोबोट लूप करता है, तो उसके पास दो काम होते हैं:

  1. आउटपुट विंडो (The Output Window): यह अपने वर्तमान विचारों को देखता है और अगले शब्द का अनुमान लगाने की कोशिश करता है (यही वह चीज़ है जिस पर हम उसे ग्रेड देते हैं)।
  2. बैकपैक (The Backpack): यह उन विचारों को लेता है, उन्हें एक बैकपैक में रखता है, और भविष्य की सोच में मदद करने के लिए उन्हें अगले लूप में ले जाता है।

पेपर एक सरल प्रश्न पूछता है: जब हम रोबोट को उसके "आउटपुट विंडो" पर ग्रेड देते हैं, तो क्या हम वास्तव में उसके "बैकपैक" के अंदर क्या है, उसे नियंत्रित कर रहे हैं?

समस्या: अदृश्य बैकपैक

शोधकर्ताओं ने रोबोट द्वारा अपनाई जाने वाली एक चालाकी भरी चाल का पता लगाया है।

कल्पना कीजिए कि रोबोट के विचार एक गुब्बारा हैं। "आउटपुट विंडो" एक विशेष फिल्टर (जिसे RMSNorm या LayerNorm कहा जाता है) का उपयोग करता है जो गुब्बारे के आकार (shape) को तो देखता है लेकिन उसके आकार/माप (size) को अनदेखा कर देता है।

  • यदि गुब्बारा छोटा है, तो फिल्टर एक विशिष्ट आकार देखता है।
  • यदि आप गुब्बारे को फुलाकर एक घर जितना बड़ा कर देते हैं, तो फिल्टर अभी भी बिल्कुल वही आकार देखता है

चूंकि फिल्टर 'साइज' को अनदेखा करता है, इसलिए शिक्षक (लॉस फंक्शन) को इस बात से फर्क नहीं पड़ता कि गुब्बारा कितना बड़ा हो जाता है। रोबोट को शब्द का अनुमान लगाने के लिए एक बेहतरीन ग्रेड मिलता है, भले ही उसका आंतरिक "बैकपैक" एक खतरनाक आकार में फूल रहा हो।

अंध बिंदु (The Blind Spot): शिक्षक रोबोट के विचारों के आकार (shape) पर उसे ग्रेड दे रहा है, लेकिन रोबोट गुप्त रूप से उसके माप (size) को अनियंत्रित रूप से बढ़ने दे रहा है। शिक्षक उस विस्फोट को नहीं देख पाता क्योंकि ग्रेडिंग विंडो उसे फिल्टर कर देती है।

परिणाम: "ड्रिफ्टिंग" रोबोट

क्योंकि शिक्षक को बढ़ता हुआ 'साइज' दिखाई नहीं देता, इसलिए रोबोट की आंतरिक स्थिति (बैकपैक) भटकने (drift) लगती है।

  • परिणाम: कुछ ही लूप के बाद, रोबोट के आंतरिक नंबर खगोलीय रूप से बड़े (हजारों या दसियों हजार) हो जाते हैं।
  • खतरा: भले ही रोबोट अंत में सही शब्द का अनुमान लगा सके, लेकिन वह अस्थिर हो चुका होता है। यदि आप समय बचाने के लिए इसे जल्दी रोकने की कोशिश करते हैं (सिर्फ एक लूप के बाद), तो यह बुरी तरह विफल हो जाता है क्योंकि इसकी आंतरिक स्थिति इतनी अराजक और विशाल हो जाती है कि यह शुरुआती चरणों में कोई अर्थ नहीं निकाल पाता।

यह एक ऐसी कार की तरह है जो 100 मील प्रति घंटे की रफ्तार पर ठीक चलती है, लेकिन उसका पेट्रोल टैंक धीरे-धीरे पानी से भर रहा है। स्पीडोमीटर (आउटपुट) ठीक दिखता है, लेकिन इंजन (आंतरिक स्थिति) डूब रहा है।

समाधान: ब्लाइंड स्पॉट को ठीक करने के दो तरीके

पेपर सुझाव देता है कि आप केवल रोबोट को "बेहतर प्रयास करने" के लिए नहीं कह सकते; आपको यह बदलना होगा कि आप उसे कैसे देखते हैं। आपको इस ब्लाइंड स्पॉट को इनमें से किसी एक तरीके से ठीक करना होगा:

विकल्प 1: फिल्टर हटा दें (द "रॉ" व्यू - The "Raw" View)
एक ऐसा फिल्टर उपयोग करने के बजाय जो साइज को अनदेखा करता है, बस कच्चे (raw) गुब्बारे को देखें।

  • यह कैसे काम करता है: आप रोबмोट को उसके विचारों के वास्तविक आकार (size) पर ग्रेड देते हैं। अब, यदि गुब्बारा बहुत बड़ा हो जाता है, तो शिक्षक इसे तुरंत देख लेता है और रोबोट को इसे सिकोड़ने के लिए कहता है।
  • उपमा: आप "केवल आकार (shape-only)" वाला दर्पण उपयोग करना बंद कर देते हैं और "पूर्ण-आकार (full-size)" वाले दर्पण का उपयोग करना शुरू कर देते हैं। रोबोट अपने विचारों को एक प्रबंधनीय आकार में रखने के लिए सीख जाता है।

विकल्प 2: लूप के बीच में बैकपैक खाली करें (द "रिसेट" - The "Reset")
यदि आपको फिल्टर रखना ही है, तो आपको साइज को आगे बढ़ने से रोकना होगा।

  • यह कैसे काम करता है: हर लूप के बाद, आप बैकपैक लेते हैं, उसे खाली करते हैं, और अगले लूप के लिए एक सामान्य आकार के बैग के साथ शुरुआत करते हैं।
  • उपमा: आप रोबोट से कहते हैं, "दोबारा सोचने से पहले, एक गहरी सांस लें और अपने आंतरिक वॉल्यूम को रीसेट करें।" यह साइज को जमा होने से रोकता है।

मुख्य निष्कर्ष

पेपर साबित करता है कि सिर्फ हर चरण पर रोबोट को ग्रेड देना पर्याप्त नहीं है। यदि जिस तरह से आप उसे ग्रेड देते हैं (रीडआउट), वह उसके विचारों के आकार (size) को छिपा देता है, तो रोबोट उन विचारों को नियंत्रण से बाहर होने देगा।

एक स्थिर, कुशल लूप वाले रोबोट का निर्माण करने के लिए जो आसान कार्य होने पर जल्दी रुक सके, आपको या तो:

  1. साइज को शिक्षक के लिए दृश्यमान बनाना होगा (ताकि शिक्षक बड़े गुब्बारों को दंडित कर सके)।
  2. लूप से साइज को पूरी तरह हटाना होगा (ता ताकि वह बढ़ ही न सके)।

इनमें से किसी भी सुधार के बिना, रोबोट शायद अंत में काम करेगा, लेकिन वह टूटा हुआ, अस्थिर और अपनी "अर्ली एग्जिट" (जल्दी बाहर निकलने की) सुपरपावर का उपयोग करने में असमर्थ होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →