← नवीनतम पेपर
💻 computer science

Training-Time Regularization for Inference-Time Monitoring-A Unified Framework for Self-Supervised World Models

यह शोध पत्र "रेगुलराइजेशन-मॉनिटरिंग डिलेमा" (नियमितीकरण-निगरानी दुविधा) की पहचान करता है और उसे संबोधित करता है, जो एक मौलिक संघर्ष है जहाँ स्व-पर्यवेक्षित विश्व मॉडलों (जैसे JEPA) के स्थिर प्रशिक्षण के लिए आवश्यक आंशिक गॉसियनकरण (marginal Gaussianization), अनजाने में उन विभेदक ज्यामितीय संरचनाओं को दबा देता है जो विश्वसनीय इन्फरेंस-टाइम विसंगति का पता लगाने के लिए आवश्यक होती हैं।

मूल लेखक: Yu-Xiang Wu, Yuyan Wu

प्रकाशित 2026-08-03
📖 10 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yu-Xiang Wu, Yuyan Wu

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक अराजक दुनिया में नेविगेट करना सिखा रहे हैं, जैसे कि एक व्यस्त रसोई या एक बिखरा हुआ लिविंग रूम। ऐसा करने के लिए, रोबोट एक "वर्ल्ड मॉडल" (विश्व मॉडल) बनाता है—एक मानसिक मानचित्र जो भविष्यवाणी करता है कि यदि वह अपना हाथ हिलाता है या अपना सिर घुमाता है तो आगे क्या होगा। वर्षों से, वैज्ञानिक एक विशिष्ट समस्या से जूझ रहे हैं: इन रोबोटों को कच्चे वीडियो से कैसे सिखाया जाए ताकि वे भ्रमित न हों या अपने ही "मस्तिष्क को तोड़" न दें। "जॉइंट-एम्बेडिंग प्रेडिक्टिव आर्किटेक्चर" (JEPAs) नामक एक हालिया सफलता ने इस "मस्तिष्क टूटने" वाले हिस्से को हल किया है, जो रोबोट के मानसिक मानचित्र को व्यवस्थित और सुव्यवस्थित रहने के लिए मजबूर करता है, ठीक वैसे ही जैसे एक लाइब्रेरियन जो सभी किताबों को शेल्फ पर पूरी तरह से फिट होने के लिए मजबूर करता है। हालांकि, यह नया शोध एक छिपी हुई कमी को उजागर करता है: जिस तरीके से वह लाइब्रेरी को व्यवस्थित रखता है, वही तरीका रोबोट को यह देखने से भी असंभव बना देता है कि कोई किताब गायब है या कोई अजनबी अंदर आया है। रोबोट इतना केंद्रित हो जाता है कि सब कुछ "सामान्य" रखने में, कि वह एक मामूली डगमगाहट और एक खतरनाक टक्कर के बीच अंतर नहीं कर पाता है। यही वह पहेली है जिसे यू-शियांग वू और युयान वू के नेतृत्व में किए गए नए शोध ने हल करने का प्रयास किया है।

यह शोध TRIM (ट्रेनिंग-टाइम रेगुलराइजेशन फॉर इन्फरेंस-टाइम मॉनिटरिंग) नामक एक चतुर नया ढांचा पेश करता है। इसे एक जादू के खेल की तरह समझें जहाँ रोबोट उसी उपकरण का उपयोग करता है जिसका उपयोग उसने अपनी लाइब्रेरी को व्यवस्थित करने के लिए किया था, ताकि वह एक सुरक्षा गार्ड के रूप में भी कार्य कर सके। लेखकों ने पाया कि "सफाई करने" की प्रक्रिया जिसे रोबोट सीखने के दौरान करता है, वास्तव में एक गुप्त सांख्यिकीय फिंगरप्रिंट (statistical fingerprint) पीछे छोड़ देती है। इस फिंगरप्रिंट का पुन: उपयोग करके, जब रोबोट सीखना समाप्त कर लेता है, तो TRIM रोबोट को विसंगतियों—जैसे कि अचानक, अजीब हलचल या टूटी हुई वस्तु—को पहचानने की अनुमति देता है, बिना किसी अतिरिक्त प्रशिक्षण या विशेष "अलार्म" पाठों के। यह बिल्कुल वैसा ही है जैसे यदि एक शेफ, सब्जियां काटने में माहिर होने के दौरान, अनजाने में यह सीख गया कि हाथ में चाकू कैसा महसूस होना चाहिए; बाद में, वह तुरंत बता सकता है कि चाकू "गलत" क्यों महसूस हो रहा है, बिना यह सीखे कि "बुरा" चाकू कैसा महसूस होता है।

समस्या: "बहुत अधिक व्यवस्थित" होने का जाल

यह समझने के लिए कि TRIM की आवश्यकता क्यों है, हमें यह देखना होगा कि इन रोबोट के दिमाग कैसे काम करते हैं। कल्पना कीजिए कि एक रोबोट ब्लॉक को स्टैक करना (एक के ऊपर एक रखना) सीख रहा है। वह एक वीडियो देखता है, अगले फ्रेम की भविष्यवाणी करता है, और प्रयास करता है कि उसकी भविष्यवाणी वास्तविकता से मेल खाए। रोबोट को हार मानने और केवल यह अनुमान लगाने से रोकने के लिए (जिसे "रिप्रेजेंटेशन कोलैप्स" कहा जाता है), वैज्ञानिक SIGReg नामक एक उपकरण का उपयोग करते हैं। SIGReg एक सख्त कोच की तरह कार्य करता है, जो रोबोट के आंतरिक विचारों को समान रूप से फैलने के लिए मजबूर करता है, जैसे कि लोगों की भीड़ एक आदर्श घेरे में खड़ी हो। यह रोबोट के मस्तिष्क को स्थिर रखता है और इसे ढहने से रोकता है।

हालांकि, लेखकों ने इस दृष्टिकोण में एक बड़ी खामी पाई। रोबोट के विचारों को एक पूर्ण, समान घेरे में मजबूर करके, SIGReg ने अनजाने में उन "लैंडमार्क्स" (चिन्हों) को मिटा दिया जिनकी उसे चीजों को अलग करने के लिए आवश्यकता थी। यह घर के हर कमरे को बिल्कुल एक ही रंग (बेज) से पेंट करने जैसा है। अब, घर बहुत स्थिर और व्यवस्थित है, लेकिन यदि कोई रसोई में चलता है, तो रोबोट यह नहीं बता सकता कि रसोई और बेडरूम के बीच क्या अंतर है क्योंकि सब कुछ एक जैसा दिखता है। जब रोबोट गलतियों (जैसे मेज से ब्लॉक गिरना) को पहचानने के लिए इस "बहुत अधिक व्यवस्थित" मस्तिष्क का उपयोग करने का प्रयास करता है, तो वह विफल हो जाता है। वह एक सामान्य डगमगाहट और एक वास्तविक आपदा के बीच अंतर नहीं कर सकता क्योंकि प्रशिक्षण के दौरान "सामान्य" और "असामान्य" के बीच की सीमाएं मिटा दी गई थीं। लेखक इसे रेगुलराइजेशन-मॉनिटरिंग डिलेमा (नियमन-निगरानी दुविधा) कहते हैं: वह उपकरण जो रोबोट को स्थिर बनाता है, वही उपकरण है जो उसे खतरे के प्रति अंधा बना देता है।

समाधान: TRIM और "टाइम-ट्रैवल" ट्रिक

यह सुधार करने के लिए शोध पत्र एक सरल लेकिन शानदार बदलाव का प्रस्ताव देता है। रोबोट के वर्तमान विचारों को व्यवस्थित करने के बजाय, TRIM रोबोट के समय के साथ होने वाले बदलावों को व्यवस्थित करता है।

कल्पना कीजिए कि आप एक फिल्म देख रहे हैं। यदि आप हर एक फ्रेम को बिल्कुल एक जैसा दिखने के लिए मजबूर करते हैं, तो फिल्म उबाऊ हो जाती है और आप यह नहीं समझ पाते कि क्या हो रहा है। लेकिन यदि आप एक फ्रेम और अगले फ्रेम के बीच के अंतर को अनुमानित और व्यवस्थित होने के लिए मजबूर करते हैं, तो आप कहानी को स्पष्ट रूप से उभरते हुए देख सकते हैं। TRIM बिल्कुल यही करता है। यह "सफाई करने" के नियम (SIGReg) को रोबोट के वर्तमान दृश्य पर नहीं, बल्कि टेम्पोरल रेसिडुअल्स (temporal residuals)—यानी, एक सेकंड पहले रोबोट ने जो देखा था और अब जो देख रहा है, उसके बीच के अंतर पर लागू करता है।

यह छोटा सा बदलाव इस दुविधा को तीन तरीकों से हल करता है:

  1. यह मस्तिष्क को स्थिर रखता है: यदि रोबोट का मस्तिष्क ढह जाता है और सोचना बंद कर देता है, तो फ्रेमों के बीच का "अंतर" शून्य हो जाता है, जो नियमों को तोड़ता है और रोबोट को खुद को ठीक करने का संकेत देता है।
  2. यह लैंडमार्क्स को बनाए रखता है: क्योंकि रोबोट को अपने वर्तमान दृश्य को एक आदर्श घेरे में रखने के लिए मजबूर नहीं किया जाता है, इसलिए वह अभी भी याद रख सकता है कि "रसोई" "बेडरूम" से अलग है। लैंडमार्क्स स्पष्ट रहते हैं।
  3. यह एक अंतर्निहित अलार्म बनाता है: चूंकि रोबोट ने सीखा है कि फ्रेमों के बीच दुनिया आमतौर पर कितनी बदलती है, इसलिए वह तुरंत पहचान सकता है कि परिवर्तन अजीब है। यदि रोबोट एक छोटी सी डगमगाहट की उम्मीद करता है लेकिन एक बड़ी छलांग देखता है, तो "अंतर" बहुत बड़ा होता है, और अलार्म बज जाता है।

व्यवहार में यह कैसे काम करता है

लेखकों ने एक प्रणाली बनाई है जिसे TRIM कहा जाता है, जिसके तीन भाग हैं, जो बिना किसी अतिरिक्त पाठ के एक साथ काम करते हैं:

  • TR-SIGReg (शिक्षक): यह रोबोट को प्रशिक्षित करता है। यह रोबोट को यह भविष्यवाणी करने के लिए सिखाता है कि दुनिया कैसे बदलती है, यह सुनिश्चित करते हुए कि क्षणों के बीच के "अंतर" एक स्वस्थ, अनुमानित सीमा के भीतर रहें।
  • TRIM-Monitor (सुरक्षा गार्ड): यह जादुई हिस्सा है। प्रशिक्षण समाप्त होने के बाद, सिस्टम रोबोट की भविष्यवाणी और वास्तविकता के बीच के "अंतर" को देखता है। यह महालानोबिस डिस्टेंस (Mahalanobis distance) नामक एक स्कोर की गणना करता है। यदि यह स्कोर बहुत अधिक है, तो इसका मतलब है कि रोबोट कुछ ऐसा देख रहा है जिसकी उसने उम्मीद नहीं की थी। चूंकि गणित प्रशिक्षण में ही शामिल है, इसलिए सिस्टम जानता है कि "बहुत अधिक" का क्या अर्थ है, बिना किसी मानव के अनुमान के। यह यहाँ तक बता सकता है कि समस्या एक छोटी, अस्थायी गड़बड़ी (जैसे कैमरा फ्लिकर) है या एक बड़ी, संरचनात्मक आपदा (जैसे दीवार गिरना)।
  • TRIM-Replan (पायलट): यदि किसी बड़े संकट के लिए अलार्म बजता है, तो रोबोट केवल रुक नहीं जाता। वह एक विशेष मानचित्र का उपयोग करके तेजी से एक नया रास्ता बनाता है जो उस "सुरक्षित क्षेत्र" के भीतर रहता है जिसे वह जानता है, लक्ष्य तक पहुँचने का प्रयास करते हुए खतरे से बचता है।

परिणाम: एक रोबोट जो सोच और प्रतिक्रिया दे सकता है

शोधकर्ताओं ने अपने नए सिस्टम का परीक्षण LIBERO नामक रोबोट चुनौतियों के एक प्रसिद्ध सेट पर किया, जिसमें ब्लॉक को स्टैक करने, वस्तुओं को हिलाने और निर्देशों का पालन करने जैसे कार्य शामिल हैं।

परिणाम प्रभावशाली थे। पुराने "बहुत अधिक व्यवस्थित" तरीके (वैनिला LeWM) का उपयोग करने वाला एक मानक रोबोट केवल 53.2% कार्यों में सफल रहा। जब शोधकर्ताओं ने TRIM जोड़ा, तो सफलता दर बढ़कर 73.6% हो गई। यह एक बड़ी छलांग है, जो रोबोट के प्रदर्शन को बहुत अधिक कंप्यूटिंग शक्ति और अतिरिक्त प्रशिक्षण की आवश्यकता वाले जटिल सिस्टमों के करीब ले आती है।

लेकिन असली परीक्षा तब आई जब शोधकर्ताओं ने वातावरण के साथ छेड़छाड़ की। उन्होंने "स्ट्रक्चरल डिस्टर्बेंस" (संरचनात्मक व्यवधान) पेश किए, जैसे कि अचानक कमरे के लेआउट को बदलना या रोबोट के दृश्य में गड़बड़ी पैदा करना।

  • पुराना तरीका बुरी तरह विफल रहा, जो केवल 38.0% बार सफल हुआ।
  • पिछला सर्वश्रेष्ठ "फिक्स-इट" सिस्टम (VLA-Corrector) 62.5% तक प्रबंधित कर सका।
  • TRIM 81.5% तक उछल गया।

इसका मतलब है कि TRIM ने मौजूदा सर्वोत्तम विधि की तुलना में रोबोट की बड़ी आपदाओं से उबरने की क्षमता में 19.0 प्रतिशत अंक का सुधार किया। इससे भी बेहतर यह है कि TRIM ने यह सब बिना किसी अतिरिक्त प्रशिक्षण के किया। "सुरक्षा गार्ड" पहले से ही वहां मौजूद था, प्रशिक्षण की गणित में छिपा हुआ, उपयोग किए जाने की प्रतीक्षा कर रहा था।

यह क्यों महत्वपूर्ण है

यह शोध पत्र तर्क देता है कि TRIM रोबोट को सिखाने के बारे में हमारी सोच को बदल देता है। "सीखने" और "सुरक्षा निगरानी" को दो अलग-अलग कार्यों के रूप में मानने के बजाय जिन्हें दो अलग उपकरणों की आवश्यकता होती है, TRIM दिखाता है कि वे एक ही सिक्के के दो पहलू हैं। वह सांख्यिकीय जानकारी जो रोबोट दुनिया कैसे काम करती है यह सीखने के लिए एकत्र करता है, वही जानकारी है जिसकी उसे यह जानने के लिए आवश्यकता है कि कब कुछ गलत है।

यह दृष्टिकोण "जीरो-शॉट" (zero-shot) है, जिसका अर्थ है कि रोबोट को आपदाओं के उदाहरण देखने की आवश्यकता नहीं है ताकि वह उन्हें पहचानना सीख सके। उसे बस यह समझने की आवश्यकता है कि दुनिया आमतौर पर कैसे चलती है। यह प्रणाली को बहुत अधिक कुशल और संभावित रूप से वास्तविक दुनिया के अनुप्रयोगों के लिए सुरक्षित बनाता है, जैसे कि अस्पतालों या कारखानों में काम करने वाले रोबोट, जहाँ किसी गलती को तुरंत पहचानना महत्वपूर्ण है।

लेखक सुझाव देते हैं कि यह विचार कई अन्य AI पर भी लागू हो सकता है, न कि केवल रोबोट पर। कोई भी सिस्टम जो भविष्य की भविष्यवाणी करके सीखता है, वह अपने स्वयं के "भविष्यवाणी नियमों" का उपयोग अपने स्वयं के सुरक्षा मॉनिटर के रूप में करने के लिए कर सकता है। हालांकि यह शोध सिमुलेशन और LIBERO बेंचमार्क पर केंद्रित है, इसके परिणाम एक शक्तिशाली नए तरीके का सुझाव देते हैं जिससे ऐसे AI का निर्माण किया जा सके जो न केवल स्मार्ट हो बल्कि अपनी सीमाओं के प्रति भी जागरूक हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →