← नवीनतम पेपर
🤖 AI

Information-Theoretic Constraints for Continual Vision-Language-Action Alignment

यह शोध पत्र Info-VLA का प्रस्ताव करता है, जो एक सूचनात्मक निरंतर शिक्षण (information-theoretic continual learning) ढांचा है जो महत्वपूर्ण क्रॉस-मोडल निर्भरताओं को संरक्षित करने के लिए रिप्ले एंकर कंट्रास्टिव लर्निंग (Replay Anchor Contrastive Learning) और क्रॉस-मोडल म्यूचुअल इंफॉर्मेशन मैक्सिमाइजेशन (Cross-Modal Mutual Information Maximization) का उपयोग करके विजन-लैंग्वेज-एक्शन मॉडलों में कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) को कम करता है, जिससे LIBERO बेंचमार्क पर कार्य प्रतिधारण (task retention) और अनुकूलन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Libang Zhao, Qixin Zeng, Hongyin Zhang, Donglin Wang

प्रकाशित 2026-03-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Libang Zhao, Qixin Zeng, Hongyin Zhang, Donglin Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप "रोबो" (Robo) नाम के एक रोबोट बटलर को घर के काम करना सिखा रहे हैं।

समस्या: "भुलक्कड़ बटलर" (The "Forgetful Butler")
अभी क्या होता है कि अगर आप रोबो को कॉफी बनाना सिखाते हैं, तो वह इसमें बहुत माहिर हो जाता है। लेकिन जैसे ही आप उसे कपड़े तह करना सिखाने की कोशिश करते हैं, कुछ अजीब सा होता है: वह अचानक कॉफी बनाना भूल जाता है। वह शायद कॉफी मशीन में कपड़े धोने का डिटर्जेंट डालने लगता है या कॉफी बीन्स को इस्त्री (iron) करने की कोशिश करने लगता है।

AI की दुनिया में, इसे कैटास्ट्रोफिक फॉरगेटिंग (Catastrophic Forgetting) कहा जाता है। जब एक रोबोट नया कौशल सीखता है, तो वह अनजाने में अपनी पुरानी यादों को मिटा देता है, जिससे वह जो देखता है (दृष्टि/vision), जो सुनता है (भाषा/language), और जो करता है (क्रिया/action) के बीच के कनेक्शन को गड़बड़ा देता है।

लेखकों ने गौर किया कि रोबोट केवल तथ्यों को नहीं भूल रहा है; वह उन चीजों के जुड़ाव के ढांचे (structure) को खो रहा है। यह ऐसा है जैसे रोबोट का दिमाग एक लाइब्रेरी हो जहाँ किताबें इधर-उधर बिखरी हुई हैं। "कॉफी" वाली किताब "लॉन्ड्री" वाली किताब के बगल में पहुँच जाती है, और रोबोट भ्रमित हो जाता है कि कौन सा निर्देश किस क्रिया के लिए है।

समाधान: Info-VLA (द "स्मार्ट लाइब्रेरियन")
टीम ने एक नया प्रशिक्षण तरीका बनाया है जिसे Info-VLA कहा जाता है। इसे एक सुपर-स्मार्ट लाइब्रेरियन की तरह समझें जो रोबोट को पुरानी चीजें भूले बिना नए कौशल सीखने में मदद करता है। वे लाइब्रेरी को व्यवस्थित रखने के लिए दो मुख्य तरीकों का उपयोग करते हैं:

ट्रिक 1: "फ्रोजन मेंटर" (Replay Anchor Contrastive Learning)

कल्पना कीजिए कि आप गिटार बजाना सीख रहे हैं। आपके पास एक शिक्षक है जो एक उस्ताद है।

  • पुराना तरीका: आप एक नया गाना सीखते हैं, और इस प्रक्रिया में, आप अनजाने में पुराने गानों के लिए अपनी 'मसल मेमोरी' (muscle memory) बिगाड़ देते हैं।
  • Info-VLA वाला तरीका: आप अपने शिक्षक द्वारा पुराने गाने बजाने की एक रिकॉर्डिंग रखते हैं। हर बार जब आप नया गाना सीखते हैं, तो आप अभ्यास के बीच में रुकते हैं और अपनी बजावट की तुलना उस रिकॉर्डिंग से करते हैं। वह रिकॉर्डिंग एक "फ्रोजन एंकर" (Frozen Anchor) के रूप में कार्य करती है। वह कहती है, "हे, याद है तुमने पुराने गाने के लिए कॉर्ड (chord) को कैसे पकड़ा था? उसे मत बदलो!"

पेपर में, वे एक "फ्रोजन टीचर मॉडल" (नया कार्य सीखने से पहले के रोबोट के मस्तिष्क का एक स्नैपशॉट) का उपयोग इस एंकर के रूप में करते हैं। यह सुनिश्चित करता है कि जब रोबोट कपड़े तह करना सीख रहा हो, तो वह गलती से कॉफी कप पकड़ने का तरीका न भूल जाए।

ट्रिक 2: "रिलेशनशिप मैप" (Cross-Modal Mutual Information)

यह दूसरा, अधिक सूक्ष्म तरीका है।
कल्पना कीजिए कि रोबोट का दिमाग एक नक्शा है।

  • विज़न (Vision) एक लाल कप की तस्वीर है।
  • लैंग्वेज (Language) शब्द है "कप"।
  • एक्शन (Action) हाथ का आगे बढ़ना है।

एक स्वस्थ मस्तिष्क में, ये तीनों आपस में मजबूती से जुड़े होते हैं। यदि आप लाल कप देखते हैं, तो आप "कप" सोचते हैं, और आप हाथ बढ़ाते हैं।
जब रोबट एक नया कार्य सीखता है, तो नक्शा विकृत हो जाता है। "लाल कप" और "हाथ बढ़ाना" के बीच का लिंक इतना खिंच सकता है कि रोबोट कप को देखता है लेकिन सोचता है "कुछ मत करो" या "कुर्सी उठाओ"।

Info-VLA म्युचुअल इंफॉर्मेशन (Mutual Information) का उपयोग इन बिंदुओं को जोड़ने वाले एक रबर बैंड की तरह करता है। यह लगातार जाँचता है: "क्या रोबोट अभी भी समझता है कि 'लाल कप' और 'हाथ बढ़ाना' एक साथ संबंधित हैं?" यह रोबोट को पुराने कौशलों के बीच के सांख्यिकीय संबंध को मजबूत बनाए रखने के लिए मजबूर करता है, भले ही वह कुछ नया सीख रहा हो। यह पुराने कौशलों के बीच के कनेक्शन पर "डू नॉट डिस्टर्ब" (Do Not Disturb) का साइन लगाने जैसा है ताकि वे खिंचकर अपना आकार न बदल लें।

परिणाम
इन दो ट्रिक्स का उपयोग करके, रोबोट (रोबो) पुराने कौशलों (जैसे कॉफी बनाना) को भूले बिना एक नया कौशल (जैसे टोस्ट बनाना) सीख सकता है।

  • Info-VLA के बिना: रोबोट टोस्ट बनाना सीखता है, कॉफी बनाना भूल जाता है, और "टोस्ट" और "टोस्टर" के बीच का संबंध गड़बड़ा जाता है।
  • Info-VLA के साथ: रोबोट टोस्ट बनाना सीखता है, कॉफी बनाना याद रखता है, और "टोस्ट" और "टोस्टर" के बीच का संबंध पूरी तरह स्पष्ट रहता है।

यह क्यों महत्वपूर्ण है
यह एक बड़ी बात है क्योंकि रोबोटों को वास्तव में हमारे घरों में मददगार होने के लिए, उन्हें लाइफटाइम लर्नर्स (lifelong learners) बनने की आवश्यकता है। उन्हें हर दिन नए काम सीखने में सक्षम होना चाहिए, बिना हर बार शुरू से फिर से ट्रेनिंग लिए या रीसेट हुए। यह पेपर हमें ऐसे रोबोट बनाने का ब्लूप्रिंट देता है जो अपना मानसिक संतुलन खोए बिना समय के साथ स्मार्ट बन सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →