HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy
यह शोध पत्र HAMLET को पेश करता है, जो एक स्केलेबल फ्रेमवर्क है जो टाइम-कॉन्ट्रास्टिव मोमेंट टोकन और एक लाइटवेट मेमोरी मॉड्यूल को एकीकृत करके विजन-लैंग्वेज-एक्शन मॉडल्स को बढ़ाता है ताकि ऐतिहासिक संदर्भ का प्रभावी ढंग से लाभ उठाया जा सके, जिससे लॉन्ग-होरिजन और हिस्ट्री-डिपेंडेंट कार्यों पर रोबोटिक मैनिपुलेशन के प्रदर्शन में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखा रहे हैं, जैसे सैंडविच बनाना या कमरा व्यवस्थित करना। आप उसे एक कैमरा और एक वॉयस कमांड देते हैं: "सेब को कटोरे में रख दो।"
मौजूदा अधिकांश रोबोट दिमाग (जिन्हें विज़न-लैंग्वेज-एक्शन मॉडल या VLAs कहा जाता है) बहुत छोटी याददाश्त वाली गोल्डफिश की तरह काम करते हैं। वे केवल उसी सटीक तस्वीर को देखते हैं जो वे इस सेकंड में देख रहे हैं। उन्हें याद नहीं रहता कि एक सेकंड पहले क्या हुआ था।
इससे समस्याएँ होती हैं। यदि रोबोट सेब उठाता है, उसे नीचे रखता है, और फिर कैमरा एंगल बदल जाता है जिससे सेब एक कप के पीछे छिप जाता है, तो रोबोट घबरा जाता है। वह एक कप और मेज देखता है, लेकिन सेब नहीं दिखता। वह भूल जाता है, "अरे रुको, मैंने अभी वह सेब पकड़ा था!" और वह कप उठाने की कोशिश कर सकता है या बस रुक सकता है।
आपके द्वारा साझा किया गया पेपर एक नया सिस्टम पेश करता है जिसे HAMLET कहा जाता है। HAMLET को एक रोबोट को स्मार्ट डायरी और एक हाइलाइटर पेन देने जैसा समझें।
यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:
1. समस्या: "गोल्डफिश" रोबोट
मौजूदा रोबोट ऐसे लोगों की तरह हैं जो आंखों पर पट्टी बांधकर पहेली सुलझाने की कोशिश कर रहे हैं। वे केवल वर्तमान फ्रेम को देखते हैं।
- उपमा: कल्पना कीजिए कि आप "साइमन कहता है" (Simon Says) खेल खेल रहे हैं लेकिन आप केवल वर्तमान निर्देश सुन सकते हैं और पिछले निर्देशों की आपको कोई याद नहीं रहती। यदि साइमन कहता है, "अपनी नाक छुओ, फिर अपने पैर छुओ," और आप केवल "अपने पैर छुओ" सुनते हैं, तो आप अपने पैर छू सकते हैं जबकि आपकी नाक अभी भी हवा में है, या आप भूल सकते हैं कि आपको पहले अपनी नाक छूनी थी।
- परिणाम: रोब वाले लंबे कार्यों (जैसे "कप उठाओ, उसे मेज पर रखो, फिर उस पर एक किताब रखो") में विफल हो जाते हैं क्योंकि वे बीच के चरणों को भूल जाते हैं।
2. समाधान: HAMLET (स्मार्ट डायरी)
HAMLET रोबोट को सब कुछ शून्य से फिर से सीखने के लिए मजबूर नहीं करता है (जो धीमा और महंगा है)। इसके बजाय, यह मौजूदा रोबोट के दिमाग में दो चतुर उपकरण जोड़ता है:
A. मोमेंट टोकन (द "हाइलाइटर")
हर बार जब रोबोट एक तस्वीर लेता है, तो वह एक छोटा, संक्षिप्त नोट बनाता है जिसे मोमेंट टोकन कहा जाता है।
- यह कैसे काम करता है: पूरी हाई-डेफिनिशन फोटो को सेव करने के बजाय (जिसमें बहुत जगह लगती है), रोबोट एक विशेष "हाइलाइटर" का उपयोग करके केवल महत्वपूर्ण चीजों को मार्क करता है जो उस पल में मायने रखती हैं।
- जादू: रोबोट को उबाऊ, स्थिर चीजों (जैसे दीवार या मेज) को अनदेखा करने और केवल उन चीजों को हाइलाइट करने के लिए प्रशिक्षित किया जाता है जो बदलती हैं या महत्वपूर्ण हैं (जैसे ग्रिपर का हिलना या कप का उठना)।
- उपमा: कल्पना कीजिए कि आप एक लंबा उपन्यास पढ़ रहे हैं। हर पेज की फोटोकॉपी करने के बजाय ताकि आप कहानी याद रख सकें, आप हर अध्याय के लिए एक स्टिकी नोट पर एक वाक्य का सारांश लिखते हैं। "अध्याय 1: नायक गुफा में प्रवेश करता है।" "अध्याय 2: नायक को तलवार मिलती है।"
B. मेमोरी मॉड्यूल (द "डायरी")
ये "स्टिकी नोट्स" (मोमेंट टोकन) एक मेमोरी मॉड्यूल में डाले जाते हैं।
- यह कैसे काम करता है: यह मॉड्यूल एक स्मार्ट लाइब्रेरियन की तरह है। यह नोट्स को केवल एक ढेर में नहीं रखता। यह वर्तमान स्थिति को देखता है और पूछता है, "मेरे पिछले नोट्स में से कौन सा अभी उपयोगी है?"
- जादू: यदि रोबोट वर्तमान में एक कप के बारे में भ्रमित है, तो मेमोरी मॉड्यूल कहता है, "हे, 5 सेकंड पहले के नोट को देखो! यह वही समय था जब हमने नीला कप देखा था।" यह निर्णय लेने के लिए उस विशिष्ट स्मृति को निकालता है।
- उपमा: यह एक ऐसे दोस्त के साथ बातचीत करने जैसा है जिसकी याददाश्त बहुत तेज है। आप कहते हैं, "मुझे लगता है कि मेरी चाबियाँ खो गई हैं।" आपका दोस्त (मेमोरी मॉड्यूल) कहता है, "रुको, मुझे याद है कि जब तुम अंदर आए थे तब तुमने उन्हें काउंटर पर रखा था।" आपको सब कुछ याद रखने की ज़रूरत नहीं थी; आपके दोस्त ने आपको सही समय पर सही जानकारी दे दी।
3. यह सिर्फ रोबोट को अधिक तस्वीरें दिखाने से बेहतर क्यों है?
आप सोच सकते हैं, "क्यों न रोबोट को इतिहास देखने के लिए पिछली 10 तस्वीरें दिखाई जाएं?"
- पुराना तरीका (मल्टी-फ्रेम): यह एक साथ 10 पन्ने पढ़ने की कोशिश करने जैसा है जैसे कि अपनी आँखें सिकोड़कर पढ़ना। यह भारी, धीमा है और रोबोट बहुत अधिक विजुअल शोर (visual noise) से भ्रमित हो जाता है। यह रोबोट के दिमाग को धीमा करता है और बहुत अधिक कंप्यूटर मेमोरी का उपयोग करता है।
- HAMLET का तरीका: यह सारांश नोट्स पढ़ने जैसा है। यह हल्का और तेज़ है। रोबोट केवल अतीत का "सार" लेकर चलता है, कच्चा डेटा नहीं। यह एक लाइब्रेरी के बजाय एक जेब के आकार की डायरी ले जाने जैसा है।
4. परिणाम: अनाड़ी से सक्षम तक
शोधकर्ताओं ने वास्तविक रोबोटों पर जटिल कार्य करते हुए HAMLET का परीक्षण किया, जैसे:
- कवर और स्टैक (Cover and Stack): एक क्यूब को कप से ढकना, फिर उसके ऊपर एक और कप रखना।
- क्यूब्स को बदलना (Swap Cubes): दो क्यूब्स को एक विशिष्ट क्रम में इधर-उधर ले जाना।
परिणाम:
- HAMLET के बिना, रोबोट अक्सर भ्रमित हो जाता था, चीजें गिरा देता था या गलत वस्तु को हिला देता था।
- HAMLET के साथ, रोबोट घरेलू कामों का मास्टर बन गया। एक परीक्षण में, सफलता दर 29% से बढ़कर 76% हो गई। यह चार में से तीन बार ड्राइविंग टेस्ट फेल होने से लगभग हर बार पास होने जैसा है।
मुख्य निष्कर्ष
HAMLET एक "प्लग-इन" अपग्रेड है। आपको रोबोट के दिमाग को फिर से बनाने या उसे शून्य से सिखाने की आवश्यकता नहीं है। आप बस उसे एक स्मार्ट मेमोरी सिस्टम देते हैं जो अतीत को संक्षेप में लिखने और ज़रूरत पड़ने पर सही विवरणों को याद करने में सक्षम है।
यह एक ऐसे रोबोट को जो केवल "वर्तमान" में जीता है, एक ऐसे रोबोट में बदल देता है जो यह समझता है कि वह क्या कर रहा है उसकी "कहानी" को, जिससे वह जटिल, लंबे समय तक चलने वाले कार्यों में बहुत बेहतर हो जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।