← नवीनतम पेपर
💻 computer science

Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents

Harness VLA एक मेमोरी-ऑगमेंटेड एजेंटिक फ्रेमवर्क है जो फ्रोजन विजन-लैंग्वेज-एक्शन मॉडल्स को रिट्रिएबल कॉन्टैक्ट-रिच प्रिमिटिव्स के रूप में मानकर और उन्हें एनालिटिक प्रिमिटिव्स की एक निश्चित लाइब्रेरी के साथ कंपोज करके जटिल मैनिपुलेशन कार्यों में उनकी विश्वसनीयता को बढ़ाता है, जिससे बिना किसी मॉडल फाइनट्यूनिंग के LIBERO-Pro और RoboCasa365 जैसे बेंचमार्क पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

मूल लेखक: Yixian Zhang, Huanming Zhang, Feng Gao, Xiao Li, Zhihao Liu, Chunyang Zhu, Jiaxing Qiu, Yuchen Yan, Jiyuan Liu, Wenhao Tang, Zhengru Fang, Yi Nie, Changxu Wei, Yu Wang, Wenbo Ding, Chao Yu

प्रकाशित 2026-07-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yixian Zhang, Huanming Zhang, Feng Gao, Xiao Li, Zhihao Liu, Chunyang Zhu, Jiaxing Qiu, Yuchen Yan, Jiyuan Liu, Wenhao Tang, Zhengru Fang, Yi Nie, Changxu Wei, Yu Wang, Wenbo Ding, Chao Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट दिमाग है जो एक विशिष्ट कार्य में अद्भुत है: अजीब आकार की वस्तुओं को पकड़ना, चिपचिले नॉब्स को घुमाना, या बटन दबाना। यह एक विश्व स्तरीय शेफ की तरह है जो सब्जियों को काटने और स्टेक को पूरी तरह से पकाने में माहिर है। लेकिन यदि आप उससे एक पूरी डिनर पार्टी की योजना बनाने, भीड़भाड़ वाली रसोई में रास्ता खोजने, या यह पता लगाने के लिए कहें कि नमक कहाँ है जब मेज को हिला दिया गया हो, तो वह पूरी तरह से खो जाता है। वे शायद नमक के डिब्बे को काटने की कोशिश करेंगे क्योंकि उन्हें एक विशिष्ट टेबल लेआउट पर प्रशिक्षित किया गया था, या वे जम सकते हैं यदि निर्देश थोड़े से भी बदल जाएं।

यही वर्तमान "विज़न-लैंग्वेज-एक्शन" (VLA) रोबोट्स की समस्या है। वे "कॉन्टैक्ट" वाले हिस्से (छूने और हिलाने) में तो बेहतरीन हैं, लेकिन जब चीजें अस्त-व्यस्त या अलग होती हैं, तो वे "प्लानिंग" (योजना बनाने) में बहुत खराब होते हैं।

मिलिए Harness VLA से। इसे एक नया रोबोट दिमाग नहीं, बल्कि एक शानदार प्रोजेक्ट मैनेजर के रूप में सोचें जो रसोई चलाने की जिम्मेदारी संभाल लेता है।

टीम-अप: मैनेजर और स्पेशलिस्ट

इस नए सिस्टम में, रोबोट का दिमाग (VLA) "फ्रोजन" (जमा हुआ) है। इसका मतलब है कि हम इसे फिर से प्रशिक्षित नहीं कर रहे हैं या इसे नए करतब नहीं सिखा रहे हैं। यह बिल्कुल वैसा ही रहता है जैसा यह है, यानी संपर्क-प्रधान कार्यों में एक विशेषज्ञ। Harness VLA सिस्टम इस विशेषज्ञ के चारों ओर एक "मैनेजर" (एक AI एजेंट) को लपेट देता है।

यहाँ बताया गया है कि वे एक साथ कैसे काम करते हैं:

  1. मैनेजर (द प्लानर): यह बॉस है। यह कार्य को देखता है (जैसे, "दूध को फ्रिज में रखें"), कमरे का जायजा लेता है, और काम को छोटे, तार्किक चरणों में तोड़ देता है। यह कुछ निश्चित "एनालिटिक" टूल्स का उपयोग करता है—जैसे हाथ को चलाने के लिए एक GPS, ग्रिपर खोलने के लिए एक सरल कमांड, या कलाई को घुमाने के लिए एक मूव। ये टूल्स रोबोट के बुनियादी रिफ्लेक्स की तरह हैं: अनुमानित, विश्वसनीय, और खाली स्थान में चलने के लिए एकदम सही।
  2. स्पेशलिस्ट (द फ्रोजन VLA): मैनेजर स्पेशलिस्ट को केवल तभी बुलाता है जब चीजें कठिन हो जाती हैं। जब रोबोट को वास्तव में एक फिसलन भरे दूध के कार्टन को पकड़ने, नल घुमाने, या बटन दबाने की आवश्यकता होती है, तो मैनेजर कहता है, "ठीक है, स्पेशलिस्ट, अब तुम्हारी बारी है!" स्पेशलिस्ट अपना जादू दिखाता है, और फिर नियंत्रण वापस मैनेजर को सौंप देता है।

सीक्रेट सॉस: मेमोरी नोटबुक

असली जादू केवल टीम-अप नहीं है; यह मेमोरी है।

कल्पना कीजिए कि मैनेजर के पास दो नोटबुक हैं:

  • टास्क नोटबुक: एक बार जब रोबोट सफलतापूर्वक किसी समस्या को हल कर लेता है, तो मैनेजर उन चरणों के क्रम को लिख लेता है जो उसने लिए थे। लेकिन यहाँ दिलचस्प बात यह है कि सटीक निर्देशांक (coordinates) जैसे "x=1.2, y=0.5 पर ले जाएं" लिखने के बजाय, वह लॉजिक लिखता है जैसे "लाल कटोरे की ओर बढ़ें।" इस तरह, यदि कल कटोरा किसी दूसरी जगह पर होता है, तो मैनेजर अभी भी उसी योजना का उपयोग कर सकता है, बस उसे नई लोकेशन के अनुसार फिर से निशाना बनाना होगा।
  • ग्लोबल नोटबुक: यह विभिन्न कार्यों से सीखे गए "नियमों" और "सबक" का संग्रह है। इसमें नोट्स शामिल हैं जैसे, "यदि ग्रिपर बंद होता है लेकिन वस्तु नहीं हिलती है, तो यह एक नकली पकड़ है—फिर से प्रयास करें," या "सफलता का संकेत मिलने से पहले जश्न न मनाएं।"

जब कोई नया कार्य आता है, तो मैनेजर इन नोटबुक्स को चेक करता है। यदि रोबलेट विफल हो जाता है, तो मैनेजर हार नहीं मानता। वह "विफलता के नियमों" को पढ़ता है, योजना को एडजस्ट करता है, रोबोट को फिर से पोजीशन करता है, और स्पेशलिस्ट की मदद के लिए फिर से प्रयास करता है। यह बिल्कुल वैसा ही है जैसे कोई इंसान साइकिल चलाना सीख रहा हो: आप गिरते हैं, आपको याद रहता है कि क्या गलत हुआ, आप अपने संतुलन को एडजस्ट करते हैं, और फिर से कोशिश करते हैं।

यह सिस्टम क्या नहीं है

पेपर बहुत स्पष्ट है कि यह सिस्टम क्या नहीं करता है। यह दो सामान्य विचारों के खिलाफ स्पष्ट रूप से तर्क देता है:

  1. यह रोबोट के दिमाग को बड़ा या स्मार्ट बनाने की कोशिश नहीं करता है। लेखकों ने सब कुछ करने के लिए एक नया, विशाल AI मॉडल प्रशिक्षित नहीं किया। उन्होंने दिमाग को छोटा और स्थिर रखा।
  2. यह रोबोट को नए कौशल की अनंत लाइब्रेरी नहीं देता है। मैनेजर मौके पर नए टूल्स का आविष्कार नहीं करता है। यह कुछ निश्चित टूल्स (Move, Rotate, Grab, Release) का उपयोग करता है और उन्हें पूरी तरह से संयोजित करना सीखता है।

पेपर सुझाव देता है कि एक विशाल AI को सब कुछ (प्लानिंग, मूविंग और ग्रैबिंग) करने की कोशिश करना ही असल समस्या है। काम को बांट देने से, सिस्टम बहुत अधिक विश्वसनीय हो जाता है।

परिणाम: क्या यह काम करता है?

लेखकों ने कई वर्चुअल वर्ल्ड्स में इस सिस्टम का परीक्षण किया, साधारण टेबलटॉप गेम्स से लेकर जटिल किचन सिमुलेशन तक। परिणाम काफी प्रभावशाली रहे:

  • एक मानक टेस्ट LIBERO-Pro पर, जहाँ निर्देशों को बदला गया था या वस्तुओं को नई जगहों पर रखा गया था, Harness VLA सिस्टम पिछले सर्वोत्तम तरीकों की तुलना में 38.6 प्रतिशत अंक अधिक बार सफल रहा।
  • एक किचन सिमुलेशन RoboCasa365 पर, इसने सफलता दर में 25.4 प्रतिशत अंक का सुधार किया।
  • एक ड्यूल-आर्म रोबोट टेस्ट RoboTwin पर, इसने 58.4% की सफलता दर हासिल की।

पेपर दिखाता है कि एक स्मार्ट मैनेजर को प्लानिंग और मेमोरी संभालने देकर, और केवल वास्तविक पकड़ने के काम के लिए फ्रोजन "स्पेशलिस्ट" दिमाग का उपयोग करके, रोबोट पहले की तुलना में वास्तविक दुनिया के बदलावों को बहुत बेहतर तरीके से संभाल सकता है। यह एक याद दिलाता है कि कभी-कभी, सुपर-रोबोट बनाने का सबसे अच्छा तरीका उसे एक बड़ा दिमाग देना नहीं, बल्कि उसे एक बेहतर मैनेजर देना होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →