← नवीनतम पेपर
💻 computer science

Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control

यह शोध पत्र स्टीयरेबल पॉलिसीज़ (Steerable Policies) को प्रस्तुत करता है, जो एक नवीन दृष्टिकोण है जो प्राकृतिक भाषा इंटरफेस की सीमाओं को दूर करने के लिए मल्टी-लेवल सिंथेटिक कमांड्स पर विजन-लैंग्वेज-एक्शन मॉडल्स को प्रशिक्षित करता है, जिससे रोबोटिक टास्क जनरलाइजेशन और लॉन्ग-हॉरिजॉन कंट्रोल में सुधार के लिए प्री-ट्रेन्ड विजन-लैंग्वेज मॉडल ज्ञान के अधिक प्रभावी ग्राउंडिंग को सक्षम बनाया जा सके।

मूल लेखक: William Chen, Jagdeep Singh Bhatia, Catherine Glossop, Nikhil Mathihalli, Ria Doshi, Andy Tang, Danny Driess, Karl Pertsch, Sergey Levine

प्रकाशित 2026-03-04
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: William Chen, Jagdeep Singh Bhatia, Catherine Glossop, Nikhil Mathihalli, Ria Doshi, Andy Tang, Danny Driess, Karl Pertsch, Sergey Levine

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को रात का खाना बनाना सिखाने की कोशिश कर रहे हैं। आपके पास एक बहुत ही बुद्धिमान, विद्वान "हेड शेफ" (एक बड़ा AI मॉडल) है जो सभी रेसिपी जानता है, समझता है कि सामग्रियां कैसी दिखती हैं, और जटिल समस्याओं पर तर्क कर सकता है। हालांकि, हेड शेफ को एक "लाइन कुक" (रोबोट के फिजिकल कंट्रोल सिस्टम) से बात करनी है, जो केवल बहुत विशिष्ट, शाब्दिक निर्देशों को ही समझ सकता है।

समस्या:
अतीत में, हेड शेफ लाइन कुक को केवल अस्पष्ट आदेश दे सकता था जैसे, "सलाद बनाओ।"
यदि लाइन कुक को यह नहीं पता होता कि कौन सा सलाद पत्ता उठाना है, या यदि मेज पर दो एक जैसे कटोरे रखे हों, तो रोबोट भ्रमित हो जाता, गलत चीज़ उठा लेता, या बस वहीं खड़ा रहता। हेड शेफ के शानदार विचार बेकार चले जाते क्योंकि लाइन कुक सूक्ष्म अंतर (nuance) को नहीं समझ पाता था।

समाधान: "स्टीयरेबल पॉलिसीज़" (Steerable Policies)
यह पेपर रोबोट से बात करने का एक नया तरीका पेश करता है जिसे स्टीयरेबल पॉलिसीज़ कहा जाता है। केवल रोबोट को एक उच्च-स्तरीय लक्ष्य देने के बजाय, अब हेड शेफ स्थिति की आवश्यकता के अनुसार किसी भी स्तर का विवरण दे सकता है।

इसे किसी मित्र को निर्देश देने जैसा समझें:

  1. उच्च-स्तरीय (क्या): "जाकर दूध ले आओ।" (सरल कार्यों के लिए अच्छा है)।
  2. उप-कार्य (कैसे): "फ्रिज तक जाओ, दरवाजा खोलो, और हैंडल को पकड़ो।" (अधिक विशिष्ट)।
  3. एटॉमिक मोशन (गति): "अपने हाथ को बाएं, फिर नीचे, और फिर मुट्ठी बंद करो।" (बाधाओं से बचने के लिए अच्छा है)।
  4. पिक्सेल कोऑर्डिनेट्स (बिंदु): "स्क्रीन पर इस विशिष्ट स्थान पर मौजूद वस्तु को पकड़ो।" (महत्वपूर्ण जब रोबोट वस्तु का नाम नहीं जानता या वहां कई समान वस्तुएं हों)।

जादुई सामग्री: सिंथेटिक ट्रेनिंग (Synthetic Training)
शोधकर्ताओं ने महसूस किया कि रोबलेट ट्रेनिंग डेटा में आमतौर पर केवल "सलाद बनाओ" जैसे अस्पष्ट लेबल होते हैं। इसे ठीक करने के लिए, उन्होंने एक पाइपलाइन बनाई जो स्वचालित रूप से घंटों के रोबोट वीडियो लेती है और हर एक गति के लिए इन विभिन्न प्रकार के निर्देशों को गढ़ती (invent) है।

  • उपमा: कल्पना कीजिए कि आप किसी व्यक्ति के खाना पकाने के वीडियो को लेते हैं और स्वचालित रूप से उसके लिए सबटाइटल लिखते हैं जो न केवल "पकाएं" कहते हैं, बल्कि "हाथ को 12 बजे की दिशा में ले जाएं," "लाल मिर्च को पकड़ें," और "कलाई को 45 डिग्री घुमाएं" भी कहते हैं। उन्होंने इस विशाल, बहु-स्तरीय डेटासेट को रोबोट को खिलाया।

परिणाम: एक लचीली टीम
अब, हेड शेफ (AI) दृश्य को देख सकता है और तय कर सकता है कि लाइन कुक से बात करने का सबसे अच्छा तरीका क्या है:

  • यदि रोबोट अच्छा कर रहा है, तो शेफ कहता है, "गाजर को प्लेट पर रखें।"
  • यदि रोबोट दो समान गाजरों के कारण भ्रमित है, तो शेफ कहता है, "[x, y] कोऑर्डिनेट्स पर मौजूद गाजर को पकड़ें।"
  • यदि रोबोट दीवार से टकराने वाला है, तो शेफ कहता है, "दाएं और ऊपर की ओर बढ़ें।"

यह क्यों मायने रखता है:

  • बेहतर सामान्यीकरण (Generalization): रोबोट उन नई, अजीब वस्तुओं को भी संभाल सकता है जिन्हें उसने पहले कभी नहीं देखा है, क्योंकि हेड शेफ बस उनकी ओर इशारा कर सकता है (" [x,y] पर मौजूद चीज़ को पकड़ो") बजाय इसके कि उसे उनका नाम जानने की आवश्यकता हो।
  • स्व-सुधार (Self-Correction): यदि रोबोट गलती करता है, तो हेड शेफ तुरंत अपनी रणनीति बदल सकता है। यदि "हथौड़ा पकड़ें" विफल हो जाता है क्योंकि रोबोट ने पेंच (screw) पकड़ लिया है, तो शेफ सुधार के लिए "हथौड़े के हैंडल तक दाएं और ऊपर की ओर बढ़ें" पर स्विच कर सकता है।
  • AI क्षमता को अनलॉक करना: यह अंततः सुपर-स्मार्ट AI मॉडल को भौतिक रोबोट को नियंत्रित करने के लिए अपनी पूरी तर्क शक्ति का उपयोग करने की अनुमति देता है, बजाय इसके कि वे एक "मूर्ख" इंटरफ़ेस तक सीमित रह जाएं।

संक्षेप में:
यह पेपर रोबोट को एक बहुत व्यापक शब्दावली समझने की शिक्षा देता है। यह एक प्रतिभाशाली AI के मस्तिष्क और एक रोबोट के शरीर के बीच के अंतर को पाटता है, जिससे वे किसी कार्य के हर एक क्षण के लिए सटीक स्तर का विवरण संचारित कर सकते हैं। यह एक ऐसे रोबोट से अपग्रेड करने जैसा है जो केवल "हाँ/नहीं" समझता है, उस रोबोट में जो एक पूर्ण, सूक्ष्म बातचीत को समझ सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →