← नवीनतम पेपर
💻 computer science

How to Instruct Your Robot: Dense Language Annotations Power Robot Policy Learning

यह शोधपत्र DeMiAn को प्रस्तुत करता है, जो एक दो-चरणीय ढांचा है जो VLM-जनित सघन, बहु-आयामी भाषाई एनोटेशन का लाभ उठाकर बिना किसी नए प्रदर्शन डेटा की आवश्यकता के विविध कार्यों में रोबोट नीति शिक्षण और सामान्यीकरण को महत्वपूर्ण रूप से सुधारता है।

मूल लेखक: Bosung Kim, Ruiyi Wang, David Acuna, Jaehun Jung, Alexander Trevithick, Brandon Cui, Yejin Choi, Prithviraj Ammanabrolu

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bosung Kim, Ruiyi Wang, David Acuna, Jaehun Jung, Alexander Trevithick, Brandon Cui, Yejin Choi, Prithviraj Ammanabrolu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखाने की कोशिश कर रहे हैं। अतीत में, रोबोट के हाथ को हर छोटी हरकत के लिए हजारों बार शारीरिक रूप से गाइड करने का एकमात्र तरीका था, और हर सूक्ष्म गतिविधि को रिकॉर्ड किया जाता था। यह महंगा, धीमा और बहुत अधिक विशेष हार्डवेयर की मांग करने वाला काम था।

जिस शोध पत्र के बारे में आप पूछ रहे हैं, "How to Instruct Your Robot: Dense Language Annotations Power Robot Policy Learning," वह एक चतुर शॉर्टकट का प्रस्ताव देता है। यह सुझाव देता है कि अधिक रोबोटिक गतिविधियाँ रिकॉर्ड करने के बजाय, हमारे पास पहले से मौजूद रिकॉर्डिंग में अधिक विस्तृत विवरण जोड़कर बेहतर परिणाम प्राप्त किए जा सकते हैं।

यहाँ उनके विचार का विवरण दिया गया है, जिसमें रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है:

1. समस्या: "बेयर बोन्स" (अल्प जानकारी वाला) मैनुअल

वर्तमान में, जब हम किसी को दराज खोलने का वीडियो दिखाते हैं, तो हम आमतौर पर उसे केवल "दराज खोलें" (Open Drawer) जैसा एक छोटा सा लेबल देते हैं।

इसे एक छात्र को गणित का सवाल देने जैसा समझें जिसमें केवल अंतिम उत्तर दिया गया हो: "उत्तर 42 है।" छात्र (रोबोट) दराज खुलने का वीडियो देखता है, लेकिन लेबल यह नहीं बताता कि हाथ कैसे हिला, हैंडल कहाँ था, या उसने हाथ को उस तरह से क्यों पकड़ा। रोबोट को केवल पिक्सेल देखकर ही सभी छिपे हुए विवरणों का अनुमान लगाना पड़ता है।

2. समाधान: "सघन" (डेंस) एनोटेशन

लेखकों, बोसुंग किम और उनकी टीम ने महसूस किया कि नई रोबोटिक गतिविधियाँ रिकॉर्ड करना महंगा है, लेकिन विस्तृत विवरण लिखना सस्ता है। उन्होंने मौजूदा वीडियो के लेबल को स्वचालित रूप से फिर से लिखने के लिए एक AI (विज़न-लैंग्वेज मॉडल) का उपयोग किया।

केवल "दराज खोलें" कहने के बजाय, उन्होंने प्रत्येक क्लिप के लिए चार अलग-अलग प्रकार की विस्तृत "कहानियां" तैयार कीं:

  • शारीरिक गति (Physical Motion): "हाथ हैंडल की ओर बढ़ता है, उंगलियां उसके चारों ओर मुड़ती हैं, और हाथ पीछे की ओर खिंचता है।" (गति पर ध्यान केंद्रित करना)।
  • दृश्य संरचना (Scene Composition): "काउंटर के ऊपर एक लकड़ी की कैबिनेट है जिसमें दाईं ओर एक धातु का हैंडल लगा है।" (चीजें कहाँ हैं, इस पर ध्यान केंद्रित करना)।
  • हाथ की मुद्रा (Arm Pose): "हाथ छाती की ऊंचाई से सीधा शुरू होता है, फिर पकड़ते समय झुक जाता है।" (रोबोट के शरीर के आकार पर ध्यान केंद्रित करना)।
  • तर्क (Reasoning): "यह पहला चरण है; हमें अंदर की वस्तुओं को पकड़ने से पहले दरवाजा खोलना होगा।" (तर्क/लॉजिक पर ध्यान केंद्रित करना)।

वे इस प्रणाली को DeMiAn (डेंस मल्टी-एस्पेक्ट एनोटेशन) कहते हैं। यह एक साधारण निर्देश पुस्तिका को एक समृद्ध, सचित्र मार्गदर्शिका में बदलने जैसा है जिसमें स्टेप-बाय-स्टेप टिप्पणी दी गई हो।

3. ट्विस्ट: सभी कहानियाँ समान नहीं होतीं

यहाँ वह चौंकाने वाला हिस्सा है जो टीम ने खोजा: हर कार्य के लिए कोई एक "सर्वश्रेष्ठ" कहानी नहीं होती है।

  • "डिश रैक खिसकाने" जैसे कार्य के लिए, रोबोट शारीरिक गति (Physical Motion) की कहानी से सबसे अच्छा सीखता है (खिसकने की गति का वर्णन)।
  • "एक विशिष्ट रंग के कप को उठाने" जैसे कार्य के लिए, रोबोट दृश्य संरचना (Scene Composition) की कहानी से सबसे अच्छा सीखता है (रंगों और स्थानों का वर्णन)।
  • "कॉफी बनाने" जैसे जटिल कार्य के लिए, तर्क (Reasoning) वाली कहानी (चरणों के क्रम को समझाना) सबसे अधिक मदद करती है।

यदि आप रोबोट को केवल "मोशन" कहानियों से सीखने के लिए मजबूर करते हैं, तो वह चलने-फिरना में तो बहुत अच्छा होगा लेकिन वस्तुओं को खोजने में खराब होगा। यदि आप उसे केवल "रीजनिंग" से सीखने के लिए मजबूर करते हैं, तो वह योजना को तो समझ जाएगा लेकिन भौतिक रूप से पकड़ने (grab) में विफल हो सकता है।

4. जादू का नुस्खा: "स्मार्ट इंस्ट्रक्टर"

चूंकि सर्वश्रेष्ठ प्रकार की कहानी कार्य के आधार पर बदलती है, इसलिए टीम ने एक छोटा AI "इंस्ट्रक्टर" बनाया है।

इस इंस्ट्रक्टर को एक पर्सनल टूर गाइड के रूप में सोचें जो रोबोट के लिए काम करता है।

  1. रोबोट दृश्य को देखता है (जैसे, रसोई का काउंटर)।
  2. इंस्ट्रक्टर दृश्य और कार्य को देखता है ("दराज खोलें")।
  3. इंस्ट्रक्टर तुरंत निर्णय लेता है: "इस विशिष्ट काम के लिए, रोबोट को दृश्य के रंगों के बजाय हाथ की शारीरिक गति के बारे में सुनने की आवश्यकता है।"
  4. इंस्ट्रक्टर फिर वह विशिष्ट विस्तृत विवरण उत्पन्न करता है और उसे रोबोट को फीड करता है जबकि रोबोट पहले से ही चल रहा होता है।

महत्वपूर्ण रूप से, यह इतना तेज़ (एसिंक्रोनसली) होता है कि रोबोट को रुकने और गाइड के बोलने का इंतज़ार नहीं करना पड़ता। गाइड सही समय पर सही टिप फुसफुसा देता है, जिससे होने वाली देरी छिप जाती है।

5. परिणाम: स्मार्ट रोबोट, कम काम

टीम ने 10 लाख से अधिक रोबोट और मानव वीडियो क्लिप पर परीक्षण किया। उन्होंने पाया:

  • बेहतर प्रदर्शन: इन समृद्ध, AI-जनरेटेड विवरणों के साथ प्रशिक्षित रोबोट साधारण लेबल वाले रोबोट की तुलना में कार्यों को लगभग 5% अधिक बार सफलतापूर्वक पूरा कर पाए।
  • दक्षता (Efficiency): उन्होंने बिना एक भी नई रोबोटिक गतिविधि रिकॉर्ड किए यह परिणाम प्राप्त किया। उन्होंने बस पुराने डेटा के लेबल को "फिर से लिखा"।
  • सामान्यीकरण (Generalization): रोबोट नई, अजीब स्थितियों (जैसे अलग रंग की वस्तुएं या नए कमरे का लेआउट) को संभालने में बेहतर हो गए क्योंकि विस्तृत विवरणों ने उन्हें केवल एक विशिष्ट वीडियो को रटने के बजाय कार्य की संरचना को समझने में मदद की।

सारांश उपमा

कल्पना कीजिए कि आप पियानो पर एक गाना बजाना सीख रहे हैं।

  • पुराना तरीका: आप किसी को पियानो बजाते हुए देखते हैं और आपको कहा जाता है, "गाना बजाओ।" आपको उंगलियों की स्थिति, लय और शीट संगीत खुद ही समझना पड़ता है।
  • DeMiAn तरीका: आप वही वीडियो देखते हैं, लेकिन एक AI ट्यूटर स्क्रीन पर विशिष्ट नोट्स ओवरले करता है: "C की (key) को ज़ोर से दबाएं," "आपका कलाई यहाँ नीचे होनी चाहिए," या "यह हिस्सा कोरस है, इसलिए इसे ज़ोर से बजाएं।"
  • इंस्ट्रक्टर: एक स्मार्ट कोच जो आपको देखता है और कहता है, "अभी, आपको अपनी कलाई की स्थिति पर ध्यान देने की आवश्यकता है," या "अब, लय पर ध्यान दें।"

यह शोध सिद्ध करता है कि रोबोटों को ये समृद्ध, संदर्भ-जागरूक "कोच नोट्स" देने से वे तेज़ी से सीखते हैं और बेहतर प्रदर्शन करते हैं, और यह सब बिना नए वीडियो रिकॉर्ड करने के लिए अधिक मानव विशेषज्ञों को नियुक्त किए बिना संभव है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →