← नवीनतम पेपर
💻 computer science

Behavior Prompting Policy: Demonstrations as Prompts for Manipulation

यह शोध पत्र बिहेवियर प्रॉम्प्टिंग पॉलिसी (BPP) प्रस्तुत करता है, जो एक इन-कॉन्टेक्स्ट विज़ुओमोटर आर्किटेक्चर है जो रोबोट को इन्फरेंस के समय एक एकल मानव प्रदर्शन से नए हेरफेर कार्यों को सीखने में सक्षम बनाता है, जिसे iPhUMI इंटरफ़ेस के माध्यम से एकत्र किए गए एक विविध प्रशिक्षण डेटासेट द्वारा समर्थित किया गया है और नवीन मूल्यांकन बेंचमार्क के माध्यम से मान्य किया गया है।

मूल लेखक: Austin Patel, Ben Pekarek, Joel Enrique Castro Hernandez, Shuran Song

प्रकाशित 2026-06-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Austin Patel, Ben Pekarek, Joel Enrique Castro Hernandez, Shuran Song

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक नया करतब सिखाना चाहते हैं, जैसे कि किसी खास तरह की शर्ट को मोड़ना या कोई विशेष आकृति बनाना। आमतौर पर, यह एक कुत्ते को नया कमांड सिखाने जैसा है: आपको इसे शुरू से बार-बार घंटों तक प्रशिक्षित करना पड़ता है, जब तक कि यह सही न कर ले। यदि आप बाद में इसे कोई अलग करतब सिखाना चाहते हैं, तो आपको अक्सर पूरी प्रशिक्षण प्रक्रिया फिर से शुरू करनी पड़ती है।

यह शोध पत्र एक नए तरीके से रोबोट को सिखाने की बात करता है जिसे "बिहेवियर प्रॉम्प्टिंग" (Behavior Prompting) कहा जाता है। इसे औपचारिक प्रशिक्षण के बजाय अपने किसी दोस्त को फोन पर एक त्वरित वीडियो दिखाने जैसा समझें और कहना, "इसे ऐसे करो।"

यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. मुख्य विचार: "वीडियो रेसिपी"

रोबोट को केवल टेक्स्ट निर्देश ("शर्ट मोड़ो") देने या शर्ट कैसी दिखनी चाहिए उसकी अंतिम तस्वीर देने के बजाय, आप उसे एक मानव द्वारा कार्य करने का एकल वीडियो प्रदर्शन (single video demonstration) देते हैं।

  • उपमा: कल्पना कीजिए कि आप केक बनाने की कोशिश कर रहे हैं।
    • पुराना तरीका: आपको एक लिखित रेसिपी (भाषा) या तैयार केक की फोटो (लक्ष्य छवि) दी जाती है। आपको चरणों का अनुमान लगाना पड़ता है।
    • बिहेविंग प्रॉम्प्टिंग: आपको उस सटीक केक को बनाने का वीडियो दिखाया जाता है। आप देख सकते हैं कि व्यक्ति ने अंडा कैसे तोड़ा, उसने कितनी बार चलाया, और वह कितनी गति से चला। रोबोट इस "वीडियो रेसिपी" (बिहेवियर प्रॉम्प्ट) को देखता है और केवल परिणाम को नहीं, बल्कि हलचल/मूवमेंट्स की नकल करने की कोशिश करता है।

2. मस्तिष्क: "स्मार्ट ट्रांसलेटर" (BPP)

यह शोध पत्र एक नया रोबोट मस्तिष्क पेश करता है जिसे बिहेवियर प्रॉम्प्टिंग पॉलिसी (BPP) कहा जाता है।

  • यह कैसे काम करता है: जब रोबोट को कोई कार्य करने के लिए कहा जाता है, तो वह एक ही समय में दो चीजों को देखता है:
    1. वह अभी क्या देख रहा है (वर्तमान कमरा, मेज पर रखी शर्ट)।
    2. "वीडियो रेसिपी" (मानव प्रदर्शन)।
  • जादू: रोबोट केवल वीडियो को रटता नहीं है। यह एक स्मार्ट ट्रांसलेटर की तरह काम करता है। यह वीडियो को देखता है और कहता है, "ठीक है, वीडियो में, व्यक्ति शर्ट को यहाँ पकड़े हुए है। मेरे वर्तमान दृश्य में, शर्ट वहाँ है। इसलिए, मुझे अपने हाथ को उस स्थिति से मिलाने के लिए हिलना होगा।" यह अगले कदम को समझने के लिए वीडियो की वास्तविकता से लगातार तुलना करता रहता है।

3. प्रशिक्षण: विविधता ही कुंजी है

शोधकर्ताओं ने पाया कि इसे सफल बनाने के लिए, रोबोट को अपने शुरुआती प्रशिक्षण के दौरान बहुत सारे अलग-अलग प्रकार के कार्यों को देखने की आवश्यकता होती है, लेकिन उसे प्रत्येक विशिष्ट कार्य के बहुत अधिक उदाहरण देखने की आवश्यकता नहीं है।

  • उपमा: एक शेफ (रसोइया) के खाना बनाना सीखने के बारे में सोचें।
    • यदि आप उन्हें केवल स्पैगेटी बनाने के 1,000 उदाहरणों पर प्रशिक्षित करते हैं, तो वे स्पैगेटी में बहुत अच्छे होंगे लेकिन सलाद बनाने में बहुत खराब होंगे।
    • यदि आप उन्हें 1,000 अलग-अलग व्यंजनों (सूप, सलाद, स्टेक, केक) के 1-1 उदाहरण देते हैं, तो वे "खाना पकाने के सामान्य कौशल" को सीख जाते हैं।
    • शोध पत्र में पाया गया कि रोबोट को कई अलग-अलग कार्यों का एक "मेन्यू" देने से (भले ही प्रत्येक के केवल कुछ ही उदाहरण हों), वह बाद में चलते-फिरते नई चीजें सीखने में बहुत बेहतर हो जाता है।

4. उपकरण: "मैजिक रिमोट" (iPhUMI)

इन सभी अलग-अलग उदाहरणों को इकट्ठा करने के लिए, टीम ने iPhUMI नामक एक विशेष हैंडहेल्ड डिवाइस बनाया है।

  • यह क्या है: यह एक ग्रिपर है जिसके साथ एक आईफोन (iPhone) लगा हुआ है।
  • यह कैसे मदद करता है: एक इंसान बस इस डिवाइस को उठा सकता है और रोबोट को क्या करना है यह दिखाने के लिए इसे शारीरिक रूप से इधर-उधर घुमा सकता है। क्योंकि इसमें आईफोन है, यह तुरंत जानता है कि कमरे में इसकी स्थिति क्या है (कमरे का मानचित्र बनाने में घंटों बिताने की आवश्यकता नहीं है)।
  • लाभ: परीक्षण के समय (जब रोबोट वास्तव में काम कर रहा होता है), एक इंसान इस डिवाइस को उठा सकता है, एक बार कार्य करके रोबोट को दिखा सकता है, और रोबोट तुरंत जान जाता है कि इसे कैसे करना है। यह नए कौशल तुरंत सिखाने के लिए एक "रिमोट कंट्रोल" की तरह है।

5. परिणाम: उन्होंने क्या परीक्षण किया?

टीम ने दो चीजों पर इसका परीक्षण किया:

  1. ड्रॉइंग (आकृतियाँ बनाना): उन्होंने रोबोट को आकृतियाँ बनाने के लिए कहा। भले ही रोबोट ने पहले कभी वह विशिष्ट आकृति न देखी हो, यदि किसी इंसान ने टैबलेट पर एक बार उसे बनाया (प्रॉम्ट), तो रोबोट एक अलग बोर्ड पर अलग जगह पर उसे बनाने के लिए उस गति की नकल कर सकता है।
  2. टेबलटॉप टास्क (मेज पर आधारित कार्य): उन्होंने कटोरे उठाने और उन्हें स्थानांतरित करने जैसे कार्यों का परीक्षण किया। उन्होंने पाया कि यदि रोबोट को एक कटोरा हिलाने का वीडियो दिखाया गया, तो वह एक अलग कटोरे को एक अलग स्थान पर ले जाने का तरीका समझ सकता था, भले ही उसने पहले कभी उस विशिष्ट संयोजन को न देखा हो।

सारांश

शोध पत्र का दावा है कि बिहेविंग प्रॉम्प्टिंग रोबोट को एक एकल मानव प्रदर्शन को देखकर तुरंत नए कौशल सीखने की अनुमति देता है, बिना महंगे पुन: प्रशिक्षण के।

  • सीक्रेट सॉस: यह तब सबसे अच्छा काम करता है जब रोबोट पहले से ही बहुत सारे विविध कार्यों को देख चुका हो।
  • लाभ: यह टेक्स्ट निर्देशों या केवल अंतिम लक्ष्य को दिखाने की तुलना में अधिक तेज़ और लचीला है। यह "क्या करना है" और "कैसे करना है" के बीच के अंतर को पाटता है, मानव की वास्तविक हलचलों का उपयोग मार्गदर्शक के रूप में करके।

महत्वपूर्ण नोट: यह शोध पत्र इन विशिष्ट क्षमताओं (ड्रॉइंग और टेबलटॉप मैनिपुलेशन) पर केंद्रित है। यह दावा नहीं करता है कि यह तकनीक जटिल चिकित्सा सर्जरी या औद्योगिक असेंबली लाइनों के लिए तैयार है, और न ही यह दावा करता है कि रोबोट केवल एक नज़र में कोई भी कार्य सीख सकता है; यह उन कार्यों के प्रकारों के भीतर सबसे अच्छा काम करता है जिनके लिए इसे व्यापक रूप से प्रशिक्षित किया गया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →