← नवीनतम पेपर
💻 computer science

Jointly Learning Predicates and Actions Enables Zero-Shot Skill Composition

यह शोध पत्र प्रेडिकेट एक्शन स्किल्स (PACTS) को प्रस्तुत करता है, जो एक क्लोज्ड-लूप विसुओमोटर पॉलिसी है जो योजना के माध्यम से सीखे गए कौशल के सुदृढ़ ज़ीरो-शॉट कंपोज़िशन को सक्षम करने के लिए एक्शन ट्रेजेक्टरीज और सिम्बोलिक प्रेडिकेट आउटकम्स को संयुक्त रूप से मॉडल करता है।

मूल लेखक: Benedict Quartey, Sebastian Castro, Eric Rosen, Wil Thomason, George Konidaris, Stefanie Tellex

प्रकाशित 2026-05-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Benedict Quartey, Sebastian Castro, Eric Rosen, Wil Thomason, George Konidaris, Stefanie Tellex

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल भोजन बनाना सिखा रहे हैं, जैसे कि सैंडविच बनाना और फिर सफाई करना।

पुराना तरीका: "अंधा" शेफ
पारंपरिक रूप से, जब हम रोबोट को नए कौशल सिखाते हैं (जैसे "ब्रेड उठाना"), तो हम "डेमोंस्ट्रेशन से सीखना" (Learning from Demonstration) नामक विधि का उपयोग करते हैं। हम रोबट को एक इंसान द्वारा यह काम करने का वीडियो दिखाते हैं, और रोबोट हाथ की गतिविधियों की नकल करना सीखता है।

हालाँकि, इस दृष्टिकोण के साथ एक समस्या है: रोबोट गतिविधियों को तो पूरी तरह सीख लेता है, लेकिन वह परिणाम को वास्तव में नहीं समझ पाता। वह जानता है कि ब्रेड पकड़ने के लिए अपने हाथ को कैसे हिलाना है, लेकिन उसके पास यह जांचने के लिए कोई आंतरिक तंत्र नहीं होता कि "ठीक है, मैंने सफलतापूर्वक ब्रेड पकड़ ली है।"

इस कारण से, यदि आप रोबोट को उन कौशलों के नए संयोजन (combination) के लिए कहते हैं जो उसने पहले नहीं देखे हैं (जैसे "ब्रेड पकड़ो, लेकिन केवल तभी जब मक्खन पहले से खुला हो"), तो वह भ्रमित हो जाता है। यह एक ऐसे शेफ की तरह है जो प्याज काटना तो जानता है, लेकिन उसे यह नहीं पता कि "कटा हुआ प्याज" कैसा दिखता है, इसलिए वह यह तय नहीं कर पाता कि कब काटना बंद करना है या आगे क्या करना है। इसे ठीक करने के लिए, हमें आमतौर पर हर नए संयोजन के लिए रोबोट को शुरू से फिर से प्रशिक्षित करना पड़ता है।

नया तरीका: PACTS (एक "सचेत" शेफ)
यह पेपर PACTS (प्रेडिकेट-एक्शन स्किल्स) नामक एक नई प्रणाली पेश करता है। PACTS को एक "सचेत" (mindful) शेफ सिखाने के रूप में समझें जो दो चीजें एक ही समय में सीखता है:

  1. एक्शन (Action): शारीरिक गतिविधियाँ (हाथ कैसे हिलाना है)।
  2. आउटकम (Outcome): एक प्रतीकात्मक "विश्वास" (belief) कि अभी क्या हुआ है (उदाहरण के लिए, "ब्रेड अब मेरे हाथ में है" या "दरवाजा अब खुला है")।

रचनात्मक उपमा: "डुअल-ट्रैक" टेप
कल्पना कीजिए कि रोबोट की सीखने की प्रक्रिया एक विशेष डुअल-ट्रैक टेप पर फिल्म रिकॉर्ड करने जैसी है:

  • ट्रैक A रोबोट के हाथों के हिलने का वीडियो रिकॉर्ड करता है।
  • ट्रैक B उन "सत्यताओं" का निरंतर कमेंट्री रिकॉर्ड करता है जो फिल्म चलते समय सच होती जाती हैं (जैसे, "वस्तु पकड़ी गई है," "वस्तु छोड़ दी गई है," "दरवाजा खुला है")।

पुराने सिस्टम में, ये दोनों ट्रैक अलग-अलग लोगों द्वारा रिकॉर्ड किए जाते थे जो आपस में कभी बात नहीं करते थे। कभी-कभी वीडियो में दिखाया जाता था कि रोबट ने कप गिरा दिया, लेकिन कमेंट्री ट्रैक अभी भी कहता था, "कप पकड़ा गया है।" इस बेमेल (mismatch) के कारण भ्रम पैदा होता था।

PACTS के साथ, रोबोट एक ही एकीकृत प्रक्रिया में दोनों ट्रैक को एक साथ रिकॉर्ड करता है। जैसे-जैसे वह गतिविधि सीखता है, वह दुनिया में होने वाले बदलाव को भी सीखता है। क्योंकि वे एक साथ सीखे जाते हैं, वे पूरी तरह से सिंक्रोनाइज़्ड (synchronized) होते हैं। यदि रोबोट का हाथ कप उठाने के लिए बढ़ता है, तो उसका आंतरिक "विश्वास" स्वतः ही अपडेट होकर "मैं कप पकड़े हुए हूँ" हो जाता है।

यह क्यों महत्वपूर्ण है: ज़ीरो-शॉट कंपोज़िशन (Zero-Shot Composition)
PACTS की सबसे बड़ी शक्ति ज़ीरो-शॉट कंपोज़िशन है।

क्योंकि रोबोट के पास अब यह स्पष्ट, प्रतीकात्मक "कमेंट्री ट्रैक" (प्रेडिकेट विश्वास) है जो वास्तविक समय में अपडेट होता है, हम एक मानक, "ऑफ-द-शेल्फ" प्लानर (जैसे जीपीएस या रेसिपी बुक) का उपयोग करके उन कौशलों को मिला सकते हैं जिन्हें रोबोट ने पहले कभी एक साथ नहीं देखा है।

  • परिदृश्य: आपने रोबोट को "दरवाजा खोलना" और अलग से "कार्ट को धकेलना" सिखाया। आपने उसे "दरवाजा खोलना फिर कार्ट को धकेलना" कभी नहीं दिखाया।
  • परिणाम: प्लानर रोबोट के आंतरिक "विश्वास ट्रैक" को देखता है। वह देखता है कि रोबोट ने सफलतापूर्वक "दरवाजा खोला" (विश्वास False से True में बदल गया)। प्लानर कहता है, "बहुत अच्छा! अब जब दरवाजा खुला है, तो चलिए 'कार्ट को धकेलने' का कौशल निष्पादित करते हैं।"

रोबोट यह सब बिना किसी नए प्रशिक्षण के कर सकता है। यह एक ऐसे शेफ की तरह है जो पानी उबालना और अंडा तलना जानता है। भले ही उसने पहले कभी "उबले-अंडे-फ्राई-सैंडविच" नहीं बनाया हो, फिर भी वह अपनी आंतरिक चेकलिस्ट को देख सकता है, देख सकता है कि पानी उबल गया है, और तुरंत अंडा तलने के काम पर लग सकता है।

वास्तविक दुनिया का परीक्षण
लेखकों ने तीन तरीकों से इसका परीक्षण किया:

  1. एक 2D गेम: एक रोबोट जो ब्लॉक्स को धकेल रहा है। PACTS न केवल ब्लॉक्स को सही ढंग से चलाने में, बल्कि यह पहचानने में भी बेहतर था कि ब्लॉक्स सही जगह पर हैं या नहीं, उन रोबोटों की तुलना में जिन्होंने केवल मूवमेंट सीखी थी।
  2. 3D सिमुलेशन: कॉफी बनाने या किचन में खाना पकाने जैसे जटिल कार्य। PACTS ने उच्च प्रदर्शन बनाए रखा और प्लानर को यह स्पष्ट दृश्य दिया कि क्या हो रहा है।
  3. वास्तविक जीवन: एक वास्तविक रोबोट जो रंगीन क्यूब्स को एक बॉक्स में पैक कर रहा है। टीम ने इसे अलग-अलग लाल और हरे क्यूब्स पैक करना सिखाया। PACTS का उपयोग करके, वे फिर रोबोट को "केवल लाल और पीले क्यूब्स पैक करें" (एक ऐसा संयोजन जो उसने पहले कभी नहीं देखा था) कह सकते थे, और इसने प्लानर के निर्देशों का पालन करते हुए सफलतापूर्वक ऐसा किया।

सारांश में
PACTS रोबोट को एक्शन और आउटकम को एक साथ, एक पैकेज की तरह सीखना सिखाता है। यह रोबोट को एक स्पष्ट, वास्तविक समय की "स्टेटस रिपोर्ट" देता है कि उसने क्या हासिल किया है। यह स्टेटस रिपोर्ट एक साधारण प्लानर को कौशलों को तुरंत मिलाने और जोड़ने की अनुमति देती है, जिससे रोबोट बिना फिर से प्रशिक्षित हुए नई, जटिल समस्याओं को हल कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →