PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations
PRTS एक विजन-लैंग्वेज-एक्शन फाउंडेशन मॉडल है जो प्रीट्रेनिंग को कंट्रास्टिव रिप्रेजेंटेशन का उपयोग करके गोल-कंडीशन्ड रिइन्फोर्समेंट लर्निंग के रूप में पुनर्गठित करता है ताकि ऑफलाइन ट्राजेक्टरीज से इंट्रिन्सिक गोल-रीचेबिलिटी अवेयरनेस सीखी जा सके, जिससे पारंपरिक बिहेवियर क्लोनिंग की तुलना में लॉन्ग-होरिजन, कॉन्टैक्ट-रिच और जीरो-शॉट कार्यों पर रोबोटिक प्रदर्शन में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखा रहे हैं। वर्तमान में अधिकांश रोबोट नकल (mimicry) करके सीखते हैं: वे किसी इंसान को कोई काम करते हुए (जैसे कप उठाना) वीडियो में देखते हैं और उनके द्वारा किए गए सटीक मूवमेंट्स की नकल करने की कोशिश करते हैं। यह एक छात्र की तरह है जो किसी डांस रूटीन को रट लेता है। यदि संगीत बदल जाए, लाइट चली जाए, या डांसर किसी दूसरी जगह चला जाए, तो छात्र भ्रमित हो जाता है और नाचना बंद कर देता है। वे जानते हैं कि कैसे हिलना है, लेकिन वे वास्तव में यह नहीं समझते कि वे क्यों हिल रहे हैं या वे कहाँ जा रहे हैं।
यह पेपर PRTS (प्रिमिटिव रीजनिंग एंड टास्किंग सिस्टम) पेश करता है, जो एक अलग तरह का रोबोट ब्रेन है जो अलग तरह से सीखता है। केवल मूव्स की नकल करने के बजाय, PRTS लक्ष्यों (goals) और प्रगति (progress) को समझना सीखता है।
यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करते हुए:
1. समस्या: "केवल रटने वाला रोबोट"
वर्तमान रोबोट उन अभिनेताओं की तरह हैं जिन्होंने एक स्क्रिप्ट रट ली है। यदि स्क्रिप्ट कहती है "लाल कप उठाओ," तो वे इसे करते हैं। लेकिन यदि आप उनसे "नीला कप उठाओ" कहें (भले ही उन्होंने नीला कप पहले देखा हो), या यदि कप किसी अजीब जगह पर हो, तो वे अक्सर असफल हो जाते हैं। उनमें दिशा का बोध नहीं होता। उन्हें यह नहीं पता होता कि वे लक्ष्य के करीब पहुँच रहे हैं या उससे दूर जा रहे हैं।
2. समाधान: "कंपास" (कॉन्ट्रास्टिव रीइन्फोर्समेंट लर्निंग)
PRTS रोबोट के दिमाग में एक "कंपास" जोड़ता है। यह कॉन्ट्रास्टिव रीइन्फोर्समेंट लर्निंग नामक तकनीक का उपयोग करता है।
- उपमा: कल्पना कीजिए कि आप एक अंधेरे जंगल में एक कैंपफायर (लक्ष्य) खोजने की कोशिश कर रहे हैं।
- पुराने रोबोट: वे बस वही रास्ता याद रखते हैं जिस पर वे पिछली बार चले थे। यदि पेड़ हिल जाएं, तो वे खो जाते हैं।
- PRTS: यह पूछना सीखता है, "यदि मैं यह कदम उठाता हूँ, तो क्या मैं आग के करीब पहुँच रहा हूँ?" इसे हर कदम पर यह बताने के लिए किसी मैप या शिक्षक की आवश्यकता नहीं है कि "अच्छा काम किया!" इसके बजाय, यह दो चीजों की तुलना करके सीखता है:
- "यदि मैं यह क्रिया करता हूँ, तो क्या यह ऐसा दिखता है कि मैं लक्ष्य की ओर बढ़ रहा हूँ?" (हाँ/अच्छा)।
- "यदि मैं यह दूसरी क्रिया करता हूँ, तो क्या यह ऐसा दिखता है कि मैं किसी अलग लक्ष्य की ओर बढ़ रहा हूँ?" (नहीं/बुरा)।
ऐसा लाखों बार करने से, रोबोट एक आंतरिक मानचित्र बनाता है जहाँ प्रत्येक क्रिया को इस आधार पर स्कोर किया जाता है कि उसके द्वारा दिए गए विशिष्ट शब्द वाले लक्ष्य तक पहुँचने की कितनी संभावना है।
3. जादू का खेल: एक साथ दो चीजें करना
आमतौर पर, रोबोट को "लक्ष्यों को समझने" के लिए सिखाना और उसे "अपने हाथ चलाने" के लिए सिखाना दो अलग-अलग कक्षाएं होती हैं। आप दिमाग को सिखाते हैं, फिर मांसपेशियों को सिखाते हैं। यह धीमा और महंगा है।
PRTS चतुर है क्योंकि यह एक ही क्लास में एक साथ दोनों चीजें सीखता है।
- उपमा: कल्पना कीजिए कि एक छात्र एक ऐसी परीक्षा दे रहा है जहाँ उसे एक निबंध (क्रिया) लिखना है और साथ ही उसी कागज पर एक गणित का सवाल (लक्ष्य) भी हल करना है।
- PRTS इसे रोबोट के इनपुट में दो छोटे, अदृश्य "स्टिकी नोट्स" जोड़कर करता है। एक नोट क्रिया (action) को ट्रैक करता है, और दूसरा लक्ष्य (goal) को ट्रैक करता है।
- रोबोट पूरे दृश्य को प्रोसेस करता है, क्रिया लिखता है, और साथ ही साथ "गणित के सवाल" (क्या यह क्रिया मुझे लक्ष्य के करीब ले जा रही है?) को चेक करता है—बिना धीमे हुए। यह इतना कुशल है कि इसमें लगभग उतना ही कंप्यूटर पावर खर्च होता है जितना पुराने, सरल तरीकों में होता है।
4. परिणाम: वह रोबोट जो "सोच" सकता है
लेखकों ने सिमुलेशन और वास्तविक रोबोट्स (दो हाथों और एक हाथ वाले) में PRTS का परीक्षण किया। यहाँ क्या हुआ:
- "लॉन्ग-होरिज़न" टेस्ट: जब रोबắt को कार्यों की एक लंबी श्रृंखला (जैसे "चाय बनाना," जिसमें पानी उबालना, कप लेना, चाय डालना आदि शामिल है) करने के लिए कहा गया, तो PRTS बीच में नहीं भटका। वह लगातार अपने "कंपास" को चेक करता रहा ताकि यह सुनिश्चित हो सके कि वह अभी भी सही रास्ते पर है।
- "नए निर्देश" टेस्ट: यदि आपने रोबोट को लाल के बजाय "नीला ब्लॉक उठाओ" कहा, तो उसने इसे तुरंत समझ लिया। उसने केवल "स्थिति X पर वस्तु को पकड़ो" को याद नहीं किया; उसने समझा कि "उस वस्तु को पकड़ो जो 'नीला' शब्द से मेल खाती है।"
- "मानवीय व्यवधान" टेस्ट: यह सबसे प्रभावशाली हिस्सा है। कल्पना कीजिए कि रोबोट मेज पर एक ब्लॉक रख रहा है, और एक इंसान उस ब्लॉक को छीनकर उसे दूसरी जगह रख देता है।
- पुराने रोबोट: वे भ्रमित हो जाएंगे, ब्लॉक को वहीं रखने की कोशिश करेंगे जहाँ वह था, या बस रुक जाएंगे।
- PRTS: वह तुरंत समझ जाता है, "ओह, लक्ष्य अभी भी 'ब्लॉक को मेज पर रखना' है, लेकिन ब्लॉक हिल गया है। मुझे इसे फिर से लेने जाना होगा।" वह रिकवर करता है और कार्य पूरा करता है, ठीक वैसे ही जैसे एक इंसान करेगा।
सारांश
PRTS एक ऐसा रोबोट ब्रेन है जो केवल "नकल करने" के बजाय "तर्क करने" (reasoning) लगता है। यह शब्दों (लक्ष्यों) को क्रियाओं के साथ जोड़ने के लिए लगातार यह पूछता है कि "क्या यह कदम मुझे वह करने के करीब ले जा रहा है जो मुझसे पूछा गया था?"
क्योंकि यह डेटा की विशाल मात्रा का उपयोग करके शुरू से ही इस "दिशा के बोध" को सीखता है, इसलिए यह पिछले रोबोटों की तुलना में नई स्थितियों, लंबे कार्यों और गलतियों को संभालने में बहुत बेहतर हो जाता है। यह रोबोट को एक विचारहीन नकलची से एक लक्ष्य-उन्मुख सहायक में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।