← नवीनतम पेपर
🤖 AI

PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations

PRTS एक विजन-लैंग्वेज-एक्शन फाउंडेशन मॉडल है जो प्रीट्रेनिंग को कंट्रास्टिव रिप्रेजेंटेशन का उपयोग करके गोल-कंडीशन्ड रिइन्फोर्समेंट लर्निंग के रूप में पुनर्गठित करता है ताकि ऑफलाइन ट्राजेक्टरीज से इंट्रिन्सिक गोल-रीचेबिलिटी अवेयरनेस सीखी जा सके, जिससे पारंपरिक बिहेवियर क्लोनिंग की तुलना में लॉन्ग-होरिजन, कॉन्टैक्ट-रिच और जीरो-शॉट कार्यों पर रोबोटिक प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Yang Zhang, Jiangyuan Zhao, Chenyou Fan, Fangzheng Yan, Tian Li, Haitong Tang, Sen Fu, Xuan'er Wu, Qizhen Weng, Weinan Zhang, Xiu Li, Chi Zhang, Chenjia Bai, Xuelong Li

प्रकाशित 2026-05-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yang Zhang, Jiangyuan Zhao, Chenyou Fan, Fangzheng Yan, Tian Li, Haitong Tang, Sen Fu, Xuan'er Wu, Qizhen Weng, Weinan Zhang, Xiu Li, Chi Zhang, Chenjia Bai, Xuelong Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखा रहे हैं। वर्तमान में अधिकांश रोबोट नकल (mimicry) करके सीखते हैं: वे किसी इंसान को कोई काम करते हुए (जैसे कप उठाना) वीडियो में देखते हैं और उनके द्वारा किए गए सटीक मूवमेंट्स की नकल करने की कोशिश करते हैं। यह एक छात्र की तरह है जो किसी डांस रूटीन को रट लेता है। यदि संगीत बदल जाए, लाइट चली जाए, या डांसर किसी दूसरी जगह चला जाए, तो छात्र भ्रमित हो जाता है और नाचना बंद कर देता है। वे जानते हैं कि कैसे हिलना है, लेकिन वे वास्तव में यह नहीं समझते कि वे क्यों हिल रहे हैं या वे कहाँ जा रहे हैं।

यह पेपर PRTS (प्रिमिटिव रीजनिंग एंड टास्किंग सिस्टम) पेश करता है, जो एक अलग तरह का रोबोट ब्रेन है जो अलग तरह से सीखता है। केवल मूव्स की नकल करने के बजाय, PRTS लक्ष्यों (goals) और प्रगति (progress) को समझना सीखता है।

यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "केवल रटने वाला रोबोट"

वर्तमान रोबोट उन अभिनेताओं की तरह हैं जिन्होंने एक स्क्रिप्ट रट ली है। यदि स्क्रिप्ट कहती है "लाल कप उठाओ," तो वे इसे करते हैं। लेकिन यदि आप उनसे "नीला कप उठाओ" कहें (भले ही उन्होंने नीला कप पहले देखा हो), या यदि कप किसी अजीब जगह पर हो, तो वे अक्सर असफल हो जाते हैं। उनमें दिशा का बोध नहीं होता। उन्हें यह नहीं पता होता कि वे लक्ष्य के करीब पहुँच रहे हैं या उससे दूर जा रहे हैं।

2. समाधान: "कंपास" (कॉन्ट्रास्टिव रीइन्फोर्समेंट लर्निंग)

PRTS रोबोट के दिमाग में एक "कंपास" जोड़ता है। यह कॉन्ट्रास्टिव रीइन्फोर्समेंट लर्निंग नामक तकनीक का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि आप एक अंधेरे जंगल में एक कैंपफायर (लक्ष्य) खोजने की कोशिश कर रहे हैं।
    • पुराने रोबोट: वे बस वही रास्ता याद रखते हैं जिस पर वे पिछली बार चले थे। यदि पेड़ हिल जाएं, तो वे खो जाते हैं।
    • PRTS: यह पूछना सीखता है, "यदि मैं यह कदम उठाता हूँ, तो क्या मैं आग के करीब पहुँच रहा हूँ?" इसे हर कदम पर यह बताने के लिए किसी मैप या शिक्षक की आवश्यकता नहीं है कि "अच्छा काम किया!" इसके बजाय, यह दो चीजों की तुलना करके सीखता है:
      1. "यदि मैं यह क्रिया करता हूँ, तो क्या यह ऐसा दिखता है कि मैं लक्ष्य की ओर बढ़ रहा हूँ?" (हाँ/अच्छा)।
      2. "यदि मैं यह दूसरी क्रिया करता हूँ, तो क्या यह ऐसा दिखता है कि मैं किसी अलग लक्ष्य की ओर बढ़ रहा हूँ?" (नहीं/बुरा)।

ऐसा लाखों बार करने से, रोबोट एक आंतरिक मानचित्र बनाता है जहाँ प्रत्येक क्रिया को इस आधार पर स्कोर किया जाता है कि उसके द्वारा दिए गए विशिष्ट शब्द वाले लक्ष्य तक पहुँचने की कितनी संभावना है।

3. जादू का खेल: एक साथ दो चीजें करना

आमतौर पर, रोबोट को "लक्ष्यों को समझने" के लिए सिखाना और उसे "अपने हाथ चलाने" के लिए सिखाना दो अलग-अलग कक्षाएं होती हैं। आप दिमाग को सिखाते हैं, फिर मांसपेशियों को सिखाते हैं। यह धीमा और महंगा है।

PRTS चतुर है क्योंकि यह एक ही क्लास में एक साथ दोनों चीजें सीखता है।

  • उपमा: कल्पना कीजिए कि एक छात्र एक ऐसी परीक्षा दे रहा है जहाँ उसे एक निबंध (क्रिया) लिखना है और साथ ही उसी कागज पर एक गणित का सवाल (लक्ष्य) भी हल करना है।
  • PRTS इसे रोबोट के इनपुट में दो छोटे, अदृश्य "स्टिकी नोट्स" जोड़कर करता है। एक नोट क्रिया (action) को ट्रैक करता है, और दूसरा लक्ष्य (goal) को ट्रैक करता है।
  • रोबोट पूरे दृश्य को प्रोसेस करता है, क्रिया लिखता है, और साथ ही साथ "गणित के सवाल" (क्या यह क्रिया मुझे लक्ष्य के करीब ले जा रही है?) को चेक करता है—बिना धीमे हुए। यह इतना कुशल है कि इसमें लगभग उतना ही कंप्यूटर पावर खर्च होता है जितना पुराने, सरल तरीकों में होता है।

4. परिणाम: वह रोबोट जो "सोच" सकता है

लेखकों ने सिमुलेशन और वास्तविक रोबोट्स (दो हाथों और एक हाथ वाले) में PRTS का परीक्षण किया। यहाँ क्या हुआ:

  • "लॉन्ग-होरिज़न" टेस्ट: जब रोबắt को कार्यों की एक लंबी श्रृंखला (जैसे "चाय बनाना," जिसमें पानी उबालना, कप लेना, चाय डालना आदि शामिल है) करने के लिए कहा गया, तो PRTS बीच में नहीं भटका। वह लगातार अपने "कंपास" को चेक करता रहा ताकि यह सुनिश्चित हो सके कि वह अभी भी सही रास्ते पर है।
  • "नए निर्देश" टेस्ट: यदि आपने रोबोट को लाल के बजाय "नीला ब्लॉक उठाओ" कहा, तो उसने इसे तुरंत समझ लिया। उसने केवल "स्थिति X पर वस्तु को पकड़ो" को याद नहीं किया; उसने समझा कि "उस वस्तु को पकड़ो जो 'नीला' शब्द से मेल खाती है।"
  • "मानवीय व्यवधान" टेस्ट: यह सबसे प्रभावशाली हिस्सा है। कल्पना कीजिए कि रोबोट मेज पर एक ब्लॉक रख रहा है, और एक इंसान उस ब्लॉक को छीनकर उसे दूसरी जगह रख देता है।
    • पुराने रोबोट: वे भ्रमित हो जाएंगे, ब्लॉक को वहीं रखने की कोशिश करेंगे जहाँ वह था, या बस रुक जाएंगे।
    • PRTS: वह तुरंत समझ जाता है, "ओह, लक्ष्य अभी भी 'ब्लॉक को मेज पर रखना' है, लेकिन ब्लॉक हिल गया है। मुझे इसे फिर से लेने जाना होगा।" वह रिकवर करता है और कार्य पूरा करता है, ठीक वैसे ही जैसे एक इंसान करेगा।

सारांश

PRTS एक ऐसा रोबोट ब्रेन है जो केवल "नकल करने" के बजाय "तर्क करने" (reasoning) लगता है। यह शब्दों (लक्ष्यों) को क्रियाओं के साथ जोड़ने के लिए लगातार यह पूछता है कि "क्या यह कदम मुझे वह करने के करीब ले जा रहा है जो मुझसे पूछा गया था?"

क्योंकि यह डेटा की विशाल मात्रा का उपयोग करके शुरू से ही इस "दिशा के बोध" को सीखता है, इसलिए यह पिछले रोबोटों की तुलना में नई स्थितियों, लंबे कार्यों और गलतियों को संभालने में बहुत बेहतर हो जाता है। यह रोबोट को एक विचारहीन नकलची से एक लक्ष्य-उन्मुख सहायक में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →