← नवीनतम पेपर
💻 computer science

Planning from Observation and Interaction

यह शोध पत्र एक प्लानिंग-आधारित इन्वर्स रिइन्फोर्समेंट लर्निंग एल्गोरिदम प्रस्तुत करता है जो वास्तविक दुनिया के रोबोटों को केवल कार्य अवलोकनों और अंतःक्रियाओं का उपयोग करके इमेज-आधारित हेरफेर कार्यों को सीखने और शून्य से ऑनलाइन ज्ञान स्थानांतरित करने में सक्षम बनाता है, जो हाथ से डिज़ाइन किए गए रिवार्ड्स या प्री-ट्रेनिंग पर निर्भर मौजूदा विधियों की तुलना में बेहतर सैंपल दक्षता और सफलता दर प्राप्त करता है।

मूल लेखक: Tyler Han, Siyang Shen, Rohan Baijal, Harine Ravichandiran, Bat Nemekhbold, Kevin Huang, Sanghun Jung, Byron Boots

प्रकाशित 2026-03-02
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tyler Han, Siyang Shen, Rohan Baijal, Harine Ravichandiran, Bat Nemekhbold, Kevin Huang, Sanghun Jung, Byron Boots

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ MPAIL2: अवलोकन और परस्पर क्रिया से नियोजन (Planning from Observation and Interaction) शोध पत्र का सरल, रोजमर्रा के उदाहरणों और रचनात्मक उपमाओं के साथ हिंदी अनुवाद दिया गया है।

मुख्य विचार: देखकर और करके सीखना

कल्पना कीजिए कि आप बेसबॉल पकड़ना सीखने की कोशिश कर रहे हैं।

  • पुराना तरीका (पारंपरिक AI): आप एक कोच रखते हैं जो आपको बताता है कि ठीक क्या करना है ("अपना हाथ बाईं ओर ले जाएं," "अभी स्विंग करें") और आपके हर कदम के लिए आपको स्कोर देता है। यह हाथ से डिज़ाइन किए गए रिवॉर्ड (पुरस्कार) के साथ सुदृढीकरण शिक्षण (Reinforcement Learning - RL) की तरह है।
  • "केवल अवलोकन" वाला तरीका: आप एक प्रो खिलाड़ी को गेंद पकड़ते हुए देखते हैं। आपके पास कोई कोच नहीं है, कोई स्कोर नहीं है, और आपको यह भी नहीं पता कि उन्होंने अपना हाथ उस तरह क्यों हिलाया। आपको बस देखकर और फिर खुद कोशिश करके इसे समझना है। यह अवलोकन से सीखना (Learning from Observation - LfO) है।

समस्या: अधिकांश रोबोट इसमें बहुत खराब होते हैं। यदि आप उन्हें केवल एक वीडियो दिखाते हैं, तो वे बिल्कुल उसकी नकल करने की कोशिश करते हैं। यदि गेंद वीडियो में दिखाई गई चीज़ से थोड़ी अलग आती है, तो वे विफल हो जाते हैं। वे एक ऐसे तोते की तरह हैं जो केवल एक गाना दोहरा सकता है लेकिन अगर संगीत बदल जाए तो वह सुधार (improvise) नहीं कर सकता।

समाधान (MPAIL2): लेखकों ने एक रोबोट मस्तिष्क बनाया है जो केवल नकल नहीं करता; वह दुनिया के भौतिक विज्ञान (physics) को समझता है। यह एक "मानसिक फिल्म" बनाता है कि उसके हिलने-डुलने पर क्या होगा, जिससे उसे आगे की योजना बनाने और गलतियों से उबरने में मदद मिलती है, ठीक वैसे ही जैसे एक इंसान करता है।


मुख्य रूपक: "मानसिक फिल्म" का निर्देशक

रोबोट को एक फिल्म निर्देशक के रूप में सोचें जिसने पहले कभी वह फिल्म नहीं देखी है, लेकिन उसके पास एक स्क्रिप्ट (डेमोंस्ट्रेशन वीडियो) है।

  1. स्क्रिप्ट (अवलोकन): रोबोट एक वीडियो देखता है जिसमें एक इंसान ब्लॉक को धकेल रहा है या कप उठा रहा है। उसे खेल के नियम नहीं पता; वह केवल दृश्यों को देखता है।
  2. मानसिक फिल्म (विश्व मॉडल/World Model): अपने हाथ को वास्तव में हिलाने से पहले, रोबोट अपने दिमाग में एक सिमुलेशन चलाता है। वह पूछता है: "अगर मैं ब्लॉक को यहाँ धकेलता हूँ, तो वह कहाँ जाएगा? क्या होगा अगर मैं चूक गया? क्या होगा अगर वह फिसल गया?"
    • यह एक मानसिक मॉडल बनाता है कि दुनिया कैसे काम करती है (गुरुत्वाकर्षण, घर्षण, संवेग)।
    • यह केवल रास्ते को याद नहीं करता; यह रास्ते के भौतिक विज्ञान को सीखता है।
  3. रिहर्सल (अभ्यास): निर्देशक अपने दिमाग में बहुत तेज़ी से हजारों "क्या होगा अगर" वाले परिदृश्य चलाता है।
    • "अगर मैं ज़ोर से धकेलता हूँ, तो ब्लॉक उड़ जाएगा।"
    • "अगर मैं धीरे से धकेलता हूँ, तो वह थोड़ा आगे रुक जाएगा।"
    • "अगर मैं चूक जाता हूँ, तो मैं अपनी पकड़ को एडजस्ट कर सकता हूँ।"
  4. प्रदर्शन (क्रिया): एक बार जब मानसिक रिहर्सल पूरी हो जाती है, तो रोबोट सबसे अच्छा प्लान चुनता है और वास्तविक दुनिया में उसे लागू करता है।

यह प्रतियोगिता को कैसे हराता है

यह शोध पत्र उनके तरीके (MPAIL2) की तुलना तीन अन्य प्रकार के सीखने वालों से करता है:

  • तोता (व्यवहार क्लोनिंग - Behavior Cloning): यह रोबोट बस वीडियो को याद कर लेता है। यदि ब्लॉक थोड़ी अलग जगह पर है, तो तोता बिल्कुल वही गति करने की कोशिश करता है और विफल हो जाता है। उसके पास कोई "सामान्य ज्ञान" नहीं है।
  • चीट शीट के साथ छात्र (रिवॉर्ड के साथ RL): इस रोबोट को एक शिक्षक दिया जाता है जो हर चाल के लिए कहता है "अच्छा काम!" या "बुरा काम!"। यह तेज़ी से सीखता है यदि शिक्षक वहां मौजूद है, लेकिन यह तब विफल हो जाता है जब शिक्षक गायब हो जाता है (जो इस शोध पत्र के परिवेश में होता है)।
  • सपनों का सौदागर (MPAIL2): इस रोबोट के पास कोई शिक्षक और कोई चीट शीट नहीं है। इसके पास केवल वीडियो है। लेकिन क्योंकि यह एक विश्व मॉडल (World Model) यानी "मानसिक फिल्म" बनाता है, यह अपने आप दुनिया के नियमों को समझ सकता है।

यह एक बड़ी बात क्यों है (अहा! क्षण)

1. यह तेज़ी से सीखता है (सैंपल एफिशिएंसी)
प्रयोगों में, अन्य रोबोटों ने ब्लॉक को धकेलना सीखने के लिए घंटों कोशिश की और विफल रहे। MPAIL2 ने इसे 40 मिनट से भी कम समय में लगातार करना सीख लिया।

  • उपमा: कल्पना कीजिए कि आप साइकिल चलाना सीख रहे हैं। तोता हर बार हवा चलने पर गिर जाता है। छात्र को एक ट्रेनर की ज़रूरत है जो सीट पकड़े हुए हो। 'सपनों का सौदागर' (Dreamer) कुछ बार गिरता है, फिर समझ जाता है कि संतुलन कैसे काम करता है, और 20 मिनट में सुचारू रूप से चलाने लगता है।

2. यह ज्ञान का हस्तांतरण कर सकता है (स्किल स्वैप)
शोधकर्ताओं ने रोबोट को ब्लॉक को बाईं ओर धकेलना सिखाया। फिर, उन्होंने उससे ब्लॉक को दाईं ओर धकेलने को कहा।

  • अन्य रोबोट: सब कुछ भूल गए। उन्हें शून्य से शुरुआत करनी पड़ी।
  • MPAIL2: इसने धकेलने के भौतिक विज्ञान को याद रखा। इसने महसूस किया, "ओह, मुझे बस विपरीत दिशा में धकेलना है।" इसने नए कार्य को शून्य से शुरू करने की तुलना में लगभग दोगुना तेज़ी से सीखा।
  • उपमा: यदि आप कार चलाना सीखते हैं, तो आपको ट्रक चलाना फिर से सीखने की आवश्यकता नहीं होती। आप स्टीयरिंग और ब्रेकिंग की अवधारणा को समझते हैं। MPAIL2 "धकेलने" की अवधारणा को समझता है, इसलिए यह इसे नई दिशाओं में लागू कर सकता है।

3. यह गलतियों से उबरता है
यदि रोबोट ब्लॉक को मिस कर देता है, तो एक साधारण रोबोट अंधे होकर आगे बढ़ता रहता है। MPAIL2 को एहसास होता है, "रुको, मैं चूक गया। मेरा प्लान काम नहीं आया। मुझे एक अलग कोण आज़माना चाहिए।"

  • उपमा: यदि आप अंधेरे में चल रहे हैं और लड़खड़ा जाते हैं, तो बिना योजना वाला रोबोट दीवार में टकराते हुए चलता रहेगा। एक इंसान (और MPAIL ही MPAIL2) रुकता है, आसपास महसूस करता है, और एक नया रास्ता खोज लेता है।

असली रहस्य: "नियोजन" बनाम "प्रतिक्रिया"

अधिकांश रोबोट प्रतिक्रियाशील (reactive) होते हैं: वे कुछ देखते हैं, और तुरंत कुछ करते हैं।
MPAIL2 प्रोएक्टिव (proactive) है: वह देखता है, रुकता है, अपने दिमाग में 50 अलग-अलग भविष्यों का सिमुलेशन करता है, सबसे अच्छे को चुनता है, और फिर कार्य करता है।

शोध पत्र इसे मॉडल प्रेडिक्टिव एडवरसेरियल इमिटेशन लर्निंग (Model Predictive Adversarial Imitation Learning) कहता है।

  • मॉडल (Model): यह मानसिक फिल्म बनाता है।
  • प्रेडिक्टिव (Predictive): यह भविष्य का अनुमान लगाता है।
  • एडवरसेरियल (Adversarial): यह खुद के खिलाफ खेल खेलता है ताकि यह पता लगाया जा सके कि केवल इंसान को देखकर "रिवॉर्ड" (लक्ष्य) वास्तव में क्या है।
  • इमिटेशन (Imitation): यह इंसान की सफलता की नकल करने की कोशिश करता है।

सामान्य दर्शकों के लिए सारांश

यह शोध पत्र एक ऐसे रोबलेट को प्रस्तुत करता है जो खिलौनों के साथ खेलने वाले मानव शिशु की तरह सीखता है।

  1. देखना: यह आपको कोई कार्य करते हुए देखता है।
  2. कल्पना करना: यह एक मानसिक मॉडल बनाता है कि खिलौना कैसे हिलता है और प्रतिक्रिया करता है।
  3. योजना बनाना: यह अपने दिमाग में हज़ार बार अभ्यास करता है।
  4. करना: यह कार्य को निष्पादित करता है, और यदि वह गड़बड़ी करता है, तो वह अपने मानसिक मॉडल का उपयोग करके उसे ठीक करता है।

परिणामस्वरूप, एक रोबोट जो वास्तविक दुनिया में एक घंटे से भी कम समय में जटिल कार्य सीख सकता है, बिना किसी इंसान के हाथ पकड़ने या स्कोरकार्ड देने की आवश्यकता के। यह हमें केवल देखकर सीखने के माध्यम से सीखने की दिशा में एक बड़ा कदम है, जो इसे हमारे घरों और कार्यस्थलों के लिए बहुत अधिक व्यावहारिक बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →