← नवीनतम पेपर
🤖 machine learning

RE4: Transformation-aware Imitation of Object Interactions Using Manipulation Modes

यह शोध पत्र RE4 प्रस्तुत करता है, जो एक ऐसा ढांचा है जो सरल निर्माण खंडों का उपयोग करके वस्तु संपर्क कार्यों के लिए सुदृढ़, व्याख्या योग्य इमिटेशन लर्निंग प्राप्त करने हेतु मॉडल-मुक्त पोज़ अनुमान (pose estimation) को मैनिपुलेशन मोड-जागरूक रिट्रीवल और ट्रांसफॉर्मेशन के साथ जोड़ता है।

मूल लेखक: Arsh Chawla, Rahul Shome

प्रकाशित 2026-06-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Arsh Chawla, Rahul Shome

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को मेज पर एक T-आकार के ब्लॉक को किसी विशिष्ट स्थान पर धकेलना सिखा रहे हैं, या एक डिब्बे में कैन (can) उठाने और रखने का काम सिखा रहे हैं। अतीत में, यह करने का सबसे उन्नत तरीका यह था कि आप रोबोट को इंसानों द्वारा किए जाने वाले कार्यों के हजारों वीडियो खिलाते थे और एक विशाल, जटिल AI (जैसे कि एक "डिफ्यूजन मॉडल") को अगला कदम अनुमान लगाने की कोशिश करने देते थे। हालांकि ये AI मॉडल शक्तिशाली हैं, लेकिन वे ब्लैक बॉक्स (black boxes) की तरह हैं: वे काम तो करते हैं, लेकिन कोई नहीं जानता कि उन्होंने एक विशिष्ट चाल क्यों चुनी, उन्हें प्रशिक्षित करना महंगा है, और यदि उन्होंने वह सटीक स्थिति नहीं देखी है, तो वे संघर्ष करते हैं।

यह पेपर RE4 (रिट्रीव, रिफ्रेम, रीप्लान, रीप्ले) नामक एक नई विधि पेश करता है। एक विशाल, रहस्यमय ब्लैक बॉक्स का उपयोग करने के बजाय, लेखकों ने चार सरल, पारदर्शी चरणों वाला एक ढांचा बनाया है जो एक स्मार्ट, अनुकूलन योग्य सहायक की तरह कार्य करता है।

RE4 कैसे काम करता है, इसका विवरण एक सरल उपमा (analogy) के माध्यम से यहाँ दिया गया है:

उपमा: "स्मार्ट लाइब्रेरियन" बनाम "प्रतिभाशाली जादूगर"

पुराने AI तरीकों को एक प्रतिभाशाली जादूगर (Genius Magician) के रूप में सोचें। जादूगर ने हजारों करतब याद कर रखे हैं। जब आप उससे एक करतब मांगते हैं, तो वह टोपी से एक निकाल लेता है। यह आमतौर पर काम करता है, लेकिन यदि आप कुछ थोड़ा अलग मांगते हैं (जैसे कि किसी दूसरे कमरे में एक करतब), तो वह भ्रमित हो सकता है। साथ ही, आप देख नहीं सकते कि वह करतब कैसे करता है; यह बस हो जाता है।

RE4 एक स्मार्ट लाइब्रेरियन (Smart Librarian) की तरह है जिसके पास प्रदर्शन वीडियो का एक पुस्तकालय है। अनुमान लगाने के बजाय, लाइब्रेरियन आपकी मदद करने के लिए एक सख्त, तार्किक चार-चरणीय प्रक्रिया का पालन करता है:

  1. रिट्रीव (सही किताब खोजें - Retrieve):
    रोबोट वर्तमान स्थिति को देखता है (जैसे, "ब्लॉक यहाँ है, और मैं यहाँ हूँ")। वह लाइब्रेरियन से पूछता है: "लाइब्रेरी में कौन सा वीडियो बिल्कुल वैसा ही दिख रहा है जैसा मैं अभी कर रहा हूँ?"

    • ट्विस्ट: लाइब्रेरियन केवल तस्वीर ही नहीं देखता; वह "मोड" (mode) की भी जाँच करता है। क्या रोबोट वर्तमान में वस्तु को पकड़े हुए है (जैसे कप लेकर चलना) या बस उसकी ओर बढ़ रहा है (जैसे कप की ओर चलना)? वह केवल एक ऐसा वीडियो चुनता है जहाँ रोबोट वही प्रकार की क्रिया कर रहा हो। यह रोबोट को उस ब्लॉक को "ले जाने" की कोशिश करने से रोकता है जिसे उसने अभी तक उठाया ही नहीं है।
  2. रिफ्रेम (निर्देशों का अनुवाद करें - Reframe):
    कल्पना कीजिए कि आपने जो वीडियो पाया वह एक रोबोट को एक नीला और बाईं ओर का ब्लॉक धकेलते हुए दिखाता है। लेकिन आपका ब्लॉक लाल और दाईं ओर है।
    पुराने तरीके में, वे सटीक नीले ब्लॉक को याद करने की कोशिश करते। RE4 का लाइब्रेरियन कहता है, "आइए निर्देशों का अनुवाद करें।" वे वीडियो से होने वाली गति को गणितीय रूप से इस तरह बदलते हैं कि वह आपके विशिष्ट लाल ब्लॉक पर फिट हो जाए। यह एक छोटे पैन के लिए केक की रेसिपी में सामग्री की मात्रा को समायोजित करने जैसा है ताकि वह काम कर सके। रोबोट वस्तु के साथ संबंध सीखता है, न कि केवल पूर्ण स्थिति।

  3. रीप्लान (पुल का निर्माण करें - Replan):
    अब रोबोट के पास वीडियो से "अनुवादित" निर्देश हैं, लेकिन वह वीडियो वाले रोबोट की तुलना में एक अलग जगह पर खड़ा है। वह वीडियो के शुरुआती बिंदु पर टेलीपोर्ट नहीं कर सकता।
    "रीप्लान" चरण एक पुल निर्माता की तरह कार्य करता है। यह एक सुरक्षित, छोटा रास्ता निकालता है ताकि रोबोट को अनुवादित वीडियो निर्देशों के शुरुआती बिंदु तक पहुँचाया जा सके। यह सुनिश्चित करता है कि वहां पहुँचते समय रोबोट किसी चीज़ से टकरा न जाए।

  4. रीप्ले (चाल को करें - Replay):
    अंत में, रोबोट अनुवादित निर्देशों को निष्पादित करता है। वह उस गति को करता है जिसे उसने अभी-अभी "उधार" लिया और अनुकूलित किया है। फिर, पूरी प्रक्रिया अगले एक सेकंड के लिए फिर से शुरू हो जाती है, जो लगातार चेक करती है, खोजती है, अनुवाद करती है और चलती है।

यह विशेष क्यों है?

  • यह पारदर्शी है (Interpretable): क्योंकि रोबరు वास्तव में एक वीडियो चुन रहा है, उसे बदल रहा है, और उसकी ओर बढ़ रहा है, हम प्रक्रिया को देख सकते हैं और कह सकते हैं, "आह, इसने वह वीडियो इसलिए चुना क्योंकि ब्लॉक उसी स्थान पर था।" "ब्लैक बॉक्स" AI के साथ, आप इसके पीछे का तर्क नहीं देख सकते।
  • यह कुशल है (Efficient): लेखकों को एक विशाल, महंगे AI को प्रशिक्षित करने की आवश्यकता नहीं थी। उन्होंने वस्तु का पता लगाने के लिए एक बहुत ही हल्का सिस्टम इस्तेमाल किया, और बाकी काम करने के लिए सरल गणित का उपयोग किया। यह बुनियादी गणित करने के लिए सुपरकंप्यूटर बनाने के बजाय कैलकुलेटर का उपयोग करने जैसा है।
  • यह मजबूत है (Robust): पेपर में परीक्षण "स्पार्स" (sparse) स्थितियों में किया गया—ऐसी स्थितियाँ जहाँ रोबोट के पास सीखने के लिए बहुत कम उदाहरण थे या उसे ऐसी जगहों पर रखा गया था जिन्हें उसने पहले कभी नहीं देखा था। "प्रतिभाशाली जादूगर" (डिफ्यूजन मॉडल) अक्सर विफल हो जाते थे या भ्रमित हो जाते थे। "स्मार्ट लाइब्रेरियन" (RE4) अच्छी तरह से काम करता रहा क्योंकि वह अपने पास मौजूद कुछ उदाहरणों को नई स्थिति के अनुरूप ढाल सकता था।

निष्कर्ष

यह पेपर तर्क देता है कि हमें रोबोट को सिखाने के लिए हमेशा विशाल, जटिल AI की आवश्यकता नहीं होती है। समस्या को चार तार्किक चरणों में तोड़कर—एक समान उदाहरण खोजना, वर्तमान स्थिति के अनुसार उसका अनुवाद करना, उस तक पहुँचने के लिए एक पथ की योजना बनाना, और चाल को पूरा करना—हम ऐसे रोबोट बना सकते हैं जो कार्यों को सीखने में उतने ही अच्छे होते हैं, लेकिन उन्हें समझना आसान है, प्रशिक्षित करना सस्ता है, और जब चीजें योजना के अनुसार नहीं होती हैं तो वे अधिक विश्वसनीय होते हैं।

लेखकों ने T-ब्लॉक को धकेलने और कैन उठाने जैसे कार्यों पर इसका परीक्षण किया, और पाया कि यह सरल, तार्किक दृष्टिकोण वर्तमान में उपलब्ध सबसे जटिल AI विधियों के समान (और कभी-कभी उनसे बेहतर) प्रदर्शन करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →