← नवीनतम पेपर
🤖 AI

Retrieval-Augmented Robots via Retrieve-Reason-Act

यह शोधपत्र रिट्रीवल-ऑगमेंटेड रोबोटिक्स (RAR) को प्रस्तुत करता है, जो एक ऐसा प्रतिमान (पैराडाइम) है जो रोबोटों को निष्पादन योग्य भौतिक योजनाओं को उत्पन्न करने के लिए असंरचित दृश्य प्रक्रियात्मक दस्तावेजों (unstructured visual procedural documents) पर पुनरावर्ती रूप से रिट्रीव करने, ग्राउंड करने और तर्क करने के माध्यम से जटिल कार्यों में ज़ीरो-शॉट सूचना अंतराल को दूर करने में सक्षम बनाता है।

मूल लेखक: Izat Temiraliev, Diji Yang, Yi Zhang

प्रकाशित 2026-03-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Izat Temiraliev, Diji Yang, Yi Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपको एक प्रसिद्ध फर्नीचर स्टोर से एक बिल्कुल नया, फ्लैट-पैक बुकशेल्फ़ (किताब रखने की अलमारी) मिला है। आपने पहले कभी इस विशिष्ट मॉडल को नहीं देखा है, और आपके पास ऐसा कोई दोस्त भी नहीं है जो इसे बनाना जानता हो। आप लकड़ी के बोर्ड, पेंचों (screws) और एक बहुत ही भ्रमित रोबोटिक हाथ के ढेर के साथ खड़े हैं।

यदि आप एक मानक रोबोट (या एक स्मार्ट AI) से "इसे बनाओ" कहेंगे, तो वह कुर्सी और मेजों के बारे में जो कुछ भी वह जानता है, उसके आधार पर अनुमान लगाने की कोशिश करेगा। वह कह सकता है, "मुझे लगता है कि पैर यहाँ जाने चाहिए," लेकिन वह विशिष्ट क्रम को गलत कर देगा, या किसी ऐसे छेद में पेंच लगाने की कोशिश करेगा जो वहां मौजूद ही नहीं है। यह वैसा ही है जैसे किसी विशिष्ट केक को बनाने के लिए केवल इस याददाश्त का उपयोग करना कि केक आमतौर पर कैसे दिखते हैं, बिना किसी रेसिपी (विधि) के।

यह पेपर रोबोट के काम करने का एक नया तरीका पेश करता है: "मैनुअल पढ़ने वाला" रोबोट।

इसका सरल विवरण यहाँ दिया गया है, जिसमें रोजमर्रा के उदाहरणों का उपयोग किया गया है:

1. समस्या: "जीरो-शॉट" (Zero-Shot) का जाल

आज के अधिकांश रोबोट उन छात्रों की तरह हैं जिन्होंने पाठ्यपुस्तक को रट लिया है लेकिन उन्होंने वास्तविक परीक्षा के प्रश्न कभी नहीं देखे हैं। यदि आप उन्हें कोई ऐसा कार्य देते हैं जो उन्होंने पहले नहीं देखा है (जैसे कि एक नया, अजीब सा फर्नीचर असेंबल करना), तो वे विफल हो जाते हैं क्योंकि वे "सामान्य ज्ञान" पर निर्भर करते हैं। वे रेसिपी को पढ़ने के बजाय उसका अनुमान लगाने की कोशिश कर रहे होते हैं।

2. समाधान: RAR (रिट्रीवल-ऑगमेंटेड रोबोटिक्स)

लेखकों ने RAR नामक एक प्रणाली प्रस्तावित की है। इस रोबोट को केवल आदेशों का पालन करने वाले कार्यकर्ता के रूप में नहीं, बल्कि एक जासूस या एक शेफ (रसोइया) के रूप में सोचें।

  • जासूस: जब किसी रहस्य का सामना होता है, तो एक जासूस केवल अनुमान नहीं लगाता; वह लाइब्रेरी जाता है, विशिष्ट केस फाइल ढूंढता है, और सुरागों को पढ़ता है।
  • शेफ: एक शेफ केवल एक नया व्यंजन बनाने का अनुमान नहीं लगाता; वह विशिष्ट रेसिपी कार्ड निकालता है।

इस प्रणाली में, रोबंड के तीन चरण हैं, जिन्हें लेखक "रिट्रीव-रीज़न-एक्ट" (Retrieve-Reason-Act) लूप कहते हैं:

  • रिट्रीव (लाइब्रेरी जाना): रोबोट फर्नीचर को देखता है और कहता है, "मुझे इस विशिष्ट कुर्सी के लिए मैनुअल चाहिए।" वह डिजिटल मैनुअल की एक लाइब्रेरी खोजता है और उस वस्तु के लिए सटीक निर्देश निकालता है।
  • रीज़न (पढ़ना और अनुवाद करना): यह कठिन हिस्सा है। मैनुअल में 2D चित्र (सपाट चित्र) होते हैं, लेकिन रोबोट 3D दुनिया (वास्तविक स्थान) में होता है। रोबोट को किताब में "पार्ट A" के चित्र को देखना होगा और कहना होगा, "आह, यह मेरे बाईं ओर रखे लाल ब्लॉक जैसा दिखता है।" उसे सपाट ड्राइंग को वास्तविक वस्तु के साथ मैप करना होगा।
  • एक्ट (काम करना): एक बार जब उसे पता चल जाता है कि कौन सा हिस्सा कहाँ जाएगा, तो वह उसे उठाता है और जोड़ देता है।

3. "जादुई" पुल: ओवरव्यू इमेज (अवलोकन छवि)

सबसे बड़ी बाधाओं में से एक यह है कि मैनुअल "पार्ट 001" और "पार्ट 002" जैसे नामों का उपयोग करता है, लेकिन रोबोट भौतिक वस्तुओं को देखता है।
इसे हल करने के लिए, शोधकर्ताओं ने एक "पार्ट्स ओवरव्यू" बनाया है। कल्पना कीजिए कि आप सभी लकड़ी के टुकड़ों को लेते हैं, उन्हें अलग-अलग रंगों से पेंट करते हैं, और उन्हें "पार्ट 001 = यह लाल ब्लॉक" जैसे लेबल के साथ लाइन में रखकर एक फोटो लेते हैं।
रोबोट इस फोटो को एक रोसेटा स्टोन (Rosetta Stone) के रूप में उपयोग करता है। वह मैनुअल को देखता है, "पार्ट 001" देखता है, फोटो को देखता है, "लाल ब्लॉक" देखता है, और फिर उसे पता चलता है कि वास्तव में किस भौतिक टुकड़े को उठाना है।

4. उन्होंने क्या पाया (परिणाम)

शोधकर्ताओं ने इसका परीक्षण 102 विभिन्न फर्नीचर वस्तुओं (कुर्सियों, मेजों, अलमारियों) के साथ एक कंप्यूटर सिमुलेशन में किया।

  • "अनुमान लगाने वाला" रोबोट: मैनुअल के बिना, रोबोट लगभग 45% कनेक्शन सही कर पाया। वह ज्यादातर अनुमान लगा रहा था।
  • "मैनुअल पढ़ने वाला" रोबोट: जब रोबोट को सटीक मैनुअल प्राप्त करने और उसका पालन करने की अनुमति दी गई, तो उसकी सफलता दर बढ़कर 53% से अधिक हो गई। यह एक बहुत बड़ा सुधार है!
  • "समान उदाहरण वाला" रोबोट: उन्होंने रोबोट को समान कुर्सियों के मैनुअल भी दिए (उदाहरण के लिए, "यहाँ उस कुर्सी के लिए एक मैनुअल है जो दिखने में वैसी ही है जैसी आप बना रहे हैं")। इससे थोड़ी मदद मिली, लेकिन यह सटीक मैनुअल होने जितना अच्छा नहीं था। यह एक विशिष्ट IKEA टेबल बनाने के लिए दूसरे IKEA टेबल का मैनुअल पढ़ने जैसा है; आप सामान्य विचार तो प्राप्त कर सकते हैं, लेकिन आप विशिष्ट पेंचों को मिस कर सकते हैं।

5. वे अभी भी कहाँ संघर्ष करते हैं

परफेक्ट मैनुअल के साथ भी, रोबोट अभी भी पूर्ण नहीं है।

  • "वर्किंग मेमोरी" की सीमा: यदि फर्नीचर में बहुत अधिक हिस्से हैं (जैसे कि 20+ टुकड़ों वाली एक जटिल बुकशेल्फ़), तो रोबंड भ्रमित हो जाता है। यह एक 20-चरणीय रेसिपी को खाना बनाते समय अपने दिमाग में रखने की कोशिश करने जैसा है; आप भूलने लगते हैं कि आप किस चरण पर थे।
  • दृश्य भ्रम (Visual Confusion): कभी-कभी मैनुअल दो ऐसे हिस्से दिखाता है जो लगभग एक जैसे दिखते हैं (जैसे दो समान लकड़ी के पैनल), और रोबोट उनमें भ्रमित हो जाता है।

बड़ी तस्वीर

यह पेपर इस दिशा में एक बड़ा कदम है कि रोबोट वास्तव में केवल निर्देशों को पढ़कर नए कार्यों को तुरंत सीख सकें।
रोबोट को यह सिखाने के लिए कि वह एक कुर्सी कैसे बनाए (जिसमें हजारों बार अपना हाथ हिलाना पड़ता है, जिसमें बहुत समय लगता है), हमें मानव द्वारा प्रशिक्षित करने की आवश्यकता नहीं है, हम बस रोबोट को मैनुल दे सकते हैं।

संक्षेप में: लेखक रोबोटों को अनुमान लगाना बंद करने और पढ़ना शुरू करने की शिक्षा दे रहे हैं। वे रोबोटों को "मांसल नकल करने वालों" से बदलकर "स्मार्ट पाठक" बना रहे हैं जो मैनुअल देख सकते हैं, योजना समझ सकते हैं और ऐसी चीजें बना सकते हैं जो उन्होंने पहले कभी नहीं देखी हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →