← नवीनतम पेपर
🤖 AI

Manual2Skill++: Connector-Aware General Robotic Assembly from Instruction Manuals via Vision-Language Models

Manual2Skill++ एक विजन-लैंग्वेज फ्रेमवर्क है जो कनेक्शन को प्राथमिक संस्थाओं के रूप में मानकर रोबोटिक असेंबली को बेहतर बनाता है, जो विविध परिदृश्यों में विश्वसनीय निष्पादन के लिए निर्देश पुस्तिकाओं से संरचित कनेक्शन डेटा को स्वचालित रूप से निकालकर पदानुक्रमित कार्य ग्राफ (hierarchical task graphs) बनाने के लिए बनाया गया है।

मूल लेखक: Chenrui Tie, Shengxiang Sun, Yudi Lin, Yanbo Wang, Zhongrui Li, Zhouhan Zhong, Jinxuan Zhu, Yiman Pang, Haonan Chen, Junting Chen, Ruihai Wu, Lin Shao

प्रकाशित 2026-03-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chenrui Tie, Shengxiang Sun, Yudi Lin, Yanbo Wang, Zhongrui Li, Zhouhan Zhong, Jinxuan Zhu, Yiman Pang, Haonan Chen, Junting Chen, Ruihai Wu, Lin Shao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप फर्नीचर का एक जटिल टुकड़ा बनाने की कोशिश कर रहे हैं, जैसे कि एक IKEA बुकशेल्फ़, लेकिन आपने पहले कभी निर्देश (instructions) नहीं देखे हैं। आपके पास लकड़ी का एक ढेर है, कुछ पेंच (screws) हैं, और पुर्जों का एक डिब्बा है। यदि आप केवल अंदाज़े से कि टुकड़ों को कहाँ रखना है, तो आप अंत में एक डगमगाता हुआ ढेर या लकड़ी का ऐसा ढेर पा लेंगे जो आपस में फिट ही नहीं होता।

लंबे समय तक, रोबोट इस काम में बहुत खराब रहे हैं। वे चीजों को इधर-उधर ले जाने में माहिर हैं, लेकिन वे उन चीजों को (जैसे गोंद या पेंच) एक गौण विचार (afterthought) की तरह देखते हैं जो चीजों को जोड़कर रखती हैं। वे लकड़ी के आकार पर तो ध्यान देते हैं, लेकिन यह भूल जाते हैं कि एक पेंच को काम करने के लिए एक विशिष्ट छेद में एक विशिष्ट कोण पर जाना चाहिए।

प्रवेश करता है "Manual2Skill++": रोबोट का नया निर्देश मैनुअल।

यह पेपर एक नई प्रणाली पेश करता है जो रोबोट को उन्हीं निर्देश मैनुअल्स को पढ़कर चीजें बनाना सिखाती है जिनका उपयोग इंसान करते हैं। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. "कनेक्टर्स" (Connectors) ही असली सितारे हैं

अधिकांश रोबोट निर्माता एक पहेली को देखते हैं और उसमें आकृतियाँ देखते हैं। यह नई प्रणाली एक पहेली को देखती है और देखता है कि टुकड़े आपस में कैसे जुड़ते हैं।

इसे Lego के खेल की तरह समझें।

  • पुराना तरीका: रोबोट एक लाल ब्लॉक और एक नीला ब्लॉक देखता है और उन्हें एक के ऊपर एक रखने की कोशिश करता है।
  • Manual2Skill++ तरीका: रोबोट एक लाल ब्लॉक देखता है और कहता है, "आह, इसमें एक 'स्टड' (कनेक्टर) है। नीले ब्लॉक में एक 'छेद' है। मुझे यह पता लगाना होगा कि स्टड और छेद कहाँ सटीक रूप से मिलते हैं, और मुझे यह भी जानना होगा कि कौन सा स्टड किस छेद में फिट बैठता है।"

यह प्रणाली इन कनेक्शनों (पेंच, डौवेल्स, पेग्स) को योजना के सबसे महत्वपूर्ण हिस्से के रूप में मानती है। यह केवल यह नहीं कहता कि "मेज पर पैर रखें"; यह कहता है "दो लकड़ी के डौवेल्स का उपयोग करके इन विशिष्ट निर्देशांकों (coordinates) पर मेज पर पैर रखें।"

2. रोबोट का "सुपर-रीडर" (विज़न-लैंग्वेज मॉडल)

रोबोट यह कैसे सीखता है? यह एक विशेष AI मस्तिष्क (जिसे विज़न-लैंग्वेज मॉडल कहा जाता है) का उपयोग करता है जो एक अति-अवलोकन करने वाले लाइब्रेरियन की तरह है।

  • इनपुट: आप रोबोट को निर्देश मैनुअल (चित्र और आरेख) देते हैं।
  • जादू: रोबोट केवल चित्र को देखता नहीं है; वह आरेख को "पढ़ता" है। वह समझ जाता है कि चित्र में एक छोटा सा गोला इसका अर्थ है कि "यहाँ पेंच लगाएँ," और एक छोटी सी रेखा का अर्थ है "इस पेग को अंदर स्लाइड करें।"
  • आउटपुट: यह बिखरे हुए चित्रों को एक संरचित मानचित्र (एक पदानुक्रमित ग्राफ) में बदल देता है। कल्पना कीजिए कि आप एक अस्त-व्यस्त रेसिपी को एक पूरी तरह से व्यवस्थित चेकलिस्ट में बदल रहे हैं जो आपको बताती है कि कौन सी सामग्री किस चरण के साथ जाती है।

3. "स्नैप-फिट" गणित

एक बार जब रोबोट के पास मानचित्र होता है, तो उसे यह समझना होता है कि टुकड़ों को ठीक कहाँ रखना है।

अतीत में, रोबोटों को अंदाज़ा लगाना पड़ता था और बार-बार प्रयास करना पड़ता था, वे एक हिस्से को इधर-उधर ले जाते थे जब तक कि वह फिट न हो जाए। यह धीमा था और अक्सर विफल हो जाता था।
Manual2Skill++ अलग है। क्योंकि यह जानता है कि "छेद" और "पेग्स" को कहाँ मिलना चाहिए, यह गणित तुरंत कर सकता है। यह एक चुंबक की तरह है जो दो टुकड़ों को पहली बार में ही बिल्कुल सही तरीके से खींच लेता है। यह सटीक स्थिति की गणना करता है ताकि जब रोबोट टुकड़े को ले जाए, तो वह मिलीमीटर की सटीकता के साथ सीधे अपनी जगह पर फिट हो जाए।

4. "वास्तविक दुनिया" का परीक्षण

शोधकर्ताओं ने केवल कंप्यूटर स्क्रीन पर इसका परीक्षण नहीं किया। उन्होंने एक सिमुलेशन बनाया जहाँ रोबोटों को ये चीजें बनानी थीं:

  • एक कुर्सी (लकड़ी के डौवेल्स का उपयोग करके)।
  • एक शू शेल्फ (पेंचों का उपयोग करके)।
  • एक खिलौना हवाई जहाज।
  • एक LEGO आकृति।

उन्होंने पाया कि कनेक्टर्स पर ध्यान न देने पर रोबोट विफल हो गए। लेकिन इस नई प्रणाली के साथ, रोबोट इन जटिल वस्तुओं को उच्च सटीकता के साथ बना सके, भले ही पुर्जों को संरेखित (align) करना कठिन हो।

बड़ी तस्वीर: यह क्यों मायने रखता है?

असेंबली को एक नृत्य की तरह समझें।

  • पुराने रोबोट: वे कदम जानते थे (हाथ बाएँ घुमाओ, हाथ दाएँ घुमाओ) लेकिन उन्हें लय (rhythm) का पता नहीं था। वे अक्सर एक-दूसरे के पैरों पर पैर रख देते थे या ताल चूक जाते थे।
  • Manual2Skill++: यह शीट संगीत (मैनुअल) को पढ़ता है और लय (कनेक्टर्स) को समझता है। इसे पता होता है कि कब कदम रखना है, हाथ कैसे पकड़ना है, और कैसे घूमना है ताकि नृत्य एकदम सही हो।

संक्षेप में: यह पेपर रोबोटों को अंदाज़ा लगाना छोड़ कर पढ़ना सिखाता है। यह समझने पर कि चीजें (पेंच, पेग, जोड़) कैसे जुड़ती हैं, रोबोट अंततः जटिल चीजें ठीक वैसे ही बना सकते हैं जैसे इंसान बनाते हैं, जिससे वे पुर्जों के ढेर को एक तैयार उत्पाद में बदल देते हैं, और इसके लिए उन्हें हर कदम पर किसी इंसान के हाथ पकड़ने की आवश्यकता नहीं होती।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →