← नवीनतम पेपर
💻 computer science

Compose by Focus: Scene Graph-based Atomic Skills

यह शोध पत्र एक सीन ग्राफ-आधारित ढांचे को प्रस्तुत करता है जो ग्राफ न्यूरल नेटवर्क और डिफ्यूजन मॉडल के माध्यम से मजबूत, केंद्रित परमाणु कौशल (atomic skills) सीखकर सामान्यवादी रोबोटों के संरचनात्मक सामान्यीकरण (compositional generalization) को बढ़ाता है, जिन्हें फिर जटिल, दीर्घ-अवधि वाले कार्यों को पूरा करने के लिए एक विजन-लैंग्वेज मॉडल प्लानर द्वारा समन्वित किया जाता है।

मूल लेखक: Han Qi, Changhe Chen, Heng Yang

प्रकाशित 2026-03-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Han Qi, Changhe Chen, Heng Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को अपना बिखरा हुआ किचन साफ करना सिखा रहे हैं। आप चाहते हैं कि वह एक केला उठाए, उसे एक कटोरे में रखे, फिर एक कप उठाए, और अंत में मेज पोंछ दे। यह एक लॉन्ग-होराइजन टास्क (long-horizon task) है—एक बड़ा काम जिसे कई छोटे चरणों में बांटा गया है।

समस्या यह है कि अधिकांश रोबोट उन छात्रों की तरह होते हैं जिन्होंने केवल एक एकदम साफ, खाली कक्षा में पढ़ाई की है। यदि आप उन्हें एक वास्तविक रसोई में रख देते हैं जहाँ बिखरा हुआ सामान, भटकाव और अजीब रोशनी हो, तो वे सुन्न पड़ जाते हैं या सब कुछ गिरा देते हैं। वे "शोर" (जैसे काउंटर पर पड़ा एक चम्मच या खिलौना) से भ्रमित हो जाते हैं और केला उठाने जैसे सरल काम को करना भूल जाते हैं।

यह पेपर, "कंपोज़ बाय फोकस" (Compose by Focus), रोबोट को सिखाने का एक चतुर नया तरीका प्रस्तावित करता है ताकि वे विचलित न हों। यहाँ इसका विवरण सरल उपमाओं के साथ दिया गया है:

1. समस्या: "विचलित छात्र" (The Distracted Student)

एक मानक रोबोट पॉलिसी (रोबोट का मस्तिष्क) को एक ऐसे छात्र के रूप में सोचें जो गणित की समस्या हल करने की कोशिश कर रहा है जबकि बगल में एक सर्कस चल रहा है।

  • पुराना तरीका: रोबोट पूरे दृश्य (पूरे सर्कस, शोर, रंगों) को एक विशाल, धुंधली तस्वीर के रूप में देखता है। जब कार्य थोड़ा बदल जाता है (जैसे, "हरे सेब" के बजाय "लाल सेब" उठाना), तो रोबोट अभिभूत हो जाता है क्योंकि वह बहुत अधिक अप्रासंगिक जानकारी को प्रोसेस करने की कोशिश कर रहा है।
  • परिणाम: यह एक शांत कमरे में तो ठीक काम करता है लेकिन एक अस्त-व्यस्त कमरे में बुरी तरह विफल हो जाता है।

2. समाधान: "स्पॉटलाइट" (दृश्य ग्राफ/Scene Graphs)

लेखक एक सीन ग्राफ (Scene Graph) पेश करते हैं। कल्पना कीजिए कि यह एक स्मार्ट स्पॉटलाइट या हाइलाइटर पेन है जिसका उपयोग रोबलेट हिलने-डुलने से पहले ही करता है।

पूरी बिखरी हुई रसोई को देखने के बजाय, रोबोट एक स्मार्ट सहायक (एक AI जिसे विजन-लैंग्वेज मॉडल कहा जाता है) से पूछता है: "हे, केला उठाने के इस विशिष्ट कार्य के लिए, वास्तव में क्या महत्वपूर्ण है?"

सहायक एक मानसिक मानचित्र (सीन ग्राफ) बनाता है जिसमें केवल शामिल होता है:

  • रोबोट का हाथ।
  • केला।
  • कटोरा।
  • शायद एक कुर्सी, यदि वह रास्ते में हो।

यह बिखरे हुए खिलौने, बिल्ली, या दीवार पर लगी तस्वीर को पूरी तरह से अनदेखा कर देता है। यह "सर्कस" को फ़िल्टर कर देता है और केवल "गणित की समस्या" पर ध्यान केंद्रित करता है।

3. यह कैसे काम करता है: "लेगो" (LEGO) की उपमा

यह पेपर इन छोटे कार्यों को एटमिक स्किल्स (Atomic Skills) कहता है। इन्हें व्यक्तिगत लेगो ब्रिक्स की तरह समझें।

  • लक्ष्य: एक किला बनाना (लंबा कार्य)।
  • पुराना तरीका: आप पूरे किले को एक साथ जोड़ने की कोशिश करते हैं। यदि निर्देश थोड़े अलग हैं, तो जोड़ विफल हो जाता है।
  • नया तरीका: आप रोबोट को एक ईंट को पूरी तरह से फिट करना सिखाते हैं। क्योंकि आपने उसे केवल उस एक ईंट पर ध्यान केंद्रित करना सिखाया है (अन्य 100 ईंटों को अनदेखा करते हुए), वह उन्हें हर बार पूरी तरह से जोड़ना सीख जाता है, चाहे मेज कितनी भी बिखरी हुई क्यों न हो।

रोबोट एक ग्राफ न्यूरल नेटवर्क (GNN) का उपयोग करता है। इसे एक सुपर-स्मार्ट अनुवादक के रूप में सोचें जो "स्पॉटलाइट मैप" (सीन ग्राफ) को उस भाषा में बदल देता है जिसे रोबोट की मांसपेशियां समझती हैं। यह बिंदुओं को जोड़ता है: "हाथ यहाँ है, केला वहाँ है, कटोरा वहाँ है। क्रिया: हाथ को केले की ओर ले जाएं।"

4. जादुई सामग्री: डिफ्यूजन (Diffusion)

रोबोट इन कौशलों को डिफ्यूजन (Diffusion) नामक चीज़ का उपयोग करके सीखता है।

  • कल्पना कीजिए कि आपके पास रोबोट के हाथ हिलाने की एक धुंधली, शोर वाली फोटो है।
  • "डिफ्यूजन" की प्रक्रिया एक मूर्तिकार की तरह है जो नीचे छिपी हुई एकदम सटीक, चिकनी गति को प्रकट करने के लिए धीरे-धीरे शोर (स्टैटिक) को हटाता है।
  • क्योंकि रोबोट केवल "स्पॉटलाइट मैप" (प्रासंगिक वस्तुओं) को देख रहा है, वह पूरे बिखरे हुए कमरे की फोटो को साफ करने की तुलना में बहुत तेज़ी से और अधिक सटीकता से शोर को हटा देता है।

5. परिणाम: "नाजुक" से "मजबूत" तक

शोधकर्ताओं ने इसे दो तरीकों से परखा:

  1. सिमुलेशन: एक वर्चुअल रोबोट जो ब्लॉक को स्टैक करना, रंग छाँटना और औजारों का उपयोग करना सीख रहा है।
  2. वास्तविक दुनिया: एक वास्तविक रोबोट आर्म जो बिखरी हुई मेज से सब्जियां उठाने की कोशिश कर रहा है।

परिणाम:

  • पुराने रोबोट: जब उन्हें एक सब्जी उठाने के लिए कहा गया, तो उन्होंने ठीक काम किया। लेकिन जब उन्हें एक ही बार में पाँच सब्जियां उठाने के लिए कहा गया (एक लंबा कार्य) एक बिखरे हुए कमरे में, तो वे लगभग 100% बार विफल रहे। वे अतिरिक्त सब्जियों से भ्रमित हो गए।
  • नया रोबोट: इसने लगभग पूर्ण सफलता (97-100%) के साथ सब्जियां उठाईं। यहाँ तक कि जब उन्होंने यादृच्छिक बाधाएं जोड़ीं या बैकग्राउंड बदल दिया, तो रोबोट को कोई फर्क नहीं पड़ा। उसने बस अपना "स्पॉटलाइट" चालू किया, सब्जी को खोजा, और उसे पकड़ लिया।

सारांश

यह पेपर रोबोट को पूरी तस्वीर को देखना बंद करने और केवल उन विशिष्ट हिस्सों पर ध्यान केंद्रित करने की शिक्षा देता है जो महत्वपूर्ण हैं।

एक बिखरे हुए दृश्य को "महत्वपूर्ण वस्तुओं और उनके संबंधों" (सीन ग्राफ) की एक साफ, संरचित सूची में बदलकर, रोबोट सरल कौशल एक बार सीख सकता है और फिर जटिल, वास्तविक दुनिया की समस्याओं को हल करने के लिए उन्हें लेगो ब्रिक्स की तरह जोड़ सकता है। यह एक ऐसे छात्र के बीच का अंतर है जो शोर वाले पुस्तकालय में घबरा जाता है और दूसरे के बीच जो नॉइज़-कैंसलिंग हेडफ़ोन लगा लेता है और सीधे अपने काम में लग जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →