← नवीनतम पेपर
🤖 AI

ConceptTree: Bringing Semantic Transparency to Black-Box Decision Making for Robotic Manipulation

ConceptTree एक ऐसा ढांचा है जो कौशल चयन को एक निर्णय वृक्ष (decision tree) के भीतर मानव-व्याख्या योग्य दृश्य अवधारणाओं पर तर्क के रूप में पुनर्गठित करके लंबी अवधि के रोबोटिक हेरफेर में पारदर्शिता को बढ़ाता है, जिससे मौजूदा अपारदर्शी दृष्टिकोणों की तुलना में पता लगाने योग्य, हस्तक्षेप योग्य और अधिक प्रभावी निर्णय लेने में सक्षम बनाया जा सके।

मूल लेखक: Yongyan Wen, Feifan Liu, Jinyi Chen, Bo An, Peng Liu, Siyuan Li

प्रकाशित 2026-07-21
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yongyan Wen, Feifan Liu, Jinyi Chen, Bo An, Peng Liu, Siyuan Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखा रहे हैं। आप केवल चाहते हैं कि वह ब्रेड को पकड़े ही नहीं; आप चाहते हैं कि उसे यह भी पता हो कि उसने ब्रेड क्यों पकड़ी, उसने फ्रिज क्यों खोला, और उसने टोस्टर में पीनट बटर डालने की कोशिश क्यों नहीं की। यह रोबोटिक मैनिपुलेशन (robotic manipulation) की दुनिया है, जहाँ मशीनें वास्तविक दुनिया में वस्तुओं को चलाना सीखती हैं। लंबे समय से, वैज्ञानिक रोबोट को बड़े, जटिल निर्णय लेना सिखाने की कोशिश कर रहे हैं, जैसे कि "दूध लाओ" या "दरवाजा बंद करो।" लेकिन यहाँ एक पेंच है: अधिकांश आधुनिक रोबोट "ब्लैक बॉक्स" मस्तिष्क का उपयोग करते हैं। वे एक तस्वीर देखते हैं, और फिर एक क्रिया निकल आती है, लेकिन कोई नहीं जानता कि रोबोट ने वह निर्णय कैसे लिया। यह एक जादूगर की तरह है जो टोपी से खरगोश निकालता है; आप परिणाम देखते हैं, लेकिन ट्रिक छिपी रहती है। यह एक समस्या है क्योंकि यदि रोबोट कोई गलती करता है—जैसे माइक्रोवेव में जीवित मछली डालने की कोशिश करना—तो हमें यह जानने की आवश्यकता है कि ऐसा क्यों हुआ ताकि हम इसे ठीक कर सकें। हमें इंटरप्रिटेबिलिटी (interpretability) की आवश्यकता है, जो बस एक फैंसी शब्द है जिसका अर्थ है "रोबोट की सोचने की प्रक्रिया को स्पष्ट और समझने योग्य बनाना।"

यहाँ ConceptTree आता है, जो एक नया फ्रेमवर्क है जो एक अनुवादक की तरह काम करता है जो रोबोट की आँखों और उसके मस्तिष्क के बीच। रोबोट को अंधे होकर अनुमान लगाने देने के बजाय, ConceptTree उसे पहले सरल, मानव-समान विचारों का उपयोग करके जो वह देख रहा है उसका वर्णन करने के लिए मजबूर करता है, जिन्हें कॉन्सेप्ट्स (concepts) कहा जाता है। इन कॉन्सेप्ट्स को रोबोट की आंतरिक चेकलिस्ट के रूप में सोचें: "क्या फ्रिज का दरवाजा खुला है?" "क्या ब्रेड अंदर है?" "क्या कप खाली है?" एक बार जब रोबोट इन बॉक्सों को चेक कर लेता है, तो वह केवल अगले कदम का अनुमान नहीं लगाता; वह एक स्पष्ट, चरण-दर-चरण डिसीजन ट्री (decision tree) का पालन करता है, जैसे कि एक "चूज़ योर ओन एडवेंचर" (Choose Your Own Adventure) किताब जहाँ हर विकल्प एक विशिष्ट कौशल की ओर ले जाता है। शोधकर्ताओं ने पाया कि रोबोट को इन सरल कॉन्सेप्ट्स और एक स्पष्ट मानचित्र का उपयोग करके अपने निर्णय समझाने के लिए कहकर, रोबोट जटिल कार्यों में बहुत बेहतर हो जाता है और अधिक महत्वपूर्ण बात यह है कि इसे फंसाने पर ठीक करना बहुत आसान हो जाता है।

समस्या: रोबोट का गुप्त नुस्खा (The Problem: The Robot's Secret Sauce)

रोबोट चीजें करने में बहुत अच्छे होते जा रहे हैं, लेकिन वे खुद को समझाने में बहुत खराब हैं। आज के अधिकांश उन्नत रोबोट "ब्लैक बॉक्स" सिस्टम का उपयोग करते हैं। आप उन्हें एक अस्त-व्यस्त रसोई की तस्वीर दिखाते हैं, और वे तुरंत "फ्रिज खोलने" का निर्णय लेते हैं। लेकिन यदि आप पूछते हैं, "आपने ऐसा क्यों चुना?" तो रोबोट आपको बता नहीं सकता। यह उस छात्र की तरह है जो गणित के टेस्ट में सही उत्तर तो देता है लेकिन अपना काम (steps) नहीं दिखा सकता। यदि रोबोट कोई गलती करता है, जैसे कि एक कैबिनेट खोलने की कोशिश करना जो पहले से ही खुला है, तो इंजीनियर अपना सिर खुजलाते रह जाते हैं। क्या रोबोट अंधा था? क्या उसने दृश्य को गलत समझा? या उसने बस एक गलत अनुमान लगाया? बिना "क्यों" को जाने, रोबोट को ठीक करना कार के इंजन को तब तक बेतरतीब ढंग से पुर्जे बदलकर ठीक करने जैसा है जब तक कि वह शुरू न हो जाए।

समाधान: एक रोबोट जो चेकलिस्ट में सोचता है (The Solution: A Robot That Thinks in Checklists)

हारबिन इंस्टीट्यूट ऑफ टेक्नोलॉजी और नानयांग टेक्नोलॉजिकल यूनिवर्सिटी में काम करने वाले इस पेपर के लेखकों ने ConceptTree नामक एक समाधान प्रस्तावित किया है। रोबोट को सीधे "देखने" से "करने" की ओर कूदने देने के बजाय, उन्होंने बीच में एक चरण जोड़ दिया है। पहले, रोबोट दृश्य को देखता है और एक कॉन्सेप्ट चेकलिस्ट भरता है। ये कोई जटिल गणितीय सूत्र नहीं हैं; ये सरल, मानव-पठनीय प्रश्न हैं जैसे:

  • "क्या माइक्रोवेव का दरवाजा खुला है?" (हाँ/नहीं)
  • "क्या माइक्रोवेव के अंदर ब्रेड है?" (हाँ/नहीं)
  • "क्या कप काउंटर पर है?" (हाँ/नहीं)

रोबोट इस चेकलिस्ट को भरने के लिए तस्वीर देखकर जवाब देना सीखता है। एक बार जब उसके पास अपनी चेकलिस्ट भर जाती है, तो वह केवल अगले कदम का अनुमान नहीं लगाता। इसके बजाय, वह एक डिसीजन ट्री के माध्यम से चलता है। एक दीवार पर लगे फ्लोचार्ट की कल्पना करें। रोबोट ऊपर से शुरू करता है और पूछता है, "क्या माइक्रोवेव का दरवाजा खुला है?" यदि उत्तर "हाँ" है, तो वह बाएं रास्ते पर जाता है। यदि "नहीं" है, तो वह दाएं रास्ते पर जाता है। अगले चरण में, वह अपनी चेकलिस्ट से एक और प्रश्न पूछता है। अंततः, वह पेड़ के नीचे पहुँच जाता है, जो उसे ठीक से बताता है कि कौन सा कौशल (skill) करना है, जैसे कि "माइक्रोवेव बंद करना।"

उन्होंने रोबोट को कैसे सिखाया (How They Taught the Robot)

रोबोट को इस चेकलिस्ट को भरने के लिए सिखाना मुश्किल है क्योंकि आप नहीं चाहते कि हर एक तस्वीर को मैन्युअल रूप से लेबल करने में वर्षों बिताएं। शोधकर्ताओं ने एक चतुर ट्रिक का उपयोग किया: उन्होंने एक सुपर-स्मार्ट AI लैंग्वेज मॉडल (एक VLM) का उपयोग एक शिक्षक के रूप में किया। उन्होंने रोबोट की तस्वीरों को इस शिक्षक AI को दिखाया और पूछा, "क्या ब्रेड माइक्रोवेव में है?" शिक्षक AI कहता, "हाँ" या "नहीं"। रोबोट फिर इन उत्तरों की नकल करना सीखता है। एक बार जब रोबोट चेकलिस्ट भरने में कुशल हो गया, तो शोधकर्ताओं ने यह पता लगाने के लिए एक डिसीजन ट्री को प्रशिक्षित किया कि उन उत्तरों के आधार पर कौन सा रास्ता चुनना है। सबसे अच्छी बात? शिक्षक AI का उपयोग केवल प्रशिक्षण के दौरान किया जाता है। एक बार जब रोबोट तैयार हो जाता है, तो वह अपनी स्वयं की चेकलिस्ट और अपने स्वयं के मानचित्र का उपयोग करके अपने आप चलता है।

परिणाम: स्मार्ट और ठीक करने में आसान (The Results: Smarter and Easier to Fix)

टीम ने चार वास्तविक दुनिया के रोबोट कार्यों पर ConceptTree का परीक्षण किया जो लगातार कठिन होते गए:

  1. फ्रूट्स-स्नैक्स (Fruits-Snacks): फल और स्नैक्स को फ्रिज और कैबिनेट में रखना।
  2. हीट-ब्रेड (Heat-Bread): ब्रेड को माइक्रोवेव में डालना, उसे गर्म करना और बाहर निकालना।
  3. कोला (Cola): सोडा का एक कैन और एक कप लेना, ड्रिंक डालना और कैन को वापस रखना।
  4. कॉफी (Coffee): केतली, फनल और पॉट्स (pots) से जुड़ी एक जटिल कॉफी बनाने की प्रक्रिया।

उन्होंने अपने तरीके की तुलना अन्य "ब्लैक बॉक्स" रोबोटों और अन्य "चेकलिस्ट" रोबोटों से की। परिणाम स्पष्ट थे: ConceptTree जीत गया। सबसे कठिन कार्यों में, जैसे कॉफी बनाना, ConceptTree लगभग 37% समय सफल रहा, जबकि ब्लैक-बॉक्स रोबोट केवल लगभग 5% ही सफल हो सके। इससे भी अधिक प्रभावशाली बात यह थी कि जब उन्होंने "इतिहास" (पिछले चरण में क्या हुआ था उसे याद रखना) जोड़ा, तो ब्रेड कार्य पर ConceptTree की सफलता दर बढ़कर 84% और कोला कार्य पर 95% हो गई।

लेकिन असली जादू केवल स्कोर नहीं था; यह पारदर्शिता थी। शोधकर्ताओं ने दिखाया कि यदि रोबोट कोई गलती करता है, तो वे डिसीजन ट्री को देख सकते हैं और देख सकते हैं कि वह कहाँ गलत हुआ। उदाहरण के लिए, "हीट-ब्रेड" कार्य में, रोबोट ने एक बार "माइक्रोवेव खोलना" तय किया जबकि उसे "बंद" करना चाहिए था। चेकलिस्ट को देखकर, उन्होंने देखा कि रोबोट ने सोचा कि ब्रेड अंदर नहीं है (उसने "ब्रेड इन माइक्रोवेव" कॉन्सेप्ट को कम स्कोर दिया)। उन्होंने उस एक संख्या को मैन्युअल रूप से "हाँ" में सुधारा, और अचानक, रोब manera का डिसीजन ट्री एक अलग रास्ता चुनता है और सही ढंग से "माइक्रोवेव बंद करें" चुनता है। उन्होंने रोबोट को फिर से प्रशिक्षित किए बिना या उसका कोड बदले बिना उसके व्यवहार को ठीक कर दिया। उन्होंने बस एक कॉन्सेप्ट को टवीक किया, और रोबोट समझ गया।

यह क्यों मायने रखता है (Why This Matters)

यह पेपर सुझाव देता है कि यदि रोबोटों को हमारे घरों और कार्यस्थलों में वास्तव में उपयोगी होना है, तो उन्हें अपने सोचने के तरीके को समझाने में सक्षम होना चाहिए। जटिल निर्णयों को सरल, मानव-समझने योग्य कॉन्सेप्ट्स में तोड़कर और एक स्पष्ट मानचित्र का पालन करके, रोबोट न केवल अधिक विश्वसनीय बनते हैं, बल्कि उन्हें डीबग करना भी बहुत आसान हो जाता है। यदि रोबोट कोई गलती करता है, तो हमें अनुमान लगाने की ज़रूरत नहीं है; हम उसकी चेकलिस्ट देख सकते हैं, गलत उत्तर ढूंढ सकते हैं, और उसे तुरंत ठीक कर सकते हैं। यह रोबोट को एक रहस्यमय ब्लैक बॉक्स से एक पारदर्शी साथी में बदल देता है जिस पर हम भरोसा कर सकते हैं और काम कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →