← नवीनतम पेपर
💻 computer science

Chain Of Interaction Benchmark (COIN): When Reasoning meets Embodied Interaction

यह शोध पत्र COIN को प्रस्तुत करता है, जो 50 संवादात्मक कार्यों, एक बड़े पैमाने के टेलीऑपरेटेड डेटासेट और व्यवस्थित मूल्यांकन मेट्रिक्स से युक्त एक व्यापक बेंचमार्क है, जो दृश्य समझ और मोटर निष्पादन के बीच के अंतराल के कारण कार्य-कारण-निर्भर (causally-dependent), दीर्घकालिक तर्क (long-horizon reasoning) करने में वर्तमान एम्बॉडीड एजेंटों की महत्वपूर्ण सीमाओं को उजागर करता है।

मूल लेखक: Xianhao Wang, Xiaojian Ma, Haozhe Hu, Rongpeng Su, Yutian Cheng, Zhou Ziheng, Hangxin Liu, Lei Liu, Bin Li, Qing Li

प्रकाशित 2026-04-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xianhao Wang, Xiaojian Ma, Haozhe Hu, Rongpeng Su, Yutian Cheng, Zhou Ziheng, Hangxin Liu, Lei Liu, Bin Li, Qing Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को आपके लिए एक कप कॉफी बनाना सिखा रहे हैं।

पुराने दिनों में, शोधकर्ता रोबोटों का परीक्षण सरल कार्यों के साथ करते थे जैसे "कप उठाना" या "कप को मेज पर रखना।" यह एक छोटे बच्चे को ब्लॉक सजाना सिखाने जैसा था। लेकिन वास्तविक दुनिया में, कॉफी बनाना केवल वस्तुओं को हिलाने के बारे में नहीं है; यह काम करते-करते चीजों को समझने के बारे में है।

हो सकता है कि कॉफी मशीन लॉक हो, इसलिए आपको चाबी ढूँढनी पड़े। हो सकता है कि चाबी एक दराज के अंदर हो जो फंसी हुई है, इसलिए आपको उसे हिलाकर खोलना पड़े। शायद कप टोस्टर के पीछे छिपा हो, इसलिए आपको पहले टोस्टर को हटाना पड़े। हर बार जब रोबोट कुछ करने की कोशिश करता है, तो वह कुछ नया सीखता है, और उसे तुरंत अपनी योजना बदलनी पड़ती है।

यह पेपर एक नया टेस्ट पेश करता है जिसे COIN (Chain of Interaction) कहा जाता है, यह देखने के लिए कि क्या रोबोट वास्तव में इस तरह की "करते हुए सोचने" की क्षमता रख सकते हैं।

यहाँ इस पेपर का सरल उपमाओं (analogies) के साथ विवरण दिया गया है:

1. समस्या: रोबोट "एक ही धुन के पक्के" होते हैं

वर्तमान रोबोट एक ऐसे GPS की तरह हैं जो आपको निर्देश तो देता है लेकिन यह नहीं जानता कि अगर रास्ते में कोई बाधा आ जाए तो क्या करना है।

  • पुराना तरीका: आप रोबोट को कहते हैं, "दरवाजा खोलो।" रोबोट दरवाजा खोलने की कोशिश करता है। यदि दरवाजा बंद है, तो रोबोट तब तक हैंडल को धक्का देता रहता है जब तक कि वह टूट न जाए, या वह हार मान लेता है। वह यह नहीं सोच पाता, "रुको, शायद मुझे पहले एक चाबी की जरूरत है।"
  • वास्तविकता: असली जीवन अव्यवस्थित होता है। आपको देखना, छूना, असफल होना, सीखना और एक अलग कोण (angle) आज़माना पड़ता है। इसे इंटरैक्टिव रीजनिंग (Interactive Reasoning) कहा जाता है।

2. समाधान: COIN बेंचमार्क

लेखकों ने रोबोटों को विशेष रूप से इस कौशल पर परखने के लिए एक विशाल वीडियो गेम (एक सिमुलेशन) बनाया है। वे इसे COIN कहते हैं। इसे रोबोटों के लिए "ड्राइवरों शिक्षा" (Driver's Ed) कोर्स की तरह समझें, लेकिन इसमें केवल सीधी रेखा में गाड़ी चलाना ही नहीं, बल्कि इसमें शामिल है:

  • COIN-प्रिमिटिव (बुनियादी बातें): 20 सरल कौशल जैसे "दरवाजा खोलना," "कप उठाना," या "बटन दबाना।" यह स्टीयरिंग व्हील पकड़ना सीखने जैसा है।
  • COIN-कंपोजिशन (मिश्रण): ऐसे कार्य जो दो सरल कौशलों को जोड़ते हैं, जैसे "दरवाजा खोलना और फिर कप उठाना।" यह राउंडअबाउट (गोल चक्कर) से गुजरने जैसा है।
  • COIN-50 (वास्तविक दुनिया): 50 जटिल परिदृश्य जहाँ रोबोट को एक रहस्य सुलझाना होता है। उदाहरण के लिए: "सेब प्राप्त करो।" लेकिन सेब एक कैबिनेट के अंदर है, कैबिनेट लॉक है, और चाबी एक दराज में है जो एक भारी बॉक्स द्वारा बाधित है। रोबोट को बॉक्स हटाना होगा, दराज खोलनी होगी, चाबी ढूँढनी होगी, कैबिनेट को अनलॉक करना होगा, और फिर सेब लेना होगा।

3. "कम लागत वाला" गुप्त हथियार

रोबोटों को ये कौशल सिखाने के लिए, आपको मनुष्यों को यह दिखाना होगा कि इसे कैसे किया जाता है। आमतौर पर, इसके लिए महंगे, लाखों डॉलर के रोबोटिक सूट की आवश्यकता होती है।

  • नवाचार: लेखकों ने एक सस्ते स्मार्टफोन (जो पुराने बाजार में $20 से कम का है) और एक ऑगमेंटेड रियलिटी (AR) ऐप का उपयोग करके एक सिस्टम बनाया।
  • उपमा: कल्पना करें कि आप एक VR हेडसेट पहने हुए हैं जहाँ आपके हाथ की हरकतें एक रोबोटिक हाथ को नियंत्रित करती हैं। उन्होंने केवल एक फोन के साथ यह करने का तरीका खोज निकाला। आप अपना फोन इधर-उधर घुमाते हैं, और रोबोट आपकी नकल करता है। उन्होंने इन कार्यों के 1,000 मानव प्रदर्शनों (demonstrations) को रिकॉर्ड करने के लिए इसका उपयोग किया। यह एक कुकिंग शो की फिल्म बनाने जैसा है जहाँ शेफ रोबोट को ठीक से दिखाता है कि प्याज कैसे काटना है, लेकिन उन्होंने यह स्टूडियो कैमरा के बजाय फोन का उपयोग करके किया।

4. परिणाम: रोबोट अभी भी चलना सीख रहे हैं

लेखकों ने आज के सबसे स्मार्ट AI रोबोट (जैसे Google, NVIDIA और Figure AI वाले) का इस नए COIN टेस्ट पर परीक्षण किया।

  • स्कोर: रोबोट बुरी तरह विफल रहे।
    • इंसान: जब इंसानों ने टेस्ट किया (फोन कंट्रोलर का उपयोग करके), तो वे सिमुलेशन में लगभग 40% बार सफल रहे (और वास्तविक जीवन में 100%)।
    • रोबोट: सबसे अच्छे AI रोबोट 3% से भी कम समय में सफल हुए।
  • क्यों?
    • "योजना बनाम क्रिया" का अंतर: रोबोट का "दिमाग" (जो योजना बनाता है) स्मार्ट है, लेकिन उसके "हाथ" (जो हिलते हैं) अनाड़ी हैं। दिमाग कहता है, "दराज खोलो," लेकिन हाथ बस उससे टकरा जाते हैं।
    • अनुकूलन क्षमता का अभाव: यदि रोबोट दरवाजा खोलने की कोशिश करता है और वह फंसा हुआ है, तो उसे दूसरा कोण आज़माने का पता नहीं चलता। वह बस बार-बार वही असफल गति करता रहता है।
    • "ब्लैक बॉक्स" की समस्या: रोबोट दुनिया को देखता है, लेकिन वह इसके भौतिक विज्ञान (physics) को नहीं समझता। उसे यह नहीं पता कि यदि आप किसी भारी बॉक्स को बहुत ज़ोर से धकेलेंगे तो वह गिर जाएगा।

5. निष्कर्ष (Takeaway)

यह पेपर एक चेतावनी है। यह कहता है: "हमने ऐसे रोबोट बनाए हैं जो बात कर सकते हैं और तस्वीरें पहचान सकते हैं, लेकिन वे भौतिक दुनिया के साथ तालमेल बिठाने में बहुत खराब हैं जब चीजें बिल्कुल वैसी नहीं होती जैसी योजना थी।"

रूपक (Metaphor):
कल्पना कीजिए कि एक रोबोट एक बहुत ही बुद्धिमान लाइब्रेरियन है जिसने दुनिया की हर किताब पढ़ ली है।

  • पुराने टेस्ट: लाइब्रेरियन किताब ढूंढ सकता है यदि आप उसे सटीक शीर्षक और शेल्फ नंबर दें।
  • COIN टेस्ट: आप लाइब्रेरियन से पूछते हैं, "मुझे खाना पकाने के बारे में एक किताब ढूंढ कर दो।" लेकिन कुकिंग सेक्शन लॉक है, चाबी गायब है, और शेल्फ बिखरी हुई है। लाइब्रेरियन भ्रमित हो जाता है, किताबों का ढेर गिरा देता है, और हार मान लेता है।

भविष्य:
लेखक सुझाव देते हैं कि इसे ठीक करने के लिए, हमें ऐसे रोबमाट चाहिए जो:

  1. अधिक सुचारू रूप से चल सकें (कम झटकेदार हाथ)।
  2. लूप में सोच सकें (कोशिश करो -> असफल हो -> सोचो -> फिर से कोशिश करो)।
  3. अपने दिमाग और हाथों को बेहतर तरीके से जोड़ सकें ताकि योजना और शारीरिक क्रिया मेल खा सके।

संक्षेप में, COIN इस बात को मापने का नया पैमाना है कि क्या एक रोबोट वास्तव में "एम्बॉडीड" (हमारी दुनिया में रहने में सक्षम) है या केवल एक फैंसी कंप्यूटर है जो रोबोट होने का नाटक कर रहा है। अभी के लिए, वे ज्यादातर केवल नाटक ही कर रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →