EnactToM: An Evolving Benchmark for Functional Theory of Mind in Embodied Agents
यह शोधपत्र EnactToM को प्रस्तुत करता है, जो 300 एम्बोडीड मल्टी-एजेंट कार्यों का एक कठोरता से सत्यापित और विकसित होने वाला बेंचमार्क है, जो वर्तमान फ्रंटियर एआई मॉडल्स में एक महत्वपूर्ण अंतराल को उजागर करता है, जो शाब्दिक विश्वास संबंधी प्रश्नों में तो उत्कृष्ट हैं लेकिन जटिल, आंशिक रूप से अवलोकन योग्य वातावरण में निहित विश्वासों पर कार्य करने के लिए आवश्यक कार्यात्मक थ्योरी ऑफ माइंड (Theory of Mind) में पूरी तरह से विफल (0.0% सफलता) रहते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, बहु-मंजिला घर में अपने एक दोस्त के साथ "लुका-छिपी" (Hide and Seek) का खेल खेल रहे हैं। लेकिन इसमें एक ट्विस्ट है: आप दोनों के पास वॉकी-टॉकी हैं, लेकिन सिग्नल कमजोर है, आप केवल कुछ ही शब्द बोल सकते हैं, और आप जो देख रहे हैं वह आपका दोस्त नहीं देख सकता। आप जानते हैं कि खजाना कहाँ है, लेकिन आपका दोस्त नहीं जानता। आपके दोस्त को पता है कि चाबी कहाँ है, लेकिन आपको नहीं। जीतने के लिए, आपको यह समझना होगा कि आपका दोस्त क्या सोचता है कि आप जानते हैं, और उसे क्या जानने की जरूरत है, बिना सीधे उत्तर चिल्लाए।
यह EnactToM का मूल आधार है, जो एक नया टेस्ट है जिसे एक शोध पत्र (paper) में वर्णित किया गया है।
यहाँ शोध पत्र का सरल शब्दों में विवरण दिया गया है:
1. समस्या: "बात करना" बनाम "करना"
वर्तमान AI मॉडल इस बारे में बात करने में बहुत अच्छे हैं कि दूसरे क्या सोचते हैं। यदि आप एक AI से पूछें, "क्या आपके साथी को पता है कि फ्रिज खुला है?" तो वह आमतौर पर सही उत्तर दे सकता है। शोध पत्र इसे लिटरल थ्योरी ऑफ माइंड (Literal Theory of Mind) कहता है। यह एक दर्शक की तरह है जो खेल का सटीक वर्णन कर सकता है।
हालाँकि, जब AI वास्तव में खेल के अंदर होता है और उस ज्ञान के आधार पर कार्य करने के लिए मजबूर होता है, तो वह अक्सर विफल हो जाता है। यह फंक्शनल थ्योरी ऑफ माइंड (Functional Theory of Mind) है। शोध पत्र का तर्क है कि सिर्फ इसलिए कि एक AI यह बता सकता है कि उसका साथी क्या जानता है, इसका मतलब यह नहीं है कि वह उस जानकारी का उपयोग मिलकर काम करने के लिए कैसे किया जाए, यह जानता है।
उपमा: कल्पना कीजिए कि एक शेफ (chef) रेसिपी का सटीक वर्णन तो कर सकता है (Literal), लेकिन वह सूप जला देता है क्योंकि उसे यह एहसास नहीं हुआ कि चूल्हा पहले से ही चालू था (Functional)। AI अपने साथी की मानसिक स्थिति का वर्णन तो कर सकता है, लेकिन वह अपने साथी के साथ समन्वय करने के लिए अपने कार्यों को व्यवस्थित करने में विफल रहता है।
2. समाधान: AI के लिए एक नया "जिम" (EnactToM)
शोधकर्ताओं ने EnactToM नामक एक नया परीक्षण मैदान बनाया है। इसे एक 3D वर्चुअल घर के रूप में सोचें जहाँ AI एजेंटों को काम पूरा करने के लिए (जैसे मेज पर कटोरा रखना या फ्रिज खोलना) मिलकर काम करना होता है।
- सेटअप: एजेंट अलग-अलग कमरों में होते हैं (आंशिक दृश्यता/Partial Observability)। उनके पास गुप्त सुराग होते हैं जिन्हें केवल वे ही जानते हैं (निजी जानकारी/Private Information)। वे केवल छोटे टेक्स्ट संदेश भेज सकते हैं (सीमित संचार/Constrained Communication)।
- लक्ष्य: उन्हें यह पता लगाकर कार्य पूरा करना है कि दूसरा व्यक्ति क्या जानता है और उसके अनुसार अपने कार्यों को ढालना है।
- "विकसित होने वाला" ट्विस्ट: यह एक स्थिर टेस्ट नहीं है। जैसे-जैसे AI मॉडल स्मार्ट होते जाते हैं और आसान स्तरों को पार करने लगते हैं, सिस्टम स्वचालित रूप से कठिन और पेचीदा पहेलियाँ बनाता है जो इस आधार पर होती हैं कि AI अभी कहाँ विफल हुआ। यह एक वीडियो गेम की तरह है जो बेहतर खेलने पर कठिन होता जाता है, जिससे यह सुनिश्चित होता है कि टेस्ट कभी भी "पुराना या उबाऊ" न हो जाए।
3. उन्होंने इसे कैसे बनाया (द "रोबोट आर्किटेक्ट")
इंसानों द्वारा हर एक टेस्ट लिखने के बजाय (जिसमें बहुत समय लगेगा), उन्होंने एक स्वायत्त कोडिंग एजेंट (एक रोबोट प्रोग्रामर) का उपयोग किया ताकि टेस्ट बनाए जा सकें।
- यह रोबोट खेल के नियम लिखता है।
- फिर यह नियमों को एक "जज काउंसिल" (दो अन्य AI) के साथ चेक करता है ताकि यह सुनिश्चित हो सके कि खेल निष्पक्ष है, हल करने योग्य है, और वास्तव में टीम वर्क की मांग करता है।
- यह एक "अभ्यास दौर" (practice round) चलाता है जहाँ सभी को सभी रहस्य पता होते हैं। यदि AI इसमें भी विफल रहता है, तो टेस्ट को हटा दिया जाता है क्योंकि वह शारीरिक रूप से बहुत कठिन था, मानसिक रूप से नहीं।
- यदि AI अभ्यास दौर में पास हो जाता है लेकिन वास्तविक दौर (जहाँ रहस्य छिपे हुए हैं) में विफल हो जाता है, तो टेस्ट को रखा जाता है। यह साबित करता है कि AI टीम वर्क की कमी के कारण विफल हुआ, न कि इसलिए कि वह वस्तु को नहीं ढूंढ सका।
4. परिणाम: "कहने-करने का अंतर" (The "Say-Do" Gap)
शोधकर्ताओं ने आज के सात सबसे स्मार्ट AI मॉडलों का परीक्षण किया। परिणाम चौंकाने वाले थे:
- बातचीत: जब उनसे केवल यह पूछा गया कि उनके साथी को क्या पता था, तो AI काफी हद तक ठीक थे, वे लगभग 45% उत्तर सही दे रहे थे।
- क्रियान्वयन: जब उन्हें मिलकर कार्य पूरा करने के लिए कहा गया, तो हर एक मॉडल ने सबसे कठिन संस्करण के टेस्ट में 0% स्कोर किया। वे विश्वसनीय रूप से समन्वय करने में विफल रहे।
निष्कर्ष: AI बेहतरीन "आर्मचेयर क्वार्टरबैक" (वे खेल का विश्लेषण कर सकते हैं) हैं लेकिन खराब "खिलाड़ी" (वे खेल को क्रियान्वित नहीं कर सकते) हैं।
5. वे क्यों विफल होते हैं? (5 ब्रेकडाउन)
शोधकर्ताओं ने विफलताओं का बारीकी से अध्ययन किया और पाया कि AI टीम वर्क मुख्य रूप से पांच तरीकों से टूटता है:
- जानकारी रोकना (Withholding Info): एक AI के पास एक महत्वपूर्ण तथ्य होता है लेकिन वह अपने साथी को बताने में बहुत देर कर देता है, जिससे साथी गलती कर बैठता है।
- टूटी हुई कड़ियाँ (Broken Chains): एक AI भौतिक कार्य तो करता है (फ्रिज खोलता है) लेकिन उसे बताना भूल जाता है, जिससे साथी को पता नहीं चलता कि काम पूरा हो गया है।
- तोड़फोड़ (Sabotage): उन कार्यों में जहाँ एजेंटों के अपने निजी लक्ष्य होते हैं, वे कभी-कभी अनजाने में (या जानबूझकर) साझा लक्ष्य को बिगाड़ देते हैं क्योंकि वे यह नहीं समझते कि उनके कार्यों का साथी पर क्या प्रभाव पड़ता है।
- गलत संदेश (Wrong Messages): वे अपने सीमित "टेक्स्ट संदेशों" को गलत व्यक्ति पर या महत्वहीन विवरणों पर बर्बाद करते हैं।
- सीमाओं को अनदेखा करना (Ignoring Limits): वे साथी को ऐसा कुछ करने के लिए कहते हैं जो असंभव है, जैसे कि ऐसे कमरे में प्रवेश करना जहाँ वे अंदर जाने से वर्जित हैं।
सारांश
यह शोध पत्र EnactToM को पेश करता है, जो एक गतिशील, विकसित होने वाला बेंचमार्क है जो यह परीक्षण करता है कि क्या AI एजेंट वास्तव में एक भौतिक दुनिया में मिलकर काम कर सकते हैं, न कि केवल इसके बारे में बात कर सकते हैं। निष्कर्ष बताते हैं कि आज के सबसे उन्नत AI मॉडल एक साथी के विचारों का वर्णन तो कर सकते हैं लेकिन समन्वय करने के लिए उस ज्ञान का उपयोग करने में विफल रहते हैं। शोध का सुझाव है कि AI के वास्तविक सहयोग के लिए, उसे केवल "रिपोर्टिंग" से आगे बढ़कर "क्रियान्वयन" की ओर बढ़ने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।