AutoToM: Scaling Model-based Mental Inference via Automated Agent Modeling
AutoToM एक स्वचालित ढांचा है जो अनुमान अनिश्चितता द्वारा निर्देशित बेयसियन इनवर्स प्लानिंग के माध्यम से एजेंट मॉडलों को पुनरावृत्ति रूप से परिष्कृत करके थ्योरी ऑफ माइंड रीजनिंग को बढ़ाता है, जिससे विविध बेंचमार्क में मौजूदा तरीकों से बेहतर, स्केलेबल, सुदृढ़ और व्याख्या योग्य मानसिक अनुमान प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रहस्यमयी फिल्म देख रहे हैं। एक पात्र, मान लीजिए उसका नाम सैली है, एक डिब्बे में एक सेब छिपाती है। फिर, दूसरा पात्र, ऐन, अंदर आती है और सेब को एक टोकरी में रख देती है। सैली यह होते हुए नहीं देख पाती।
यदि आप पूछें, "ऐने को लगता है कि सेब कहाँ है?" तो एक समझदार इंसान तुरंत जान जाता है: ऐने को लगता है कि वह टोकरी में है क्योंकि उसने उसे हिलते हुए देखा था। लेकिन यदि आप पूछें, "सैली को लगता है कि सेब कहाँ है?" तो आपको मानसिक रूप से एक उल्टा सोचना होगा। आपको यह याद रखना होगा कि सैली ने उस बदलाव को नहीं देखा, इसलिए वह अभी भी सोचती है कि सेब डिब्बे में है।
यह दूसरों के विचारों, विश्वासों या इच्छाओं को समझने की क्षमता—विशेष रूप से जब उनके विचार वास्तविकता से भिन्न हों—थ्योरी ऑफ माइंड (ToM) कहलाती है। यह वह सुपरपावर है जो हमें सहयोग करने, झूठ बोलने, मजाक करने और एक-दूसरे की मदद करने में सक्षम बनाती है।
यह शोध पत्र AutoToM नामक एक नए AI सिस्टम का परिचय देता है जो इस सुपरपावर में महारत हासिल करने की कोशिश करता है। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है।
समस्या: दो त्रुटिपूर्ण दृष्टिकोण
AutoToM से पहले, AI इन पहेलियों को दो तरीकों से हल करने की कोशिश करता था, जिनमें दोनों में बड़ी कमियां थीं:
- "अंतर्ज्ञान" वाला दृष्टिकोण (LLMs): लार्ज लैंग्वेज मॉडल्स (जैसे कि वह AI जिससे आप अभी बात कर रहे हैं) बस कहानी पढ़ते हैं और पैटर्न के आधार पर उत्तर का अनुमान लगाते हैं। यह एक ऐसे छात्र की तरह है जो केवल प्रश्न के लहजे के आधार पर अंदाज़ा लगाकर परीक्षा दे रहा हो। कभी-कभी वे सही होते हैं, लेकिन अक्सर लंबी कहानियों या पेचीदा तर्क के कारण भ्रमित हो जाते हैं, जिससे "व्यवस्थित त्रुटियाँ" (systematic errors) होती हैं।
- "कठोर ब्लूप्रिंट" वाला दृष्टिकोण (मॉडल-आधारित): अन्य शोधकर्ताओं ने सख्त, गणितीय नियमपुस्तिकाएँ (जैसे कि एक फ्लोचार्ट) बनाईं ताकि AI को चरण-दर-चरण सोचने के लिए मजबूर किया जा सके। यह बहुत सटीक है, लेकिन यह न्यूयॉर्क शहर के नक्शे का उपयोग करके जापान के एक छोटे से गाँव में रास्ता खोजने जैसा है। आपको हर एक कहानी के लिए एक नया नक्शा मैन्युअल रूप से बनाना पड़ता है, जो धीमा है और नई स्थितियों में काम नहीं करता।
समाधान: AutoToM (द "एडेप्टिव आर्किटेक्ट")
AutoToM एक हाइब्रिड है। यह एक स्मार्ट अनुमान लगाने वाले के लचीलेपन और एक नियमपुस्तिका की विश्वसनीयता को जोड़ता है, लेकिन यह कुछ अनूठा करता है: यह अपना नियमपुस्तिका खुद मौके पर ही बनाता है।
AutoToM को एक जासूस के रूप में समझें जो हर नए रहस्य के लिए एक कस्टम केस फाइल बनाता है।
AutoToM कैसे काम करता है (3-चरणीय लूप)
1. प्रारंभिक रेखाचित्र (प्रस्ताव - Proposal)
जब AutoToM को कोई कहानी मिलती है, तो वह केवल उसे पढ़ता नहीं है; वह पूछता है, "मुझे इस समस्या को हल करने के लिए किन मानसिक चरों (variables) की आवश्यकता है?"
- उपमा: कल्पना कीजिए कि आपको एक जिग्सॉ पहेली दी गई है। टुकड़ों को जबरदस्ती जोड़ने के बजाय, आप पहले बॉक्स पर बनी तस्वीर को देखते हैं और एक रफ आउटलाइन बनाते हैं कि टुकड़े कैसे दिख सकते हैं।
- AutoToM एक सरल "मानसिक मॉडल" (एक आरेख कि कौन क्या जानता है, क्या चाहता है, और क्या देखता है) प्रस्तावित करने के लिए एक लार्ज लैंग्वेज मॉडल का उपयोग करता है।
2. तनाव परीक्षण (बेयसियन इन्फरेंस - Bayesian Inference)
एक बार जब उसके पास एक रेखाचित्र होता है, तो वह एक सिमुलेशन चलाता है। वह पूछता है: "यदि यह मानसिक मॉडल सत्य है, तो क्या यह कहानी में देखे गए कार्यों की व्याख्या करता है?"
- उपमा: यह एक मौसम पूर्वानुमानकर्ता द्वारा सिमुलेशन चलाने जैसा है। "यदि हवा चल रही है और नमी अधिक है (मॉडल), तो क्या बारिश होगी (क्रिया)?"
- यदि सिमुलेशन कहानी से मेल खाता है, तो बहुत अच्छा! यदि गणित से पता चलता है कि कोई विसंगति है (जैसे, मॉडल कहता है कि पात्र को सेब हिलते हुए देखना चाहिए था, लेकिन कहानी कहती है कि उसने नहीं देखा), तो सिस्टम को पता चल जाता है कि मॉडल गलत है।
3. मरम्मत दल (मॉडल समायोजन - Model Adjustment)
यही असली जादू है। यदि पहला रेखाचित्र विफल हो जाता है, तो AutoToM हार नहीं मानता। वह स्वचालित रूप से अपने ब्लूप्रिंट को ठीक करता है।
- चर समायोजन (Variable Adjustment): शायद वह "लक्ष्य" (Goal) को शामिल करना भूल गया। वह आरेख में एक "लक्ष्य" चर जोड़ता है और फिर से प्रयास करता है।
- समय समायोजन (Time Adjustment): शायद उसने केवल कहानी की अंतिम पंक्ति को देखा। उसे एहसास होता है कि उसे पूरी कहानी को देखने की आवश्यकता है, इसलिए वह मॉडल में अधिक "टाइम स्टेप्स" जोड़ देता है।
- यह ब्लूप्रिंट को तब तक ट्यून करता रहता है (विश्वास, लक्ष्य या टाइम स्टेप्स जोड़कर) जब तक कि गणित कहानी की पूरी तरह से व्याख्या न कर दे।
यह क्यों मायने रखता है (परिणाम)
शोध पत्र ने पांच अलग-अलग "रहस्य" बेंचमार्क पर AutoToM का परीक्षण किया, जिसमें सरल कहानियों से लेकर कई पात्रों और वीडियो इनपुट वाले जटिल परिदृश्य शामिल थे।
- दिग्गजों को पछाड़ना: AutoToM ने आज के सबसे बड़े, सबसे स्मार्ट AI मॉडल्स (जैसे GPT-4o और DeepSeek-R1) को पछाड़ दिया। इसने केवल अनुमान नहीं लगाया; इसने तर्क दिया।
- मानव जैसी आत्मविश्वास: जब मनुष्य इन पहेलियों को हल करते हैं, तो वे कभी "काफी आश्वस्त" महसूस करते हैं और कभी "इतने आश्वस्त नहीं" होते। AutoToM इन्हीं आत्मविश्वास स्तरों को उत्पन्न कर सकता है। वह जानता है कि वह कब अनुमान लगा रहा है और कब उसके पास एक ठोस उत्तर है।
- वास्तविक दुनिया में मदद: लेखकों ने एक रोबोट-सहायता परिदृश्य में AutoToM का परीक्षण किया। कल्पना कीजिए कि एक रोबोट खाना बनाने में किसी इंसान की मदद करने की कोशिश कर रहा है। मानव के लक्ष्य को समझने के (भले ही इंसान ने इसे अभी तक कहा न हो), रोबोट अन्य तरीकों की तुलना में 27% तेजी से मदद कर सका। उसने केवल आदेशों का पालन नहीं किया; वह इरादे को समझ गया।
निष्कर्ष
AutoToM एक ऐसा सिस्टम है जो केवल उत्तरों को रटता नहीं है या कठोर नियमों का पालन नहीं करता है। इसके बजाय, यह किसी भी सामाजिक स्थिति के लिए एकदम सही मानसिक मॉडल को स्वचालित रूप से डिजाइन करता है। यह हर कहानी के लिए एक कस्टम "थ्योरी ऑफ माइंड" बनाता है, जिससे यह सुनिश्चित होता है कि वह जटिल, भ्रमित करने वाली या बहु-स्तरीय स्थितियों में भी दूसरों के विचारों को समझ सके।
यह एक ऐसे छात्र के बीच का अंतर है जो उत्तर कुंजी को रट लेता है और एक ऐसे जासूस के बीच का अंतर है जो हर बार शून्य से एक केस बनाने का तरीका सीखता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।