Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks
यह शोध पत्र Agent-X को प्रस्तुत करता है, जो छह विविध वातावरणों में 828 वास्तविक-विश्व, बहुआयामी कार्यों वाला एक बड़े पैमाने का बेंचमार्क है और विज़न-केंद्रित एजेंटों में गहन तर्क (deep reasoning) का आकलन करने के लिए एक सूक्ष्म चरण-स्तरीय मूल्यांकन ढांचा प्रदान करता है, जिससे यह पता चलता है कि वर्तमान अग्रणी मॉडल जटिल, बहु-चरणीय परिदृश्यों में पूर्ण-श्रृंखला सफलता प्राप्त करने में संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने एक सुपर-स्मार्ट रोबोट असिस्टेंट बनाया है। आप उसे एक कैमरा, एक दिमाग और गैजेट्स से भरा एक टूलबॉक्स (जैसे कि एक आवर्धक लेंस, एक कैलकुलेटर, या एक वेब ब्राउज़र) देते हैं। आप उससे एक पेचीदा पहेली सुलझाने के लिए कहते हैं, जैसे कि "पेरिस के लिए सबसे सस्ती उड़ान खोजें, वहां के मौसम की जांच करें, और मुझे बताएं कि क्या मुझे छाते की जरूरत है।"
लंबे समय तक, हमने इन रोबनों का परीक्षण सरल, नकली पहेलियों के साथ किया है जो वीडियो गेम के स्तरों की तरह दिखती हैं। लेकिन वास्तविक दुनिया अव्यवस्थित है, इसमें वीडियो शामिल हैं, और इसके लिए रोबोट को एक ही कदम में नहीं, बल्कि कई चरणों में सोचने की आवश्यकता होती है।
यहाँ Agent-X आता है। इस पेपर को इन रचनाकारों द्वारा बनाए गए एक नए, अविश्वसनीय रूप से कठिन "ऑब्स्टेकल कोर्स" (बाधा दौड़) के रूप में समझें, जिसे विशेष रूप से यह परीक्षण करने के लिए डिज़ाइन किया गया है कि ये रोबोट असिस्टेंट वास्तविक दुनिया में कितनी गहराई से सोच सकते हैं और अपने उपकरणों का उपयोग कैसे कर सकते हैं।
यहाँ उन्होंने जो किया है, उसका विवरण दिया गया है, कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करते हुए:
1. समस्या: "वीडियो गेम" बनाम "वास्तविक दुनिया"
पिछले परीक्षण किसी रोबोट को वीडियो गेम लेवल देने जैसे थे जहाँ नियम दीवार पर लिखे होते हैं: "नीले दरवाजे को खोलने के लिए लाल चाबी का उपयोग करें।" रोबोट बस उस निर्देश का पालन करता है।
लेकिन वास्तविक जीवन में, कोई आपको यह नहीं बताता कि किस उपकरण का उपयोग करना है। आप बस कहते हैं, "नल से पानी टपक रहा है, इसे ठीक करो।" रोबोट को यह समझना होगा: क्या मुझे रिंच (wrench) की जरूरत है? क्या मुझे एक वीडियो ट्यूटोरियल देखना चाहिए? क्या मुझे प्लंबर को बुलाना चाहिए?
लेखक कहते हैं कि वर्तमान रोबोट उन छात्रों की तरह हैं जो किसी विशिष्ट परीक्षा के लिए उत्तर रटने में तो माहिर हैं, लेकिन जब उन्हें ऐसी समस्या हल करने के लिए कहा जाता है जिसे उन्होंने पहले नहीं देखा, तो वे घबरा जाते हैं। उन्हें कई चरणों वाली सोच को एक साथ जोड़ने में कठिनाई होती है।
2. समाधान: "Agent-X" बाधा दौड़
टीम ने Agent-X बनाया, जो 828 वास्तविक दुनिया की चुनौतियों का एक विशाल संग्रह है।
- परिदृश्य (Scenarios): नकली छवियों के बजाय, उन्होंने जीवन के छह अलग-अलग "पड़ोसों" से वास्तविक फोटो, वीडियो और स्क्रीनशॉट का उपयोग किया:
- ड्राइविंग: एक कार का वीडियो देखना और यह पता लगाना कि क्या कोई पैदल यात्री सड़क पार करने वाला है।
- निगरानी (Surveillance): संदिग्ध व्यक्ति का पता लगाने के लिए सुरक्षा फुटेज को देखना।
- खेल (Sports): खिलाड़ियों की गिनती करने या विजेता की भविष्यवाणी करने के लिए खेल के वीडियो का विश्लेषण करना।
- वेब ब्राउज़िंग: बिना यह बताए कि ठीक कौन से बटन दबाने हैं, किसी वेबसाइट पर विशिष्ट जानकारी खोजने के लिए नेविगेट करना।
- गणित और सामान्य तर्क: छवियों में पाए गए समीकरणों को हल करना या कई चित्रों की तुलना करना।
- ट्विस्ट: रोबोटों को चेकलिस्ट नहीं दी जाती है। उन्हें तस्वीर को देखना होता है, यह महसूस करना होता है कि क्या गायब है, अपने टूलबॉक्स से सही उपकरण चुनना होता है, उसका उपयोग करना होता है, परिणाम देखना होता है, और फिर तय करना होता है कि आगे क्या करना है।
3. "रेफरी": वे रोबोटों को ग्रेड कैसे देते हैं
यह सबसे महत्वपूर्ण हिस्सा है। आमतौर पर, हम केवल यह देखते हैं कि रोबोट ने अंतिम उत्तर सही दिया या नहीं (जैसे कि एक शिक्षक गणित के टेस्ट की जांच करता है)।
Agent-X एक चरण-दर-चरण रेफरी पेश करता है। कल्पना कीजिए कि एक शिक्षक न केवल अंतिम उत्तर देखता है, बल्कि छात्र के रफ कार्य (scratch paper) को भी देखता है।
- क्या उन्होंने सही उपकरण चुना? (जैसे, क्या उन्होंने आवर्धक लेंस के बजाय कैलकुलेटर का उपयोग किया?)
- क्या उन्होंने उपकरण का सही उपयोग किया? (जैसे, क्या उन्होंने नंबर सही क्रम में टाइप किए?)
- क्या उनका तर्क समझ में आने वाला था? (जैसे, क्या वे बिना सबूत देखे निष्कर्ष पर पहुँच गए?)
यदि एक रोबोट सही उत्तर का अनुमान लगा लेता है लेकिन वह भ्रमित होकर (hallucinating) या चरणों को छोड़कर वहाँ पहुँचा है, तो Agent-X उसे फेल कर देता है। यह एक ऐसे शेफ की तरह है जिसने स्वादिष्ट केक तो बनाया लेकिन गलत सामग्री का उपयोग किया; केक का स्वाद अच्छा है, लेकिन प्रक्रिया त्रुटिपूर्ण थी।
4. परिणाम: रोबोट अभी भी सीख रहे हैं
लेखकों ने उपलब्ध 12 सबसे स्मार्ट AI मॉडलों (GPT-4, Gemini और Qwen जैसे बड़े नामों सहित) का परीक्षण किया।
फैसला: यहाँ तक कि "सबसे बुद्धिमान" रोबोट भी संघर्ष कर रहे हैं।
- स्कोर: सबसे अच्छे मॉडलों ने भी शुरुआत से अंत तक 50% से कम कार्यों को पूरी तरह से सही किया।
- रुकावट (Bottleneck): रोबोट चित्र को देखने और उसके बारे में बात करने में अच्छे हैं, लेकिन वे योजना बनाने (planning) में बहुत खराब हैं। वे अक्सर:
- उस उपकरण का उपयोग करना भूल जाते हैं जिसकी उन्हें आवश्यकता होती है।
- ऐसे उपकरण का उपयोग करते हैं जो उनके पास नहीं है (एक ऐसे उपकरण की कल्पना करना जो मौजूद ही नहीं है)।
- भ्रमित हो जाते हैं जब उन्हें किसी वीडियो को देखना होता है और समय के साथ होने वाले बदलावों को ट्रैक करना होता है।
- अपने उत्तरों के फॉर्मेटिंग में गलती कर देते हैं (जैसे कि फॉर्म भरने के बजाय अक्षर लिखना)।
5. निष्कर्ष (Takeaway)
पेपर यह निष्कर्ष निकालता है कि हालांकि ये AI एजेंट प्रभावशाली हैं, वे अभी पूरी तरह से स्वायत्त (autonomous) कार्यकर्ता बनने के लिए तैयार नहीं हैं। वे एक शानदार इंटर्न की तरह हैं जो बहुत सारे तथ्य जानते हैं लेकिन उन्हें यह समझने के लिए निरंतर पर्यवेक्षण की आवश्यकता होती है कि काम कैसे करना है।
लेखकों ने Agent-X को एक "तनाव परीक्षण" (stress test) के रूप में बनाया है जो हमें दिखाता है कि ये रोबोट कहाँ विफल हो रहे हैं ताकि शोधकर्ता उनके "दिमाग" के उन विशिष्ट हिस्सों को ठीक कर सकें जो योजना बनाने और टूल के उपयोग को संभालते हैं। वे केवल यह नहीं पूछ रहे हैं, "क्या आप इसका उत्तर दे सकते हैं?" वे यह पूछ रहे हैं, "क्या आप इसके माध्यम से अपनी सोच बना सकते हैं?" और अब तक, उत्तर है "अभी पूरी तरह से नहीं।"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।