AgentVista: Evaluating Multimodal Agents in Ultra-Challenging Realistic Visual Scenarios
यह शोधपत्र AgentVista प्रस्तुत करता है, जो एक व्यापक बेंचमार्क है जो 25 उप-क्षेत्रों में फैला हुआ है और हाइब्रिड टूल उपयोग की आवश्यकता वाले अत्यंत चुनौतीपूर्ण, यथार्थवादी लॉन्ग-होराइजन कार्यों पर जनरललिस्ट मल्टीमॉडल एजेंटों का मूल्यांकन करता है, जो वर्तमान अत्याधुनिक मॉडलों में महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने एक जटिल वास्तविक दुनिया के कार्य में मदद करने के लिए एक सुपर-स्मार्ट रोबोटिक सहायक को काम पर रखा है, जैसे कि एक टपकते हुए नल को ठीक करना, एक देशव्यापी सड़क यात्रा की योजना बनाना, या जन्मदिन का सही उपहार खरीदना। आप रोबोट को समस्या की एक फोटो और कुछ निर्देश देते हैं।
समस्या:
हमने इन रोबोटों की जांच करने के लिए जो परीक्षण उपयोग किए हैं, वे एक 'पॉप क्विज़' की तरह हैं। वे रोबोट को एक तस्वीर दिखाते हैं और पूछते हैं, "कार का रंग क्या है?" या "वहाँ कितने सेब हैं?" रोबमाट बस देखता है और उत्तर दे देता है। वह वास्तव में कुछ करता नहीं है। यह एक पायलट को विमान के हिस्सों के नाम बताने के लिए पूछने जैसा है, लेकिन उसे कभी उड़ान भरने ही नहीं देने जैसा है।
समाधान: AGENTVISTA
इस शोध पत्र के लेखकों ने एक नया, बहुत कठिन परीक्षण बनाया है जिसे AGENTVISTA कहा जाता है। इसे AI एजेंटों के लिए "सर्वाइवल आइलैंड" (Survival Island) समझें।
एक पॉप क्विज़ के बजाय, AGENTVISTA रोबोट को एक अस्त-व्यस्त, वास्तविक जीवन का मिशन देता है जिसमें कार्यों की एक लंबी श्रृंखला की आवश्यकता होती है। यह इस प्रकार काम करता है:
1. "डिटेक्टिव" मिशन
कल्पना कीजिए कि आप एक जासूस हैं। आपके पास अपराध स्थल की एक धुंधली फोटो है (विजुअल इनपुट)। आप केवल अनुमान नहीं लगा सकते; आपको इसे सुलझाना होगा।
- चरण 1: आप फोटो देखते हैं और महसूस करते हैं कि आपको एक विशिष्ट प्रकार के जूते खोजने की आवश्यकता है।
- चरण 2: आप उस जूते की तस्वीरें खोजने के लिए एक सर्च इंजन (एक टूल) का उपयोग करते हैं।
- चरण 3: आपको वह जूता बेचने वाली एक वेबसाइट मिलती है, लेकिन कीमत छिपी हुई है। कीमत खोजने के लिए आपको वेबसाइट पर क्लिक (एक अन्य टूल) करना होगा।
- चरण 4: आपको पता चलता है कि जूता अलग-अलग साइज में आता है, और आपको पूरे परिवार के लिए कुल लागत की गणना करनी है। गणित करने के लिए आप एक कैलकुलेटर (कोड टूल) खोलते हैं।
- चरण 5: आपको एहसास होता है कि फोटो एक विशिष्ट शहर में ली गई थी, इसलिए आपको मौसम की जांच करने की आवश्यकता है कि जूते वाटरप्रूफ पर्याप्त हैं या नहीं।
AGENTVISTA ऐसे 209 "डिटेक्टिव मिशनों" का एक संग्रह है। ये लेगो (LEGO) सेट को ठीक करने से लेकर जापान की यात्रा की योजना बनाने तक सब कुछ कवर करते हैं। पेच यह है कि रोबोट को एक विशिष्ट क्रम में विभिन्न उपकरणों (खोजने, क्लिक करने, गणना करने, फोटो को ज़ूम करने) को मिलाना और उपयोग करना होगा ताकि सही उत्तर मिल सके।
2. यह इतना कठिन क्यों है?
लेखक इसे "अत्यधिक चुनौतीपूर्ण" (Ultra-Challenging) कहते हैं। इसके कारण यहाँ दिए गए हैं:
- विजुअल्स अव्यवस्थित हैं: तस्वीरें परफेक्ट स्टूडियो शॉट नहीं हैं। वे वास्तविक जीवन की तरह हैं: बिखरी हुई, धुंधली, या अजीब कोणों से ली गई। रोबोट को ध्यान से देखना होगा और समझना होगा कि वह क्या देख रहा है।
- श्रृंखला लंबी है: रोबोट केवल एक वाक्य में उत्तर नहीं दे सकता। उसे उत्तर पाने के लिए 25 अलग-अलग कदम उठाने पड़ सकते हैं (जैसे पेज पलटना, खोजना, गणना करना, फिर से खोजना)। यदि वह चरण 3 में गलती करता है, तो पूरा मिशन विफल हो जाता है।
- कोई शॉर्टकट नहीं: प्रश्न इस तरह डिज़ाइन किए गए हैं कि रोबोट केवल "गूगल" करके उत्तर नहीं पा सकता। उसे पहले तस्वीर को देखना होगा, फिर जानकारी प्राप्त करनी होगी।
3. परिणाम: रोबोट अभी भी सीख रहे हैं
लेखकों ने दुनिया के सबसे स्मार्ट AI मॉडल (जैसे GPT, Gemini और Claude के नवीनतम संस्करण) का इस "सर्वाइवल आइलैंड" पर परीक्षण किया।
स्कोरकार्ड:
कमरे में मौजूद सबसे अच्छा रोबोट, Gemini-3-Pro, भी केवल लगभग 27% उत्तर सही दे पाया। यह एक टेस्ट में 'D-' ग्रेड प्राप्त करने जैसा है।
- अधिकांश रोबोट इसलिए फंस गए क्योंकि उन्होंने तस्वीर को गलत पढ़ा (उदाहरण के लिए, उन्होंने सोचा कि एक धुंधले साइन बोर्ड पर "Open" लिखा है जबकि वहां "Closed" लिखा था)।
- एक बार जब उन्होंने तस्वीर को गलत पढ़ा, तो वे गलत रास्ते पर निकल गए, गलत चीज़ों को खोजा और गलत उत्तर दिया।
- उन्हें लंबे चरणों की श्रृंखला को याद रखने में भी कठिनाई हुई, और वे भूल गए कि उन्हें आगे क्या करना था।
4. उपमा: "आंखों पर पट्टी बांधा हुआ शेफ"
इन AI एजेंटों को उन शेफ के रूप में सोचें जो एक जटिल भोजन पकाने की कोशिश कर रहे हैं, लेकिन उन्होंने आंखों पर पट्टी बांधी हुई है जो केवल एक सेकंड के लिए उठती है।
- पुराने परीक्षण: हमने उनसे पूछा, "टमाटर क्या है?" उन्होंने सही उत्तर दिया।
- AGENTVISTA: हम कहते हैं, "यहाँ एक अव्यवस्थित किचन काउंटर की फोटो है। टमाटर ढूंढें, जांचें कि वह पका है या नहीं, उसके उपयोग वाली ऑनलाइन रेसिपी खोजें, गणना करें कि उसकी कितनी कीमत है, और मुझे बताएं कि क्या आपके पास उसे खरीदने के लिए पर्याप्त पैसे हैं।"
- परिणाम: शेफ चीजों से टकराते रहते हैं, गलत सामग्री पकड़ लेते हैं, या रेसिपी भूल जाते हैं। वे खाना पकाने के बारे में बात करने में अच्छे हैं, लेकिन वे अभी भी एक अव्यवस्थित रसोई में वास्तव में खाना पकाना सीख रहे हैं।
यह क्यों महत्वपूर्ण है?
लेखक कहते हैं कि यह परीक्षण महत्वपूर्ण है क्योंकि यह हमें स्पष्ट रूप से दिखाता है कि वास्तविक दुनिया में AI कहाँ विफल हो रहा है। ऐसा नहीं है कि रोबोट "मूर्ख" हैं; बात यह है कि उन्होंने एक साथ ध्यान से देखना, उपकरणों का बुद्धिमानी से उपयोग करना और एक लंबी योजना को अपने दिमाग में बनाए रखना नहीं सीखा है।
इस परीक्षण (AGENTVISTA) और अन्य शोधकर्ताओं के लिए एक टूलकिट जारी करके, लेखकों की उम्मीद है कि वे ऐसे AI एजेंट बनाने में मदद करेंगे जो वास्तव में हमारे दैनिक जीवन में मदद कर सकें, चाहे वह हमारे फोन को ठीक करना हो या हमारी छुट्टियों की योजना बनाना हो, बिना भ्रमित हुए या मूर्खतापूर्ण गलतियां किए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।