← नवीनतम पेपर
🤖 AI

Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation

यह शोध पत्र Messier को प्रस्तुत करता है, जो 30 बेंचमार्क और विविध डोमेन में फैले लगभग दस लाख मानकीकृत रिकॉर्डों का एक एकीकृत उच्च-रिज़ॉल्यूशन कॉर्पस है, जो व्यापक क्रॉस-बेंचमार्क एजेंट मूल्यांकन को सक्षम बनाता है, कार्य प्रकारों के बीच असमान प्रगति को प्रकट करता है, और AI एजेंट क्षमताओं के ऑडिटिंग और स्केलिंग के लिए एक आधारभूत बुनियादी ढांचा प्रदान करता है।

मूल लेखक: Stefan Krsteski, Charlotte Meyer, Guillaume Allegre, Tony O'Halloran, Alexandre Sallinen

प्रकाशित 2026-07-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Stefan Krsteski, Charlotte Meyer, Guillaume Allegre, Tony O'Halloran, Alexandre Sallinen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप यह पता लगाने की कोशिश कर रहे हैं कि कौन सा वीडियो गेम पात्र हर चीज़ में बिल्कुल सर्वश्रेष्ठ है। आपके पास एक ऐसा पात्र है जो कूदने में अद्भुत है, दूसरा जो गणित की पहेलियाँ सुलझाने में जादूगर है, और तीसरा जो एक भूलभुलैया को पूरी तरह से पार कर सकता है। लेकिन इसमें एक पेच है: हर गेम "कौशल" को अलग तरह से मापता है। एक गेम आपको एक गड्ढे के ऊपर से कूदने के लिए एक स्वर्ण सितारा (gold star) देता है, जबकि दूसरे में दरवाजा खोलने के लिए आपको एक जटिल बीजगणित (algebra) की समस्या हल करने की आवश्यकता होती है, और तीसरा यह मांग करता है कि आप बिना किसी दुश्मन को छुए एक स्तर में प्रत्येक सिक्के को एकत्र करें। यदि आप केवल अंतिम स्कोर देखते हैं—जैसे कि "95%" जैसा एक एकल अंक—तो आपको लग सकता है कि वे सभी समान रूप से अच्छे हैं। लेकिन यह संख्या विवरणों को छिपा देती है। क्या पात्र इसलिए विफल हुआ क्योंकि वह कूद नहीं सका, या इसलिए क्योंकि वह एक दरवाजे पर अटक गया था? क्या उसने 95% इसलिए प्राप्त किया क्योंकि उसने सब कुछ पूरी तरह से किया, या इसलिए क्योंकि वह एक छोटी सी चीज़ में विफल रहा और गेम ने पूरे रन को शून्य मान लिया?

यह ठीक वही समस्या है जिसका सामना AI एजेंटों का अध्ययन करने वाले वैज्ञानिक कर रहे हैं। ये केवल चैटबॉट्स नहीं हैं; ये डिजिटल कार्यकर्ता हैं जो उपकरणों का उपयोग कर सकते हैं, कोड लिख सकते हैं, वेब ब्राउज़ कर सकते हैं, और वास्तविक समय के वातावरण में निर्णय ले सकते हैं। इस समय, सैकड़ों अलग-अलग परीक्षण (बेंचमार्क) मौजूद हैं, लेकिन वे सभी अलग-अलग भाषाएँ बोलते हैं। कुछ परीक्षण सख्त होते हैं: यदि आप 10-चरणीय रेसिपी के एक भी चरण को चूक जाते हैं, तो आपको शून्य मिलता है। अन्य अधिक उदार होते हैं। इस कारण से, एक ऐसे एजेंट की तुलना करना अविश्वसनीय रूप से कठिन है जो कोडिंग में अच्छा है, उस एजेंट से जो कानूनी शोध में अच्छा है। यह एक मैराथन धावक की तुलना केवल एक "एथलेटिकिज्म" स्कोर का उपयोग करके शतरंज के ग्रैंडमास्टर से करने जैसा है। यह समझने के लिए कि AI वास्तव में कैसे सुधार कर रहा है, हमें इन स्कोर के नीचे झांकने और यह देखने के एक तरीके की आवश्यकता है कि एजेंट कहाँ सफल होते हैं और कहाँ वे लड़खड़ाते हैं।

यहाँ MESSIER आता है, जो एक विशाल नया प्रोजेक्ट है जो AI परीक्षण के लिए एक विशाल, सार्वभौमिक अनुवादक (universal translator) के रूप में कार्य करता है। MESSIER के पीछे के शोधकर्ताओं ने केवल एक नया परीक्षण नहीं बनाया; उन्होंने एक विशाल लाइब्रेरी बनाई जो 30 अलग-अलग मौजूदा परीक्षणों के परिणामों को एकत्र करती है, जिसमें 11,891 विशिष्ट कार्य और 74,205 अलग-अलग तरीके शामिल हैं जिनसे यह जांचा जाता है कि क्या एक एजेंट सफल हुआ। उन्होंने 714 अलग-अलग AI एजेंटों पर डेटा एकत्र किया और यहाँ तक कि छह कठिन क्षेत्रों में नए, ताज़ा परीक्षण भी चलाए जहाँ डेटा की कमी थी, जैसे कि कानूनी समीक्षा और क्वांटम सर्किट डिज़ाइन। कुल मिलाकर, उन्होंने लगभग एक मिलियन परीक्षण रिकॉर्ड्स को एक व्यवस्थित, मानकीकृत प्रारूप में व्यवस्थित किया। इसे एक अराजक ढेर के रसीदों को लेने के रूप में सोचें, जो 30 अलग-अलग दुकानों से हैं, जिनमें से प्रत्येक अलग मुद्रा और अलग गणितीय नियमों के साथ लिखी गई है, और उन्हें एक एकल, स्पष्ट स्प्रेडशीट में बदलना जो आपको दिखा सके कि क्या खरीदा गया था, कितनी लागत आई और किस स्टोर में सबसे अच्छे सौदे थे।

सबसे रोमांचक बात जो MESSIER ने खोजी है वह यह है कि अंक गिनने का तरीका कहानी बदल देता है। पेपर दिखाता है कि कई परीक्षण एक "सख्त" नियम का उपयोग करते हैं: यदि एक एजेंट किसी कार्य के एक भी छोटे हिस्से में विफल हो जाता है, तो पूरे कार्य को विफलता के रूप में चिह्नित किया जाता है। शोधकर्ताओं ने दिखाया कि यदि वे इस नियम को थोड़ा ढीला करते और यह देखते कि एजेंट ने कितने हिस्से सही किए, तो प्रगति की तस्वीर बहुत अलग दिखती। उदाहरण के लिए, एक कानूनी बेंचमार्क पर, सख्त "सब-या-कुछ-नहीं" (all-or-nothing) नियम ने कहा कि एजेंट केवल 0.2% बार सफल हो रहे थे। लेकिन जब उन्होंने विवरणों को देखा, तो उन्होंने पाया कि औसतन, एजेंट वास्तव में 28.8% मानदंडों को पूरा कर रहे थे। सख्त नियम ने बहुत सारी आंशिक प्रगति को छिपा दिया था। यह सुझाव देता है कि जबकि AI बेहतर हो रहा है, मापने का हमारा तरीका बहुत कठोर हो सकता है, जिससे यह दिखता है कि एजेंट वास्तव में जितना विफल हो रहे हैं, उससे कहीं अधिक विफल होते हैं।

इस अध्ययन ने यह भी मानचित्रित किया कि AI वास्तव में कहाँ "जीत" रहा है और कहाँ वह अभी भी संघर्ष कर रहा है। उन्होंने पाया कि AI "फंक्शन कॉलिंग" (उपकरणों का उपयोग करना) में लगभग पूर्ण है, जिसकी सफलता दर 0.97 है। यह प्रोग्रामिंग में भी बहुत अच्छा हो रहा है, जो पिछले दो वर्षों में तेजी से सुधर रहा है। हालाँकि, AI को "एंटरप्राइज वर्कफ़्लो" के साथ कठिनाई हो रही है—जटिल, बहु-चरणीय कार्यालय कार्य जैसे कि एक व्यावसायिक प्रक्रिया का प्रबंधन करना। इन क्षेत्रों में, सफलता दर केवल 0.57 है, जिसका अर्थ है कि एजेंट अभी भी सफल होने की तुलना में अधिक बार विफल होते हैं। शोधकर्ताओं ने यह भी सिद्ध किया कि आप इस विशाल लाइब्रेरी का उपयोग AI के लिए एक नया "कौशल पैमाना" बनाने के लिए कर सकते हैं जो अन्य प्रमुख रैंकिंगों के साथ बहुत करीब से मेल खाता है (एक सहसंबंध 0.81 के साथ), बिना नए परीक्षण चलाने के लिए लाखों डॉलर खर्च किए।

अंततः, MESSIER स्पष्टता के लिए एक उपकरण है। यह सुझाव देता है कि केवल अंतिम स्कोर को देखने के बजाय, एजेंट के कैसे विफल होने के सूक्ष्म विवरणों को देखकर, हम वास्तव में AI क्या कर सकता है, इसकी एक बहुत अधिक सच्ची तस्वीर प्राप्त कर सकते हैं। यह यह नहीं कहता कि AI ने सब कुछ हल कर लिया है, लेकिन यह यह भी सुझाव देता है कि हमारे वर्तमान मापने के डंडे बहुत कुंद (blunt) हो सकते हैं। इन परिणामों को मानकीकृत करके, लेखक इस उम्मीद में हैं कि वे एक ही परीक्षण को बार-बार दोहराने पर होने वाली धन की बर्बादी को रोक सकें और शोधकर्ताओं को यह समझने में मदद कर सकें कि AI किन नौकरियों के लिए तैयार है और किन कार्यों के लिए अभी भी मानवीय हाथ की आवश्यकता है। डेटा अब किसी के भी उपयोग के लिए खुला है, जो संख्याओं के एक भ्रमित करने वाले ढेर को AI परिदृश्य के एक स्पष्ट मानचित्र में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →