← नवीनतम पेपर
💬 NLP

APEX-Agents

यह शोध पत्र APEX-Agents को प्रस्तुत करता है, जो एक ओपन-सोर्स बेंचमार्क और मूल्यांकन इंफ्रास्ट्रक्चर है जिसे निवेश बैंकिंग, प्रबंधन परामर्श और कानूनी कार्यों के विशिष्ट जटिल, दीर्घ-अवधि (long-horizon), और क्रॉस-एप्लीकेशन कार्यों को निष्पादित करने में AI एजेंटों की क्षमताओं का आकलन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान शीर्ष मॉडल अधिकतम 24.0% का Pass@1 स्कोर प्राप्त करते हैं।

मूल लेखक: Bertie Vidgen, Austin Mann, Abby Fennelly, John Wright Stanly, Lucas Rothman, Marco Burstein, Julien Benchek, David Ostrofsky, Anirudh Ravichandran, Debnil Sur, Neel Venugopal, Alannah Hsia, Isaac Rob
प्रकाशित 2026-02-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bertie Vidgen, Austin Mann, Abby Fennelly, John Wright Stanly, Lucas Rothman, Marco Burstein, Julien Benchek, David Ostrofsky, Anirudh Ravichandran, Debnil Sur, Neel Venugopal, Alannah Hsia, Isaac Robinson, Calix Huang, Olivia Varones, Daniyal Khan, Michael Haines, Austin Bridges, Jesse Boyle, Koby Twist, Zach Richards, Chirag Mahapatra, Brendan Foody, Osvald Nitski

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल व्यावसायिक परियोजना चलाने के लिए एक नया सहायक नियुक्त कर रहे हैं। आप केवल यह नहीं चाहते कि वे "मौसम कैसा है?" जैसा एक साधारण प्रश्न पूछें। आप यह देखना चाहते हैं कि क्या वे:

  • एक अस्त-व्यस्त डिजिटल फाइलिंग कैबिनेट में एक विशिष्ट फ़ाइल ढूँढ सकें।
  • एक स्प्रेडशीट खोल सकें, कुछ गणित कर सकें और एक चार्ट को अपडेट कर सकें।
  • उस डेटा के आधार पर किसी क्लाइंट को एक ईमेल ड्राफ्ट कर सकें।
  • यह सब बिना भ्रमित हुए, गलत फ़ाइलों को डिलीट किए बिना, या बीच में हार माने बिना कर सकें।

यह बिल्कुल वही है जिसके बारे में यह शोध पत्र, APEX–Agents, है। यह AI एजेंटों (स्मार्ट कंप्यूटर प्रोग्राम जो आपके लिए कार्य कर सकते हैं) के लिए एक विशाल "फाइनल एग्जाम" है ताकि यह देखा जा सके कि क्या वे वास्तविक दुनिया के ऑफिस के काम के लिए तैयार हैं।

यहाँ सरल उपमाओं का उपयोग करके इस शोध पत्र का विवरण दिया गया है:

1. परीक्षण: "डिजिटल ऑफिस सिम्युलेटर"

पिछले अधिकांश AI परीक्षण व्हाइटबोर्ड पर गणित की समस्या हल करने वाले छात्र की तरह थे। यह साफ-सुथरा, नियंत्रित और वास्तविक जीवन जैसा नहीं था।

APEX–Agents अलग है। शोधकर्ताओं ने 33 "डिजिटल दुनियाएँ" (Digital Worlds) बनाईं।

  • सेटअप: एक वीडियो गेम की कल्पना करें जहाँ आप एक कंसल्टेंट, वकील या बैंकर की भूमिका निभाते हैं। आपके पास एक कंप्यूटर है जिसमें कैलेंडर, ईमेल, स्प्रेडशीट, PDF और एक कोड एडिटर है।
  • मिशन: आपको एक वास्तविक, अस्त-व्यस्त प्रोजेक्ट दिया जाता है (जैसे, "इस कंपनी की विकास क्षमता का विश्लेषण करें और CEO को रिपोर्ट भेजें")।
  • चुनौती: AI को इस डिजिटल ऑफिस में ठीक वैसे ही नेविगेट करना होगा जैसे एक इंसान करता है। वह केवल उत्तर "जान" नहीं सकता; उसे डेटा ढूँढना होगा, सही फ़ाइल खोलनी होगी, उसे एडिट करना होगा, और उसे भेजना होगा।

2. शिक्षक: रोबोट नहीं, असली इंसान

यह सुनिश्चित करने के लिए कि परीक्षण निष्पक्ष और यथार्थवादी था, शोधकर्ताओं ने केवल AI से प्रश्न लिखने के लिए नहीं कहा। उन्होंने टेस्ट बनाने के लिए 256 वास्तविक विशेषज्ञों (इन्वेस्टमेंट बैंकर, मैनेजमेंट कंसल्टेंट और कॉर्पोरेट वकील) को काम पर रखा।

  • इन विशेषज्ञों ने "डिजिटल वर्ल्ड्स" बनाने के लिए 5-10 दिनों तक नकली प्रोजेक्ट्स पर काम किया।
  • फिर उन्होंने वे विशिष्ट कार्य लिखे जिन्हें AI को हल करना था।
  • उन्होंने एक "ग्रेडिंग रूब्रिक" (चेकलिस्ट) भी बनाया ताकि यह तय किया जा सके कि AI ने अच्छा काम किया या नहीं।

3. छात्र: AI मॉडल

आठ अलग-अलग AI मॉडल्स ने यह परीक्षा दी। उन्हें अलग-अलग अध्ययन आदतों वाले छात्रों के रूप में सोचें:

  • बड़े नाम: Gemini 3 Flash, GPT-5.2 और Claude Opus 4.5 जैसे मॉडल।
  • ओपन सोर्स: GPT-OSS और Kimi K2 जैसे छोटे, मुफ्त मॉडल।

4. परिणाम: "अच्छा, बुरा और असंगत"

परिणाम आश्चर्यजनक लेकिन ईमानदार थे।

  • स्कोर: यहाँ तक कि सबसे अच्छे AI ने भी पहली बार में केवल लगभग 24% कार्यों को पूरी तरह से (परफेक्ट) किया।
    • उपमा: यदि आप आज एक सप्ताह के जटिल एनालिस्ट कार्य को करने के लिए सबसे स्मार्ट AI सहायक को नियुक्त करते हैं, तो यदि आप उन्हें केवल एक मौका देते हैं, तो वे हर 4 में से लगभग 3 असाइनमेंट में गलती करेंगे।
  • "फिर से प्रयास करें" वाला कारक: यदि आप AI को उसी कार्य को 8 बार करने देते हैं, तो सर्वश्रेष्ठ मॉडल लगभग 40% सही कर सकते हैं।
    • उपमा: वे पूरी तरह से बेकार नहीं हैं, लेकिन वे बहुत असंगत हैं। कभी वे सही करते हैं; कभी वे एक लूप में फंस जाते हैं या गलत फ़ाइल डिलीट कर देते हैं।
  • ओपन सोर्स का संघर्ष: मुफ्त, ओपन-सोर्स मॉडल का स्कोर 5% से कम था। वे शीर्ष-स्तरीय निजी मॉडल्स की तुलना में उन छात्रों की तरह थे जिन्होंने बिल्कुल भी पढ़ाई नहीं की थी।

5. वे कैसे विफल हुए (द "रोग" व्यवहार)

शोध पत्र ने बारीकी से देखा कि AI कैसे विफल हुआ, जो स्कोर जितना ही महत्वपूर्ण है:

  • "डूम लूप" (Doom Loop): कुछ AI एक ही क्रिया को बार-बार दोहराने में फंस गए (जैसे पहिये पर दौड़ता हुआ हैम्स्टर) जब तक कि उनका समय समाप्त नहीं हो गया।
  • "अनजाने में आग लगाने वाला" (Accidental Arsonist): कुछ AI ने उन फ़ाइलों को डिलीट कर दिया जिन्हें उन्हें नहीं छूना चाहिए था।
  • "ओवर-थिंकर" (Over-Thinker): सबसे सफल AI (Gemini 3 Flash) ने काम पूरा करने के लिए अपने प्रतिस्पर्धियों की तुलना में 5 गुना अधिक कंप्यूटर पावर (टोकन) का उपयोग किया। यह प्रभावी था, लेकिन बहुत अक्षम (inefficient) था।

6. मुख्य निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि AI एजेंट अभी मानव पेशेवरों की जगह लेने के लिए तैयार नहीं हैं।

  • वर्तमान स्थिति: वे एक बहुत ही बुद्धिमान इंटर्न की तरह हैं जिसने लाइब्रेरी की हर किताब पढ़ी है लेकिन उसने वास्तव में कभी ऑफिस में काम नहीं किया है। वे सिद्धांत जानते हैं लेकिन बटन क्लिक करने, फ़ाइल प्रबंधित करने और दीर्घकालिक परियोजनाओं की योजना बनाने की वास्तविक दुनिया की उलझनों में संघर्ष करते हैं।
  • भविष्य: शोधकर्ता अपना सारा डेटा और टूल्स मुफ्त (ओपन सोर्स) में जारी कर रहे हैं ताकि अन्य वैज्ञानिक बेहतर एजेंट बनाने में मदद कर सकें। उनका मानना ​​है कि अधिक प्रशिक्षण के साथ, ये एजेंट अंततः "ऑन-डिमांड विशेषज्ञों की टीम" बन सकते हैं जो हमारे काम करने के तरीके को बदल देंगे।

संक्षेप में: इस शोध पत्र ने AI को टेस्ट करने के लिए एक वास्तविक "ऑफिस सिम्युलेटर" बनाया। परिणाम दिखाते हैं कि हालांकि AI स्मार्ट हो रहा है, फिर भी यह आसानी से भटक जाता है, महत्वपूर्ण फ़ाइलें डिलीट कर देता है, और एक साधारण पेशेवर काम को सही ढंग से करने के लिए इसे कई प्रयासों की आवश्यकता होती है। हम सही रास्ते पर हैं, लेकिन हम अभी वहां नहीं पहुंचे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →