APEX-Agents
यह शोध पत्र APEX-Agents को प्रस्तुत करता है, जो एक ओपन-सोर्स बेंचमार्क और मूल्यांकन इंफ्रास्ट्रक्चर है जिसे निवेश बैंकिंग, प्रबंधन परामर्श और कानूनी कार्यों के विशिष्ट जटिल, दीर्घ-अवधि (long-horizon), और क्रॉस-एप्लीकेशन कार्यों को निष्पादित करने में AI एजेंटों की क्षमताओं का आकलन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान शीर्ष मॉडल अधिकतम 24.0% का Pass@1 स्कोर प्राप्त करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जटिल व्यावसायिक परियोजना चलाने के लिए एक नया सहायक नियुक्त कर रहे हैं। आप केवल यह नहीं चाहते कि वे "मौसम कैसा है?" जैसा एक साधारण प्रश्न पूछें। आप यह देखना चाहते हैं कि क्या वे:
- एक अस्त-व्यस्त डिजिटल फाइलिंग कैबिनेट में एक विशिष्ट फ़ाइल ढूँढ सकें।
- एक स्प्रेडशीट खोल सकें, कुछ गणित कर सकें और एक चार्ट को अपडेट कर सकें।
- उस डेटा के आधार पर किसी क्लाइंट को एक ईमेल ड्राफ्ट कर सकें।
- यह सब बिना भ्रमित हुए, गलत फ़ाइलों को डिलीट किए बिना, या बीच में हार माने बिना कर सकें।
यह बिल्कुल वही है जिसके बारे में यह शोध पत्र, APEX–Agents, है। यह AI एजेंटों (स्मार्ट कंप्यूटर प्रोग्राम जो आपके लिए कार्य कर सकते हैं) के लिए एक विशाल "फाइनल एग्जाम" है ताकि यह देखा जा सके कि क्या वे वास्तविक दुनिया के ऑफिस के काम के लिए तैयार हैं।
यहाँ सरल उपमाओं का उपयोग करके इस शोध पत्र का विवरण दिया गया है:
1. परीक्षण: "डिजिटल ऑफिस सिम्युलेटर"
पिछले अधिकांश AI परीक्षण व्हाइटबोर्ड पर गणित की समस्या हल करने वाले छात्र की तरह थे। यह साफ-सुथरा, नियंत्रित और वास्तविक जीवन जैसा नहीं था।
APEX–Agents अलग है। शोधकर्ताओं ने 33 "डिजिटल दुनियाएँ" (Digital Worlds) बनाईं।
- सेटअप: एक वीडियो गेम की कल्पना करें जहाँ आप एक कंसल्टेंट, वकील या बैंकर की भूमिका निभाते हैं। आपके पास एक कंप्यूटर है जिसमें कैलेंडर, ईमेल, स्प्रेडशीट, PDF और एक कोड एडिटर है।
- मिशन: आपको एक वास्तविक, अस्त-व्यस्त प्रोजेक्ट दिया जाता है (जैसे, "इस कंपनी की विकास क्षमता का विश्लेषण करें और CEO को रिपोर्ट भेजें")।
- चुनौती: AI को इस डिजिटल ऑफिस में ठीक वैसे ही नेविगेट करना होगा जैसे एक इंसान करता है। वह केवल उत्तर "जान" नहीं सकता; उसे डेटा ढूँढना होगा, सही फ़ाइल खोलनी होगी, उसे एडिट करना होगा, और उसे भेजना होगा।
2. शिक्षक: रोबोट नहीं, असली इंसान
यह सुनिश्चित करने के लिए कि परीक्षण निष्पक्ष और यथार्थवादी था, शोधकर्ताओं ने केवल AI से प्रश्न लिखने के लिए नहीं कहा। उन्होंने टेस्ट बनाने के लिए 256 वास्तविक विशेषज्ञों (इन्वेस्टमेंट बैंकर, मैनेजमेंट कंसल्टेंट और कॉर्पोरेट वकील) को काम पर रखा।
- इन विशेषज्ञों ने "डिजिटल वर्ल्ड्स" बनाने के लिए 5-10 दिनों तक नकली प्रोजेक्ट्स पर काम किया।
- फिर उन्होंने वे विशिष्ट कार्य लिखे जिन्हें AI को हल करना था।
- उन्होंने एक "ग्रेडिंग रूब्रिक" (चेकलिस्ट) भी बनाया ताकि यह तय किया जा सके कि AI ने अच्छा काम किया या नहीं।
3. छात्र: AI मॉडल
आठ अलग-अलग AI मॉडल्स ने यह परीक्षा दी। उन्हें अलग-अलग अध्ययन आदतों वाले छात्रों के रूप में सोचें:
- बड़े नाम: Gemini 3 Flash, GPT-5.2 और Claude Opus 4.5 जैसे मॉडल।
- ओपन सोर्स: GPT-OSS और Kimi K2 जैसे छोटे, मुफ्त मॉडल।
4. परिणाम: "अच्छा, बुरा और असंगत"
परिणाम आश्चर्यजनक लेकिन ईमानदार थे।
- स्कोर: यहाँ तक कि सबसे अच्छे AI ने भी पहली बार में केवल लगभग 24% कार्यों को पूरी तरह से (परफेक्ट) किया।
- उपमा: यदि आप आज एक सप्ताह के जटिल एनालिस्ट कार्य को करने के लिए सबसे स्मार्ट AI सहायक को नियुक्त करते हैं, तो यदि आप उन्हें केवल एक मौका देते हैं, तो वे हर 4 में से लगभग 3 असाइनमेंट में गलती करेंगे।
- "फिर से प्रयास करें" वाला कारक: यदि आप AI को उसी कार्य को 8 बार करने देते हैं, तो सर्वश्रेष्ठ मॉडल लगभग 40% सही कर सकते हैं।
- उपमा: वे पूरी तरह से बेकार नहीं हैं, लेकिन वे बहुत असंगत हैं। कभी वे सही करते हैं; कभी वे एक लूप में फंस जाते हैं या गलत फ़ाइल डिलीट कर देते हैं।
- ओपन सोर्स का संघर्ष: मुफ्त, ओपन-सोर्स मॉडल का स्कोर 5% से कम था। वे शीर्ष-स्तरीय निजी मॉडल्स की तुलना में उन छात्रों की तरह थे जिन्होंने बिल्कुल भी पढ़ाई नहीं की थी।
5. वे कैसे विफल हुए (द "रोग" व्यवहार)
शोध पत्र ने बारीकी से देखा कि AI कैसे विफल हुआ, जो स्कोर जितना ही महत्वपूर्ण है:
- "डूम लूप" (Doom Loop): कुछ AI एक ही क्रिया को बार-बार दोहराने में फंस गए (जैसे पहिये पर दौड़ता हुआ हैम्स्टर) जब तक कि उनका समय समाप्त नहीं हो गया।
- "अनजाने में आग लगाने वाला" (Accidental Arsonist): कुछ AI ने उन फ़ाइलों को डिलीट कर दिया जिन्हें उन्हें नहीं छूना चाहिए था।
- "ओवर-थिंकर" (Over-Thinker): सबसे सफल AI (Gemini 3 Flash) ने काम पूरा करने के लिए अपने प्रतिस्पर्धियों की तुलना में 5 गुना अधिक कंप्यूटर पावर (टोकन) का उपयोग किया। यह प्रभावी था, लेकिन बहुत अक्षम (inefficient) था।
6. मुख्य निष्कर्ष
शोध पत्र निष्कर्ष निकालता है कि AI एजेंट अभी मानव पेशेवरों की जगह लेने के लिए तैयार नहीं हैं।
- वर्तमान स्थिति: वे एक बहुत ही बुद्धिमान इंटर्न की तरह हैं जिसने लाइब्रेरी की हर किताब पढ़ी है लेकिन उसने वास्तव में कभी ऑफिस में काम नहीं किया है। वे सिद्धांत जानते हैं लेकिन बटन क्लिक करने, फ़ाइल प्रबंधित करने और दीर्घकालिक परियोजनाओं की योजना बनाने की वास्तविक दुनिया की उलझनों में संघर्ष करते हैं।
- भविष्य: शोधकर्ता अपना सारा डेटा और टूल्स मुफ्त (ओपन सोर्स) में जारी कर रहे हैं ताकि अन्य वैज्ञानिक बेहतर एजेंट बनाने में मदद कर सकें। उनका मानना है कि अधिक प्रशिक्षण के साथ, ये एजेंट अंततः "ऑन-डिमांड विशेषज्ञों की टीम" बन सकते हैं जो हमारे काम करने के तरीके को बदल देंगे।
संक्षेप में: इस शोध पत्र ने AI को टेस्ट करने के लिए एक वास्तविक "ऑफिस सिम्युलेटर" बनाया। परिणाम दिखाते हैं कि हालांकि AI स्मार्ट हो रहा है, फिर भी यह आसानी से भटक जाता है, महत्वपूर्ण फ़ाइलें डिलीट कर देता है, और एक साधारण पेशेवर काम को सही ढंग से करने के लिए इसे कई प्रयासों की आवश्यकता होती है। हम सही रास्ते पर हैं, लेकिन हम अभी वहां नहीं पहुंचे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।