AlphaEval: Evaluating Agents in Production
यह शोध पत्र AlphaEval प्रस्तुत करता है, जो सात कंपनियों के 94 वास्तविक-विश्व कार्यों से बना एक प्रोडक्शन-ग्राउंडेड बेंचमार्क है, जो एक नवीन ढांचे का उपयोग करके वास्तविक आवश्यकताओं को निष्पादन योग्य मूल्यांकनों में परिवर्तित करते हुए पूर्ण AI एजेंट प्रणालियों का मूल्यांकन करता है, जिससे मौजूदा मॉडल-केंद्रित बेंचमार्क और वाणिज्यिक परिनियोजन की जटिल, गतिशील वास्तविकताओं के बीच के अंतर को दूर किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप अपनी कंपनी के सबसे महत्वपूर्ण कार्यों को चलाने के लिए एक नया कर्मचारी नियुक्त करने की कोशिश कर रहे हैं। आपके पास रिज्यूमे (resumes) का एक ढेर और साक्षात्कार के प्रश्नों की एक सूची है।
समस्या:
आज अधिकांश AI कंपनियाँ उस "अभ्यास परीक्षण" (practice test) के आधार पर भर्ती कर रही हैं जो वास्तविक काम से बिल्कुल अलग है।
- अभ्यास परीक्षण (वर्तमान बेंचमार्क): कल्पना कीजिए कि एक ऐसा परीक्षण जहाँ निर्देश एकदम स्पष्ट हैं: "बिल्ली के बारे में एक कविता लिखें।" उत्तर या तो सही है या गलत। यह साफ-सुथरा, सुरक्षित और एक शून्य (vacuum) में होता है।
- वास्तविक काम (उत्पादन वास्तविकता): वास्तविक दुनिया में, एक बॉस कह सकता है, "हमें अपनी सप्लाई चेन को ठीक करने की जरूरत है, लेकिन हमारे पास कोई स्पष्ट योजना नहीं है, डेटा पुराने एक्सेल शीट्स और पीडीएफ में बिखरा हुआ है, और आपको यह भी पता होना चाहिए कि हमारे विशिष्ट उद्योग के बारे में कैसे काम करना है। ओह, और अगले हफ्ते बॉस की 'अच्छा' की परिभाषा बदल भी सकती है।"
पेपर AlphaEval तर्क देता है कि हम वर्षों से AI को "अभ्यास परीक्षण" पर टेस्ट कर रहे हैं, लेकिन वे "वास्तविक काम" में विफल हो रहे हैं।
समाधान: AlphaEval
लेखकों ने AI को टेस्ट करने का एक नया तरीका बनाया जिसे AlphaEval कहा जाता है। नकली कार्य बनाने के बजाय, वे सात वास्तविक कंपनियों (जैसे टेक फर्म, अस्पताल और फाइनेंस ग्रुप) के पास गए और पूछा: "वे कौन से वास्तविक, जटिल और कठिन कार्य हैं जिनके लिए आप अभी अपने मानव कर्मचारियों को भुगतान कर रहे हैं?"
उन्होंने उन वास्तविक व्यावसायिक कार्यों को AI के लिए एक परीक्षण में बदल दिया।
"निर्माण स्थल" (Construction Site) का रूपक
इस परीक्षण को बनाने के लिए, लेखकों ने केवल पुराने होमवर्क असाइनमेंट नहीं उठाए। उन्होंने वास्तविक व्यावसायिक आवश्यकताओं को परीक्षणों में बदलने के लिए एक फैक्टरी (एक ढांचा/framework) बनाई।
- ब्लूप्रिंट (Blueprint): उन्होंने वास्तविक विशेषज्ञों (जैसे HR मैनेजर या वित्तीय विश्लेषक) से बात की ताकि उनके काम के जटिल और अनकहे नियमों को समझा जा सके।
- सामग्री (Materials): उन्होंने वास्तविक दस्तावेज़ एकत्र किए—स्कैन किए गए PDF, भ्रमित करने वाली स्प्रेडशीट और अस्पष्ट ईमेल—ठीक वैसे ही जैसे एक वास्तविक कर्मचारी को प्राप्त होंगे।
- ग्रेडिंग (Grading): किसी कंप्यूटर द्वारा एकल "सही" उत्तर की जाँच करने के बजाय, उन्होंने मानव विशेषज्ञों का उपयोग AI के काम को ग्रेड करने के लिए किया, ठीक वैसे ही जैसे एक बॉस रिपोर्ट की समीक्षा करता है। उन्होंने पूछा: "क्या यह क्लाइंट को भेजने के लिए पर्याप्त अच्छा है?"
बड़ी खोजें (प्लॉट ट्विस्ट)
जब उन्होंने शीर्ष AI मॉडल को इस "वास्तविक काम" के परीक्षण से गुजारा, तो परिणाम चौंकाने वाले थे:
1. "सर्वश्रेष्ठ" AI केवल "ठीक-ठाक" है
यहाँ तक कि सबसे स्मार्ट AI (Claude Opus 4.6) का स्कोर भी 100 में से 64 था।
- रूपक: कल्पना कीजिए कि एक छात्र गणित के टेस्ट में A+ पाता है लेकिन ड्राइविंग टेस्ट में फेल हो जाता है क्योंकि वह बारिश के दिन या अचानक आए मोड़ को नहीं संभाल पाता। AI सटीक निर्देशों का पालन करने में महान है लेकिन व्यावसायिक वास्तविकता को संभालने में बहुत खराब है।
2. "इंजन" जितना ही "कार" भी मायने रखती है
पेपर ने एक ही AI "दिमाग" (मॉडल) को चार अलग-अलग "कारों" (सॉफ्टवेयर टूल्स जैसे Cursor, GitHub Copotiler, आदि) के अंदर टेस्ट किया।
- रूपक: एक फेरारी इंजन को एक जंग लगी पिकअप ट्रक बनाम एक लग्जरी सेडान में रखने जैसा।
- परिणाम: एक ही AI दिमाग एक टूल में 64 स्कोर करता है लेकिन दूसरे में केवल 53। सॉफ्टवेयर रैपर (द ढांचा/scaffold) AI खुद जितना ही महत्वपूर्ण है। आप सिर्फ सबसे स्मार्ट दिमाग नहीं खरीद सकते; आपको उसे ले जाने के लिए सही शरीर की आवश्यकता होती है।
3. एक आकार सबके लिए उपयुक्त नहीं है (One Size Does Not Fit All)
AI कुछ कामों में बहुत अच्छा था और कुछ में बहुत बुरा।
- यह टेक्नोलॉजी रिसर्च (ऑनलाइन जानकारी ढूँढना) में ठीक-ठाक था।
- यह ह्यूमन रिसोर्स (HR) (रिज्यूमे और सॉफ्ट स्किल्स का आकलन करना) में बहुत खराब था।
- रूपक: आप एक शतरंज के ग्रैंडमास्टर को नर्स बनने के लिए नहीं रखेंगे। AI एक विशेषज्ञ है, जनरललिस्ट नहीं। यदि आप अपने "औसत" स्कोर के आधार पर AI चुनते हैं, तो आप गलत चुनाव कर सकते हैं।
4. "छिपी हुई" विफलताएँ
AI ने केवल छोटी गलतियाँ नहीं कीं; यह उन तरीकों से विफल हुआ जिसकी मनुष्य उम्मीद नहीं करते:
- डोमिनो प्रभाव (The Domino Effect): यदि इसने मेडिकल रिपोर्ट में एक छोटी सी तारीख भी गलत कर दी, तो इसने पूरे दस्तावेज़ को बिगाड़ दिया।
- "हाँ में हाँ मिलाने वाला" पूर्वाग्रह (The "Yes-Man" Bias): यह खुशी-खुशी किसी ऐसी समस्या का समाधान गढ़ देगा जो वास्तव में असंभव थी, बजाय इसके कि यह कहता, "हे, यह नहीं किया जा सकता।"
- फॉर्मेटिंग की विफलता (The Formatting Fail): इसने एक शानदार विश्लेषण लिखा, लेकिन इसे इतनी खराब तरह से फॉर्मेट किया कि कंपनी का सॉफ्टवेयर इसे पढ़ ही नहीं सका, जिससे इसका काम बेकार हो गया।
निष्कर्ष (The Bottom Line)
AlphaEval एक चेतावनी है। यह हमें बताता है कि हम AI को बहुत अधिक आंक रहे हैं क्योंकि हम इसे एक स्टेरिल लैब (sterile lab) में टेस्ट कर रहे हैं।
- व्यवसाय मालिकों के लिए: केवल AI के "IQ स्कोर" को न देखें। इसे अपने विशिष्ट जटिल डेटा पर टेस्ट करें। एक बैंक के लिए "सर्वश्रेष्ठ" AI अस्पताल के लिए सबसे खराब हो सकता है।
- डेवलपर्स के लिए: केवल उन AI को बनाना बंद करें जो सटीक निर्देशों का पालन करते हैं। हमें ऐसे AI की आवश्यकता है जो अस्पष्टता को संभाल सके, लाइनों के बीच पढ़ सके, और यह स्वीकार कर सके कि कोई कार्य असंभव है।
संक्षेप में: हम अंततः AI को वास्तविक काम पर टेस्ट कर रहे हैं, और अब यह मानने का समय आ गया है कि यह वर्कफोर्स के लिए तैयार नहीं है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।