← नवीनतम पेपर
💬 NLP

AlphaEval: Evaluating Agents in Production

यह शोध पत्र AlphaEval प्रस्तुत करता है, जो सात कंपनियों के 94 वास्तविक-विश्व कार्यों से बना एक प्रोडक्शन-ग्राउंडेड बेंचमार्क है, जो एक नवीन ढांचे का उपयोग करके वास्तविक आवश्यकताओं को निष्पादन योग्य मूल्यांकनों में परिवर्तित करते हुए पूर्ण AI एजेंट प्रणालियों का मूल्यांकन करता है, जिससे मौजूदा मॉडल-केंद्रित बेंचमार्क और वाणिज्यिक परिनियोजन की जटिल, गतिशील वास्तविकताओं के बीच के अंतर को दूर किया जा सके।

मूल लेखक: Pengrui Lu, Bingyu Xu, Wenjun Zhang, Shengjia Hua, Xuanjian Gao, Ranxiang Ge, Lyumanshan Ye, Linxuan Wu, Yiran Li, Junfei Fish Yu, Yibo Zhang, Ruixin Li, Manxiang Li, Xiao Han, Xiaocong Zhou, Guangyao
प्रकाशित 2026-04-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pengrui Lu, Bingyu Xu, Wenjun Zhang, Shengjia Hua, Xuanjian Gao, Ranxiang Ge, Lyumanshan Ye, Linxuan Wu, Yiran Li, Junfei Fish Yu, Yibo Zhang, Ruixin Li, Manxiang Li, Xiao Han, Xiaocong Zhou, Guangyao Chi, Zisheng Chen, Kaishen Chen, Kun Wang, Qihua Xu, Fengyue Meng, Yuchen Ni, Jiajun Li, Jinxiu Liu, Danfeng Zhang, Jingru Zhao, Pengfei Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपनी कंपनी के सबसे महत्वपूर्ण कार्यों को चलाने के लिए एक नया कर्मचारी नियुक्त करने की कोशिश कर रहे हैं। आपके पास रिज्यूमे (resumes) का एक ढेर और साक्षात्कार के प्रश्नों की एक सूची है।

समस्या:
आज अधिकांश AI कंपनियाँ उस "अभ्यास परीक्षण" (practice test) के आधार पर भर्ती कर रही हैं जो वास्तविक काम से बिल्कुल अलग है।

  • अभ्यास परीक्षण (वर्तमान बेंचमार्क): कल्पना कीजिए कि एक ऐसा परीक्षण जहाँ निर्देश एकदम स्पष्ट हैं: "बिल्ली के बारे में एक कविता लिखें।" उत्तर या तो सही है या गलत। यह साफ-सुथरा, सुरक्षित और एक शून्य (vacuum) में होता है।
  • वास्तविक काम (उत्पादन वास्तविकता): वास्तविक दुनिया में, एक बॉस कह सकता है, "हमें अपनी सप्लाई चेन को ठीक करने की जरूरत है, लेकिन हमारे पास कोई स्पष्ट योजना नहीं है, डेटा पुराने एक्सेल शीट्स और पीडीएफ में बिखरा हुआ है, और आपको यह भी पता होना चाहिए कि हमारे विशिष्ट उद्योग के बारे में कैसे काम करना है। ओह, और अगले हफ्ते बॉस की 'अच्छा' की परिभाषा बदल भी सकती है।"

पेपर AlphaEval तर्क देता है कि हम वर्षों से AI को "अभ्यास परीक्षण" पर टेस्ट कर रहे हैं, लेकिन वे "वास्तविक काम" में विफल हो रहे हैं।

समाधान: AlphaEval

लेखकों ने AI को टेस्ट करने का एक नया तरीका बनाया जिसे AlphaEval कहा जाता है। नकली कार्य बनाने के बजाय, वे सात वास्तविक कंपनियों (जैसे टेक फर्म, अस्पताल और फाइनेंस ग्रुप) के पास गए और पूछा: "वे कौन से वास्तविक, जटिल और कठिन कार्य हैं जिनके लिए आप अभी अपने मानव कर्मचारियों को भुगतान कर रहे हैं?"

उन्होंने उन वास्तविक व्यावसायिक कार्यों को AI के लिए एक परीक्षण में बदल दिया।

"निर्माण स्थल" (Construction Site) का रूपक

इस परीक्षण को बनाने के लिए, लेखकों ने केवल पुराने होमवर्क असाइनमेंट नहीं उठाए। उन्होंने वास्तविक व्यावसायिक आवश्यकताओं को परीक्षणों में बदलने के लिए एक फैक्टरी (एक ढांचा/framework) बनाई।

  1. ब्लूप्रिंट (Blueprint): उन्होंने वास्तविक विशेषज्ञों (जैसे HR मैनेजर या वित्तीय विश्लेषक) से बात की ताकि उनके काम के जटिल और अनकहे नियमों को समझा जा सके।
  2. सामग्री (Materials): उन्होंने वास्तविक दस्तावेज़ एकत्र किए—स्कैन किए गए PDF, भ्रमित करने वाली स्प्रेडशीट और अस्पष्ट ईमेल—ठीक वैसे ही जैसे एक वास्तविक कर्मचारी को प्राप्त होंगे।
  3. ग्रेडिंग (Grading): किसी कंप्यूटर द्वारा एकल "सही" उत्तर की जाँच करने के बजाय, उन्होंने मानव विशेषज्ञों का उपयोग AI के काम को ग्रेड करने के लिए किया, ठीक वैसे ही जैसे एक बॉस रिपोर्ट की समीक्षा करता है। उन्होंने पूछा: "क्या यह क्लाइंट को भेजने के लिए पर्याप्त अच्छा है?"

बड़ी खोजें (प्लॉट ट्विस्ट)

जब उन्होंने शीर्ष AI मॉडल को इस "वास्तविक काम" के परीक्षण से गुजारा, तो परिणाम चौंकाने वाले थे:

1. "सर्वश्रेष्ठ" AI केवल "ठीक-ठाक" है
यहाँ तक कि सबसे स्मार्ट AI (Claude Opus 4.6) का स्कोर भी 100 में से 64 था।

  • रूपक: कल्पना कीजिए कि एक छात्र गणित के टेस्ट में A+ पाता है लेकिन ड्राइविंग टेस्ट में फेल हो जाता है क्योंकि वह बारिश के दिन या अचानक आए मोड़ को नहीं संभाल पाता। AI सटीक निर्देशों का पालन करने में महान है लेकिन व्यावसायिक वास्तविकता को संभालने में बहुत खराब है।

2. "इंजन" जितना ही "कार" भी मायने रखती है
पेपर ने एक ही AI "दिमाग" (मॉडल) को चार अलग-अलग "कारों" (सॉफ्टवेयर टूल्स जैसे Cursor, GitHub Copotiler, आदि) के अंदर टेस्ट किया।

  • रूपक: एक फेरारी इंजन को एक जंग लगी पिकअप ट्रक बनाम एक लग्जरी सेडान में रखने जैसा।
  • परिणाम: एक ही AI दिमाग एक टूल में 64 स्कोर करता है लेकिन दूसरे में केवल 53। सॉफ्टवेयर रैपर (द ढांचा/scaffold) AI खुद जितना ही महत्वपूर्ण है। आप सिर्फ सबसे स्मार्ट दिमाग नहीं खरीद सकते; आपको उसे ले जाने के लिए सही शरीर की आवश्यकता होती है।

3. एक आकार सबके लिए उपयुक्त नहीं है (One Size Does Not Fit All)
AI कुछ कामों में बहुत अच्छा था और कुछ में बहुत बुरा।

  • यह टेक्नोलॉजी रिसर्च (ऑनलाइन जानकारी ढूँढना) में ठीक-ठाक था।
  • यह ह्यूमन रिसोर्स (HR) (रिज्यूमे और सॉफ्ट स्किल्स का आकलन करना) में बहुत खराब था।
  • रूपक: आप एक शतरंज के ग्रैंडमास्टर को नर्स बनने के लिए नहीं रखेंगे। AI एक विशेषज्ञ है, जनरललिस्ट नहीं। यदि आप अपने "औसत" स्कोर के आधार पर AI चुनते हैं, तो आप गलत चुनाव कर सकते हैं।

4. "छिपी हुई" विफलताएँ
AI ने केवल छोटी गलतियाँ नहीं कीं; यह उन तरीकों से विफल हुआ जिसकी मनुष्य उम्मीद नहीं करते:

  • डोमिनो प्रभाव (The Domino Effect): यदि इसने मेडिकल रिपोर्ट में एक छोटी सी तारीख भी गलत कर दी, तो इसने पूरे दस्तावेज़ को बिगाड़ दिया।
  • "हाँ में हाँ मिलाने वाला" पूर्वाग्रह (The "Yes-Man" Bias): यह खुशी-खुशी किसी ऐसी समस्या का समाधान गढ़ देगा जो वास्तव में असंभव थी, बजाय इसके कि यह कहता, "हे, यह नहीं किया जा सकता।"
  • फॉर्मेटिंग की विफलता (The Formatting Fail): इसने एक शानदार विश्लेषण लिखा, लेकिन इसे इतनी खराब तरह से फॉर्मेट किया कि कंपनी का सॉफ्टवेयर इसे पढ़ ही नहीं सका, जिससे इसका काम बेकार हो गया।

निष्कर्ष (The Bottom Line)

AlphaEval एक चेतावनी है। यह हमें बताता है कि हम AI को बहुत अधिक आंक रहे हैं क्योंकि हम इसे एक स्टेरिल लैब (sterile lab) में टेस्ट कर रहे हैं।

  • व्यवसाय मालिकों के लिए: केवल AI के "IQ स्कोर" को न देखें। इसे अपने विशिष्ट जटिल डेटा पर टेस्ट करें। एक बैंक के लिए "सर्वश्रेष्ठ" AI अस्पताल के लिए सबसे खराब हो सकता है।
  • डेवलपर्स के लिए: केवल उन AI को बनाना बंद करें जो सटीक निर्देशों का पालन करते हैं। हमें ऐसे AI की आवश्यकता है जो अस्पष्टता को संभाल सके, लाइनों के बीच पढ़ सके, और यह स्वीकार कर सके कि कोई कार्य असंभव है।

संक्षेप में: हम अंततः AI को वास्तविक काम पर टेस्ट कर रहे हैं, और अब यह मानने का समय आ गया है कि यह वर्कफोर्स के लिए तैयार नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →