← नवीनतम पेपर
💬 NLP

EnterpriseClawBench: Benchmarking Agents from Real Workplace Sessions

यह शोध पत्र EnterpriseClawBench प्रस्तुत करता है, जो मालिकाना वास्तविक-दुनिया के एंटरप्राइज एजेंट सत्रों से प्राप्त एक बेंचमार्क है जो 852 पुनरुत्पादित कार्यों का मूल्यांकन करता है ताकि यह प्रदर्शित किया जा सके कि वर्तमान मॉडल सीमित सफलता (0.663) प्राप्त करते हैं और भविष्य के मूल्यांकनों को केवल एक एकल स्कोर पर निर्भर रहने के बजाय हार्नेस-मॉडल संयोजनों, आर्टिफैक्ट डिलीवरी, दृश्य गुणवत्ता, लागत, रनटाइम और कौशल-हस्तांतरण व्यवहार की रिपोर्ट करने वाले एक बहु-आयामी ढांचे को अपनाना चाहिए।

मूल लेखक: Jincheng Zhong, Weizhi Wang, Che Jiang, Kai Tian, Zhenzhao Yuan, Junlin Yang, Dianqiao Lei, Kaiyan Zhang

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jincheng Zhong, Weizhi Wang, Che Jiang, Kai Tian, Zhenzhao Yuan, Junlin Yang, Dianqiao Lei, Kaiyan Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट, नया कर्मचारी है जो फ़ाइलें पढ़ सकता है, टूल्स का उपयोग कर सकता है और रिपोर्ट लिख सकता है। आप जानना चाहते हैं कि क्या वह वास्तव में अपने काम में अच्छा है।

AI "कर्मचारियों" के लिए अधिकांश पिछले परीक्षण एक शांत कक्षा में पॉप क्विज़ देने जैसे थे। उनसे अलग-थलग होकर प्रश्न पूछने या कोड लिखने के लिए कहा जाता था। लेकिन वास्तविक ऑफिस का काम एक शांत क्विज़ नहीं है; यह एक अराजक, शोर-शराबे वाला वातावरण है जहाँ आपको बिखरे हुए ईमेल पढ़ने, विशिष्ट अटैचमेंट खोलने, टूटे हुए लिंक को ठीक करने और दिन के अंत तक एक तैयार उत्पाद (जैसे स्प्रेडशीट या प्रेजेंटेशन) डिलीवर करना होता है।

यह पेपर EnterpriseClawBench पेश करता है, जो बनावटी अभ्यास परीक्षणों के बजाय एक कंपनी के वास्तविक, वास्तविक कार्य सत्रों (work sessions) पर आधारित AI एजेंटों को टेस्ट करने का एक नया तरीका है।

यहाँ उन्होंने क्या किया और क्या पाया, इसका विवरण दिया गया है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. वास्तविक काम के लिए "रीसाइक्लिंग प्लांट"

शोधकर्ताओं ने अपनी ही कंपनी के हजारों वास्तविक कार्य सत्रों के एक विशाल संग्रह से शुरुआत की। ये सत्र अस्त-व्यस्त थे: इनमें निजी चैट, टूटे हुए फ़ाइल पाथ और अस्पष्ट निर्देश शामिल थे।

इस संग्रह को कच्चे, बिना रिफ़ाइंड अयस्क (ore) के ढेर के रूप में सोचें। पेपर इस "निर्माण पाइपलाइन" (एक रीसाइक्लिंग प्लांट) का वर्णन करता है जो इस अयस्क को साफ करती है:

  • फ़िल्टर: उन्होंने उन कार्यों को बाहर कर दिया जो बहुत छोटे थे, जिनमें फ़ाइलें गायब थीं, या जो टूटे हुए लिंक पर निर्भर थे।
  • अनुवादक (Translator): उन्होंने बहु-चरणीय (multi-turn), अव्यवस्थित बातचीत को लेकर उन्हें स्पष्ट, सिंगल-शॉट निर्देशों में फिर से लिखा (जैसे एक लंबी ईमेल श्रृंखला को एक स्पष्ट "To-Do" सूची में बदलना)।
  • सुरक्षा जांच: उन्होंने सुनिश्चित किया कि प्रत्येक कार्य को बिना किसी गुप्त कंपनी पासवर्ड के बार-बार चलाया जा सके।

5,291 कच्चे प्रयासों से, वे 852 उच्च-गुणवत्ता वाले, पुनरुत्पादक (reproducible) कार्यों तक पहुँचे। उन्होंने 120 कार्यों का एक छोटा, "लाइट" संस्करण भी बनाया जिसे गुणवत्ता सुनिश्चित करने के लिए मनुष्यों द्वारा मैन्युअल रूप से जांचा गया था।

2. "ड्राइवर और कार" का परीक्षण

इस पेपर का एक प्रमुख निष्कर्ष यह है कि आप केवल AI मॉडल (इंजन) का परीक्षण शून्य में नहीं कर सकते। आपको AI + सॉफ्टवेयर फ्रेमवर्क (कार) को एक साथ टेस्ट करना होगा।

  • उपमा: एक फेरारी इंजन का परीक्षण करने की कल्पना करें। यदि आप इसे एक जंग लगे, टूटे हुए ट्रक में रखते हैं, तो यह अच्छा प्रदर्शन नहीं करेगा। यदि आप इसे एक शानदार स्पोर्ट्स कार में रखते हैं, तो यह उड़ जाएगी।
  • परिणाम: पेपर ने 32 अलग-अलग "इंजन" (जैसे GPT-5.5, Sonnet 4.6) और "कार" (सॉफ्टवेयर फ्रेमवर्क जैसे Claude Code, OpenClaw, Hermes) के संयोजनों का परीक्षण किया।
  • आश्चर्य: कुछ शक्तिशाली इंजनों ने गलत फ्रेमवर्क के साथ जुड़ने पर बहुत खराब प्रदर्शन किया। उदाहरण के लिए, एक शीर्ष-स्तरीय मॉडल ने "Hermes" फ्रेमवर्क के साथ उपयोग किए जाने पर अपना स्कोर काफी कम कर दिया क्योंकि फ्रेमवर्क ने मॉडल को कुछ आवश्यक कार्यों को करने से रोक दिया। यह साबित करता है कि सॉफ्टवेयर रैपर (wrapper) AI मस्तिष्क जितना ही महत्वपूर्ण है।

3. "रिपोर्ट कार्ड" एक ग्रेड से कहीं अधिक है

स्कूल में, आपको एक अंतिम ग्रेड मिलता है। इस बेंचमार्क में, शोधकर्ता कहते हैं कि वास्तविक काम के लिए यह पर्याप्त नहीं है। वे एजेंटों को एक बहु-आयामी रिपोर्ट कार्ड पर ग्रेड देते हैं:

  • क्या उन्होंने काम पूरा किया? (आर्टिफैक्ट डिलीवरी)
  • क्या उन्होंने इसे तेजी से किया? (रनटाइम)
  • क्या इसमें बहुत अधिक पैसा खर्च हुआ? (लागत)
  • क्या फ़ाइल वास्तव में उपयोगी है? (दृश्य गुणवत्ता/Visual quality)
  • क्या उन्होंने संदर्भ को समझा? (सिमेंटिक गुणवत्ता)

रियलिटी चेक: यहाँ तक कि सबसे अच्छा संयोजन (Codex के साथ GPT-5.5) भी केवल 66.3% स्कोर कर सका। इसका मतलब है कि हमारे सबसे स्मार्ट AI एजेंट भी अभी भी वास्तविक दुनिया के ऑफिस कार्यों को पूरी तरह से संभालने में संघर्ष कर रहे हैं। वे अक्सर विवरण छोड़ देते हैं, सही फ़ाइल खोजने में विफल रहते हैं, या ऐसी रिपोर्ट तैयार करते हैं जो दिखने में तो अच्छी होती है लेकिन जिसमें गलत नंबर होते हैं।

4. "कौशल हस्तांतरण" (Skill Transfer) प्रयोग

शोधकर्ता यह देखना चाहते थे कि क्या एक AI एक कार्य से एक कौशल "सीख" सकता है और उसे दूसरे, समान कार्य पर लागू कर सकता है।

  • प्रयोग: उन्होंने एक AI लिया जिसने "फ्रंटएंड वेब पेज" बनाने का अभ्यास किया था और उसे एक नया वेब पेज कार्य दिया जो उसने पहले कभी नहीं देखा था।
  • "शिक्षक" बनाम "छात्र": उन्होंने पाया कि "कौशल" की गुणवत्ता पूरी तरह से इस बात पर निर्भर थी कि किसने उसे सिखाया।
    • यदि एक मजबूत AI (जैसे GPT-5.5) ने कौशल को डिस्टिल (distill) किया, तो छात्र AI बेहतर हुआ।
    • यदि एक कमजोर AI ने कौशल सिखाने की कोशिश की, तो छात्र AI वास्तव में और खराब हो गया।
  • सबक: आप यह मान नहीं सकते कि एक AI ने "सीख" लिया है। शिक्षण की गुणवत्ता मायने रखती है, और कभी-कभी एक बुरा शिक्षक एक अच्छे छात्र को बिगाड़ देता है।

5. "मानव बनाम रोबोट" जज की समस्या

इन कार्यों को ग्रेड करने के लिए, उन्होंने AI जजों (रोबोटों द्वारा रोबोटों को ग्रेड करना) का उपयोग किया।

  • टेक्स्ट कार्य: AI जज टेक्स्ट रिपोर्ट को ग्रेड करने में काफी अच्छे थे, जो मानव जजों के काफी करीब थे।
  • विजुअल कार्य: जब स्प्रेडशीट, स्लाइड्स या छवियों को ग्रेड करने की बात आई, तो AI जज बहुत अविश्वसनीय थे। उन्होंने अक्सर उन अव्यवस्थित आउटपुट को उच्च अंक दिए जिन्हें इंसान अस्वीकार कर देते।
  • निष्कर्ष: हम यह टेस्ट करने में अच्छे हैं कि एक AI वाक्य लिख सकता है या नहीं, लेकिन हम अभी भी यह टेस्ट करने में खराब हैं कि क्या एक AI पेशेवर दिखने वाला व्यावसायिक दस्तावेज़ बना सकता है।

सारांश

EnterpriseClawBench AI उद्योग के लिए एक रियलिटी चेक है। यह कहता है:

  1. AI को नकली, साफ वातावरण में टेस्ट करना बंद करें; उन्हें अस्त-व्यस्त, वास्तविक अभिलेखागारों (archives) में टेस्ट करें।
  2. आप जिस सॉफ्टवेयर फ्रेमवर्क का उपयोग करते हैं वह AI मॉडल जितना ही महत्वपूर्ण है।
  3. वर्तमान AI एजेंट अभी भी जटिल ऑफिस जॉब्स में मानव श्रमिकों को पूरी तरह से बदलने के लिए तैयार नहीं हैं; वे अभी भी बहुत अधिक गलतियाँ करते हैं ताकि उन्हें अंतिम उत्पाद के लिए भरोसेमंद बनाया जा सके।
  4. हमें केवल टेक्स्ट ही नहीं, बल्कि विजुअल आउटपुट को ग्रेड करने के बेहतर तरीकों की आवश्यकता है।

पेपर निष्कर्ष निकालता है कि हालांकि AI बेहतर हो रहा है, लेकिन "AI के साथ चैट करने" और "विश्वसनीय रूप से एक बिजनेस विभाग चलाने" के बीच का अंतर अभी भी बहुत बड़ा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →