💬 NLP
EnterpriseClawBench: Benchmarking Agents from Real Workplace Sessions
यह शोध पत्र EnterpriseClawBench प्रस्तुत करता है, जो मालिकाना वास्तविक-दुनिया के एंटरप्राइज एजेंट सत्रों से प्राप्त एक बेंचमार्क है जो 852 पुनरुत्पादित कार्यों का मूल्यांकन करता है ताकि यह प्रदर्शित किया जा सके कि वर्तमान मॉडल सीमित सफलता (0.663) प्राप्त करते हैं और भविष्य के मूल्यांकनों को केवल एक एकल स्कोर पर निर्भर रहने के बजाय हार्नेस-मॉडल संयोजनों, आर्टिफैक्ट डिलीवरी, दृश्य गुणवत्ता, लागत, रनटाइम और कौशल-हस्तांतरण व्यवहार की रिपोर्ट करने वाले एक बहु-आयामी ढांचे को अपनाना चाहिए।
Jincheng Zhong, Weizhi Wang, Che Jiang, Kai Tian, Zhenzhao Yuan, Junlin Yang, Dianqiao Lei, Kaiyan Zhang2026-06-23