← नवीनतम पेपर
💬 NLP

RealClawBench: Live OpenClaw Benchmarks from Real Developer-Agent Sessions

RealClawBench एक लाइव बेंचमार्क फ्रेमवर्क पेश करता है जो वास्तविक OpenClaw डेवलपर-एजेंट सत्रों से व्युत्पन्न है, जो 281 चुनौतीपूर्ण, वास्तविक दुनिया के कार्यों को पुनरुत्पादक मूल्यांकनों में बदलने के लिए पुनर्निर्मित निष्पादन वातावरण और नियतात्मक स्कोरर्स का उपयोग करता है, जो वर्तमान मॉडलों में महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है।

मूल लेखक: Zongwei Lv, Zhewen Tan, Yaoming Li, Yilun Yao, Yuxuan Tian, Lin Sun, Xiangzheng Zhang, Weihong Lin, Tong Yang, Guangxiang Zhao

प्रकाशित 2026-06-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zongwei Lv, Zhewen Tan, Yaoming Li, Yilun Yao, Yuxuan Tian, Lin Sun, Xiangzheng Zhang, Weihong Lin, Tong Yang, Guangxiang Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नए रोबोट शेफ (रसोइया) की कुशलता का परीक्षण करने की कोशिश कर रहे हैं।

पुराना तरीका (पारंपरिक बेंचमार्क):
परंपरागत रूप से, शोधकर्ता "ग्रिल्ड चीज़ सैंडविच बनाएं" या "चॉकलेट केक बेक करें" जैसे आदर्श, पाठ्यपुस्तकीय व्यंजनों की एक सूची लिखते थे। वे इन व्यंजनों को रोबोट को देते थे और देखते थे कि क्या वह चरणों का पालन करता है। समस्या क्या है? वास्तविक जीवन कोई पाठ्यपुस्तक नहीं है। वास्तविक दुनिया में, एक ग्राहक कह सकता है, "मेरी ब्रेड थोड़ी बासी है, चीज़ फ्रिज के पीछे रखी है, और मेरे पास केवल एक टोस्टर ओवन है, ग्रिल नहीं। क्या आप कुछ खाने योग्य बना सकते हैं?" पुराने परीक्षण यह जांच नहीं करते थे कि क्या रोबक वास्तविक दुनिया के उन उलझे हुए विवरणों को संभाल सकता है।

नया तरीका (REALCLAWBENCH):
इस शोध पत्र के लेखकों ने महसूस किया कि एक "डेवलपर एजेंट" (एक रोबोट जो प्रोग्रामर्स की मदद करता है) को वास्तव में परखने के लिए, उन्हें नकली टेस्ट लिखना बंद करना होगा और वास्तविक लोगों को जंगल में (वास्तविक परिस्थितियों में) रोबोट का उपयोग करते हुए देखना होगा।

उन्होंने REALCLAWBENCH नामक एक प्रणाली बनाई। यह कैसे काम करती है, इसके सरल उपमाएँ यहाँ दी गई हैं:

1. वास्तविक क्षणों को पकड़ना (स्रोत)

कार्य गढ़ने के बजाय, टीम ने 76,155 वास्तविक सत्रों को देखा जहाँ वास्तविक डेवलपर्स ने "OpenClaw" नामक टूल का उपयोग करके कोड के लिए मदद ली थी। उन्होंने वास्तविक लोगों को जटिल, उलझी हुई और कभी-कभी अस्पष्ट अनुरोधों के साथ मदद मांगते हुए देखा।

  • उपमा: कल्पना कीजिए कि एक सुरक्षा कैमरा एक व्यस्त रेस्तरां में वास्तविक ग्राहकों के खाना ऑर्डर करने के हजारों वीडियो रिकॉर्ड कर रहा है, बजाय इसके कि एक शेफ एक शांत रसोई में मेनू लिखे।

2. "जादुई सफाई" (पाइपलाइन)

आप किसी वास्तविक ग्राहक की कच्ची रिकॉर्डिंग को सीधे एक टेस्ट में नहीं बदल सकते। रिकॉर्डिंग में निजी पासवर्ड, गुप्त कंपनी फाइलें, या ऐसे कंप्यूटरों के संदर्भ हो सकते हैं जो अब अस्तित्व में नहीं हैं।
शोध पत्र एक पाइपलाइन (एक चरण-दर-चरण फैक्ट्री लाइन) का वर्णन करता है जो इन वास्तविक क्षणों को साफ करती है:

  • प्राइवेसी स्क्रीन: वे सभी रहस्यों और निजी जानकारी को हटा देते हैं, जैसे वीडियो में चेहरे को धुंधला करना।
  • एनवायरनमेंट रिकंस्ट्रक्शन (वातावरण का पुनर्निर्माण): यदि किसी डेवलपर ने रोबोट से उनके विशिष्ट कंप्यूटर पर एक फ़ाइल को ठीक करने के लिए कहा था, तो टीम उस कंप्यूटर वातावरण का एक नकली, सुरक्षित संस्करण बनाती है ताकि उस टेस्ट को बाद में फिर से चलाया जा सके।
  • अनुरोध का पुनर्लेखन: वे एक अस्पष्ट, संवादात्मक अनुरोध ("हे, क्या आप उस चीज़ को देख सकते हैं जिसका मैंने पहले उल्लेख किया था?") को एक स्पष्ट, स्वतंत्र निर्देश में बदलते हैं ("कृपया लॉगिन फ़ाइल में बग को ठीक करें")।
  • स्वचालित जज (Automatic Judge): इंसान द्वारा काम को ग्रेड देने के बजाय, वे एक कंप्यूटर प्रोग्राम लिखते हैं जो परिणाम की जांच करता है। क्या फ़ाइल ठीक हुई? हाँ/नहीं। अनुमान लगाने की अनुमति नहीं है।

3. परिणाम: एक "लाइव" टेस्ट

अंतिम उत्पाद एक बेंचमार्क है जिसमें 281 वास्तविक दुनिया के कार्य शामिल हैं।

  • यह क्यों विशेष है: यह "लाइव" और "एंकरित" (anchored) है। इसका मतलब है कि यह प्रश्नों की एक स्थिर सूची नहीं है जो पुरानी हो जाए। क्योंकि उन्होंने इसे वास्तविक उपयोगकर्ता डेटा के निरंतर प्रवाह से बनाया है, वे इसे नए वास्तविक दुनिया के उदाहरणों के साथ अपडेट कर सकते हैं ताकि यह ताज़ा बना रहे।
  • "रियलिज्म गैप" (वास्तविकता का अंतर): शोध पत्र का तर्क है कि पिछले परीक्षणों में जो वे टेस्ट करते थे और जो वास्तव में होता है, उसके बीच एक "गैप" था। REALCLAWBENCH उस गैप को भरता है। यह एक ड्राइवर को एक आदर्श, खाली ट्रैक पर टेस्ट करने के बजाय, उसे गड्ढों और भ्रमित पैदल यात्रियों के साथ वास्तविक भीड़-भाड़ वाले ट्रैफिक में टेस्ट करने जैसा है।

उन्होंने क्या पाया?

उन्होंने इस नए, जटिल, वास्तविक दुनिया के टेस्ट पर 14 सबसे स्मार्ट AI मॉडल्स का परीक्षण किया।

  • स्कोर: यहाँ तक कि सबसे अच्छा AI मॉडल (Claude Opus 4.7) भी केवल लगभग 66% कार्यों को ही हल कर पाया।
  • निष्कर्ष: इसका अर्थ है कि अभी भी सुधार की बहुत गुंजाइश है। वर्तमान "सुपर-इंटेलिजेंट" रोबोट अभी भी उन उलझे हुए, वास्तविक जीवन की समस्याओं के साथ संघर्ष कर रहे हैं जिनका सामना वास्तविक डेवलपर्स हर दिन करते हैं।

सारांश

संक्षेप में, शोध पत्र कहता है: "रोबोटों को नकली, आदर्श परिदृश्यों के साथ टेस्ट करना बंद करें। आइए उन्हें उन उलझे हुए, वास्तविक जीवन की समस्याओं के साथ टेस्ट करें जिनका वे वास्तव में सामना करते हैं, लेकिन उन्हें बस इतना साफ करें कि उन्हें निष्पक्ष रूप से ग्रेड दिया जा सके।"

उन्होंने बिल्कुल ऐसा ही करने के लिए एक प्रणाली बनाई, और उन्होंने पाया कि आज के सबसे अच्छे रोबोट भी वास्तविक दुनिया में पूरी तरह विश्वसनीय होने के मामले में अभी भी केवल दो-तिहाई के करीब ही पहुँच पाए हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →