← नवीनतम पेपर
💻 computer science

DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness

यह शोध पत्र DataClawEval प्रस्तुत करता है, जो पांच निष्पादन इंजनों (execution engines) में वास्तविक दुनिया के, एंड-टू-एंड डेटा इंजीनियरिंग कार्यों में स्वायत्त एजेंटों का मूल्यांकन करने के लिए पहला व्यापक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान फ्रंटियर मॉडल्स में सामान्य दक्षता की कमी है और वे सख्त डोमेन विशेषज्ञता द्वारा सीमित बने हुए हैं।

मूल लेखक: Debin Meng, Jiaming Yang, Zefang Zong, Tengyue Xu, Haining Xie, Yang Li, Peng Chen

प्रकाशित 2026-07-31
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Debin Meng, Jiaming Yang, Zefang Zong, Tengyue Xu, Haining Xie, Yang Li, Peng Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ कंप्यूटर केवल आपसे चैट ही नहीं करते, बल्कि वास्तव में काम भी करते हैं। यह AI एजेंट्स का क्षेत्र है। इन्हें उन स्मार्ट चैटबॉट्स के रूप में न देखें जो आपको सलाह देते हैं, बल्कि डिजिटल इंटर्न के रूप में देखें जो एक लैपटॉप खोल सकते हैं, एक बिखरी हुई स्प्रेडशीट को पढ़ सकते हैं, यह समझ सकते हैं कि क्या ठीक करने की आवश्यकता है, उसे ठीक करने के लिए कोड लिख सकते हैं, और फिर यह सुनिश्चित करने के लिए अपने काम की जाँच कर सकते हैं कि वह वास्तव में काम करता है या नहीं। लंबे समय से, वैज्ञानिक इन डिजिटल इंटर्नों का सरल कार्यों पर परीक्षण करते रहे हैं, जैसे कि एक वाक्य को डेटाबेस क्वेरी में अनुवाद करना (यह थोड़ा वैसा ही है जैसे किसी लाइब्रेरियन से एक अस्पष्ट विवरण के आधार पर किताब खोजने के लिए कहना)। लेकिन वास्तविक दुनिया का डेटा बहुत अधिक जटिल होता है। इसमें विभिन्न प्रकार के डेटाबेस को जोड़ना, सूचनाओं की लाइव स्ट्रीम को संभालना और उस कोड को डीबग करना शामिल है जो अप्रत्याशित तरीकों से क्रैश हो जाता है। बड़ा सवाल जो शोधकर्ता पूछ रहे हैं वह यह है: क्या ये AI एजेंट्स वास्तव में एक पेशेवर डेटा इंजीनियर के जटिल, वास्तविक दुनिया के काम को संभाल सकते हैं, या वे केवल कागजों पर अच्छे दिखते हैं?

यहाँ आता है DataClawEval, एक नया "स्ट्रेस टेस्ट" इन AI एजेंट्स के लिए, जिसे टेनसेंट (Tencent) और शिडियन यूनिवर्सिटी (Xidian University) के शोधकर्ताओं द्वारा बनाया गया है। इन AI एजेंट्स को केवल कोड की एक एकल पंक्ति लिखने के लिए कहने के बजाय, यह बेंचमार्क उन्हें एक यथार्थवादी औद्योगिक सिमुलेशन में डाल देता है। शोधकर्ताओं ने 100 अलग-अलग डेटा इंजीनियरिंग कार्यों वाला एक सैंडबॉक्स बनाया, जिसमें यूजर ग्रोथ के विश्लेषण से लेकर सुरक्षा जोखिमों के प्रबंधन तक के कार्य शामिल हैं। इन कार्यों के लिए AI को पूरे डेटा पाइपलाइनों को बनाने, चलाने और डीबग करने के लिए पांच अलग-अलग "इंजनों" (PySpark, MySQL और FlinkSQL जैसे विशिष्ट उपकरण) का उपयोग करने की आवश्यकता होती है। ट्विस्ट यह है कि AI को केवल इस आधार पर ग्रेड नहीं दिया जाता कि उसने सही शब्द लिखे हैं या नहीं; इसे इस आधार पर ग्रेड दिया जाता है कि क्या कोड वास्तव में चलता है और एक लाइव वातावरण में सही डेटा उत्पन्न करता है।

इस प्रयोग के परिणाम वास्तविकता का एक कड़ा अहसास कराने वाले थे। शोधकर्ताओं ने आज के सबसे स्मार्ट उपलब्ध 16 AI मॉडल्स का परीक्षण किया। यहाँ तक कि "चैंपियन" मॉडल, GPT 5.5 भी केवल 100 में से 74.9 का स्कोर ही प्राप्त कर सका। यह सुझाव देता है कि हालांकि AI बेहतर हो रहा है, लेकिन पूरी तरह से स्वायत्त डेटा इंजीनियर का सपना अभी भी समाधान से बहुत दूर है। अध्ययन में पाया गया कि कोई भी एकल AI मॉडल सभी कार्यों में माहिर नहीं है; कुछ एक प्रकार के डेटाबेस में बेहतरीन हैं तो दूसरे में बहुत खराब। उदाहरण के लिए, जबकि अधिकांश मॉडल्स ने MySQL कार्यों को अच्छी तरह से संभाला, वे HiveSQL के साथ काफी संघर्ष करते दिखे। इसके अलावा, शोधकर्ताओं ने पाया कि अधिक "दिमागी शक्ति" (अधिक कंप्यूटर टोकन का उपयोग करना) का उपयोग करने से जरूरी नहीं कि बेहतर परिणाम मिले। वास्तव में, सबसे कुशल एजेंट वे थे जिन्होंने केवल अनुमान लगाने और अंतहीन रूप से पुनः प्रयास करने के बजाय कुछ और किया।

शायद सबसे आश्चर्यजनक खोज यह थी कि हमें इन AI एजेंट्स को कैसे ग्रेड देना चाहिए। टीम ने परीक्षण किया कि क्या दूसरा AI काम को स्कोर करने के लिए एक जज के रूप में कार्य कर सकता है, लेकिन यह एक आपदा साबित हुआ। "AI जज" अत्यधिक उदार था, उन एजेंट्स को उच्च स्कोर दे रहा था जो अपने कोड को सही ढंग से चलाने में विफल रहे, केवल इसलिए क्योंकि टेक्स्ट दिखने में अच्छा था। शोधकर्ताओं ने निष्कर्ष निकाला कि केवल एक सख्त, नियम-आधारित प्रणाली जो वास्तव में कोड को चलाती है और डेटा की जाँच करती है, वही सच बता सकती है। संक्षेप में, DataClawEval हमें दिखाता है कि हालांकि AI एजेंट्स आशाजनक हैं, लेकिन मानव के निगरानी किए बिना हमारे महत्वपूर्ण डेटा सिस्टम चलाने के लिए भरोसेमंद बनने से पहले उन्हें अभी भी बहुत कुछ सीखने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →