DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?
यह शोध पत्र DSAgentBench प्रस्तुत करता है, जो वास्तविक कंप्यूटर वातावरण के भीतर एंड-टू-एंड डेटा साइंस वर्कफ़्लो को स्वचालित करने की AI एजेंटों की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है, जो एक महत्वपूर्ण प्रदर्शन अंतराल को उजागर करता है जहाँ सबसे मजबूत मॉडल भी टूल ऑर्केस्ट्रेशन और मल्टी-स्टेप रीजनिंग के साथ संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
तकनीकी सारांश: DSAgentBench
समस्या विवरण
वास्तविक दुनिया का डेटा विज्ञान जटिल, दीर्घकालिक वर्कफ्लो (long-horizon workflows) से जुड़ा होता है जो डेटा रेंगलिंग, अन्वेषण, मॉडलिंग, विज़ुअलाइज़ेशन और सत्यापन तक फैला होता है। इन कार्यों के लिए एक कार्यात्मक ऑपरेटिंग सिस्टम के भीतर विविध उपकरणों—जैसे नोटबुक, IDE, टर्मिनल, ब्राउज़र और डेटाबेस—के समन्वित उपयोग की आवश्यकता होती है। हालांकि हाल के बड़े भाषा मॉडल (LLMs) के विकास ने कोड उत्पन्न करने या अलग-थलग विश्लेषणात्मक कार्यों को करने की क्षमता प्रदर्शित की है, मौजूदा बेंचमार्क यह मूल्यांकन करने में विफल रहते हैं कि क्या एजेंट वास्तविक कंप्यूटिंग वातावरणों में पूर्ण एंड-टू-एंड डेटा-साइंस वर्कफ्लो को स्वायत्त रूप से निष्पादित कर सकते हैं।
वर्तमान बेंचमार्क दो श्रेणियों में आते हैं: वे जो सिस्टम इंटरेक्शन की आवश्यकता के बिना केवल कोड जनरेशन का मूल्यांकन करते हैं (जैसे, DS-1000, DSEval), और वे जो डोमेन-विशिष्ट विश्लेषणात्मक तर्क का आकलन किए बिना सामान्य कंप्यूटर नियंत्रण का मूल्यांकन करते हैं (जैसे, OSWorld, WebArena)। फलस्वरूप, एक ऐसे मूल्यांकन ढांचे की कमी है जो एक वास्तविक OS वातावरण के भीतर फ़ाइल सिस्टम को नेविगेट करने, डिपेंडेंसी प्रबंधित करने, त्रुटियों की व्याख्या करने और मध्यवर्ती आउटपुट के आधार पर विश्लेषण को परिष्कृत करने की एजेंट की क्षमता का परीक्षण करता हो।
कार्यप्रणाली
बेंचमार्क निर्माण (DSAgentBench)
लेखक DSAgentBench पेश करते हैं, जो वास्तविक ऑपरेटिंग सिस्टम के भीतर स्वायत्त डेटा-साइंस वर्कफ्लो का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है। यह बेंचमार्क पूरे डेटा-साइंस जीवनचक्र को कवर करने वाले 275 विविध, मानव-लिखित कार्यों से बना है।
- कार्य सूत्रीकरण (Task Formulation): कार्यों को टुपल्स के रूप में परिभाषित किया गया है, जहाँ प्रारंभिक सिस्टम कॉन्फ़िगरेशन (डेटासेट, फ़ाइल संरचना, स्थापित लाइब्रेरी) है, एक प्राकृतिक भाषा निर्देश है, और एक नियत (deterministic) पायथन इवैल्यूएटर है।
- डेटा सोर्सिंग: डेटासेट विषम वास्तविक दुनिया के स्रोतों से लिए गए हैं, जिनमें Kaggle, OpenML, GitHub, SQLite डेटाबेस और वेब API शामिल हैं। डेटा में टैबुलर (95.3%), इमेज (3.6%), और टेक्स्ट (1.1%) मोडैलिटीज शामिल हैं।
- कार्य श्रेणियाँ: कार्यों को छह क्षमता श्रेणियों में व्यवस्थित किया गया है: डेटा अधिग्रहण (Data Acquisition), एक्सप्लोरेटरी डेटा एनालिसिस (EDA), फीचर इंजीनियरिंग, मॉडलिंग, मूल्यांकन/परिनियोजन (Evaluation/Deployment), और विज़ुअलाइज़ेशन/रिपोर्टिंग।
- मूल्यांकन प्रोटोकॉल: कोड निष्पादन को स्कोर करने वाले बेंचमार्क के विपरीत, DSAgentBench नियत इवैल्यूएटर्स (deterministic evaluators) का उपयोग करता है जो विश्लेषणात्मक शुद्धता, विजुअल आउटपुट गुणवत्ता और मॉडल प्रदर्शन को सत्यापित करते हैं। एक कार्य तभी सफल माना जाता है जब एजेंट का अंतिम आउटपुट इवैल्यूएटर के मानदंडों को संतुष्ट करता है (स्कोर )।
- निर्माण पाइपलाइन: बेंचमार्क को तीन-चरणीय प्रक्रिया के माध्यम से बनाया गया था: डेटा सोर्सिंग, मानव विशेषज्ञों द्वारा सहयोगात्मक कार्य/इवैल्यूएटर डिज़ाइन (जिसमें परिशोधन के लिए LLM का उपयोग किया गया), और पुनरुत्पादकता और तकनीकी शुद्धता सुनिश्चित करने के लिए डुअल-एनोटेटर सत्यापन।
एनवायरनमेंट आर्किटेक्चर
DSAgentBench एक यथार्थवादी निष्पादन वातावरण बनाने के लिए OSWorld फ्रेमवर्क का विस्तार करता है:
- OS: Ubuntu जिसमें पायथन और डेटा-साइंस लाइब्रेरी पहले से इंस्टॉल हैं।
- टूल्स: Visual Studio Code, Jupyter Notebook, Chrome, और Kaggle/OpenML API तक पहुंच।
- ऑब्जर्वेशन स्पेस: एजेंटों को या तो 1920×1080 स्क्रीनशॉट या एक हाइब्रिड स्क्रीनशॉट + एक्सेसिबिलिटी ट्री (A11y) मोडैलिटी प्राप्त होती है, जो संरचित UI मेटाडेटा (रोल्स, बाउंडिंग बॉक्स, इंटरेक्शन स्टेट्स) प्रदान करती है।
- एक्शन स्पेस: एजेंट GUI क्रियाओं (माउस क्लिक, कीबोर्ड इनपुट) और मेटा-एक्शन (WAIT, DONE, FAIL) के माध्यम से इंटरैक्ट करते हैं। वातावरण प्रत्येक क्रिया के बाद स्टेट ट्रांजिशन को कैप्चर करता है।
मूल्यांकित मॉडल
लेखकों ने 15 क्लोज्ड-सोर्स और ओपन-सोर्स एजेंटों का मूल्यांकन किया, जिनमें शामिल हैं:
- क्लोज्ड-सोर्स: GPT-4o, GPT-5 (और मिनी), O4-mini, Claude Sonnet 4/4.5/4.6, Gemini 2.5 Pro, और OpenAI का कंप्यूटर एजेंट।
- ओपन-सोर्स: UI-TARS (2B/7B), GUI-OWL-7B, OpenCUA-72B, और हाइब्रिड मॉडल (Jedi जिसे GPT-4o के साथ जोड़ा गया है)।
मुख्य परिणाम
समग्र प्रदर्शन
प्रयोग वर्तमान एजेंटिक सिस्टमों और वास्तविक डेटा-साइंस वर्कफ्लो की मांगों के बीच एक पर्याप्त क्षमता अंतर प्रकट करते हैं:
- सबसे मजबूत एजेंट: Claude-4.6-Sonnet ने स्क्रीनशॉट + A11y ट्री सेटिंग के तहत 56.70% कार्य सफलता के साथ उच्चतम प्रदर्शन हासिल किया।
- अन्य क्लोज्ड-सोर्स मॉडल: अन्य मॉडलों के लिए प्रदर्शन काफी गिर गया, GPT-5 29.81% पर था और अन्य (GPT-4o, Gemini-2.5-Pro) लगभग 20% के आसपास थे।
- ओपन-सोर्स मॉडल: सभी ओपन-सोर्स एजेंटों ने 1% से कम सफलता प्राप्त की, जो अक्सर टूल ऑर्केस्ट्रेशन, OS ग्राउंडिंग और मल्टी-स्टेप रीजनिंग में विफल रहे।
- मानव बेसलाइन: मानव विशेषज्ञों ने 85.09% सफलता दर हासिल की, जो सबसे मजबूत AI एजेंटों के लिए भी शेष अंतर को उजागर करती है।
एब्लेशन और एरर एनालिसिस (Ablation and Error Analysis)
- कार्य जटिलता: कठिनाई के साथ प्रदर्शन निरंतर घटता है। "हार्ड" कार्य (5+ स्टेप्स) सबसे चुनौतीपूर्ण बने हुए हैं। मल्टी-स्टेज वर्कफ्लो (56.7% कार्य) सिंगल-स्टेज कार्यों की तुलना में काफी कठिन हैं क्योंकि इसके लिए स्टेट मेंटेनेंस और एरर रिकवरी की आवश्यकता होती है।
- टूल उपयोग: Jupyter Notebook में निष्पादित कार्यों ने VS Code की तुलना में बेहतर प्रदर्शन किया, जिसका मुख्य कारण टर्मिनल और एनवायरनमेंट संबंधी कम विफलताएं थीं।
- ऑब्जर्वेशन मोडैलिटी: A11y ट्री जानकारी जोड़ने से आम तौर पर प्रदर्शन में सुधार हुआ, जिससे पता चलता है कि संरचित UI मेटाडेटा ग्राउंडिंग में मदद करता है, हालांकि लाभ मॉडल के अनुसार भिन्न थे।
- विफलता के प्रकार (Failure Modes):
- ओपन-सोर्स एजेंट लगभग विशेष रूप से (97–98%) ग्राउंडिंग त्रुटियों (डेस्कटॉप स्टेट के साथ निर्देशों को संरेखित करने में असमर्थता) के कारण विफल हुए।
- मजबूत क्लोज्ड-सोर्स एजेंटों ने मिश्रित विफलताएं प्रदर्शित कीं, जिनमें टर्मिनल त्रुटियां, कोड जनरेशन दोष और रीजनिंग की कमियां शामिल थीं।
- टेम्पोरल स्ट्रक्चर: ओपन-सोर्स और कमजोर मॉडल अक्सर शुरुआती चरणों में विफल हुए (टर्मिनल खोलने में असमर्थता), जबकि मजबूत मॉडल लंबे समय तक अप्रभावी खोज के बाद बाद के चरणों में विफल होते दिखे।
- बजट संवेदनशीलता: इंटरैक्शन बजट को 15 से बढ़ाकर 50 स्टेप्स करने से केवल मामूली लाभ (24.54% 25.81%) हुआ, जो दर्शाता है कि विफलताएं मुख्य रूप से स्टेप लिमिट के कारण नहीं बल्कि प्लानिंग और रीजनिंग में मौलिक समस्याओं के कारण हैं।
महत्व और दावे
यह पेपर DSAgentBench को ग्राउंडेड, वेरीफिएबल और स्वायत्त डेटा-साइंस एजेंट विकसित करने के लिए एक मौलिक संसाधन के रूप में स्थापित करता है। इसके प्राथमिक योगदान हैं:
- पहला रियल-OS बेंचमार्क: यह एक फंक्शनिंग ऑपरेटिंग सिस्टम के भीतर स्वायत्त डेटा-साइंस वर्कफ्लो का मूल्यांकन करने वाला पहला बेंचमार्क है, जो डेटा अधिग्रहण से लेकर सत्यापन तक के पूर्ण जीवनचक्र को कवर करता है।
- एक्जीक्यूशन-आधारित मूल्यांकन: यह मूल्यांकन प्रतिमान को "कोड शुद्धता" से बदलकर "विश्लेषणात्मक शुद्धता" में ले जाता है, जिसके लिए एजेंटों को वैध आर्टिफैक्ट्स (विज़ुअलाइज़ेशन, मॉडल, रिपोर्ट) उत्पन्न करने की आवश्यकता होती है जिन्हें नियत स्क्रिप्टों द्वारा सत्यापित किया जाता है।
- अंतर को उजागर करना: परिणाम वर्तमान एजेंटिक सिस्टमों की एक महत्वपूर्ण सीमा को उजागर करते हैं, यह प्रदर्शित करते हुए कि सबसे मजबूत मॉडल भी वास्तविक डेटा विज्ञान के लिए आवश्यक टूल समन्वय, लॉन्ग-होरिज़न रीजनिंग और OS ग्राउंडिंग के साथ संघर्ष करते हैं।
- भविष्य की दिशा: विशिष्ट विफलता मोड (ग्राउंडिंग, प्लानिंग, टूल ऑर्केस्ट्रेशन) की पहचान करके, यह बेंचमार्क वास्तविक दुनिया के डेटा विज्ञान कार्यों को करने में सक्षम एजेंटों के निर्माण के उद्देश्य से भविष्य के अनुसंधान के लिए एक स्पष्ट रोडमैप प्रदान करता है।
लेखक इस डोमेन में आगे के शोध को सुगम बनाने के लिए बेंचमार्क को https://github.com/vis-nlp/DSAgentBench पर रिलीज़ करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।