← नवीनतम पेपर
🌿 ecology

Scrub Data: A Framework for Reproducible Data Curation with AI Coding Agents

यह शोध पत्र स्क्रब डेटा (Scrub Data) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो डेटा क्यूरेशन के लिए एआई कोडिंग एजेंटों का लाभ उठाता है और एक प्रोवेनेंस ग्राफ (provenance graph) के माध्यम से पुनरुत्पादकता और सत्यापन क्षमता सुनिश्चित करता है जो सभी रूपांतरणों को निष्पादन योग्य चरणों के रूप में ट्रैक करता है, जिसे 89 मिलियन कच्चे जीपीएस निर्देशांकों को एक क्यूरेटेड बेंचमार्क डेटासेट में कम करके प्रदर्शित किया गया है।

मूल लेखक: Kay, J., Bar, S., Beery, S.

प्रकाशित 2026-09-23
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kay, J., Bar, S., Beery, S.

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

डेटा साइंस की कल्पना अक्सर जटिल एल्गोरिदम और भविष्य कहने वाले मॉडलों के क्षेत्र के रूप में की जाती है, लेकिन किसी भी मॉडल को प्रशिक्षित करने से पहले, कच्चे माल को तैयार करने के लिए बहुत सारा काम करना पड़ता है। यह तैयारी का चरण, जिसे डेटा क्यूरेशन (data curation) कहा जाता है, इसमें वास्तविक दुनिया से अव्यवस्थित जानकारी एकत्र करना, त्रुटियों को ठीक करना और इसे एक ऐसे प्रारूप में व्यवस्थित करना शामिल है जिसे कंप्यूटर समझ सकें। यह एक उबाऊ और समय लेने वाली प्रक्रिया है जहाँ एक छोटी सी गलती—जैसे कि संख्याओं की गलत पंक्ति को हटा देना या किसी तारीख को गलत समझना—पूरे अध्ययन को बर्बाद कर सकती है। वर्षों से, वैज्ञानिक इस काम को संभालने के लिए मैन्युअल प्रयास या कठोर स्क्रिप्ट पर निर्भर रहे हैं, जिससे यह सुनिश्चित होता है कि प्रत्येक परिवर्तन को दर्ज किया जाए ताकि अन्य लोग इस प्रक्रिया को बिल्कुल वैसे ही दोहरा सकें। हालाँकि, आर्टिफिशियल इंटेलिजेंस के उदय ने एक नया, लुभावना शॉर्टकट पेश किया है: कंप्यूटर प्रोग्राम से अपने लिए सफाई करने के लिए कहना। जबकि ये AI एजेंट अविश्वसनीय गति से कोड लिख सकते हैं और कार्य कर सकते हैं, वे पारदर्शिता के खतरनाक अभाव के साथ काम करते हैं। यदि कोई AI फ़ाइल को हटा देता है या डेटासेट को बिना कोई स्पष्ट निशान छोड़े बदल देता है, तो परिणामों को सत्यापित या पुनरुत्पादित करना असंभव हो जाता है, जिससे वैज्ञानिक खोज एक 'ब्लैक बॉक्स' बन जाती है जहाँ कच्चे डेटा से अंतिम निष्कर्ष तक का मार्ग खो जाता है।

इस समस्या को हल करने के लिए, MIT के शोधकर्ताओं ने 'स्क्रब डेटा' (Scrub Data) नामक एक नया ढांचा विकसित किया है, जिसे वैज्ञानिकों को डेटा सफाई के लिए शक्तिशाली AI एजेंटों का उपयोग करने देने के लिए डिज़ाइन किया गया है, बिना उनके काम की जांच करने की क्षमता से समझौता किए। यह प्रणाली AI के लिए एक सख्त पर्यवेक्षक के रूपas कार्य करती है, यह सुनिश्चित करती है कि डेटासेट में किया गया प्रत्येक परिवर्तन एक स्थायी इतिहास लॉग में एक स्व-निहित, निष्पादन योग्य चरण के रूप में दर्ज किया जाए। AI को फाइलों में स्वतंत्र रूप से घूमने और बिना किसी निशान के संपादन करने की अनुमति देने के बजाय, यह ढांचा एजेंट को एक विशिष्ट स्क्रिप्ट प्रस्तावित करने, उसे एक नियंत्रित प्रणाली के माध्यम से चलाने और फिर परिणाम को लॉग करने के लिए मजबूर करता है। यह घटनाओं की एक स्पष्ट, अटूट श्रृंखला बनाता है, जो बिल्कुल एक हवाई जहाज के फ्लाइट रिकॉर्डर की तरह है, जहाँ कच्चे डेटा के संग्रह से लेकर अंतिम, पॉलिश किए गए डेटासेट तक की हर कार्रवाई का दस्तावेजीकरण किया जाता है। इस प्रणाली में एक विज़ुअल इंटरफ़ेस भी शामिल है जो मानव शोधकर्ताओं को वास्तविक समय में डेटा देखने, त्रुटियों को पहचानने के लिए कस्टम उपकरण बनाने और यह सत्यापित करने की अनुमति देता है कि AI के परिवर्तन स्थायी रूप से सहेजने से पहले तर्कसंगत हैं या नहीं।

शोधकर्ताओं ने इस दृष्टिकोण का परीक्षण एक कठिन और विशाल परियोजना को हल करके किया: पशु आंदोलन पारिस्थितिकी (animal movement ecology) में एक मानकीकृत बेंचमार्क डेटासेट बनाना जिसे MOVEBENCH कहा जाता है। उन्होंने वन्यजीव ट्रैकिंग अध्ययनों से 89 मिलियन कच्चे GPS निर्देशांकों के एक अराजक संग्रह से शुरुआत की, जो विभिन्न प्रारूपों और गुणवत्ता वाले सैकड़ों अलग-अलग स्रोतों से एकत्र किए गए थे। लक्ष्य इस डेटा को 110 प्रजातियों के 807 व्यक्तिगत जानवरों से 2.6 मिलियन बिंदुओं के एक उपयोगी सेट तक साफ करना था, जो जानवरों की गति का अनुमान लगाने के लिए मशीन लर्निंग मॉडल को प्रशिक्षित करने के लिए उपयुक्त हो। स्क्रब डेटा ढांचे का उपयोग करते हुए, दो शोधकर्ताओं की एक टीम ने एक AI एजेंट के साथ मिलकर सूचना के इस पहाड़ को नेविगेट किया। एजेंट ने उन्हें खराब टाइमस्टैम्प को फ़िल्टर करने, बहुत बार रिकॉर्ड किए गए डेटा को कम करने और विभिन्न अध्ययनों से प्रतिनिधि जानवरों का चयन करने के लिए स्क्रिप्ट लिखने में मदद की। महत्वपूर्ण रूप से, एजेंट द्वारा लिया गया प्रत्येक निर्णय एक वर्शन हिस्ट्री ग्राफ में कैप्चर किया गया था। यदि टीम यह जानना चाहती थी कि किसी विशिष्ट जानवर के स्थान की गणना कैसे की गई, या किसी विशेष अध्ययन को क्यों बाहर रखा गया, तो वे उस निर्णय को लेने के लिए उपयोग किए गए सटीक कोड और तर्क का पता लगा सकती थीं।

पूरी प्रक्रिया के दौरान, मानव शोधकर्ता नियंत्रण में रहे, इस ढांचे का उपयोग करके कस्टम विज़ुअलाइज़ेशन टूल बनाए जिससे वे मानचित्र पर जानवरों के रास्तों को देख सके और विसंगतियों की जाँच कर सके। जब AI ने एक बदलाव का सुझाव दिया, जैसे कि अमान्य तिथियों वाली पंक्तियों को हटाना, तो सिस्टम कोड को निष्पादित करेगा, परिणाम दिखाएगा और नए संस्करण को सहेजने से पहले पुष्टि के लिए पूछेगा। इस लूप ने टीम को तेजी से आगे बढ़ने की अनुमति दी, जिससे वे वैज्ञानिक अनुसंधान के लिए आवश्यक कठोर मानकों को बनाए रखते हुए दोहराव वाले कार्यों को संभालने के लिए AI की गति का लाभ उठा सके। अंतिम परिणाम एक स्वच्छ, पुनरुत्पादित डेटासेट था जिसे केवल तीन दिनों में तैयार किया गया था, एक ऐसा कार्य जिसे पारंपरिक मैन्युअल तरीकों का उपयोग करके हफ्तों या महीनों में किया जाता। क्यूरेशन प्रक्रिया का पूरा इतिहास, प्रारंभिक कच्ची फाइलों से लेकर अंतिम बेंचमार्क तक, निष्पादन योग्य चरणों के एक सेट के रूप में संरक्षित किया गया था, जिससे यह सुनिश्चित हुआ कि कोई भी अन्य वैज्ञानिक प्रक्रिया को फिर से चला सके और बिल्कुल वही परिणाम प्राप्त कर सके।

इस परियोजना की सफलता इस बात पर प्रकाश डालती है कि वैज्ञानिक उपकरणों के निर्माण के तरीके में क्या बदलाव आया है। AI को मानव निर्णय के विकल्प के रूप में देखने के बजाय, स्क्रब डेटा ढांचा इसे एक शक्तिशाली सहायक के रूप में मानता है जिसे एक पारदर्शी, ऑडिट योग्य संरचना के भीतर काम करना चाहिए। AI की कोड लिखने की क्षमता को डेटा फाइलों के प्रत्यक्ष संशोधन से अलग करके, यह प्रणाली "वाइब क्यूरेशन" (vibe curation) के दृष्टिकोण को रोकता है, जहाँ उपयोगकर्ता सत्यापन के बिना AI आउटपुट पर अंधा विश्वास करते हैं। इसके बजाय, यह एक ऐसी कार्यप्रणाली लागू करता है जहाँ प्रत्येक संशोधन एक जानबूझकर लिया गया, रिकॉर्ड किया गया चरण है। यह दृष्टिकोण मानवीय विशेषज्ञता की आवश्यकता को समाप्त नहीं करता है; वास्तव में, यह उस पर निर्भर करता है। शोधकर्ताओं को अभी भी यह तय करना था कि किन जानवरों को रखना है, लापता डेटा को कैसे संभालना है, और अंतिम डेटासेट कैसा दिखना चाहिए। ढांचा केवल यह सुनिश्चित करता है कि AI का योगदान विश्वसनीय है और कच्चे अवलोकन से वैज्ञानिक अंतर्दृष्टि तक का मार्ग स्पष्ट और निरीक्षण के लिए खुला बना रहे।

यह कार्य सुझाव देता है कि डेटा विज्ञान का भविष्य मानव सटीकता और मशीन की गति के बीच चयन करने के बारे में नहीं है, बल्कि उन्हें सुरक्षित रूप से एकीकृत करने का एक तरीका खोजने के बारे में है। स्क्रब डेटा ढांचा वैज्ञानिक पद्धति को बरकरार रखते हुए AI एजेंटों की दक्षता का लाभ उठाने का एक व्यावहारिक तरीका प्रदान करता है। यह सिद्ध करता है कि परिणामों को ट्रेस करने, सत्यापित करने और पुनरुत्पादित करने की क्षमता को खोए बिना डेटा सफाई के उबाऊ हिस्सों को स्वचालित करना संभव है। जैसे-जैसे पारिस्थितिकी, चिकित्सा और जलवायु विज्ञान जैसे क्षेत्रों में डेटा की मात्रा बढ़ती जा रही है, इस तरह के उपकरण आधुनिक अनुसंधान के प्रबंधन के लिए आवश्यक होंगे। यह ढांचा अब अन्य वैज्ञानिकों के लिए उपयोग करने और अनुकूलित करने के लिए उपलब्ध है, जो अपने स्वयं के कस्टम डेटा क्यूरेशन वर्कफ़्लो बनाने के लिए एक आधार प्रदान करता है। डेटा सफाई की प्रक्रिया को पारदर्शी और पुनरुत्पादित बनाकर, शोधकर्ता एक ऐसी नई पीढ़ी की वैज्ञानिक खोज को सक्षम बनाने की आशा करते हैं जो तेज़ भी हो और अधिक विश्वसनीय भी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →