Agentic coding without the cloud: evaluating open-weight large language models on longitudinal data preparation tasks
यह शोध पत्र एक ओपन-सोर्स फ्रेमवर्क प्रस्तुत करता है जो यह प्रदर्शित करता है कि स्थानीय रूप से तैनात, ओपन-वेट लार्ज लैंग्वेज मॉडल्स (विशेष रूप से 31-35B पैरामीटर वाले मॉडल) उपभोक्ता-ग्रेड हार्डवेयर पर अनुदैर्ध्य डेटा तैयारी कार्यों को प्रभावी ढंग से स्वचालित कर सकते हैं, जो संवेदनशील व्यक्तिगत डेटा से जुड़े अनुसंधान के लिए क्लाउड-आधारित एआई का एक व्यवहार्य, गवर्नेंस-अनुपालन विकल्प प्रदान करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे एक जासूस हैं, लेकिन सुरागों को देखने से पहले ही आपको पुराने बक्सों, फटे हुए नोट्स और बेमेल फाइलों से भरी एक बिखरी हुई अटारी को व्यवस्थित करने में तीन महीने बिताने पड़ते हैं। विज्ञान की दुनिया में—विशेष रूप से यह अध्ययन करते समय कि लोगों के जीवन में समय के साथ कैसे बदलाव आते हैं—शोधकर्ता अपना बहुत सारा समय केवल इस "अटारी की सफाई" करने में बिताते हैं। उन्हें सर्वेक्षणों से कच्चा डेटा लेना होता है, टाइपिंग की गलतियों को ठीक करना होता है, विभिन्न वर्षों के उत्तरों को आपस में मिलाना होता है, और भ्रमित करने वाले कोड को स्पष्ट संख्याओं में बदलना होता है। यह उबाऊ है, इसमें बहुत समय लगता है, और यदि आप एक छोटी सी गलती भी करते हैं, तो आपकी पूरी जांच गलत हो सकती है।
हाल ही में, "लार्ज लैंग्वेज मॉडल्स" (LLMs) नामक स्मार्ट कंप्यूटर प्रोग्राम इस सफाई को स्वचालित रूप से करने के लिए कोड लिखने में बहुत कुशल हो गए हैं। लेकिन इसमें एक पेंच है: अधिकांश ये अति-बुद्धिमान प्रोग्राम क्लाउड में रहते हैं, जो दूर स्थित एक विशाल पुस्तकालय की तरह है। यदि आप वास्तविक लोगों के बारे में संवेदनशील जानकारी (जैसे स्वास्थ्य रिकॉर्ड या निजी सर्वेक्षण उत्तर) का अध्ययन कर रहे हैं, तो नियम कहते हैं कि आप उस डेटा को किसी दूर स्थित क्लाउड लाइब्रेरी में नहीं भेज सकते। यह बिल्कुल वैसा ही है जैसे आपको अपनी डायरी किसी अजनबी को डाक से भेजने से मना कर दिया गया हो। इसलिए, वैज्ञानिक इन सहायक उपकरणों का उपयोग करने में असमर्थ रहे क्योंकि वे अपने सुरक्षित, स्थानीय कंप्यूटरों को छोड़कर बाहर नहीं जा सकते। यह शोध पत्र एक सरल लेकिन कठिन प्रश्न पूछता है: क्या हम एक ऐसा "स्मार्ट असिस्टेंट" बना सकते हैं जो पूरी तरह से हमारे अपने कंप्यूटरों पर रहता है, डेटा कहीं बाहर नहीं भेजता, और फिर भी शोध डेटा की सफाई का कठिन काम पूरी तरह से कर सकता है?
इस शोध पत्र के लेखकों ने यह पता लगाने का निर्णय लिया कि इन स्थानीय एआई सहायकों के लिए एक विशेष परीक्षण ट्रैक बनाकर। उन्होंने एक "ग्राउंड ट्रुथ" डेटासेट बनाया, जो एक मास्टर कुंजी या एक पूर्ण उत्तर पुस्तिका की तरह है, जो यूके में युवाओं के एक दीर्घकालिक अध्ययन "नेक्स्ट स्टेप्स" के वास्तविक डेटा पर आधारित है। उन्होंने डेटा को साफ करने के विशाल कार्य को 20 विशिष्ट कार्यों में विभाजित किया, जैसे कि किसी व्यक्ति के नौकरी के इतिहास को समझने के लिए विभिन्न वर्षों की जानकारी को जोड़ना या उनके बॉडी मास इंडेक्स (BMI) की गणना करना। इसके बाद, उन्होंने एक "एजेंट" स्थापित किया—एक छोटा सा एआई रोबोट जो ओपन-सोर्स मॉडल द्वारा संचालित है जो सामान्य, उपभोक्ता-ग्रेड कंप्यूटरों (जैसे कि एक शक्तिशाली गेमिंग लैपटॉप या एक हाई-एंड मैक) पर चल सकता है) पर चल सकता है—और उसे डेटा को साफ करने के लिए कोड लिखने की कोशिश करते हुए देखा।
परिणाम आश्चर्यजनक रूप से उत्साहजनक थे। सबसे अच्छा प्रदर्शन करने वाले एआई मॉडल, जो काफी बड़े हैं और जिनके लिए शक्तिशाली हार्डवेयर की आवश्यकता होती है, लगभग 87.9% कार्यों को "काफी हद तक सही" करने में सफल रहे और बिना किसी मानवीय सहायता के एक ही प्रयास में 75% कार्यों को पूरी तरह से पूरा कर लिया। शोध पत्र में पाया गया कि ये स्थानीय मॉडल स्पष्ट, सार्वभौमिक परिभाषाओं वाली चीजों को संभालने में अविश्वसनीय रूप से अच्छे हैं, जैसे कि BMI की गणना करना या किसी के लिंग की पहचान करना। हालांकि, वे जटिल, सर्वेक्षण-विशिष्ट पहेलियों के साथ अधिक संघर्ष करते हैं, जैसे कि जटिल आवास स्थितियों या आय श्रेणियों को समझना जो उस वर्ष के विशिष्ट सर्वेक्षण के नियमों के आधार पर बदल जाती हैं।
महत्वपूर्ण रूप से, यह शोध पत्र दिखाता है कि हालांकि एआई बहुत अच्छा हो रहा है, लेकिन यह अभी भी पूर्ण नहीं है। शोधकर्ताओं ने पाया कि भले ही एआई ने ऐसा डेटा तैयार किया जो सतह पर सही दिखता था, फिर भी सूक्ष्म छिपी हुई त्रुटियां अंदर आ सकती थीं। उदाहरण के लिए, एक कमजोर मॉडल ने गलती से एक "लापता" (missing) कोड को "शून्य" (zero) के रूप में बदल दिया, जिसने आय के अध्ययन के परिणामों को पूरी तरह से बदल दिया, जिससे एक नकारात्मक रुझान सकारात्मक में बदल गया। यह सुझाव देता है कि भले ही ये स्थानीय एआई उपकरण काम को तेज करने के लिए "कोडिंग कोपायलट" के रूप में उपयोग किए जाने के लिए पर्याप्त शक्तिशाली हैं, फिर भी उन्हें अपना होमवर्क दोबारा जांचने के लिए एक मानव शोधकर्ता की आवश्यकता होती है। शोध पत्र निष्कर्ष निकालता है कि हमें मदद पाने के लिए अपने संवेदनशील डेटा को क्लाउड पर भेजने की आवश्यकता नहीं है; सही स्थानीय हार्डवेयर और ओपन-सोर्स मॉडल के साथ, हम डेटा की तैयारी के भारी काम को करने के लिए एआई का उपयोग करते हुए भी अपने डेटा को सुरक्षित और निजी रख सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।