To Add Is Machine, To Delete Is Human: Measuring and Mitigating Deletion Avoidance in LLM Code Editing
यह शोध पत्र प्रमुख लार्ज लैंग्वेज मॉडल्स में एक व्यवस्थित "डिलीशन अवॉयडेंस" (हटाने से बचने के) पूर्वाग्रह की पहचान और मात्रा निर्धारित करता है जो उन्हें संपादन के दौरान कोड को हटाने के बजाय उसे बनाए रखने के लिए प्रेरित करता है, यह प्रदर्शित करते हुए कि यह व्यवहार कोड की रखरखाव क्षमता को महत्वपूर्ण रूप से कम करता है और इसे लक्षित पोस्ट-ट्रेनिंग के माध्यम से कम किया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप कंप्यूटर कोड लिखने और उसे ठीक करने में मदद करने के लिए एक सुपर-स्मार्ट रोबोट सहायक को काम पर रख रहे हैं। आप उसे एक समस्या देते हैं, जैसे "यह बटन काम नहीं कर रहा है," और वह उसे ठीक करने की कोशिश करता है। सॉफ्टवेयर इंजीनियरिंग की दुनिया में, इस रोबोट को लार्ज लैंग्वेज मॉडल (LLM) कहा जाता है। ये मॉडल उन डिजिटल शेफ की तरह हैं जिन्होंने लाइब्रेरी की हर कुकबुक पढ़ ली है; वे शून्य से जटिल रेसिपी (कोड) तैयार कर सकते हैं। लेकिन यहाँ एक पेचीदा बात है: कभी-कभी, किसी रेसिपी को ठीक करने का मतलब केवल एक नया घटक जोड़ना नहीं होता; इसका मतलब पुराने, खराब हो चुके घटक को फेंक देना भी होता है। यदि रोबोट चीजों को फेंकने से बहुत डरता है, तो वह खराब घटक को वहीं रख सकता है और बस एक फैंसी नोट जोड़ सकता है कि, "इसे मत खाएं," बजाय इसके कि वास्तव में उसे हटा दिया जाए। यह शोध पत्र जांच करता है कि क्या ये AI रोबोट वास्तव में काम के इस "फेंकने वाले" हिस्से में अच्छे हैं, या वे बस कुछ भी डिलीट करने के लिए बहुत विनम्र हैं।
क्वीन्स यूनिवर्सिटी के शोधकर्ताओं ने इन AI कोडिंग सहायकों को एक बहुत ही विशिष्ट परीक्षण में डालने का निर्णय लिया। वे देखना चाहते थे कि क्या ये मॉडल "डिलीशन अवॉयडेंस" (हटाने से बचने की प्रवृत्ति) से जूझ रहे हैं। इसे एक होम रेनोवेशन (घर के नवीनीकरण) की तरह समझें जहाँ आपको कमरे को बड़ा करने के लिए एक दीवार ढहाना आवश्यक है। एक अच्छा ठेकेदार उस दीवार को गिरा देगा। एक बुरा ठेकेदार शायद उसके सामने एक पर्दा लगा देगा और कहेगा, "ठीक है, अब दीवार हट गई है," भले ही ईंटें अभी भी वहीं मौजूद हों। टीम ने पाया कि शीर्ष AI मॉडल वास्तव में दीवारें गिराने में बहुत खराब हैं। भले ही वे उन परीक्षणों में पास हो जाते हैं जो कहते हैं कि "कमरा ठीक हो गया है," वे अक्सर पुराने कोड को वहां छोड़ देते हैं, जो नए निर्देशों के पर्दे के पीछे छिपा होता है।
यह शोध पत्र एक नया बेंचमार्क पेश करता है जिसे CanItDelete कहा जाता है, जो इन रोबोटों के लिए एक "डिलीशन-ओनली" जिम की तरह है। उन्होंने सभी अन्य भ्रमित करने वाले कार्यों को हटा दिया और केवल मॉडलों से कोड की विशिष्ट पंक्तियों को डिलीट करने के लिए कहा। परिणाम चौंकाने वाले थे। यहाँ तक कि बेहतरीन AI मॉडल भी हर पांच में से लगभग एक बार कोड को सही ढंग से डिलीट करने में विफल रहे। जब उन्होंने डिलीट करने की कोशिश की, तो अक्सर वे बहुत अधिक डिलीट कर देते थे या अतिरिक्त बेकार कोड जोड़ देते थे। शोधकर्ताओं ने एक चालाक पैटर्न भी खोजा जिसे वे "गार्ड-एंड-गो" (Guard-and-Go) कहते हैं। टूटे हुए कोड के हिस्से को हटाने के बजाय, AI उसे रखता है लेकिन एक "गार्ड" (जैसे एक सुरक्षा गार्ड) जोड़ देता है जो कहता है, "यदि आप इस विशिष्ट प्रकार के उपयोगकर्ता हैं, तो टूटे हुए कोड को अनदेखा करें।" इससे परीक्षण पास हो जाते हैं क्योंकि टूटे हुए कोड का उपयोग नहीं किया जा रहा है, लेकिन अस्त-व्यस्त कोड अभी भी प्रोजेक्ट में गंदगी फैला रहा है।
इसे ठीक करने के लिए, टीम ने एक छोटा सा प्रयोग किया। उन्होंने एक AI मॉडल को विशेष रूप से चीजें डिलीट करना सिखाया, इसके लिए उन्हें हजारों उदाहरण दिखाए गए जहाँ कोड को हटाया जा रहा था। इस "प्रशिक्षण" ने मॉडल को डिलीट करने में बहुत बेहतर बनाया, जिससे उसकी गलतियाँ लगभग 14% कम हो गईं। यह सुझाव देता है कि समस्या यह नहीं है कि रोबोट डिलीट नहीं कर सकते; बल्कि यह है कि उन्हें इसकी पर्याप्त प्रैक्टिस नहीं कराई गई है। शोध पत्र निष्कर्ष निकालता है कि जबकि AI नया कोड लिखने में बहुत अच्छा हो रहा है, उसे अभी भी चीजों को छोड़ देने की कला सीखने की आवश्यकता है। जब तक ऐसा नहीं होता, मानव समीक्षकों को संभवतः उन डिजिटल कचरे की सफाई करनी होगी जो रोबोट पीछे छोड़ जाते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।