Repairing vulnerabilities without invisible hands. A differentiated replication study on LLMs
यह शोध पत्र एक विभेदित प्रतिकृति अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि स्वचालित भेद्यता सुधार (vulnerability repair) में लार्ज लैंग्वेज मॉडल्स की सफलता वास्तविक तर्क के बजाय प्रशिक्षण डेटा के स्मृतिकरण (memorization) द्वारा संचालित हो सकती है, क्योंकि प्रॉम्प्ट्स में दोष के स्थान (fault location) को बदलने से सही पैच उत्पन्न करने की उनकी क्षमता काफी कम हो जाती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े अहंकारी छात्र को एक टूटी हुई मशीन ठीक करना सिखाने की कोशिश कर रहे हैं। आप उसे मशीन दिखाते हैं, ठीक उस टूटे हुए हिस्से की ओर इशारा करते हैं, और पूछते हैं, "क्या तुम इसे ठीक कर सकते हो?"
छात्र मशीन को देखता है, एक सेकंड के लिए सोचता है, और आपको एक सटीक मरम्मत (repair) थमा देता है। आप खुशी से झूम उठते हैं! लेकिन फिर आप सोचने लगते हैं: क्या छात्र ने वास्तव में मशीनें ठीक करना सीखा है, या उसने केवल उस विशिष्ट समस्या का उत्तर रट लिया है जो उसने पहले किसी किताब से पढ़ी थी?
यह पेपर लार्ज लैंग्वेज मॉडल्स (LLMs) और कंप्यूटर सुरक्षा खामियों (vulnerabilities) को ठीक करने की उनकी क्षमता के बारे में एक "संदिग्ध जासूसी कहानी" (skeptical detective story) है। लेखक, मारिया कैंपोरेसे और फैबियो मैसासी, संदेह करते हैं कि अब तक हमने जो अद्भुत परिणाम देखे हैं, वे एक चाल हो सकती है। वे इन चालों को "अदृश्य हाथ" (invisible hands) कहते हैं।
यहाँ उनके अन्वेषण का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
तीन "अदृश्य हाथ" (संदिग्ध)
लेखकों का मानना है कि तीन छिपे हुए कारक इन AI मॉडल्स को वास्तव में स्मार्ट दिखने में मदद कर रहे हैं:
"लीकी टेक्स्टबुक" (डेटा लीकेज - Data Leakage):
कल्पना कीजिए कि छात्र एक परीक्षा दे रहा है, लेकिन उत्तर गलती से टेस्ट पेपर के पीछे छपे हुए हैं, और छात्र ने परीक्षा से पहले उसी पेपर का अध्ययन किया था। AI की दुनिया में, "टेक्स्टबुक" बग्स और फिक्स का डेटासेट है। यदि AI को ठीक उन्हीं बग्स पर प्रशिक्षित किया गया है जिन्हें अब उससे ठीक करने के लिए कहा जा रहा है, तो वह कुछ भी "मरम्मत" नहीं कर रहा है; वह केवल एक रटा हुआ उत्तर दोहरा रहा है।"परफेक्ट जीपीएस" (परफेक्ट लोकलाइजेशन - Perfect Localization):
आमतौर पर, जब हम किसी AI को बग ठीक करने के लिए कहते हैं, तो हम उसे ठीक-ठीक बताते हैं कि कोड की कौन सी लाइन टूटी हुई है। यह वैसा ही है जैसे किसी छात्र को एक नक्शा देना जिस पर टूटे हुए गियर के ठीक ऊपर एक बड़ा लाल "X" बना हो। लेखक संदेह करते हैं कि यदि आप वह "X" हटा दें या उसे गलत गियर पर रख दें, तो छात्र भ्रमित हो सकता है। यदि AI वास्तव में स्मार्ट है, तो उसे अभी भी टूटा हुआ हिस्सा ढूंढ लेना चाहिए, भले ही आपने गलत जगह इशारा किया हो। यदि वह विफल रहता है, तो वह केवल "X" का अनुसरण कर रहा था, मशीन को समझ नहीं रहा था।"खाली स्थान भरें" वाली ट्रिक (कम्प्लीशन बनाम रिपेयर - Completion vs. Repair):
कभी-कभी, जिस तरह से हम AI को कोड ठीक करने के लिए कहते हैं, वह "मैड लिब्स" (Mad Libs) खेल जैसा होता है। हम टूटे हुए हिस्से को हटा देते हैं और कहते हैं, "खाली स्थान भरें।" क्योंकि AI वाक्य में अगले शब्द का अनुमान लगाने में बहुत अच्छा है, इसलिए वह केवल इसलिए सही सुधार का अनुमान लगा सकता है क्योंकि वह सबसे आम शब्द है जो वहां फिट बैठता है, न कि इसलिए कि वह तर्क (logic) को समझता है।
प्रयोग: "विस्थापित जीपीएस" टेस्ट (The "Displaced GPS" Test)
अपने सिद्धांत को सिद्ध करने के लिए, लेखकों ने एक चतुर प्रयोग तैयार किया। उन्होंने एक मानक परीक्षण लिया जहाँ AI सुरक्षा बग्स को ठीक करता है और उसमें एक ट्विस्ट जोड़ दिया: उन्होंने जानबूझकर AI से झूठ बोला।
- सेटअप: उन्होंने AI को बताया, "बग लाइन 10 पर है।"
- ट्विस्ट: वास्तव में, उन्होंने AI को बताया कि बग लाइन 12 पर, या लाइन 14 पर, या लाइन 8 पर है। उन्होंने "लोकेशन" को बदल दिया।
परिकल्पना (Hypothesis):
- यदि AI एक "प्रतिभा" है (सामान्यीकरण/Generalizing): तो इसे कोड को देखना चाहिए, यह समझना चाहिए कि बग वास्तव में कहीं और है, और सही ढंग से इसे ठीक करना चाहिए, चाहे आपने कहीं भी इशारा किया हो।
- यदि AI एक "धोखेबाज" है (रटने वाला/Memorizing): तो वह आपके गलत संकेत को अनदेखा कर देगा, अपने "मेमोरी बैंक" को देखेगा, और उस उत्तर को उगल देगा जिसे उसने मूल समस्या के लिए याद किया था। या, यदि पॉइंटर बहुत दूर है, तो वह भ्रमित हो जाएगा और पूरी तरह विफल हो जाएगा।
लेखक भविष्यवाणी करते हैं कि यदि AI केवल रट रहा है, तो वह वही परिणाम देगा चाहे आप सही जगह इशारा करें या 8 लाइन दूर के स्थान पर। यह एक ऐसे छात्र की तरह है जो जानता है कि उत्तर "42" है और वह हर उस सवाल के लिए "42" ही लिखेगा जो थोड़ा बहुत परिचित लगता है।
"दूसरी राय" (द रिव्यूअर - The Reviewer)
लेखकों ने एक दूसरे AI को "रिव्यूअर" के रूप में भी जोड़ा। पहले AI द्वारा कोड को ठीक करने के बाद, दूसरा AI जाँच करता है कि वह सही है या नहीं।
- सिद्धांत: यदि पहला AI केवल उत्तर रट रहा है, तो दूसरा AI (जिसने भी वही उत्तर रटे हैं) बहुत अच्छा होगा कि वह "सही" रटे हुए फिक्स को पहचान सके और गलत वाले को खारिज कर सके।
- टेस्ट: यदि आप निर्देशों को बिगाड़ देते हैं (अदृश्य हाथ को हटा दिया जाता है), तो दूसरा AI अचानक भ्रमित हो जाना चाहिए और सही फिक्स तथा गलत फिक्स के बीच अंतर करने में असमर्थ हो जाना चाहिए।
वे क्या कर रहे हैं
वे जावा कोड की कमजोरियों (vulnerabilities) के एक डेटासेट पर यह परीक्षण चला रहे हैं। वे:
- लक्ष्य को स्थानांतरित कर रहे हैं: AI को गलत जगह पर बग होने के बारे में बता रहे हैं।
- भाषा बदल रहे हैं: वेरिएबल्स के नाम बदल रहे हैं ताकि AI उन शब्दों से मिलान न कर सके जिन्हें उसने रटा है।
- काम की जाँच कर रहे हैं: यह देखने के लिए कि क्या फिक्स वास्तव में काम करता है, वे ऑटोमेटेड टेस्ट और मानव विशेषज्ञों का उपयोग कर रहे हैं।
लक्ष्य
वे यह नहीं कह रहे हैं कि AI बेकार है। वे यह जानना चाहते हैं: क्या AI वास्तव में सुरक्षा खामियों को ठीक करना सीख रहा है, या वह केवल एक तोते की तरह वही दोहरा रहा है जो उसने ट्रेनिंग के दौरान सुना था?
यदि उन्हें पता चलता है कि बग की लोकेशन बदलने से AI की सफलता दर में कोई बदलाव नहीं आता है, तो यह साबित करता है कि AI केवल रटकर धोखाधड़ी कर रहा है। यदि निर्देशों के साथ छेड़छाड़ करने पर सफलता दर गिर जाती है, तो इसका मतलब है कि AI वास्तव में समस्या को समझने की कोशिश कर रहा है।
संक्षेप में: यह पेपर AI कोड रिपेयर के लिए एक "झूठ पकड़ने वाला टेस्ट" (lie detector test) है, जिसे वास्तविक बुद्धिमत्ता और चतुर रटने की क्षमता के बीच अंतर करने के लिए डिज़ाइन किया गया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।