← नवीनतम पेपर
💻 computer science

Evaluating Large Language Models for Multilingual Vulnerability Detection at Dual Granularities

यह शोध पत्र सात प्रोग्रामिंग भाषाओं में फंक्शन और लाइन स्तरों पर बहुभाषी भेद्यता (vulnerability) का पता लगाने के लिए अत्याधुनिक प्री-ट्रेंड और लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने वाला एक व्यापक अनुभवजन्य अध्ययन प्रस्तुत करता है, जो यह प्रकट करता है कि इंस्ट्रक्शन-ट्यून्ड GPT-4o अन्य मॉडल्स की तुलना में काफी बेहतर प्रदर्शन करता है, विशेष रूप से उच्च-गंभीरता वाली और अद्वितीय बहुभाषी भेद्यताओं की पहचान करने में।

मूल लेखक: Honglin Shu, Michael Fu, Junji Yu, Dong Wang, Chakkrit Tantithamthavorn, Junjie Chen, Yasutaka Kamei

प्रकाशित 2026-03-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Honglin Shu, Michael Fu, Junji Yu, Dong Wang, Chakkrit Tantithamthavorn, Junjie Chen, Yasutaka Kamei

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, हलचल भरे अंतरराष्ट्रीय शहर के सुरक्षा प्रमुख हैं। यह शहर हजारों अलग-अलग वास्तुकारों द्वारा बनाया गया है जो सात अलग-अलग भाषाओं (जैसे C, Python, Java, Go, आदि) का उपयोग करके इन इमारतों का निर्माण करते हैं। आपका काम इन इमारतों में छिपे हुए जाल (कमियों/vulnerabilities) को ढूंढना है, इससे पहले कि अपराधी अंदर घुसने के लिए इनका उपयोग कर सकें।

वर्षों से, आप विशेष निरीक्षकों (जिसे Pre-trained Language Models या PLMs कहा जाता है) की एक टीम पर भरोसा करते आए हैं। ये निरीक्षक अनुभवी जासूसों की तरह हैं जिन्होंने लाखों ब्लूप्रिंट का अध्ययन किया है। वे विशिष्ट प्रकार की इमारतों में सामान्य जाल पहचानने में अच्छे हैं, लेकिन जब शहर बहुत जटिल हो जाता है या जब ब्लूप्रिंट अजीब बोलियों के मिश्रण में लिखे होते हैं, तो वे संघर्ष करते हैं।

हाल ही में, एक नए प्रकार के निरीक्षक आए हैं: सुपर-इंटेलिजेंट AI (जिसे Large Language Models या LLMs कहा जाता है)। ये प्रतिभाशाली लोगों की तरह हैं जिन्होंने केवल ब्लूप्रिंट ही नहीं, बल्कि लाइब्रेरी की हर किताब पढ़ी है। वे संदर्भ (context), चुटकुले और जटिल तर्क को समझ सकते हैं। लेकिन बड़ा सवाल यह था: क्या ये जीनियस, एक अराजक, बहुभाषी शहर में जाल खोजने में विशेष जासूसों से बेहतर हैं?

यह शोध पत्र एक विशाल प्रयोग का रिपोर्ट कार्ड है जो यह पता लगाने के लिए किया गया है। यहाँ हमने जो पाया, उसे सरल भाषा में समझाया गया है:

1. जाल खोजने के दो तरीके

शोधकर्ताओं ने निरीक्षकों का दो तरह से परीक्षण किया:

  • "पूरी इमारत" की जाँच (Function-Level): "क्या यह पूरा कमरा खतरनाक है?" यह एक त्वरित स्कैन है। यह कहना आसान है कि "हाँ, यह कमरा जोखिम भरा है," लेकिन यह जानना कठिन है कि ठीक कौन सा फर्श का तख्ता ढीला है।
  • "विशिष्ट फर्श के तख्ते" की जाँच (Line-Level): "कोड की ठीक कौन सी लाइन जाल है?" यह बहुत कठिन है। यह घास के ढेर में सुई खोजने जैसा है।

2. दावेदार

  • विशेषज्ञ (PLMs): CodeT5P जैसे मॉडल। वे उन जासूसों की तरह हैं जिन्होंने विशिष्ट बिल्डिंग कोड के नियमों को रट लिया है। वे विश्वसनीय हैं लेकिन नए या मिश्रित भाषाओं में भ्रमित हो सकते हैं।
  • जीनियस (LLMs): GPT-4o, Llama 3, और Code Llama जैसे मॉडल। वे बुद्धिमान हैं, लेकिन उन्हें बताया जाना चाहिए कि कैसे काम करना है।
    • Zero-Shot: "बस जाकर जाल ढूंढो।" (AI सामान्य ज्ञान के आधार पर अनुमान लगाता है)।
    • Few-Shot: "यहाँ जाल के तीन उदाहरण दिए गए हैं। अब और जाल ढूंढो।" (AI उदाहरणों से सीखता है)।
    • Instruction Tuning: "यहाँ जाल पहचानने का एक मैनुअल है। इसका अध्ययन करें, फिर उन्हें खोजें।" (AI को विशेष रूप से इस कार्य के लिए प्रशिक्षित किया गया है)।

3. बड़े परिणाम

🏆 विजेता: "स्टडी गाइड" के साथ GPT-4o

प्रयोग में पाया गया कि विशेषज्ञ जासूस (PLMs) ठीक-ठाक थे, लेकिन जीनियस AI (GPT-4o) तब अपराजेय हो गया जब आपने उसे दो चीजें दीं:

  1. Instruction Tuning: जाल पहचानने के तरीके पर एक विशिष्ट "स्टडी गाइड" (प्रशिक्षण डेटा)।
  2. Few-Shot Prompting: कुछ उदाहरण कि एक जाल कैसा दिखता है।

उपमा: कल्पना कीजिए कि आप एक प्रतिभाशाली व्यक्ति को अंधेरे कमरे में खोई हुई चाबी खोजने के लिए कह रहे हैं।

  • बिना मदद के, वे केवल अनुमान लगाएंगे।
  • यदि आप उन्हें चाबी की तस्वीर दिखाते हैं (Few-Shot), तो वे बेहतर करते हैं।
  • यदि आप उन्हें एक टॉर्च और कमरे का नक्शा देते हैं (Instruction Tuning), तो वे तुरंत चाबी ढूंढ लेते हैं।

GPT-4o स्पष्ट विजेता था। इसने किसी भी अन्य मॉडल की तुलना में अधिक जाल खोजे, चाहे वह "पूरी इमारत" की जाँच हो या "विशिष्ट फर्श के तख्ते" की जाँच। यह विशेष रूप से सबसे खतरनाक जालों (जैसे SQL Injection या Buffer Overflows) को खोजने में सक्षम था जो पूरे शहर को क्रैश कर सकते हैं।

📉 "आकार मायने नहीं रखता" वाला आश्चर्य

शोधकर्ताओं ने सोचा: "यदि हम AI को और भी बड़ा (अधिक मस्तिष्क शक्ति) बनाते हैं, तो क्या वह बेहतर होगा?"

  • परिणाम: जरूरी नहीं। एक विशाल 70-बिलियन पैरामीटर वाला मॉडल हमेशा छोटे 7-बिलियन वाले मॉडल को नहीं हरा पाया।
  • सबक: यह मस्तिष्क के आकार के बारे में नहीं है; यह इस बारे में है कि आप उसे कितनी अच्छी तरह सिखाते हैं। एक अच्छा स्टडी गाइड रखने वाला छोटा जीनियस, एक भ्रमित विशाल जीनियस को हरा देता है।

🧠 "तर्क" (Reasoning) का जाल

नए "रीजनिंग" AI (वे मॉडल जो इंसान की तरह स्टेप-बाय-स्टेप सोचते हैं) का परीक्षण किया गया।

  • परिणाम: वे "पूरी इमारत" की जाँच में थोड़े बेहतर थे लेकिन "विशिष्ट फर्श के तख्ते" की जाँच में उनकी ज्यादा मदद नहीं मिली।
  • सबक: कभी-कभी, बहुत अधिक सोचना आपको धीमा कर देता है। कोड की विशिष्ट त्रुटियों को खोजने के लिए, एक तेज़, अच्छी तरह से प्रशिक्षित सहज ज्ञान (instinct) अक्सर स्टेप-बाय-स्टेप तर्क से बेहतर होता है।

4. व्यवसाय की लागत

शोध पत्र ने कीमत पर भी नज़र डाली।

  • विशेषज्ञ (PLMs): आप उन्हें अपने कार्यालय के एक मानक कंप्यूटर पर चला सकते हैं। एक बार हार्डवेयर खरीदने के बाद उन्हें चलाना सस्ता है।
  • जीनियस (LLMs): आपको उन्हें एक विशाल क्लाउड सर्वर (जैसे OpenAI) से किराए पर लेना होगा। हर बार सवाल पूछने पर पैसा खर्च होता है।
  • फैसला: यदि आप एक छोटा व्यवसाय हैं, तो विशेषज्ञ सस्ते हैं। यदि आप एक विशाल निगम हैं जिसे पूर्ण सटीकता की आवश्यकता है और जो बिल चुकाने में सक्षम है, तो जीनियस (GPT-4o) उस लागत के लायक हैं।

5. "डेटा लीक" का डर

एक आम चिंता है: "क्या AI ने केवल टेस्ट के सवालों को रट लिया है?"

  • शोधकर्ताओं ने AI का परीक्षण बिल्कुल नए खतरों (vulnerabilities) पर किया जो AI के प्रशिक्षण के बाद सामने आए थे।
  • परिणाम: AI ने अभी भी अच्छा प्रदर्शन किया! उसने केवल रटा नहीं; उसने वास्तव में यह सीखा कि जाल कैसे बनाए जाते हैं।

🌟 मुख्य निष्कर्ष

यह शोध पत्र हमें बताता है कि आर्टिफिशियल इंटेलिजेंस हमारे सॉफ्टवेयर को सुरक्षित करने में मदद करने के लिए तैयार है, लेकिन हम केवल एक कच्चे AI को समस्या पर नहीं झोंक सकते।

  • केवल यह न पूछें: "क्या यह कोड सुरक्षित है?"
  • यह करें: "यहाँ बग खोजने के लिए एक गाइड है, और यहाँ तीन उदाहरण हैं। अब, इस कोड को देखें और मुझे ठीक से बताएं कि खतरा कहाँ है।"

जब आप AI को सही उपकरण और प्रशिक्षण देते हैं, तो वह एक सुपर-पावर्ड सुरक्षा गार्ड बन जाता है जो सात अलग-अलग भाषाओं को समझ सकता है और किसी भी मानव या पुराने ज़माने के सॉफ़्टवेयर की तुलना में सबसे खतरनाक जालों को बेहतर ढंग से ढूंढ सकता है। यह हमारी डिजिटल दुनिया को सुरक्षित रखने की दिशा में एक बड़ा कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →