Security-First Evaluation of Text-to-Terraform: Benchmarking LLMs and SLMs for Secure IaC Generation
यह शोध पत्र सुरक्षित AWS टेराफॉर्म कोड उत्पन्न करने पर सात बड़े और छोटे भाषा मॉडलों का बेंचमार्क निर्धारित करता है, जो यह प्रकट करता है कि सिंटैक्टिक वैधता (syntactic validity) और सुरक्षा अनुपालन (security compliance) काफी हद तक ऑर्थोगोनल गुण हैं और मॉडल के प्रदर्शन या प्रॉम्प्ट इंजीनियरिंग रणनीतियों के बावजूद स्वचालित मल्टी-टूल स्कैनिंग आवश्यक बनी रहती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप आकाश में एक विशाल, अदृश्य शहर बना रहे हैं, जो पूरी तरह से डिजिटल ईंटों से बना है। वास्तविक दुनिया में, यदि आप एक कमजोर नींव के साथ घर बनाते हैं या सामने का दरवाजा खुला छोड़ देते हैं, तो यह एक आपदा है। डिजिटल दुनिया में, इस "शहर" को क्लाउड (Cloud) कहा जाता है, और इसे बनाने के लिए उपयोग किए जाने वाले ब्लूप्रिंट्स (नक्शों) को एक विशेष भाषा में लिखा जाता है जिसे इंफ्रास्ट्रक्चर-एज़-कोड (IaC) कहते हैं। IaC को एक अत्यंत सटीक रेसिपी की तरह समझें जो कंप्यूटर को बताती है कि सर्वर, स्टोरेज और सुरक्षा तालों को बिल्कुल कैसे सेट किया जाए। लंबे समय तक, इंसानों ने ये रेसिपी लिखीं, लेकिन अक्सर उनसे गलतियाँ हो जाती थीं, जिससे डिजिटल दरवाजे खुले रह जाते थे और बुरे लोग चुपके से अंदर घुस जाते थे।
हाल ही में, एक नया प्रकार का सहायक आया है: आर्टिफिशियल इंटेलिजेंस (AI)। विशेष रूप से, लार्ज लैंग्वेज मॉडल्स (LLMs) और उनके छोटे, तेज़ चचेरे भाई, स्मॉल लैंग्वेज मॉडल्स (SLMs)। ये सुपर-स्मार्ट रोबोट की तरह हैं जो लाखों रेसिपी पढ़ सकते हैं और आपके लिए कुछ ही सेकंड में नई रेसिपी लिखने की कोशिश कर सकते हैं। बड़ा सवाल हर किसी के मन में था: क्या ये AI रोबोट ऐसी रेसिपी लिख सकते हैं जो न केवल सही हों (ताकि इमारत ढहे नहीं) बल्कि भी सुरक्षित हों (ताकी कोई अंदर न घुस सके)? यह कुछ ऐसा है जैसे पूछना कि क्या एक रोबोट शेफ एक ऐसा केक बना सकता है जो स्वादिष्ट भी हो और उसमें गलती से अंदर कोई छिपा हुआ बम न हो। यदि AI व्याकरण (syntax) को सही कर देता है लेकिन तालों को भूल जाता है, तो पूरा शहर खतरे में पड़ सकता है। यह वही पहेली है जिसे हल करने के लिए ब्राजील के शोधकर्ताओं की एक टीम ने हाथ आजमाया।
द ग्रेट AI शेफ कॉम्पिटिशन (महान AI शेफ प्रतियोगिता)
शोधकर्ताओं ने सात अलग-अलग AI शेफ को एक विशाल रसोई में टेस्ट करने का फैसला किया जिसे "क्लाउड" कहा जाता है। उन्होंने रोबोट्स को सिर्फ एक रेसिपी लिखने के लिए नहीं कहा; उन्होंने उन्हें टेराफॉर्म (Terraform) नामक टूल का उपयोग करके सुरक्षित डिजिटल संरचनाएं बनाने के लिए 17 अलग-अलग प्रकार की रेसिपी लिखने को कहा। उन्होंने तीन "बड़े दिमाग" वाले मॉडल्स (बंद, महंगे मॉडल जैसे क्लॉड ओपस 4, GPT-5.4, और जेमिनी 2.5 प्रो) और चार "पॉकेट ब्रेन" मॉडल्स (ओपन-सोर्स, छोटे मॉडल जैसे विज़ार्डकोडर और कोडलामा) का परीक्षण किया।
यह देखने के लिए कि रेसिपी कितनी अच्छी थी, टीम ने केवल अपनी आँखों से उसे नहीं देखा। इसके बजाय, उन्होंने एक अत्यंत सख्त स्वचालित निरीक्षण लाइन बनाई। सबसे पहले, उन्होंने जांचा कि क्या रेसिपी व्याकरणिक रूप से सही (Syntactic Validity) थी। यदि रेसिपी में टाइपिंग की गलतियाँ थीं, तो इमारत शुरू ही नहीं हो पाती। लेकिन असली परीक्षण इसके बाद आया: उन्होंने दो अलग-अलग सुरक्षा स्कैनर, चेकोव (Checkov) और ट्रीवी (Trivy) चलाए, जो खुले खिड़कियों, खुले दरवाजों और छिपे हुए जाल की तलाश करने वाले डिजिटल सुरक्षा गार्डों की तरह काम करते हैं। उन्होंने यह भी परीक्षण किया कि क्या रोबोट अपनी गलतियों को सुधार सकते हैं जब उन्हें कहा जाए, "हे, तुमने एक दरवाजा खुला छोड़ दिया है," और क्या उन्हें सुरक्षा के बारे में अधिक विस्तृत निर्देश देने से वास्तव में मदद मिली।
चौंकाने वाले परिणाम: अच्छी व्याकरण, खराब ताले
यहाँ वह मोड़ है जो शोधकर्ताओं ने पाया, और यह एक बड़ा ट्विस्ट है: एक आदर्श रेसिपी लिखना और एक सुरक्षित रेसिपी लिखना दो पूरी तरह से अलग कौशल हैं।
उन्होंने पाया कि सिर्फ इसलिए कि एक AI एक टेराफॉर्म रेसिपी लिख सकता है जो व्याकरणिक रूप से एकदम सही है और बिना क्रैश हुए चलती है, इसका मतलब यह नहीं है कि वह रेसिपी सुरक्षित है। वास्तव में, दोनों कौशल लगभग असंबंधित हैं। एक छोटे मॉडल, विज़ार्डकोडर-33B, व्याकरण का चैंपियन था। उसने 77.8% समय वैध रेसिपी लिखीं! लेकिन जब सुरक्षा गार्डों ने उन रेसिपी की जाँच की, तो वह मॉडल हर एक सुरक्षा जांच में विफल रहा। यह एक ऐसे शेफ की तरह था जिसने एक सुंदर, पूरी तरह से आकार वाला केक बनाया लेकिन उसके अंदर जहर के जार का ढक्कन लगाना भूल गया।
दूसरी ओर, "बड़े दिमाग" वाले मॉडल्स ने बहुत बेहतर प्रदर्शन किया, लेकिन उन्हें अभी भी बहुत मदद की जरूरत थी। सबसे अच्छा प्रदर्शन करने वाले मॉडल, क्लॉड ओपस 4 ने, बुनियादी निर्देशों के साथ केवल 23% समय में एक पूरी तरह सुरक्षित रेसिपी लिखने में सफलता पाई। हालाँकि, जब शोधकर्ताओं ने उसे एक बहुत ही विशिष्ट, विस्तृत सुरक्षा चेकलिस्ट दी (उसे ठीक-ठीक बताया कि कौन से ताले लगाने हैं और कौन सा अलार्म सेट करना है), तो एक प्रकार के सुरक्षा स्कैनर के लिए उसका प्रदर्शन 92.5% तक बढ़ गया। इसने साबित कर दिया कि बड़े दिमाग सक्षम तो हैं, लेकिन वे सही काम तभी करेंगे जब आप उन्हें बिल्कुल वही करने को कहेंगे जो आपको चाहिए।
"पॉकेट ब्रेन्स" की सीमा
छोटे मॉडल्स (SLMs) एक कठिन दीवार से टकरा गए। शोधकर्ताओं ने उन्हें कितने भी विस्तृत सुरक्षा निर्देश दिए, छोटे मॉडल्स उनका पालन करने में सक्षम नहीं रहे। या तो वे एक टूटी हुई रेसिपी लिखते थे, या वे एक वैध रेसिपी लिखते थे जो पूरी तरह से असुरक्षित थी। शोधकर्ताओं ने पाया कि इन छोटे मॉडल्स के लिए समस्या निर्देश नहीं थे; समस्या यह थी कि इन मॉडल्स के पास जटिल सुरक्षा नियमों को समझने के लिए आवश्यक "दिमागी शक्ति" ही नहीं थी। वे पैटर्न की नकल करने में माहिर हैं, लेकिन वे अपने आप सुरक्षित समाधान बनाने में संघर्ष करते हैं।
क्या वे अपनी गलतियों को सुधार सकते हैं?
टीम ने यह भी परीक्षण किया कि क्या रोबोट अपनी गलतियों से सीख सकते हैं। उन्होंने रोबोट्स को एक रेसिपी लिखने दी, उसे स्कैन किया, और फिर रोबोट को गलतियों की सूची दिखाई (जैसे "तुमने इस फ़ाइल को एन्क्रिप्ट करना भूल गए") और उन्हें फिर से प्रयास करने के लिए कहा।
- अच्छी खबर: रोबोट ट्रीवी (Trivy) स्कैनर द्वारा पाई गई सरल, विशिष्ट गलतियों (जैसे किसी विशिष्ट दरवाजे पर लॉक की कमी) को ठीक करने में आश्चर्यजनक रूप से अच्छे थे। कई मॉडल्स ने त्रुटि सूची देखने के बाद अपने स्कोर में काफी सुधार किया।
- बुरी खबर: वे चेकोव (Checkov) स्कैनर द्वारा पाई गई बड़ी, संरचनात्मक समस्याओं को ठीक करने में बहुत खराब थे। ये ऐसी समस्याएं थीं जैसे "आपको इस इमारत के लिए एक पूरी नई सुरक्षा प्रणाली बनाने की आवश्यकता है।" रोबलेट अपने काम को एक बार में पुनर्गठित (re-architect) नहीं कर सके। वे एक ढीले पेंच को कस सकते थे, लेकिन वे आधार (foundation) को फिर से डिजाइन नहीं कर सकते थे।
मुख्य निष्कर्ष
इस अध्ययन का सबसे महत्वपूर्ण निष्कर्ष उन लोगों के लिए एक चेतावनी है जो AI को अपना डिजिटल शहर बनाने देने के बारे में सोच रहे हैं: आप AI को सुरक्षा गार्ड बनने के लिए भरोसा नहीं कर सकते।
शोधकर्ताओं ने पाया कि 2024 और 2026 के बीच, AI मॉडल्स कोड लिखने में बहुत बेहतर हो गए जो सही दिखता है, लेकिन वे ऐसा कोड लिखने में बेहतर नहीं हुए जो सुरक्षित हो। वास्तव में, "अच्छा दिखने" और "सुरक्षित होने" के बीच का अंतर वास्तव में और चौड़ा हो गया है।
अध्ययन निष्कर्ष निकालता है कि आप केवल AI से यह कहकर नहीं छोड़ सकते कि "इसे सुरक्षित बनाओ" और उम्मीद कर सकते हैं कि सब ठीक होगा। सबसे स्मार्ट AI मॉडल्स को भी अपने काम की दोबारा जाँच करने के लिए एक इंसान (या एक बहुत सख्त स्वचालित प्रणाली) की आवश्यकता होती है। आपको AI द्वारा उत्पन्न किए गए हर कोड पर कई सुरक्षा स्कैनर चलाने ही होंगे, चाहे मॉडल कितना भी अच्छा क्यों न हो या आपके निर्देश कितने भी विस्तृत क्यों न हों। AI एक शक्तिशाली सहायक है, लेकिन क्लाउड सुरक्षा की दुनिया में, यह अभी तक एक सुरक्षा निरीक्षक (safety inspector) का विकल्प नहीं है। यदि आप निरीक्षण छोड़ देते हैं, तो आप एक सुंदर, पूरी तरह से निर्मित डिजिटल शहर के साथ समाप्त कर सकते जिसके दरवाजों पर कोई ताला नहीं है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।