← नवीनतम पेपर
💻 computer science

SHIELDS: Automating OS Hardening with Iterative Multi-Agent Remediation

यह शोध पत्र SHIELDS को प्रस्तुत करता है, जो एक मल्टी-एजेंट सिस्टम है जो एक पुनरावृत्ति, फीडबैक-संचालित सुधार प्रक्रिया के माध्यम से OS हार्डनिंग को स्वचालित करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है और सफलतापूर्वक 73% तक सुरक्षा स्कैन निष्कर्षों को संबोधित करता है, यह प्रदर्शित करते हुए कि सफलता के लिए मॉडल के आकार की तुलना में प्रभावी टूल उपयोग और सूचना एकत्र करना अधिक महत्वपूर्ण है।

मूल लेखक: Andrew Hamara, Dwight Horne, Aldehir Rojas, Timothy Kurniawan, Sophie Lamothe, Vishal Suresh, Nicholas Turoci, Lawrence Wong

प्रकाशित 2026-06-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Andrew Hamara, Dwight Horne, Aldehir Rojas, Timothy Kurniawan, Sophie Lamothe, Vishal Suresh, Nicholas Turoci, Lawrence Wong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके कंप्यूटर का ऑपरेटिंग सिस्टम एक विशाल, जटिल घर की तरह है। समय के साथ, "डिफेंस इंफॉर्मेशन सिस्टम्स एजेंसी" (DISA) आपको एक बहुत लंबी, बहुत सख्त चेकलिस्ट (जिसे STIG कहा जाता है) भेजती है, जो आपको ठीक से बताती है कि घुसपैठियों को बाहर रखने के लिए हर दरवाजे को कैसे लॉक करना है, हर खिड़की को कैसे मजबूत करना है और हर अलमारी को कैसे सुरक्षित करना है।

समस्या यह है कि इस सूची की मैन्युअल रूप से जांच करना थका देने वाला है। इसे करने में सुरक्षा गार्डों (इंजीनियरों) की एक टीम को हर साल सैकड़ों घंटे खर्च करने पड़ते हैं ताकि वे घर में घूम सकें, खुली खिड़कियां ढूंढ सकें और उन्हें ठीक कर सकें। यदि वे एक भी चूक जाते हैं, तो घर में चोरी हो सकती है।

मौजूदा स्वचालित उपकरण (automated tools) उन रोबोटों की तरह हैं जो केवल उन्हीं समस्याओं को ठीक करना जानते हैं जिन्हें उन्होंने पहले देखा है। यदि चेकलिस्ट में कुछ नया करने के लिए कहा जाता है या यदि उनका दरवाजा ठीक करने का पहला प्रयास विफल हो जाता है, तो रोबोट बस हार मान लेता है और कहता है, "मैं यह नहीं कर सकता।"

SHIELDS से मिलिए।

यह शोध पत्र SHIELDS को पेश करता है, जो एक नए सिस्टम के रूप में कार्य करता है जो एक कठोर रोबोट के बजाय चार विशिष्ट, बुद्धिमान जासूसों की एक टीम की तरह काम करता है जो घर को सुरक्षित करने के लिए मिलकर काम करते हैं। केवल एक स्क्रिप्ट का पालन करने के बजाय, वे उन्नत एआई (लार्ज लैंग्वेज मॉडल्स) द्वारा संचालित "प्रयास करें, जांचें और फिर से प्रयास करें" के दृष्टिकोण का उपयोग करते हैं।

यहाँ SHIELDS टीम का कार्य विवरण दिया गया है, जो इस पेपर के विशिष्ट आर्किटेक्चर का उपयोग करता है:

1. चार जासूस (मल्टी-एजेंट सिस्टम)

एक ही एआई द्वारा सब कुछ करने के बजाय, SHIELDS काम को चार अलग-अलग भूमिकाओं में विभाजित करता है ताकि गलतियों से बचा जा सके:

  • द ट्राइएज एजेंट (गेटकीपर): यह एजेंट सबसे पहले चेकलिस्ट को देखता है। यदि कोई नियम कहता है कि "घर की नींव हिला दो," तो गेटकीपर जानता है कि यह ऑटोमेट करने के लिए बहुत खतरनाक है (आप पूरे घर को ही क्रैश कर सकते हैं)। वह इन चीजों को मनुष्यों के लिए चिह्नित करता है और सुरक्षित, ठीक करने योग्य चीजों को अगले एजेंट को सौंप देता है।
  • द रेमेडी एजेंट (हैंडीमैन): यह काम करने वाला मुख्य सदस्य है। यह एक विशिष्ट समस्या (जैसे ढीली खिड़की का लैच) को देखता है और उसे ठीक करने की कोशिश करता है। इसके पास फाइलें पढ़ने, कमांड चलाने और सेटिंग्स बदलने के उपकरण होते हैं। यदि यह विफल होता है, तो यह केवल हार नहीं मानता; इसे दूसरा मौका मिलता है ताकि यह एक अलग समाधान आज़मा सके।
  • द रिव्यू एजेंट (सुरक्षा निरीक्षक): हैंडyman द्वारा वास्तव में कुछ भी बदलने से पहले, सुरक्षा निरीक्षक योजना की जांच करता है। "क्या यह सुधार प्लंबिंग को खराब कर देगा?" वह योजना को एक स्कोर देता है। यदि योजना जोखिम भरी लगती है, तो वह हैंडyman को योजना पर फिर से विचार करने के लिए वापस भेज देता है।
  • द क्यूए एजेंट (ऑपरेशंस मैनेजर): यह एजेंट बड़े चित्र (big picture) को देखता है। "यदि हम यह एक खिड़की ठीक करते हैं, तो क्या इससे हीटिंग सिस्टम काम करना बंद कर देगा?" यह सुनिश्चित करता है कि सुधार के कारण समस्याओं की कोई श्रृंखला न बने।

2. लूप (वे चीजों को कैसे ठीक करते हैं)

यह सिस्टम एक निरंतर चक्र में चलता है, जैसे कि "अनुमान लगाओ और जांचो" का खेल:

  1. स्कैन (Scan): सिस्टम कंप्यूटर को स्कैन करता है और सुरक्षा खामियों की एक सूची पाता है।
  2. फ़िल्टर (Filter): गेटकीपर उन्हें छाँटता है।
  3. फिक्स लूप (The Fix Loop): सुरक्षित वस्तुओं के लिए, हैंडमैन एक समाधान प्रस्तावित करता है। सुरक्षा निरीक्षक और ऑपरेशंस मैनेजर दोनों "हाँ" या "ना" कहते हैं।
    • यदि वे "हाँ" कहते हैं, तो सुधार लागू किया जाता है।
    • यदि सुधार विफल हो जाता है या वे "ना" कहते हैं, तो सिस्टम उस फीडबैक को लेता है, सीखता है कि वह क्यों काम नहीं किया, और हैंडमैन फिर से प्रयास करता है (तीन बार तक)।
  4. सत्यापन (Verify): एक बार सुधार लागू होने के बाद, सिस्टम यह सुनिश्चित करने के लिए उस विशिष्ट आइटम को फिर से स्कैन करता है कि क्या वास्तव में काम हुआ है।

3. उन्हें क्या मिला (परिणाम)

शोधकर्ताओं ने तीन अलग-अलग आकार के वर्चुअल कंप्यूटर सिस्टम (छोटा, मध्यम और बड़ा) पर छह अलग-अलग एआई "मस्तिष्क" (छोटे से लेकर बहुत बड़े तक) का उपयोग करके इस टीम का परीक्षण किया।

  • बड़ा हमेशा बेहतर नहीं होता: आप सोच सकते हैं कि सबसे बड़ा, सबसे शक्तिशाली एआई मस्तिष्क विजेता होगा। लेकिन शोध पत्र में पाया गया कि सबसे बड़ा एआई (400 बिलियन पैरामीटर्स) एक बहुत छोटे एआई (20 बिलियन पैरामीटर्स) की तुलना में खराब प्रदर्शन करता है।
  • आकार से अधिक कौशल महत्वपूर्ण है: विजेता वे एआई थे जो उपकरणों का उपयोग करने (जैसे फाइलें पढ़ना और कमांड चलाना) और जानकारी एकत्र करने में अच्छे थे, न कि वे जिनके पास केवल अधिक मेमोरी थी। यह एक ऐसे हैंडमैन की तरह है जो औजारों का उपयोग करना अच्छी तरह जानता है, बजाय उसके जिसके पास किताबों का एक विशाल पुस्तकालय है लेकिन उसे औजार पकड़ना भी नहीं आता।
  • सफलता दर (Success Rate): सबसे अच्छे सेटअप ने लगभग 73% सुरक्षा समस्याओं को स्वचालित रूप적으로 ठीक किया।
  • पहला प्रयास मायने रखता है: अधिकांश सुधार पहले प्रयास में ही हो गए। चौथी या पांचवीं बार प्रयास करने से शायद ही कभी मदद मिली, इसलिए तीन प्रयासों के बाद रुक जाना सबसे सही तरीका है।

निष्कर्ष

SHIELDS यह साबित करता है कि हमें अपने कंप्यूटर को सुरक्षित करने के लिए किसी सुपर-मैसिव, महंगे एआई की आवश्यकता नहीं है। इसके बजाय, हमें छोटे एआई की एक स्मार्ट, संगठित टीम की आवश्यकता है जो एक-दूसरे से बात कर सके, अपने काम की जांच कर सके और अपनी गलतियों से सीख सके। यह दृष्टिकोण एक उबाऊ, मैन्युअल सुरक्षा कार्य को एक स्वचालित, स्वयं-सुधारने वाली प्रक्रिया में बदल देता है जो बिना किसी मानवीय सहायता के वास्तविक दुनिया के सुरक्षा नियमों को संभाल सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →