← नवीनतम पेपर
💻 computer science

PatchIsland: Orchestration of LLM Agents for Continuous Vulnerability Repair

PatchIsland एक स्वायत्त प्रणाली है जो निरंतर फज़िंग पाइपलाइनों के शोर-शराबे वाले और विफलता-प्रवण वातावरण के भीतर निरंतर भेद्यता सुधार को प्रभावी ढंग से संचालित करने के लिए विविध LLM एजेंटों के एक समूह और दो-चरणीय डीडुप्लीकेशन रणनीति का लाभ उठाती है, जिससे AIxCC प्रतियोगिता में 72.1% मरम्मत दर प्राप्त होती है।

मूल लेखक: Wonyoung Kim, Seunggi Min, Minjae Gwon, Dowoo Baik, Haein Lee, Hyeon Heo, Minjae Lee, Min Woo Baek, Yonghwi Jin, Younggi Park, Yunjae Choi, Taesoo Kim, Sangdon Park, Insu Yun

प्रकाशित 2026-07-17
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wonyoung Kim, Seunggi Min, Minjae Gwon, Dowoo Baik, Haein Lee, Hyeon Heo, Minjae Lee, Min Woo Baek, Yonghwi Jin, Younggi Park, Yunjae Choi, Taesoo Kim, Sangdon Park, Insu Yun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि इंटरनेट एक विशाल, हलचल भरे शहर की तरह है जो पूरी तरह से कोड से बना है। इस शहर में, "फज़िंग" (fuzzing) हजारों छोटे, अराजक रोबोटों को दीवारों से टकराने, तारों में उलझने और हर उस दरवाजे को खटखटाने के लिए भेजने जैसा है जिसे वे ढूंढ सकते हैं। उनका काम शहर की सुरक्षा में छिपी दरारों को ढूंढना है—सॉफ्टवेयर कमजोरियां जिनका उपयोग हैकर्स घुसपैकी के लिए कर सकते हैं। वर्षों से, ये रोबोट दरारें खोजने में अविश्वसनीय रूप से कुशल रहे हैं, जो हर साल ओपन-सोर्स प्रोजेक्ट्स में हजारों सुरक्षा खामियों को उजागर करते हैं। लेकिन समस्या यह है: जबकि रोबोट छेद खोजने में बहुत अच्छे हैं, उन्हें ठीक करना अभी भी मानव विशेषज्ञों के लिए एक धीमा, मैनुअल काम है। यह ऐसा है जैसे आपके पास एक रोबोट सेना है जो शहर में हर गड्ढे को ढूंढ सकती है, लेकिन फिर आपको प्रत्येक को व्यक्तिगत रूप से ठीक करने के लिए इंजीनियरों की एक टीम को नियुक्त करना पड़ता है। जैसे-जैसे शहर बढ़ता है, यह मैनुअल मरम्मत प्रक्रिया एक बड़ा अड़चन बन जाती है, जिससे शहर लंबे समय तक असुरक्षित रहता है। यहीं पर "स्वचालित भेद्यता मरम्मत" (Automated Vulnerability Repair) का विचार आता है: एक ऐसा सिस्टम बनाने की कोशिश करना जो न केवल गड्ढों को ढूंढ सके बल्कि उन्हें स्वचालित रूप से पैच (ठीक) भी कर सके।

यहाँ PatchIsland आता है, एक नया सिस्टम जिसे ठीक इसी समस्या को हल करने के लिए डिज़ाइन किया गया है। इसके पीछे के शोधकर्ताओं ने महसूस किया कि मौजूदा स्वचालित मरम्मत उपकरण एक शांत गैरेज में काम करने वाले एकल मैकेनिक की तरह थे; उन्हें एक बार में एक कार पर नियंत्रित वातावरण में परीक्षण किया गया था। लेकिन वास्तविक दुनिया की निरंतर फज़िंग एक शोर-शराबे वाली, अराजक और अप्रत्याशित हाईवे की तरह है जहाँ कारें लगातार खराब होती रहती हैं। इसे संभालने के लिए, टीम ने PatchIsland बनाया, जो एक अकेले मैकेनिक के बजाय एक अत्यधिक संगठित, 24/7 मरम्मत दल की तरह कार्य करता है। उन्होंने इसका परीक्षण AIxCC (AI साइबर चैलेंज) नामक एक प्रमुख प्रतियोगिता में किया, जहाँ इसे बिना किसी मानवीय सहायता के एक सप्ताह तक पूरी तरह से अपने आप काम करना था। परिणाम प्रभावशाली थे: PatchIsland ने 43 वास्तविक दुनिया की कमजोरियों में से 31 को सफलतापूर्वक ठीक किया, 72.1% की सफलता दर हासिल की, और यहाँ तक कि लोकप्रिय प्रोजेक्ट 'PDFBox' में एक बिल्कुल नए, पहले कभी न देखे गए "जीरो-डे" (zero-day) बग को भी ठीक करने में सक्षम रहा।

समस्या: "एक ही आकार सबके लिए" (One-Size-Fits-All) का जाल

कल्पना कीजिए कि आप एक बांध में रिसाव को ठीक करने की कोशिश कर रहे हैं। आपके पास एक टूलबॉक्स है जिसमें एक हथौड़ा, एक रिंच और एक ग्लू गन है। यदि आप केवल हथौड़े का उपयोग करते हैं, तो आप शायद एक दरार को ठीक कर लेंगे, लेकिन यदि रिसाव एक टूटे हुए पाइप के कारण है, तो आप विफल हो जाएंगे। अधिकांश पिछले स्वचालित मरम्मत सिस्टम उस हथौड़े की तरह थे: उन्हें एक नियंत्रित, एकल-रन परीक्षण में पूरी तरह से काम करने के लिए डिज़ाइन किया गया था। लेकिन वास्तविक दुनिया की निरंतर फज़िंग में, "रिसाव" विविध होते हैं, वातावरण अव्यवस्थित होता है, और चीजें लगातार गलत होती रहती हैं। एक सिस्टम जो केवल एक विधि पर निर्भर करता है, वह अक्सर क्रैश हो जाता है या तब अटक जाता है जब वह ऐसी समस्या का सामना करता है जिसके लिए उसे विशेष रूप से प्रशिक्षित नहीं किया गया था। शोधकर्ताओं ने पाया कि पुराने सिस्टम निरंतर, वास्तविक दुनिया के मरम्मत कार्य की अराजकता को संभालने में असमर्थ थे।

समाधान: विविध विशेषज्ञों की एक टीम

इसे ठीक करने के लिए, टीम ने "एन्सेम्बल ऑफ एजेंट्स" (ensemble of agents) नामक अवधारणा का उपयोग करके PatchIsland बनाया। इसे एक एकल प्रतिभाशाली मैकेनिक को काम पर रखने के बजाय, विभिन्न सुपरपावर वाले विशेषज्ञों की एक पूरी टीम को काम पर रखने के रूप में सोचें। कुछ एजेंट कोड पढ़ने में माहिर हैं, अन्य विशिष्ट प्रकार के बग खोजने में विशेषज्ञ हैं, और कुछ तेज़ हैं लेकिन शायद थोड़े लापरवाह हैं, जबकि अन्य धीमे हैं लेकिन अविश्वसनीय रूप से सटीक हैं।

एक एकल एजेंट पर सब कुछ करने के लिए निर्भर रहने के बजाय, PatchIsland इस पूरी टीम को टूटा हुआ कोड भेजता है। यदि एक एजेंट विफल होता है या भ्रमित हो जाता है, तो दूसरे काम करते रहते हैं। यह एक फायर डिपार्टमेंट की तरह है जहाँ यदि एक ट्रक खराब हो जाता है, तो अन्य अभी भी आग बुझा सकते हैं। यह विविधता सिस्टम को बहुत अधिक मजबूत बनाती है, जिसका अर्थ है कि यह तब भी चलते रह सकता है जब व्यक्तिगत भाग विफल हो जाते हैं।

स्मार्ट फ़िल्टर: "वही पुरानी कहानी" से बचना

एक निरंतर मरम्मत प्रणाली में, एक ही बग अक्सर बार-बार एक ही क्रैश का कारण बनता है। यदि सिस्टम एक ही क्रैश को 100 बार ठीक करने की कोशिश करता है, तो यह बहुत अधिक समय और पैसा बर्बाद करेगा। शोधकर्ताओं ने एक चतुर "दो-चरणीय वि-डुप्लीकेशन" (two-phase deduplication) रणनीति पेश की।

कल्पना कीजिए कि एक जासूस को अपराध की रिपोर्ट मिलती है। पूरी टीम को बुलाने से पहले, जासूस जाँच करता है: "क्या यह सटीक अपराध पहले ही सुलझा लिया गया है?"

  1. चरण 1 (क्रैश चेक): जब एक नई क्रैश रिपोर्ट आती है, तो सिस्टम जाँचता है कि क्या टीम द्वारा पहले से बनाया गया कोई पैच इसे ठीक कर देगा। यदि हाँ, तो यह नई रिपोर्ट को अनदेखा कर देता है।
  2. चरण 2 (पैच चेक): यदि टीम एक नया पैच बनाती है, तो सिस्टम जाँचता है कि क्या यह नया पैच पुराने पैच की पुनरावृत्ति है या क्या यह वास्तव में कुछ नया ठीक करता है। यदि यह एक पुनरावृत्ति है, तो इसे हटा दिया जाता है। यदि यह बेहतर है, तो यह पुराने को बदल देता है।

यह सुनिश्चित करता है कि सिस्टम एक ही समस्या को दो बार ठीक करने में ऊर्जा बर्बाद न करे, जो अत्यंत महत्वपूर्ण है जब आप हजारों रिपोर्टों से निपट रहे हों।

कंडक्टर: FP2 ऑर्केस्ट्रेशन

विभिन्न एजेंटों की एक टीम के साथ, आपको एक कंडक्टर की आवश्यकता होती है जो यह तय करे कि कौन कब काम करेगा और कैसे। टीम ने FP2 (First-come first-served, Preference-based, and Provider-aware) नामक एक रणनीति विकसित की।

  • First-come first-served (पहले आओ, पहले पाओ): यदि कोई पैच तैयार है, तो उसे तुरंत सबमिट किया जाता है।
  • Preference-based (वरीयता आधारित): सिस्टम जानता है कि कौन से एजेंट आमतौर पर सही समाधान खोजने में "सर्वश्रेष्ठ" होते हैं। यह इन शीर्ष एजेंटों को पहले प्रयास करने देता है। यदि वे विफल होते हैं, तो यह अन्यों को बुलाता है। इससे समय और पैसा बचता है।
  • Provider-aware (प्रदाता-जागरूक): एजेंट अलग-अलग AI "मस्तिष्क" (जैसे विभिन्न लार्ज लैंग्वेज मॉडल्स) का उपयोग करते हैं। सिस्टम काम को इस तरह फैलाता है कि कोई भी एक AI अभिभूत न हो या उसकी सीमा (rate-limit) समाप्त न हो जाए।

यह ऑर्केस्ट्रेशन सुनिश्चित करता है कि सिस्टम कुशल है, जो शक्तिशाली AI उपकरणों के उपयोग की लागत के साथ गति का संतुलन बनाता है।

परिणाम: एक वास्तविक दुनिया का टेस्ट ड्राइव

असली परीक्षा AIxCC फाइनल प्रतियोगिता के दौरान हुई, जो एक सप्ताह लंबी घटना थी जहाँ टीमों को बिना किसी मानवीय हस्तक्षेप के 53 विभिन्न ओपन-सोर्स प्रोजेक्ट्स में कमजोरियों को खोजना और ठीक करना था।

  • स्कोर: PatchIsland ने 31 कमजोरियों को खोजा और पैच किया, जो किसी भी टीम की सर्वाधिक संख्या थी।
  • सफलता दर: इसने 72.1% की सफलता दर हासिल की (43 पुष्ट कमजोरियों में से 31)।
  • जीरो-डे जीत: एक शानदार क्षण में, PatchIsland ने PDFBox प्रोजेक्ट में एक बिल्कुल नए बग को ठीक किया। प्रतियोगिता के बाद, प्रोजेक्ट के मेंटेनरों ने उसी पैच को अपनाया जो सिस्टम ने बनाया था, जिससे यह सिद्ध हुआ कि AI ने केवल अनुमान नहीं लगाया; इसने एक वास्तविक, सही समाधान खोजा।

शोधकर्ताओं ने यह भी नोट किया कि हालांकि सिस्टम अविश्वसनीय रूप से प्रभावी था, लेकिन यह पूर्ण नहीं था। इसे कुछ "सिंगल पॉइंट ऑफ फेल्योर" का सामना करना पड़ा, जैसे कि systemd प्रोजेक्ट में एक टूटा हुआ लिंक जिसने सिस्टम को उस विशिष्ट कार्य के लिए शुरू होने से रोक दिया। हालाँकि, अन्य प्रणालियों की तुलना में जो अधिक बार क्रैश हुए, PatchIsland के डिज़ाइन ने इसे अधिकांश अराजकता के दौरान चलते रहने में मदद की।

यह क्यों मायने रखता है

PatchIsland दिखाता है कि हम एक ऐसे भविष्य के करीब पहुँच रहे हैं जहाँ सॉफ्टवेयर खुद को ठीक कर सकेगा। विविध AI एजेंटों की एक टीम के साथ स्मार्ट प्रबंधन और फ़िल्टरिंग को जोड़कर, सिस्टम निरंतर सुरक्षा परीक्षण की अव्यवस्थित, अप्रत्याशित वास्तविकता को संभाल सकता है। यह सुझाव देता है कि भले ही हम अभी तक सभी बग्स को स्वचालित रूप से खत्म न कर सकें, लेकिन हम ऐसे सिस्टम बना सकते हैं जो पर्याप्त मजबूत हों ताकि आधुनिक सॉफ़्टवेयर के सामने आने वाली कमजोरियों की बाढ़ को संभाल सकें, जिससे मानव विशेषज्ञों का बोझ कम हो सके और हमारा डिजिटल शहर सुरक्षित रह सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →