← नवीनतम पेपर
🤖 AI

Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction

यह शोध पत्र मास्टरमाइंड (Mastermind) को प्रस्तुत करता है, जो एक ड्यूल-लूप फ्रेमवर्क है जो एक प्लानर को उच्च-स्तरीय रणनीतियों को सीखने और स्थानांतरित करने के लिए प्रशिक्षित करके रिपॉजिटरी-स्केल भेद्यता पुनरुत्पादन (vulnerability reproduction) में सुधार करता है, जिससे साइबरजिम (CyberGym) पर 84.5% पास रेट प्राप्त होता है और कई फ्रोजन एलएलएम (LLM) निष्पादकों (executors) के विरुद्ध मौजूदा बेसलाइनों से काफी बेहतर प्रदर्शन होता है।

मूल लेखक: Mingzhe Du, Luu Anh Tuan, Tianyi Wu, Renyang Liu, Zhijiang Guo, Dong Huang, See-Kiong Ng

प्रकाशित 2026-07-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mingzhe Du, Luu Anh Tuan, Tianyi Wu, Renyang Liu, Zhijiang Guo, Dong Huang, See-Kiong Ng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही विशिष्ट, छिपी हुई खामी को खोजने की कोशिश कर रहे हैं जो एक विशाल, जटिल मशीन (जैसे कोड की एक बड़ी लाइब्रेरी) में है। उस खामी को साबित करने के लिए, आपको एक छोटा, कस्टम चाबी (एक "प्रूफ-ऑफ-कॉन्सेप्ट" या PoC) बनाना होगा जो उस ताले में पूरी तरह से फिट हो सके ताकि मशीन एक विशिष्ट तरीके से क्रैश हो जाए। यदि आप ऐसा कर पाते हैं, तो आपने उस भेद्यता (vulnerability) को खोज लिया है।

यह शोध पत्र तर्क देता है कि समस्या यह नहीं है कि "श्रमिक" (AI) चाबियाँ बनाने या उन्हें घुमाने में बुरा है। समस्या यह है कि श्रमिक गलत चाबियाँ आज़माता रहता है या गलत कमरों में ढूँढता रहता है। वह कार्य करने में कुशल है, लेकिन योजना बनाने में बहुत खराब है।

यहाँ शोध पत्र का समाधान दिया गया है, जिसे मास्टरमाइंड (Mastermind) कहा जाता है, सरल उपमाओं का उपयोग करके समझाया गया है:

समस्या: "व्यस्त लेकिन खोया हुआ" श्रमिक

एक बहुत ही कुशल मैकेनिक (AI निष्पादक/Executor) की कल्पना करें जो किसी भी उपकरण का उपयोग कर सकता है, कोई भी दरवाजा खोल सकता है और किसी भी इंजन को ठीक कर सकता है। हालाँकि, यदि आप उसे कहें, "जाओ और टूटा हुआ हिस्सा ढूँढो," तो वह रेडियो, टायर और सीटों की जाँच करने में घंटों बिता सकता है, और उस इंजन ब्लॉक को पूरी तरह से मिस कर सकता है जहाँ असली समस्या है।

हालिया AI एजेंट ऐसे ही मैकेनिक की तरह हैं। वे निर्देशों का पूरी तरह से पालन कर सकते हैं, लेकिन वे अक्सर इसलिए समय बर्बाद करते हैं क्योंकि उनके पास इस बात की कोई अच्छी रणनीति (strategy) नहीं होती कि पहले कहाँ देखना है।

समाधान: मास्टरमाइंड (द जनरल और द स्क्राइब)

मास्टरमाइंड इस काम को दो अलग-अलग भूमिकाओं में विभाजित करता है, जो सोचने और करने को अलग करता है।

  1. द जनरल (योजनाकार/The Planner): यह वह हिस्सा है जो सीखता है। यह उपकरणों या मशीन को नहीं छूता है। इसका एकमात्र काम एक छोटा, स्पष्ट मानचित्र (एक "रणनीति") लिखना है जो कहता है: "इंजन रूम में जाओ, फ्यूल लाइन की जाँच करो, और वाल्व को घड़ी की दिशा में घुमाने की कोशिश करो।"
  2. द स्क्राइब/वर्कर (निष्पादक/The Executor): यह एक स्थिर AI (जैसे GPT-5.5) है जो वास्तव में काम करता है। यह जनरल के मानचित्र को पढ़ता है और कार्यों को निष्पादित करता है। इसे बदला या फिर से प्रशिक्षित नहीं किया जाता है; यह बस आदेशों का पालन करता है।

मास्टरमाइंड कैसे सीखता है: "दोहरा-लूप" (Dual-Loop) सिस्टम

शोध पत्र जनरल को बेहतर मानचित्र लिखने के लिए एक चतुर दो-भाग वाली सीखने की प्रणाली पेश करता है:

  • लूप 1: "पाठ पुस्तिका" (अनुभव लूप/The Lesson Book)
    कल्पना कीजिए कि जनरल इस विशिष्ट मशीन के लिए एक नोटबुक रखता है। यदि जनरल कहता है, "फ्यूल लाइन की जाँच करो," और वर्कर को कुछ नहीं मिलता है, तो जनरल नोटबुक में लिखता है: "फ्यूल लाइन ठीक थी; इसे दोबारा न देखें।" यह नोटबुक अस्थायी है और वर्तमान कार्य के लिए विशिष्ट है। यह जनरल को इसी मशीन पर अगले प्रयास में वही गलतियाँ दोहराने से बचने में मदद करती है।

  • लूप 2: "मस्तिष्क प्रशिक्षण" (पॉलिसी लूप/The Brain Training)
    यहीं पर जनरल वास्तव में समय के साथ स्मार्ट बनता है। कई अलग-अलग मशीनों पर कई प्रयासों के बाद, जनरल अपनी नोटबुक को देखता है और पूछता है: "जब मैंने 'फ्यूल लाइन की जाँच करें' लिखा, तो क्या यह आमतौर पर काम आया? जब मैंने 'टायरों की जाँच करें' लिखा, तो क्या यह आमतौर पर विफल रहा?"
    सिस्टम एक रिवॉर्ड सिस्टम (जैसे वीडियो गेम स्कोर) का उपयोग करता है जो जनरल को बताता है: "अच्छा काम, उस रणनीति ने क्रैश किया!" या "बुरा काम, वह समय की बर्बादी थी।" जनरल अपने आंतरिक मस्तिष्क (weights) को अपडेट करता है ताकि वह खामियों को खोजने के बारे में सामान्य नियम सीख सके, जिसे वह उन नई मशीनों पर उपयोग कर सकता है जिन्हें उसने पहले कभी नहीं देखा है।

यह क्यों एक बड़ी बात है

शोध पत्र ने इसका परीक्षण साइबर जिम (CyberGym) नामक बेंचमार्क पर किया, जिसमें वास्तविक दुनिया की सैकड़ों कोड भेद्यताएं (vulnerabilities) हैं।

  • मास्टरमाइंड के बिना: यदि आप केवल AI को रैंडम अनुमान लगाने (या यहाँ तक कि एक साथ 8 रैंडम अनुमान लगाने) के लिए छोड़ देते हैं, तो वह लगभग 63% समस्याओं को हल करता है।
  • मास्टरमाइंड के साथ: AI को बेहतर रणनीतियों की योजना बनाने के लिए सिखाकर, इसने उसी अंतर्निहित AI वर्कर का उपयोग करके 84.5% समस्याओं को हल किया।

मुख्य निष्कर्ष

शोध पत्र का दावा है कि जटिल सॉफ्टवेयर कार्यों के लिए, शक्ति से अधिक रणनीति महत्वपूर्ण है।

इसे एक खजाने की खोज की तरह समझें। आपके पास सबसे मजबूत, तेज़ धावक (AI निष्पादक) हो सकता है, लेकिन यदि उसके पास एक अच्छा मानचित्र (रणनीति) नहीं है, तो वह गोल-गोल घूमता रहेगा। मास्टरमाइंड AI को बेहतर मानचित्र बनाना सिखाता है। एक बार जब AI बेहतर मानचित्र बनाना सीख जाता है, तो वह उस मानचित्र को किसी भी धावक (यहाँ तक कि एक छोटे या अलग AI) को दे सकता है, और वे सभी खजाना खोजने में बहुत बेहतर काम करेंगे।

संक्षेप में: मास्टरमाइंड AI को अपने हाथ चलाने में अधिक शक्तिशाली नहीं बनाता है; यह AI को यह तय करने में अधिक स्मार्ट बनाता है कि उसे अपने हाथ कहाँ चलाने हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →