Do Agents Dream of Root Shells? Partial-Credit Evaluation of LLM Agents in Capture The Flag Challenges
यह शोध पत्र DeepRed प्रस्तुत करता है, जो एक ओपन-सोर्स बेंचमार्क है जो आंशिक-क्रेडिट स्कोरिंग और स्वचालित लॉग विश्लेषण का उपयोग करके यथार्थवादी कैप्चर द फ्लैग चुनौतियों पर LLM एजेंटों का मूल्यांकन करता है, जिससे यह पता चलता है कि वर्तमान मॉडल सीमित सफलता (औसतन 35% चेकपॉइंट पूर्णता) प्राप्त करते हैं और गैर-मानक खोज एवं लंबी-अवधि अनुकूलन कार्यों के साथ संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने एक शानदार, अति-बुद्धिमान रोबोट जासूस बनाया है। आप उसे एक नक्शा, एक आवर्धक लेंस (magnifying glass) और औजारों की एक सूची देते हैं, और आप उससे बंद कमरों के रहस्यों (locked-room mysteries) को सुलझाने के लिए कहते हैं। सवाल सिर्फ यह नहीं है कि, "क्या उसने खजाना ढूंढ लिया?" बल्कि यह है कि, "वह उलझने से पहले कितना आगे तक जा पाया?"
यह शोध पत्र, जिसका शीर्षक "Do Agents Dream of Root Shells?" है, ठीक इसी बात का परीक्षण करने के बारे में है: आज के AI "जासूस" साइबर सुरक्षा पहेलियों, जिन्हें कैप्चर द फ्लैग (Capture The Flag - CTF) चुनौतियां कहा जाता है, को सुलझाने में कितने अच्छे हैं?
यहाँ उनके शोध का विवरण दिया गया है, जिसे सरल उपमाओं (analogies) के माध्यम से समझाया गया है।
1. सेटअप: AI के लिए एक सुरक्षित "खेल का मैदान"
शोधकर्ताओं ने DeepRed नामक एक डिजिटल खेल का मैदान बनाया।
- हमलावर (The Attacker): उन्होंने एक वर्चुअल कंप्यूटर (एक "काली" मशीन) के अंदर एक AI एजेंट को रखा, जो एक जासूस को पूरी तरह से सुसज्जित टूलबॉक्स और वर्दी देने जैसा है।
- लक्ष्य (The Target): उन्होंने इसे एक अलग, अलग-थलग वर्चुअल मशीन से जोड़ा जिसमें "रहस्य" (CTF चुनौती) छिपा था।
- नियम: AI केवल एक टेक्स्ट टर्मिनल (जैसे पुराने ज़माने का कमांड लाइन) के माध्यम से लक्ष्य से बात कर सकता है और कभी-कभी एक सर्च इंजन का उपयोग कर सकता है। वह उत्तर कुंजी (answer key) को देखकर या सिमुलेशन की दीवारों को तोड़कर धोखाधड़ी नहीं कर सकता।
इसे एक शतरंज के ग्रैंडमास्टर को एक ताले वाली तिजोरी वाले कमरे में रखने जैसा समझें। वे हर संयोजन (combination) को आज़मा सकते हैं, ताला खोल सकते हैं, या दरवाज़े की वायरिंग छेड़ सकते हैं, लेकिन वे पीछे के दरवाज़े से सीधे बाहर नहीं निकल सकते।
2. समस्या: "सब-कुछ-या-कुछ-नहीं" वाला जाल
अतीत में, शोधकर्ता केवल इस बात की परवाह करते थे कि क्या AI ने पूरी पहेली सुलझा ली।
- पुराना तरीका: यदि AI ने "फ्लैग" ढूंढ लिया, तो उसे 100 अंक मिलते थे। यदि वह पहले ही चरण में विफल रहा, तो उसे 0 अंक मिलते थे।
- वास्तविकता: वर्तमान AI उस छात्र की तरह है जो गणित के सवाल का आधा हिस्सा हल कर सकता है लेकिन अंतिम समीकरण पर अटक जाता है। पुराने सिस्टम के तहत, उस छात्र को शून्य मिलता है, भले ही उसने 80% काम किया हो। यह देखना मुश्किल बनाता है कि क्या AI वास्तव में स्मार्ट हो रहा है।
3. समाधान: "आंशिक क्रेडिट" (Partial Credit) प्रणाली
लेखकों ने AI को ग्रेड देने का एक नया तरीका पेश किया, जो एक लंबे निबंध को ग्रेड देने वाले शिक्षक के समान है।
- चेकपॉइंट्स (Checkpoints): केवल अंतिम "फ्लैग" खोजने के बजाय, उन्होंने हर चुनौती को छोटे मील के पत्थरों में विभाजित किया (जैसे, "सर्वर मिला," "यूज़रनेम मिला," "एडमिन तक पहुँच बनाई")।
- ग्रेडिंग मशीन: चूंकि इंसान AI के काम के हर सेकंड को नहीं देख सकते (इसमें बहुत समय लगेगा), इसलिए उन्होंने एक स्वचालित ग्रेडिंग प्रणाली बनाई।
- चरण 1 (सारांशकर्ता/Summarizer): एक AI जासूस द्वारा किए गए लंबे और अस्त-व्यस्त लॉग को पढ़ता है और एक साफ-सुथरा सारांश लिखता है।
- चरण 2 (न्यायाधीश/Judge): दूसरा AI उस सारांश को पढ़ता है और बॉक्स चेक करता है: "क्या इसने सर्वर खोजा? हाँ। क्या इसने पासवर्ड प्राप्त किया? नहीं।"
- परिणाम: अब वे कह सकते हैं, "यह AI 35% रास्ते तक पहुँचा," जो केवल यह कहने से कहीं अधिक उपयोगी है कि "यह विफल रहा।"
4. निष्कर्ष: "स्मार्ट लेकिन अनाड़ी" जासूस
उन्होंने 10 अलग-अलग व्यावसायिक AI मॉडल का 10 अलग-अलग पहेलियों पर परीक्षण किया। यहाँ उन्हें जो मिला वह है:
- स्कोर: सबसे अच्छा AI औसतन केवल लगभग 35% चेकपॉइंट्स को पूरा कर सका। उनमें से कोई भी पहेलियों को शुरू से अंत तक हल नहीं कर सका।
- ताकत: AI "आसान" चीजों में अच्छा था। यदि पहेली एक मानक वेब हैक थी (जैसे वेबसाइट में छिपे हुए दरवाजे को खोजना), तो AI ने अच्छा प्रदर्शन किया।
- कमजोरी: AI दीर्घकालिक योजना (long-term planning) बनाने में संघर्ष करता था।
- उपमा: कल्पना कीजिए कि AI गेंद का पीछा करने वाला एक कुत्ता है। वह गेंद पाने के लिए तेज़ी से दौड़ता है (पहला सुराग पाता है), लेकिन फिर वह भूल जाता है कि वह क्यों दौड़ रहा है, गोल-गोल घूमने लगता है, या झाड़ियों के पीछे गेंद लुढ़कने पर हार मान लेता है।
- वे अक्सर चरणों के बीच के संबंध बनाने में विफल रहे। वे एक सुराग पाते थे, उसे भूल जाते थे, और फिर से शुरू कर देते थे।
- लागत: कुछ मॉडलों ने बहुत कम काम करने के लिए भारी मात्रा में "दिमागी शक्ति" (टोकन) का उपयोग किया, जबकि अन्य कुशल थे लेकिन फिर भी अटक गए।
5. यह क्यों महत्वपूर्ण है
यह शोध पत्र एक वास्तविकता की जाँच (reality check) है।
- सुरक्षा के लिए: यह दिखाता है कि हालांकि AI बेहतर हो रहा है, लेकिन यह अभी तक एक "सुपर-हैकर" नहीं है जो मानवीय मदद के बिना जटिल प्रणालियों को स्वायत्त रूप से तोड़ सके। हमें आज इंटरनेट पर कब्जा करने के लिए AI के डर में घबराने की ज़रूरत नहीं है, लेकिन हमें नज़र रखनी होगी।
- AI अनुसंधान के लिए: यह साबित करता है कि हमें केवल इस आधार पर AI को ग्रेड देना बंद करना होगा कि "क्या वह जीता?" और इसके बजाय इस आधार पर ग्रेड देना शुरू करना होगा कि "उसने कैसे सोचा?" नई "आंशिक क्रेडिट" प्रणाली शोधकर्ताओं को यह देखने में मदद करती है कि AI वास्तव में कहाँ विफल हो रहा है ताकि वे उसे ठीक कर सकें।
निचोड़ (The Bottom Line)
AI एजेंट उभरते हुए प्रशिक्षुओं (apprentices) की तरह हैं। उनके पास काम शुरू करने के लिए उपकरण और ज्ञान है, लेकिन उनमें पूरे घर को पूरा करने के लिए धैर्य और दीर्घकालिक स्मृति (long-term memory) की कमी है। शोधकर्ताओं ने उनकी प्रगति को मापने के लिए एक बेहतर पैमाना बनाया है, जो हमें ठीक से दिखाता है कि वे कहाँ लड़खड़ा रहे हैं ताकि हम उन्हें काम पूरा करना सीखने में मदद कर सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।