Autonomous LLM Agents & CTFs: A Second Look
यह शोध पत्र यह प्रदर्शित करते हुए कि कैसे क्लॉड कोड (Claude Code) जैसे सामान्य-उद्देश्य वाले एजेंट सीटीएफ (CTF) चुनौतियों में जटिल इंजीनियर की गई आर्किटेक्चर के प्रदर्शन के बराबर हैं, लेकिन दोनों ही अभी भी महत्वपूर्ण मानव-स्तर की बाधाओं का सामना करते हैं, और संरचित, बहु-भूमिका ऑर्केस्ट्रेशन (multi-role orchestration), निरंतरता और लागत दक्षता में मोनोलिथिक डिज़ाइनों की तुलना में श्रेष्ठ सिद्ध होता है, ऑफेंसिव सिक्योरिटी में लार्ज लैंग्वेज मॉडल एजेंटों की क्षमताओं का पुनर्मूल्यांकन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास डिजिटल जासूसों की एक टीम है जो डिजिटल तिजोरियों (जिन्हें "CTF चुनौतियां" कहा जाता है) को तोड़ने की कोशिश कर रही है ताकि छिपा हुआ खजाना (जिसे "फ्लैग" कहा जाता है) मिल सके। कुछ समय से, लोग दावा कर रहे हैं कि आर्टिफिशियल इंटेलिजेंस (AI) एजेंट इतने स्मार्ट हो रहे हैं कि वे मानव विशेषज्ञों के लगभग बराबर काम कर सकते हैं।
यह पेपर एक "रियलिटी चेक" रिपोर्ट की तरह है। लेखकों ने इन दावों की जांच करने के लिए खुद परीक्षण करने का निर्णय लिया कि क्या AI वास्तव में मुख्य भूमिका के लिए तैयार है या यह केवल भाग्यशाली हो रहा है।
यहाँ उनके प्रयोग और निष्कर्षों का विवरण दिया गया है, कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करते हुए:
1. प्रयोग: अलग-अलग जासूसी टीमें बनाना
शोधकर्ताओं ने केवल एक प्रकार का AI नहीं उपयोग किया। उन्होंने यह देखने के लिए तीन अलग-अलग "टीम संरचनाएं" बनाईं कि कौन सा सबसे अच्छा काम करता है, और उन्होंने एक प्रसिद्ध, तैयार (off-the-shelf) AI जासूस Claude Code का भी परीक्षण किया।
- एकल जासूस (एग्जीक्यूटर - Executor): कल्पना कीजिए कि एक व्यक्ति सब कुछ करने की कोशिश कर रहा है: ताले को देखना, योजना बनाना, ताला खोलना और यह जांचना कि क्या उसे खजाना मिल गया है। पेपर में पाया गया कि यह व्यक्ति बहुत अधिक बोझ महसूस करता है और गलतियां करता है।
- एक आलोचक के साथ जासूस (एग्जीक्यूटर + इवैल्यूएटर): यहाँ, जासूस काम करने की कोशिश करता है, लेकिन एक दूसरा व्यक्ति (क्रिटिक) उसके कंधे के ऊपर से देख रहा होता है। ताला खोलने से पहले, क्रिटिक कहता है, "रुको, यह एक बुरा विचार है, फिर से कोशिश करो।" इससे मदद मिलती है, लेकिन क्रिटिक कभी-कभी पूरी तस्वीर नहीं देख पाता और केवल छोटी-छोटी बारीकियों पर ही सवाल उठाता है।
- एक रणनीतिकार और एक आलोचक के साथ जासूस (प्लानर + एग्जीक्यूटर + इवैल्यूएटर): यह सबसे जटिल टीम है।
- रणनीतिकार (प्लानर): पहले तिजोरी को देखता है और एक चरण-दर-चरण मानचित्र लिखता है।
- जासूस (एग्जीक्यूटर): मानचित्र का पालन करता है।
- आलोचक (इवैल्यूएटर): मानचित्र के विरुद्ध काम की जांच करता है।
- परिणाम: यह टीम सबसे कुशल थी। उन्होंने कम समय और पैसा बर्बाद किया क्योंकि वे बिना किसी उद्देश्य के इधर-उधर नहीं भटक रहे थे।
उन्होंने Claude Code का भी परीक्षण किया, जो एक "स्मार्ट जनरललिस्ट" की तरह है। इसकी कोई निश्चित टीम संरचना नहीं है; यह खुद तय करता है कि उसे सहायकों को काम पर रखना है या अकेले काम करना है।
2. परिणाम: "30 में से 19" की सीमा
बड़ी खबर यह है कि चाहे आपने टीम को कैसे भी व्यवस्थित किया हो, AI एक कठिन सीमा (ceiling) पर पहुंच गया।
- स्कोर: सबसे अच्छी मानव-निर्मित टीम और स्मार्ट "जनरलिस्ट" AI (Claude Code) दोनों ने ठीक 30 में से 19 चुनौतियों को हल किया।
- तुलना: यह उन पिछले अध्ययनों से कम है जो अधिक दावे करते थे। लेखक सुझाव देते हैं कि वे पिछले अध्ययन शायद बहुत आशावादी थे या उन्होंने आसान परीक्षणों का उपयोग किया था।
- दक्षता की जीत: जबकि स्कोर समान था, "रणनीतिकार + जासूस + आलोचक" वाली टीम इस मामले में बहुत बेहतर थी कि वे कैसे काम करते थे। उन्होंने एकल जासूस की तुलना में कम कदम उठाए और इसे चलाने में कम लागत आई। यह दो धावकों की तरह है जो एक ही समय में दौड़ पूरी करते हैं, लेकिन एक ने सीधी रेखा में दौड़ लगाई जबकि दूसरे ने गोल-गोल चक्कर लगाए।
3. AI कहाँ फंस जाता है (क्यों)
शोधकर्ताओं ने गहराई से जांच की कि AI बाकी 11 चुनौतियों में क्यों विफल रहा। उन्होंने पाया कि AI दो बहुत अलग कारणों से विफल होता है:
A. "टूल्स की कमी" की समस्या (तकनीकी सीमाएं)
कभी-कभी AI जानता है कि क्या करना है, लेकिन उसके पास सही उपकरण नहीं होते।
- उपमा: कल्पना कीजिए कि AI को पता है कि ताला कैसे खोलना है, लेकिन वह यह सब मोटे ओवन मिट्स (oven mitts) पहनकर करने की कोशिश कर रहा है।
- उदाहरण: कुछ चुनौतियों के लिए ब्राउज़र में वेबपेज देखने की आवश्यकता थी (छिपा हुआ कोड देखने के लिए), लेकिन AI केवल टेक्स्ट-आधारित वातावरण में काम कर रहा था। कुछ कार्यों के लिए एक ही समय में दो चीजें करने की आवश्यकता थी (जैसे रेस कंडीशन), लेकिन AI सख्ती से एक समय में एक ही कदम चलता है।
B. "दिमागी धुंध" की समस्या (संज्ञानात्मक सीमाएं)
कभी-कभी AI के पास सभी उपकरण होते हैं, लेकिन वह तर्क (logic) को समझ नहीं पाता।
- उपमा: कल्पना कीजिए कि एक जासूस जो टूटी हुई खिड़कियों (तकनीकी हैक्स) को खोजने में माहिर है, लेकिन वह पूरी तरह से इस बात को नजरअंदाज कर देता है कि मालिक ने डिलीवरी वाले से नाराज होने के कारण पिछला दरवाजा खुला छोड़ दिया था (बिजनेस लॉजिक)।
- उदाहरण:
- बिजनेस लॉजिक दोष: AI यह नहीं समझ सका कि वेबसाइट को वास्तव में कैसे काम करना चाहिए, इसलिए वह उसे धोखा देने में विफल रहा।
- लंबी श्रृंखलाएं (Long Chains): यदि किसी कार्य के लिए 20 चरणों की आवश्यकता थी जहाँ चरण 20, चरण 1 पर निर्भर था, तो AI भ्रमित हो जाता और अंत तक पहुँचते-पहुँचते कहानी की शुरुआत भूल जाता।
- अंधाधुंध अनुमान लगाना: कुछ जटिल पहेलियों के लिए, AI बस तब तक रैंडम चीजें आजमाता रहा जब तक कि उसका समय समाप्त नहीं हो गया, बजाय इसके कि वह सोच-समझकर आगे बढ़ता।
4. निष्कर्ष (The Bottom Line)
पेपर निष्कर्ष निकालता है कि हालांकि AI एजेंट बेहतर हो रहे हैं, वे अभी तक "मानव-स्तर" के नहीं हैं।
- अच्छी खबर: यदि आप AI को एक स्पष्ट योजना और टीम संरचना (रणनीतिकार + जासूस + आलोचक) देते हैं, तो यह बहुत कुशलता से और निरंतर काम करता है।
- बुरी खबर: एक "ग्लास सीलिंग" (कांच की छत) है। चाहे आप एक कस्टम टीम का उपयोग करें या एक सामान्य-उद्देश्य वाले AI का, वे सभी एक ही बिंदु पर रुक जाते हैं (30 में से 19)।
- असली बाधा: मुख्य समस्या यह नहीं है कि AI एक योजना को कैसे निष्पादित (execute) करता है; बल्कि यह है कि AI अक्सर सबसे पहले सही प्रकार की समस्या को पहचानने में विफल रहता है। एक बार जब AI भेद्यता (vulnerability) को सही ढंग से पहचान लेता है, तो वह उसे हल करने में अच्छा होता है। लेकिन यदि वह यह नहीं समझ पाता कि समस्या क्या है, तो वह शुरू ही नहीं कर सकता।
संक्षेप में: AI एक बहुत ही कुशल कार्यकर्ता है, लेकिन उसे अभी भी एक इंसान की जरूरत होती है जो उसे बता सके कि काम वास्तव में क्या है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।