← नवीनतम पेपर
💻 computer science

unix-ctf: Procedural Environments for Unix-Competence Reinforcement Learning

यह शोध पत्र **unix-ctf** को प्रस्तुत करता है, जो एक प्रक्रियात्मक वातावरण (procedural environment) है जो यूनिक्स सक्षमता (Unix competence) को अलग करने और प्रशिक्षित करने के लिए 656 विशिष्ट शेल-आधारित कैप्चर-द-फ्लैग कार्यों को उत्पन्न करता है, यह प्रदर्शित करते हुए कि इस सतह पर एक भाषा मॉडल को फाइन-ट्यून करना सामान्य प्रोग्रामिंग कौशल से स्वतंत्र रूप से ऑपरेटिंग सिस्टम प्रिमिटिव्स (operating system primitives) का उपयोग करने की इसकी क्षमता में महत्वपूर्ण सुधार करता है।

मूल लेखक: Geoffrey Bradway, Roger Creus Castanyer, Lorenz Wolf, Maxwill Lin, Matthew James Sargent, Augustine N. Mavor-Parker

प्रकाशित 2026-05-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Geoffrey Bradway, Roger Creus Castanyer, Lorenz Wolf, Maxwill Lin, Matthew James Sargent, Augustine N. Mavor-Parker

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "unix-ctf: Procedural Environments for Unix-Competence Reinforcement Learning" का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

मुख्य विचार: दो अलग-अलग कौशल

कल्पना कीजिए कि आप एक रोबोट को एक व्यस्त कार्यालय में काम करना सिखा रहे हैं। इसमें दो बहुत अलग कौशल शामिल हैं:

  1. "प्रोग्रामर" कौशल: रोबोट को एक जटिल रिपोर्ट लिखनी होगी, गणित की समस्या हल करनी होगी, या एक छोटी मशीन बनानी होगी। वह यह एक मानक भाषा (जैसे Python) का उपयोग करके कर सकता है और टर्मिनल का उपयोग केवल कोड टाइप करने के लिए एक साधारण टाइपराइटर के रूप में कर सकता है।
  2. "जैनिटर/मैनेजर" कौशल (Unix Competence): रोबोट को यह जानना होगा कि छिपी हुई चाबियाँ कहाँ हैं, या किसी विशिष्ट प्रकार के लॉक किए गए दराज को कैसे खोलना है, या फाइलिंग कैबिनेट पर अदृश्य स्याही से लिखे गए गुप्त संदेश को कैसे पढ़ना है। इसके लिए उसे इमारत के विशिष्ट नियमों को जानने की आवश्यकता है, न कि केवल एक रिपोर्ट लिखने की।

समस्या: एआई (AI) रोबोट के वर्तमान परीक्षण इन दोनों कौशलों को मिला देते हैं। एक रोबोट जो प्रोग्रामिंग में जीनियस है लेकिन इमारत के गुप्त नियमों के बारे में कुछ नहीं जानता, वह फिर भी टेस्ट पास कर सकता है। लेखक तर्क देते हैं कि हमें केवल "जैनिटर/मैनेजर" कौशल का परीक्षण करने के तरीके की आवश्यकता है—यानी ऑपरेटिंग सिस्टम के मूल उपकरणों का उपयोग करके उन चीजों को खोजने की क्षमता जो स्पष्ट नहीं हैं।

समाधान: एक "स्कैवेंजर हंट" जनरेटर

लेखकों ने unix-ctf नामक एक प्रणाली बनाई है। इसे एक स्वचालित फैक्ट्री के रूप में समझें जो एआई रोबोटों के लिए स्कैवेंजर हंट (खोज अभियान) तैयार करती है।

  • लक्ष्य: एक डिजिटल कमरे (एक Linux कंटेनर) के भीतर एक गुप्त टोकन (एक "फ्लैग" जैसे flag{abc123}) को छिपाना।
  • ट्विस्ट: फ्लैग केवल एक टेक्स्ट फाइल में नहीं है। इसे कंप्यूटर के ऑपरेटिंग सिस्टम की एक विशिष्ट, पेचीदा विशेषता का उपयोग करके छिपाया गया है।
    • उदाहरण: फ्लैग को किसी फ़ाइल के "एक्सटेंडेड एट्रिब्यूट्स" (extended attributes) के अंदर छिपाना (जैसे किसी फोटो के पीछे चिपका हुआ एक गुप्त नोट जिसे आप तब तक नहीं देख सकते जब तक आप यह न जानते हों कि कहाँ देखना है)।
    • उदाहरण: फ्लैग को किसी संगीत फ़ाइल के मेटाडेटा में या किसी प्रोग्राम के विशिष्ट भाग के भीतर छिपाना।
  • रोबोट का काम: रोबोट को कमरे की खोज करनी होगी, यह पता लगाना होगा कि कौन सा ट्रिक इस्तेमाल किया गया है, और फ्लैग खोजने के लिए सही कमांड का उपयोग करना होगा।

उन्होंने इसे कैसे बनाया (द फैक्ट्री)

इन पहेलियों को मैन्युअल रूप से बनाना कठिन है। लेखकों ने इन पहेलियों को स्वचालित रूप से बनाने के लिए एक स्मार्ट पाइपलाइन का उपयोग किया:

  1. आर्किटेक्ट (LLM): उन्होंने एक शक्तिशाली AI से फ्लैग छिपाने के विचार (जैसे, "फ्लैग को वर्ष 1970 से पहले की बनी फ़ाइल में छिपाएं") देने के लिए कहा।
  2. इंस्पेक्टर (मैकेनिकल चेक्स): पहेली को सेव करने से पहले, एक रोबोट इंस्पेक्टर दो चीजें चेक करता है:
    • "नो चीटिंग" नियम: क्या फ्लैग इतनी अच्छी तरह छिपा है कि एक साधारण सर्च से वह न मिल सके?
    • "रिकवरी" नियम: यदि आप एक नए कमरे से शुरुआत करते हैं, तो क्या रिकवरी स्क्रिप्ट वास्तव में फ्लैग को ढूंढ सकती है?
  3. परिणाम: वे 750 विचारों के साथ शुरू हुए। क्योंकि उनका "इंस्पेक्टर" बहुत सख्त था, इसलिए 656 विचार पास हुए। यह एक 87.5% सफलता दर है।
    • तुलना: जब उन्होंने अन्य शोधकर्ताओं के एक समान प्रोजेक्ट की नकल करने की कोशिश की, तो केवल 17.5% पहेलियाँ काम कर पाईं। लेखकों का तरीका अधिक विश्वसनीय पहेलियाँ बनाने में बहुत बेहतर है।

अंत में उनके पास 155 अद्वितीय प्रकार के ट्रिक्स थे (जैसे फ़ाइल नामों में, छिपे हुए सिस्टम लॉग्स में, या विशेष कोड सेक्शन में छिपाना)।

रोबोट को प्रशिक्षित करना

लेखकों ने एक मानक AI मॉडल (Qwen3-8B) लिया और इन स्कैवेंजर हंट्स का उपयोग करके उसे प्रशिक्षित किया।

  • प्रशिक्षण: उन्होंने केवल रोबोट को उत्तर नहीं दिखाया। उन्होंने रोबोट को प्रयास करने, विफल होने और फीडबैक से सीखने दिया (Reinforcement Learning)।
  • परिणाम:
    • प्रशिक्षण से पहले, रोबोट नई पहेलियों में से लगभग 11.6% हल कर पाया।
    • प्रशिक्षण के बाद, उसने 43.6% हल कीं।
    • यह साबित करता है कि रोबोट ने वास्तव में विशिष्ट "Unix" कौशल सीखे हैं, न कि केवल उत्तर रटे हैं।

क्या यह अन्य परीक्षणों में मदद करता है?

लेखकों ने परीक्षण किया कि क्या इन स्कैवेंजर हंट्स को सीखने से रोबोट को अन्य मौजूदा परीक्षणों (जैसे InterCode-CTF, जो सुरक्षा कौशल के लिए एक मानक परीक्षण है) पर मदद मिली।

  • आश्चर्य: रोबोट हर चीज़ में बेहतर नहीं हुआ। वह कोड लिखने में बेहतर नहीं हुआ।
  • जीत: वह उन विशिष्ट कार्यों में बहुत बेहतर हो गया जिनमें "Unix competence" की आवश्यकता थी (जैसे Forensics)।
    • "Forensics" श्रेणी (छिपे हुए सुराग खोजने) में, सफलता दर में 33 प्रतिशत अंक की वृद्धि हुई।
    • यह पुष्टि करता है कि प्रशिक्षण ने रोबोट को एक बेहतर डिजिटल डिटेक्टिव बनने का हुनर सिखाया, विशेष रूप से कंप्यूटर सिस्टम के भीतर छिपी चीजों को खोजने के लिए।

सारांश

यह पेपर AI को सीधे कंप्यूटर ऑपरेटिंग सिस्टम का बेहतर उपयोग करने के लिए प्रशिक्षित करने का एक नया तरीका पेश करता है। केवल AI को टर्मिनल के माध्यम से कोड लिखना सिखाने के बजाय, उन्होंने छिपी हुई वस्तुओं की पहेलियों का एक विशेष "जिम" बनाया। उन्होंने साबित किया कि:

  1. आप स्वचालित रूप से उच्च गुणवत्ता वाली, पेचीदा पहेलियाँ बना सकते हैं।
  2. AI इन विशिष्ट "ऑपरेटिंग सिस्टम डिटेक्टिव" कौशलों को सीख सकता है।
  3. यह प्रशिक्षण AI को छिपे हुए डेटा को खोजने में काफी बेहतर बनाता है, एक ऐसा कौशल जिसे पिछले प्रशिक्षण तरीकों ने अक्सर मिस कर दिया था।

उन्होंने क्या दावा नहीं किया: उन्होंने यह दावा नहीं किया कि इससे AI एक बेहतर सामान्य प्रोग्रामर बन जाता है, और न ही उन्होंने दावा किया कि यह वास्तविक दुनिया के हैकिंग हमलों या चिकित्सा समस्याओं को हल करता है। उन्होंने सख्ती से केवल एक Unix कंप्यूटर सिस्टम के भीतर चीजों को खोजने और नेविगेट करने की AI की क्षमता को मापने और सुधारने पर ध्यान केंद्रित किया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →