← नवीनतम पेपर
🤖 AI

Post-Training Local LLM Agents for Linux Privilege Escalation with Verifiable Rewards

यह शोध पत्र PrivEsc-LLM को प्रस्तुत करता है, जो एक 4B स्थानीय मॉडल है जिसे सुपरवाइज्ड फाइन-ट्यूनिंग और सत्यापन योग्य पुरस्कारों (verifiable rewards) के साथ सुदृढीकरण लर्निंग (reinforcement learning) के दो-चरणीय पाइपलाइन के माध्यम से प्रशिक्षित किया गया है, जो लिनक्स प्रिविलेज एस्केलेशन कार्यों में 95.8% सफलता प्राप्त करता है—जो शीर्ष स्तर के क्लोज्ड मॉडलों के लगभग बराबर है—जबकि अनुमान लागत (inference costs) को 100 गुना से अधिक कम कर देता है।

मूल लेखक: Philipp Normann, Andreas Happe, Jürgen Cito, Daniel Arp

प्रकाशित 2026-03-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Philipp Normann, Andreas Happe, Jürgen Cito, Daniel Arp

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, लेकिन थोड़ा अनुभवहीन, प्रशिक्षु जासूस (apprentice detective) है। यह जासूस (AI) किताबें पढ़ने और तथ्यों को जानने में तो बहुत अच्छा है, लेकिन वह वास्तव में एक असली, अस्त-व्यस्त कमरे में रहस्य सुलझाने में बहुत बुरा है। उसे यह तो पता हो सकता है कि एक लॉकपिक (lockpick) क्या होता है, लेकिन वह यह नहीं जानता कि बिना दरवाजे को तोड़े उसका उपयोग कैसे किया जाए, या वह एक ही ताले को खोलने की कोशिश में एक घंटे तक फंसा रह सकता है।

यह शोध पत्र इस बारे में है कि उस प्रशिक्षु जासूस को एक मास्टर हैकर (विशेष रूप से, एक "प्रिविलेज एस्केलेशन" विशेषज्ञ) बनने के लिए कैसे सिखाया जाए, बिना किसी बहुत महंगे, क्लाउड-आधारित "ग्रैंड मास्टर" जासूस के हाथ पकड़ने की आवश्यकता के।

यहाँ शोधकर्ताओं ने क्या किया है, इसका विवरण सरल उपमाओं (analogies) का उपयोग करके दिया गया है:

समस्या: "क्लाउड-ओनली" जासूस

अभी के समय में, सबसे अच्छे AI हैकर्स उन ग्रैंड मास्टर्स की तरह हैं जो एक विशाल, महंगे गगनचुंबी इमारत (क्लाउड) में रहते हैं। वे अविश्वसनीय रूप से शक्तिशाली हैं, लेकिन:

  1. वे महंगे हैं: आपको उनसे कोई सवाल पूछने के लिए बहुत पैसा देना पड़ता है।
  2. वे धीमे हैं: आपको अपनी गुप्त फाइलें उनकी इमारत में भेजनी पड़ती हैं, उनके देखने का इंतज़ार करना पड़ता है, और फिर उन्हें वापस मंगवाना पड़ता है।
  3. वे गोपनीयता का जोखिम हैं: आप अपनी कंपनी का गुप्त कोड किसी अजनबी की इमारत में नहीं भेज सकते।

शोधकर्ता एक स्थानीय जासूस (local detective) बनाना चाहते थे जो आपके अपने बेसमेंट (आपके स्थानीय कंप्यूटर) में रहता हो। यह जासूस छोटा और सस्ता है, लेकिन आमतौर पर, यह कठिन मामलों को सुलझाने के लिए पर्याप्त बुद्धिमान नहीं होता है।

समाधान: दो-चरणों वाला ट्रेनिंग कैंप

शोधकर्ताओं ने एक छोटे, स्थानीय AI मॉडल (जिसे Qwen3-4B कहा जाता है, जो एक स्मार्ट हाई स्कूल छात्र की तरह है) को लिया और उसे PrivEsc-LLM बनाने के लिए दो-भागों वाला बूट कैंप दिया।

चरण 1: "पाठ्यपुस्तक" चरण (सुपरवाइज्ड फाइन-ट्यूनिंग)

कल्पना कीजिए कि आप प्रशिक्षु जासूस को हल किए गए रहस्य उपन्यासों का एक ढेर देते हैं। ये केवल कहानियाँ नहीं हैं; ये स्टेप-बाय-स्टेप ट्रांसक्रिप्ट हैं कि कैसे एक प्रो ने एक विशिष्ट प्रकार के ताला खोलने की समस्या को हल किया।

  • क्या हुआ: AI ने इन "समाधानों" को पढ़ा और पैटर्न सीखे। इसने सीखा, "ओह, जब मैं एक विशिष्ट प्रकार का दरवाजा देखता हूँ, तो मुझे इस विशिष्ट चाबी को आज़माना चाहिए।"
  • परिणाम: प्रशिक्षु बहुत बेहतर हो गया। यह 42% पहेलियों को सुलझाने से बढ़कर 80% तक पहुँच गया। लेकिन यह अभी भी थोड़ा धीमा था और कभी-कभी फंस जाता था।

चरण 2: "वीडियो गेम" चरण (सत्यापन योग्य पुरस्कारों के साथ सुदृढीकरण सीखना - Reinforcement Learning)

यही जादू वाला हिस्सा है। केवल किताबें पढ़ने के बजाय, अब प्रशिक्षु को एक वीडियो गेम में डाल दिया जाता है जहाँ लक्ष्य "बॉस लेवल" (रूट एक्सेस) तक पहुँचना है।

  • नियम: गेम में एक सख्त टाइमर है। हर बार जब AI कोई चाल चलता है (सवाल पूछता है या कमांड आज़माता है), तो इसमें "समय" की लागत आती है।
  • पुरस्कार प्रणाली:
    • अच्छा मूव: यदि वह कोई सुराग पाता है, तो उसे छोटे अंक मिलते हैं।
    • जीतना: यदि वह "बॉस लेवल" तक पहुँच जाता है, तो उसे एक बड़ा जैकपॉट मिलता है।
    • बुरा मूव: यदि वह एक ही गलत चाबी को 10 बार आज़माता है, या दीवार को घूरते हुए समय बर्बाद करता है, तो उसके अंक कट जाते हैं।
  • ट्विस्ट: गेम रैंडम तरीके से जेनरेट किया जाता है। दरवाजों का रंग बदल जाता है, चाबियों के नाम बदल जाते हैं, और ताले हिलते हैं। यह AI को ताले खोलने के लॉजिक को सीखने के लिए मजबूर करता है, न कि केवल विशिष्ट चाबियों को रटने के लिए।

AI ने इस गेम को हजारों बार खेला। इसने सीखा कि समय बर्बाद करना कैसे बंद किया जाए, तेज़ी से कैसे सोचा जाए, और यह कब पता लगाया जाए कि अनुमान लगाना बंद करना है और हमला करना शुरू करना है।

परिणाम: अंडरडॉग की जीत

शोधकर्ताओं ने अपने नए स्थानीय जासूस का परीक्षण 12 विभिन्न सुरक्षा पहेलियों पर "ग्रैंड मास्टर्स" (महंगे क्लाउड AI) के खिलाफ किया।

  • गति: स्थानीय AI अविश्वसनीय रूप से तेज़ था। इसने 20 मूव्स के भीतर 95.8% पहेलियों को हल किया।
  • तुलना: महंगे क्लाउड AI (Claude Opus) ने 97.5% हल किया। स्थानीय AI लगभग उतना ही अच्छा था!
  • लागत: यहाँ मुख्य बात है। क्लाउड AI एक पहेली को हल करने के लिए लगभग $0.62 खर्च करता है। स्थानीय AI लगभग $0.005 खर्च करता है। यह 100 गुना सस्ता है।

यह क्यों मायने रखता है

इसे इस तरह सोचें:

  • पहले: एक जटिल सुरक्षा समस्या को हल करने के लिए, आपको एक दूसरे देश में काम करने वाले $1,000/घंटा के सलाहकार को काम पर रखना पड़ता था।
  • अब: आप एक $10/घंटा के स्थानीय कर्मचारी को प्रशिक्षित कर सकते हैं जो काम को लगभग उतना ही अच्छी तरह जानता है, आपके कार्यालय में काम करता है, और कभी आपकी इमारत नहीं छोड़ता।

"सीक्रेट सॉस" (गुप्त नुस्खा)

पेपर इस बात पर ज़ोर देता है कि उन्होंने केवल उत्तरों को याद रखने देकर धोखाधड़ी नहीं की। उन्होंने एक "प्रोसीजरल जनरेटर" (एक गेम इंजन की तरह जो हर बार एक नया लेवल बनाता है) का उपयोग किया ताकि यह सुनिश्चित हो सके कि AI ने केवल विशिष्ट टेस्ट प्रश्नों के उत्तर नहीं, बल्कि हैकिंग का कौशल सीखा है।

संक्षेप में

शोधकर्ताओं ने साबित किया कि शीर्ष स्तर का सुरक्षा विशेषज्ञ बनने के लिए आपको एक विशाल, महंगे, क्लाउड-आधारित सुपरकंप्यूटर की आवश्यकता नहीं है। सही प्रशिक्षण (हल किए गए मामलों को पढ़ना + रिवॉर्ड-आधारित वीडियो गेम खेलना) के साथ, एक छोटा, सस्ता, स्थानीय AI दुनिया के सबसे महंगे सिस्टमों के लगभग बराबर काम कर सकता है, जबकि आपके धन की बचत करता है और आपके डेटा को सुरक्षित रखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →