← नवीनतम पेपर
🤖 machine learning

Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization

मेटिस (Metis) एक नवीन ढांचा है जो एलएलएम (LLM) जेलब्रेकिंग को एक प्रतिकूल POMDP के भीतर एक स्व-विकसित मेटाकॉग्निटिव पॉलिसी ऑप्टिमाइज़ेशन प्रक्रिया के रूप में पुनर्गठित करता है, जो उन्नत सुरक्षा रक्षा प्रणालियों को बायपास करने के लिए स्थिर ह्यूरिस्टिक्स के स्थान पर निर्देशित, कारण संबंधी तर्क (causal reasoning) का उपयोग करके अत्याधुनिक हमला सफलता दर और काफी कम टोकन लागत प्राप्त करता है।

मूल लेखक: Huilin Zhou, Jian Zhao, Yilu Zhong, Zhen Liang, Xiuyuan Chen, Yuchen Yuan, Tianle Zhang, Chi Zhang, Lan Zhang, Xuelong Li

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Huilin Zhou, Jian Zhao, Yilu Zhong, Zhen Liang, Xiuyuan Chen, Yuchen Yuan, Tianle Zhang, Chi Zhang, Lan Zhang, Xuelong Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक हाई-टेक, अत्यंत सुरक्षित तिजोरी (AI मॉडल) खोलने की कोशिश कर रहे हैं जिसके सामने एक बहुत ही बुद्धिमान और सतर्क गार्ड (सेफ्टी अलाइनमेंट) खड़ा है।

लंबे समय से, हैकर्स (रेड टीमर्स) दरवाजे पर पत्थर फेंककर, अलग-अलग चाबियाँ आजमाकर, या तब तक रैंडम वाक्यांश चिल्लाकर घुसने की कोशिश कर रहे थे जब तक कि कुछ काम न कर जाए। यह स्टोकेस्टिक सर्च (stochastic search) है: बहुत सारी अटकलें, बहुत सारी बर्बाद कोशिशें, और यह अक्सर नए, स्मार्ट गार्ड्स के खिलाफ विफल हो जाता है।

यह पेपर Metis नामक एक नया टूल पेश करता है। Metis केवल दरवाजा तोड़ने की कोशिश करने वाला चोर नहीं है; यह सीखता है कि गार्ड कैसे सोचता है और वास्तविक समय में अपनी रणनीति बदलता है।

यहाँ बताया गया है कि Metis कैसे काम करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. दो-मस्तिष्क प्रणाली (हमलावर और मूल्यांकनकर्ता)

Metis केवल एक रोबोट नहीं है; यह एक लूप में काम करने वाली दो इकाइयों की एक टीम है:

  • द अटैकर (चोर): यह वह है जो AI को धोखा देने की कोशिश कर रहा है। लेकिन पुराने तरीकों के विपरीत, इस अटैकर के पास एक "सोचने" वाला चरण है। कोई प्रश्न पूछने से पहले, यह विश्लेषण करने के लिए रुकता है: "पिछली बार गार्ड ने 'ना' क्यों कहा? क्या मैं बहुत स्पष्ट था? क्या मैंने गलत शब्दों का उपयोग किया?"
  • द इवैल्यूएटर (कोच): यह दूसरा AI है जो बातचीत पर नज़र रखता है। केवल "पास" या "फेल" कहने के बजाय, कोच एक विस्तृत रिपोर्ट कार्ड देता है। यह कहता है, "आप विफल रहे, लेकिन यहाँ इसका सटीक कारण है: आपने बहुत सीधे तरीके से पूछा। इसके बजाय, इसे एक मूवी स्क्रिप्ट की कहानी के रूप में पेश करने की कोशिश करें।"

2. "मेटाकॉग्निटिव" लूप (अपनी सोच के बारे में सोचना)

इसका असली मंत्र मेटाकॉग्निशन (Metacognition) है। मानवीय शब्दों में, यह "अपनी अपनी सोच के बारे में सोचना" है।

  • पुराना तरीका: हैकर एक चाल चलता है। गार्ड "ना" कहता है। हैकर एक अलग रैंडम चाल चलता है।
  • Metis का तरीका: हैकर एक चाल चलता है। गार्ड "ना" कहता है। हैकर सोचता है: "आह, गार्ड 'हैक' शब्द के प्रति संदिग्ध है। मैं इस शब्द का उपयोग करना बंद कर दूँगा। इसके बजाय, मैं यह नाटक करूँगा कि मैं तालों के काम करने के तरीके का अध्ययन करने वाला एक वैज्ञानिक हूँ।"
  • इसके बाद, हैकर गार्ड के तर्क के अपने आंतरिक मानचित्र (internal map) को अपडेट करता है और उस निदान के आधार पर एक बिल्कुल नई, स्मार्ट रणनीति अपनाता है।

3. "सिमेंटिक ग्रेडिएंट" (एक दिशा-सूचक यंत्र)

कल्पना कीजिए कि आप अंधेरे में छिपे हुए खजाने को खोजने की कोशिश कर रहे हैं।

  • पुराने तरीके ऐसे हैं जैसे आप गोल-गोल घूम रहे हैं, इस उम्मीद में कि आप संयोग से खजाने से टकरा जाएंगे।
  • Metis एक कंपास की तरह है जो न केवल उत्तर (North) की ओर इशारा करता है, बल्कि यह भी बताता है कि, "आप 10 कदम दूर हैं, और यदि आप थोड़ा बाईं ओर मुड़ते हैं, तो जमीन नरम हो जाएगी।"
  • "इवैल्यूएटर" यह कंपास प्रदान करता है। यह एक "सिमेंटिक ग्रेडिएंट" देता है—भाषा की दुनिया में एक दिशा जो अटैकर को केवल यह बताने के बजाय कि वे गलत हैं, उत्तर की ओर ले जाती है।

4. परिणाम: स्मार्ट और सस्ता

पेपर ने 10 अलग-अलग AI मॉडल्स के खिलाफ Metis का परीक्षण किया, जिनमें सबसे उन्नत मॉडल्स (जैसे GPT-5 और O1) भी शामिल हैं।

  • सफलता दर (Success Rate): Metis औसतन 89.2% बार सुरक्षा गार्डों को तोड़ने में सफल रहा। यह पिछले तरीकों की तुलना में बहुत अधिक है, जो सबसे स्मार्ट गार्ड्स के सामने आने पर अक्सर शून्य के करीब गिर जाते थे।
  • दक्षता (Efficiency): क्योंकि Metis रैंडम अनुमान लगाने में समय बर्बाद नहीं करता है, इसलिए यह सफल होने के लिए 8 से 11 गुना कम कंप्यूटर पावर (टोकन्स) का उपयोग करता है। यह दीवार से टकराने के बजाय मैप देखकर भूलभुलैया सुलझाने जैसा है।

5. एक बड़ी चेतावनी

पेपर एक गंभीर अवलोकन के साथ समाप्त होता है: आज के सर्वश्रेष्ठ सुरक्षा गार्ड भी इस तरह के "सोचने वाले" हमले के प्रति संवेदनशील हैं। गार्ड बुरे शब्दों को पहचानने में अच्छे हैं, लेकिन वे संघर्ष करते हैं जब कोई हमलावर किसी चीज़ को प्रकट करने के लिए धीरे-धीरे उन्हें धोखा देने के लिए एक लंबी, तार्किक बातचीत का उपयोग करता है।

संक्षेप में: Metis एक ऐसा सिस्टम है जो एक AI को दूसरे AI को जेलब्रेक करने के तरीके सिखाता है, जो लगातार अपनी गलतियों का विश्लेषण करता है, अपने सामने वाले गार्ड के विशिष्ट "व्यक्तित्व" को सीखता है, और एक जुआरी के बजाय शतरंज के ग्रैंडमास्टर की तरह अपनी रणनीति को अनुकूलित करता है। लेखक कहते हैं कि यह साबित करता है कि हमें बेहतर सुरक्षा की आवश्यकता है जो गतिशील रूप से "सोच" सके, न कि केवल स्थिर नियमों की।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →