Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization
मेटिस (Metis) एक नवीन ढांचा है जो एलएलएम (LLM) जेलब्रेकिंग को एक प्रतिकूल POMDP के भीतर एक स्व-विकसित मेटाकॉग्निटिव पॉलिसी ऑप्टिमाइज़ेशन प्रक्रिया के रूप में पुनर्गठित करता है, जो उन्नत सुरक्षा रक्षा प्रणालियों को बायपास करने के लिए स्थिर ह्यूरिस्टिक्स के स्थान पर निर्देशित, कारण संबंधी तर्क (causal reasoning) का उपयोग करके अत्याधुनिक हमला सफलता दर और काफी कम टोकन लागत प्राप्त करता है।