REFLECTOR: Internalizing Step-wise Reflection against Indirect Jailbreak
यह शोध पत्र रिफ्लेक्टर (Reflector) को पेश करता है, जो एक दो-चरणीय ढांचा है जो शिक्षक-निर्देशित सुपरवाइज्ड फाइन-ट्यूनिंग और सुदृढीकरण लर्निंग (reinforcement learning) के माध्यम से एलएलएम (LLM) जनरेशन प्रक्रिया में आत्म-चिंतन को आंतरिक रूप से समाहित करता है, जिससे मॉडल की उपयोगिता और सामान्यीकरण को बढ़ाते हुए जटिल अप्रत्यक्ष जेलब्रेक (indirect jailbreaks) के विरुद्ध 90% से अधिक रक्षा सफलता प्राप्त होती है।