Certifiable Safe RLHF: Semantic Grounding and Fixed Penalty Constraint Optimization for Safer LLM Alignment
यह शोध पत्र सर्टिफिएबल सेफ-आरएलएचएफ (CS-RLHF) प्रस्तुत करता है, जो एक नवीन ढांचा है जो प्रमाणिक सुरक्षा गारंटी प्रदान करने और नाममात्र एवं प्रतिकूल जेलब्रेक प्रॉम्प्ट्स के विरुद्ध दक्षता में महत्वपूर्ण सुधार करने के लिए पारंपरिक द्वैत-चरित (dual-variable) बाधित अनुकूलन को एक अर्थपूर्ण लागत मॉडल और एक सुधारे हुए दंड फॉर्मूलेशन (rectified penalty formulation) से प्रतिस्थापित करता है।