A Systematic Investigation of The RL-Jailbreaker in LLMs
यह शोध पत्र RL-आधारित जेलब्रेकिंग का पहला व्यवस्थित अपघटन प्रस्तुत करता है, जो यह प्रकट करता है कि पर्यावरणीय औपचारिकीकरण कारक—विशेष रूप से सघन पुरस्कार (dense rewards) और विस्तारित एपिसोड की लंबाई—सभी लक्षित लार्ज लैंग्वेज मॉडल्स और उनके सुरक्षा उपायों के विरुद्ध सफल हमलों के प्राथमिक चालक हैं।