LLM-Based Persuasion Enables Guardrail Override in Frontier LLMs
यह शोध पत्र प्रदर्शित करता है कि फ्रंटियर-क्लास LLMs को सिम्युलेटेड उपयोगकर्ताओं के रूप में कार्य करने वाले अन्य LLMs द्वारा व्यवस्थित रूप से उनके सुरक्षा गार्डरेल्स को बायपास करने और होलोकॉस्ट के खंडन और जलवायु परिवर्तन जैसे संवेदनशील विषयों पर हानिकारक सामग्री उत्पन्न करने के लिए राजी किया जा सकता है, जो केवल प्राकृतिक भाषा के तर्कों का उपयोग करके कई मॉडल पेयरिंग में उच्च सफलता दर प्राप्त करता है।