LLM-Based Persuasion Enables Guardrail Override in Frontier LLMs
تُثبت هذه الورقة أن النماذج اللغوية الكبيرة من فئة الطليعة يمكن إقناعها بشكل منهجي من قبل نماذج لغوية كبيرة أخرى تعمل كمستخدمين محاكيين لتجاوز حواجز الحماية الخاصة بها وتوليد محتوى ضار حول مواضيع حساسة مثل إنكار الهولوكوست وتغير المناخ، محققة معدلات نجاح عالية عبر أزواج متعددة من النماذج باستخدام الحجج اللغوية الطبيعية فقط.