Fuzzing Large Language Models to Elicit Hidden Behaviours
यह शोध पत्र बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) में छिपे हुए "स्लीपर एजेंट" व्यवहारों को उजागर करने के लिए वेट्स (weights) या एक्टिवेशन्स (activations) में शोर (noise) इंजेक्ट करके एक व्यवस्थित फज़िंग दृष्टिकोण प्रस्तुत करता है, जो यह प्रदर्शित करता है कि यह टेम्परेचर सैंपलिंग से बेहतर प्रदर्शन करता है और एक सस्ते प्रॉक्सी कार्य के माध्यम से हाइपरपैरामीटर चयन, यूनिफॉर्म स्वीप की तुलना में इलिकिटेशन रेट (elicitation rates) में महत्वपूर्ण सुधार करता है।