Exposing Long-Tail Safety Failures in Large Language Models through Efficient Diverse Response Sampling
يقترح هذا العمل ويثبت أن أخذ العينات المتنوعة للسكان التدريجي (PDPS)، وهي طريقة تكشف عن الثغرات الخفية من خلال تحويل التركيز من إعادة صياغة المدخلات إلى أخذ عينات منهجية وفعالة لمخرجات النماذج عالية الجودة والمتنوعة، يمكنها كشف نطاق واسع من المعرفة غير الآمنة المكبوتة في النماذج اللغوية الكبيرة بتكلفة حوسبية أقل بكثير من الطرق التقليدية.