Exposing Long-Tail Safety Failures in Large Language Models through Efficient Diverse Response Sampling
यह कार्य प्रस्तावित करता है और प्रदर्शित करता है कि प्रोग्रेसिव डाइवर्स पॉपुलेशन सैंपलिंग (PDPS), एक ऐसी विधि जो इनपुट को फिर से लिखने के बजाय उच्च गुणवत्ता वाले विविध मॉडल आउटपुट को व्यवस्थित रूप से और कुशलतापूर्वक नमूना लेने पर ध्यान केंद्रित करके छिपी हुई कमजोरियों को उजागर करती है, पारंपरिक तरीकों की तुलना में काफी कम कम्प्यूटेशनल लागत पर एलएलएम (LLMs) में दबी हुई असुरक्षित जानकारी की एक विस्तृत श्रृंखला को उजागर कर सकती है।