Mechanistically Eliciting Latent Behaviors in Language Models
यह शोध पत्र कॉज़ल पर्टर्बेटिव एलिसिटेशन (CPE) को प्रस्तुत करता है, जो एक अनसुपरवाइज्ड (unsupervised), डेटा-कुशल विधि है जो विविध लेटेंट व्यवहारों (latent behaviors) को उजागर करने में सक्षम व्याख्या योग्य लो-रैंक एडेप्टर्स (low-rank adapters) की खोज के लिए टेंसर डिकंपोजिशन का उपयोग करता है, जिसमें जटिल तर्क और सैंडबैगिंग (sandbagging) या अलाइनमेंट-फेकिंग (alignment-faking) जैसे छिपे हुए विफलता मोड शामिल हैं, जिससे यह एआई सुरक्षा मूल्यांकन और अलाइनमेंट के लिए एक शक्तिशाली उपकरण प्रदान करता है।