Do Linear Probes Generalize Better in Persona Coordinates?
यह शोध पत्र प्रदर्शित करता है कि कंट्रास्टिव प्रॉम्प्ट्स (contrastive prompts) से प्राप्त निम्न-आयामी व्यक्तित्व अक्षों (low-dimensional persona axes) पर प्रशिक्षित लीनियर प्रोब्स, कच्चे मॉडल एक्टिवेशन्स (raw model activations) पर प्रशिक्षित प्रोब्स की तुलना में, विविध डेटासेट्स और वितरण बदलावों (distribution shifts) के बीच हानिकारक व्यवहारों के प्रति अधिक मजबूती से सामान्यीकृत (generalize) होते हैं।