High-Dimensional Random Projection for Activation Steering in Language Models
यह शोध पत्र HiDRA को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) एक्टिवेशन स्टीयरिंग विधि है जो गैररेखीय फीचर सबस्पेस (nonlinear feature subspaces) में विभेदक संकेतों (discriminative signals) को कैप्चर करने के लिए उच्च-आयामी यादृच्छिक प्रक्षेपों (high-dimensional random projections) का लाभ उठाता है, जिससे यह महत्वपूर्ण कम्प्यूटेशनल ओवरहेड के बिना लार्ज लैंग्वेज मॉडल के व्यवहार को नियंत्रित करने में मौजूदा रैखिक माध्य-अंतर (linear mean-difference) दृष्टिकोणों से बेहतर प्रदर्शन करता है।