Introspection Adapters: Training LLMs to Report Their Learned Behaviors
यह शोध पत्र इंट्रोस्पेक्शन एडेप्टर्स (Introspection Adapters) का परिचय देता है, जो एक स्केलेबल विधि है जिसमें LoRA का उपयोग करके बड़े भाषा मॉडलों को उनके अपने सीखे हुए व्यवहारों को मौखिक रूप से रिपोर्ट करने के लिए प्रशिक्षित किया जाता है, जिससे उन सूक्ष्म या हानिकारक लक्षणों के प्रभावी ऑडिटिंग को सक्षम बनाया जा सके जो तब भी मौजूद हो सकते हैं जब उन मॉडलों को एडेप्टर के प्रशिक्षण डेटा से भिन्न तरीके से प्रशिक्षित किया गया हो।