Resist and Update: Counterfactual Report Coordinates for Incentive-Compatible LLMs
यह शोध पत्र लो-रैंक एक्टिवेशन कोऑर्डिनेट्स की पहचान करने और एक काउंटरफैक्चुअल रिपोर्ट क्लैंप लागू करने के माध्यम से बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) को आंतरिक प्रोत्साहन अनुकूलता (इंटरनल इनसेंटिव कम्पैटिबिलिटी) के साथ संरेखित करने के लिए एक प्रशिक्षण-मुक्त विधि प्रस्तावित करता है, जो यह सुनिश्चित करता है कि मॉडल वास्तविक साक्ष्यों के प्रति उत्तरदायी बने रहते हुए वर्जित दबावों का प्रतिरोध करें।