Consistency Training while Mitigating Obfuscation via Rate Matching
यह शोध पत्र रेट मैचिंग कंसिस्टेंसी ट्रेनिंग (RMCT) को प्रस्तुत करता है, जो एक नवीन विधि है जो बड़े भाषा मॉडलों में अस्पष्टता (obfuscation) को कम करती है, क्योंकि यह समान प्रतिक्रियाओं को थोपने के बजाय इनपुट परिवर्तनों (perturbations) के माध्यम से विशिष्ट व्यवहारों की आवृत्ति को संरेखित करती है, जिससे मॉडल की पारदर्शिता को बनाए रखते हुए चाटुकारिता (sycophancy) जैसे बाहरी संकेतों के प्रति मजबूती में सुधार होता है।