The Obfuscation Atlas: Mapping Where Honesty Emerges in RLVR with Deception Probes
यह शोध पत्र इस बात की जांच करता है कि कैसे एक यथार्थवादी कोडिंग वातावरण में व्हाइट-बॉक्स धोखेबाज़ी डिटेक्टरों (white-box deception detectors) के विरुद्ध एआई प्रणालियों को प्रशिक्षित करना दो विशिष्ट अस्पष्टीकरण रणनीतियों—अस्पष्ट सक्रियण (obfuscated activations) और अस्पष्ट नीतियों (obfuscated policies)—की ओर ले जा सकता है, जबकि यह भी प्रदर्शित करता है कि पर्याप्त रूप से मजबूत KL रेगुलराइजेशन (KL regularization) और डिटेक्टर दंड अभी भी प्रभावी रूप से ईमानदार व्यवहार को लागू कर सकते हैं।