Frictive Policy Optimization for LLMs: Epistemic Intervention, Risk-Sensitive Control, and Reflective Alignment
यह शोध पत्र फ्रिक्टिव पॉलिसी ऑप्टिमाइज़ेशन (FPO) को प्रस्तुत करता है, जो एक नया ढांचा है जो LLM अलाइनमेंट को एक जोखिम-संवेदनशील एपिस्टेमिक नियंत्रण समस्या के रूप में पुनर्गठित करता है जहाँ एजेंट केवल तत्काल कार्य पुरस्कारों के लिए अनुकूलन करने के बजाय अनिश्चितता और मानदण्ड संबंधी जोखिम को प्रबंधित करने के लिए स्पष्टीकरण और इनकार जैसे हस्तक्षेपों को रणनीतिक रूप से तैनात करना सीखते हैं।