Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift
यह शोध पत्र टोकन-लेवल ऑफ-पॉलिसी लेबलिंग (TOPL) का प्रस्ताव करता है, जो एक प्रशिक्षण प्रतिमान (पैराडाइम) है जो पोस्ट-ट्रेनिंग को टोकन-स्तरीय शुद्धता भविष्यवाणी कार्य के रूप में पुनर्गठित करता है ताकि सारांशीकरण और मशीन अनुवाद जैसे निष्ठावान जनरेशन कार्यों में मजबूत आउट-ऑफ-डिस्ट्रीब्यूशन सामान्यीकरण और व्याख्या योग्य मॉडल अपडेट प्राप्त किया जा सके।