TAB-PO: Preference Optimization with a Token-Level Adaptive Barrier for Token-Critical Structured Generation
यह शोधपत्र TAB-PO प्रस्तुत करता है, जो एक नवीन प्राथमिकता अनुकूलन (preference optimization) विधि है जो टोकन-क्रिटिकल संरचित पीढ़ी कार्यों में मानक DPO की सीमाओं को दूर करने के लिए टोकन-स्तरीय अनुकूली बाधाओं (adaptive barriers) और भारित लाभों (weighted advantages) का उपयोग करती है, जिससे मार्जिन कोलैप्स और ग्रेडिएंट डाइल्यूशन जैसी समस्याओं को संबोधित करते हुए मेडिकल एनोटेशन में महत्वपूर्ण प्रदर्शन सुधार प्राप्त होता है।