TAB-PO: Preference Optimization with a Token-Level Adaptive Barrier for Token-Critical Structured Generation
تقدم هذه الورقة البحثية TAB-PO، وهي طريقة مبتكرة لتحسين التفضيلات تستخدم حواجز تكيفية على مستوى الرمز (token-level) ومزايا موزونة للتغلب على قيود طريقة DPO القياسية في مهام التوليد الهيكلي الحرجة للرموز، محققةً تحسينات كبيرة في الأداء في مجال التوسيم الطبي من خلال معالجة مشكلات مثل انهيار الهامش وتخفيف التدرج.