RLSF: Fine-tuning LLMs via Symbolic Feedback
تقدم الورقة البحثية "التعلم التعزيزي عبر التغذية الراجعة الرمزية" (RLSF)، وهو نموذج جديد للضبط الدقيق يستفيد من أدوات الاستدلال الرمزي لتوفير تغذية راجعة دقيقة على مستوى الرمز (token-level)، مما يمكّن النماذج اللغوية الكبيرة الأصغر حجماً من التفوق بشكل كبير على النماذج المغلقة الأكبر حجماً في المهام التي تتطلب توافقاً منطقياً خاصاً بمجال معين.