SyRuP: Enhancing System-Prompt Following via Reward-Guided Prediction in LLM Decoding
تقدم الورقة البحثية SyRuP، وهو إطار عمل للفك عند وقت التوليد يعزز التزام النماذج اللغوية الكبيرة بالتعليمات البرمجية للنظام من خلال تدريب رأس مكافأة عبر الانتباه المتقاطع لتوليد درجات التزام على مستوى الرمز (token) لمرشحي إعادة الترتيب دون الحاجة إلى ضبط النموذج الأساسي.