Small Reward Models via Backward Inference
تقدم هذه الورقة FLIP، وهو نهج لنمذجة المكافأة بدون مرجع يستفيد من الاستدلال العكسي لإعادة بناء التعليمات من الاستجابات، مما يظهر أداءً متفوقًا على النماذج المرجعية القائمة على النموذج اللغوي الكبير كحَكَم (LLM-as-a-Judge)، ويعزز بشكل كبير المهام اللاحقة باستخدام النماذج اللغوية الصغيرة.