Personalizing LLMs with Binary Feedback: A Preference-Corrected Optimization Framework
تقدم هذه الورقة البحثية C-BPO، وهو إطار تحسين مُعاير بالتفضيلات يعزز تخصيص النماذج اللغوية الكبيرة من خلال الاستفيد من التغذية الراجعة الثنائية للتمييز بين تفضيلات المستخدم الفردية والمعرفة المشتركة، مما يساهم بفعالية في نمذجة الاختلافات بين المستخدمين مع الحفاظ على الفائدة العامة.