EvoRubrics: Dynamic Rubrics as Rewards via Adversarial Co-Evolution for LLM Reinforcement Learning
EvoRubrics एक सह-विकासवादी सुदृढीकरण अधिगम (co-evolutionary reinforcement learning) ढांचे को पेश करता है जहाँ एक नीति मॉडल (policy model) और एक रूब्रिक जनरेटर वास्तविक समय में एक-दूसरे के अनुकूल प्रतिकूल रूप से (adversarially) अनुकूलित होते हैं, जो गतिशील, विभेदक पुरस्कार प्रदान करने के लिए स्थिर मानदंडों की सीमाओं को पार करते हैं जो स्व-पर्यवेक्षित शिक्षण और स्वचालित पाठ्यक्रम निर्माण को सक्षम करते हैं।