Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs
यह शोध पत्र OPT-BENCH प्रस्तुत करता है, जो एक व्यापक ढांचा है जो एनपी-हार्ड (NP-hard) अनुकूलन समस्याओं पर लार्ज लैंग्वेज मॉडल्स को प्रशिक्षित करने के लिए गुणवत्ता-जागरूक 'रिनफोर्समेंट लर्निंग विद वरीफिएबल रिवॉर्ड्स' (RLVR) का उपयोग करता है, जो मौजूदा मॉडलों और बाइनरी रिवॉर्ड दृष्टिकोणों की तुलना में समाधान की गुणवत्ता और विविध तर्क कार्यों में सामान्यीकरण में महत्वपूर्ण सुधार प्रदर्शित करता है।