Secure Code Generation via Online Reinforcement Learning with Vulnerability Reward Model
SecCoderX एक ऑनलाइन सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो कोड उपयोगिता से समझौता किए बिना LLMs को संरेखित करने के लिए संश्लेषित भेद्यता-प्रेरित कार्यों और एक तर्क-आधारित पुरस्कार मॉडल का उपयोग करके कार्यक्षमता-संरक्षण सुरक्षित कोड जनरेशन प्राप्त करता है।