CoRe-Code: Collaborative Reinforcement Learning for Code Generation
CoRe-Code एक सहयोगात्मक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो जटिल कार्यों में कोड जनरेशन की सटीकता और दक्षता को सुधारने तथा ऑटोरेग्रेसिव डिकोडिंग की सीमाओं को दूर करने के लिए ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) द्वारा उन्नत भूमिका-विशिष्ट प्लानर (Planner) और कोडर (Coder) एजेंटों का उपयोग करता है।