G-Zero: Self-Play for Open-Ended Generation from Zero Data
G-Zero एक वर्िफायर-मुक्त (verifier-free), सह-विकासवादी (co-evolutionary) ढांचा है जो एक आंतरिक "Hint-" रिवॉर्ड का उपयोग करके LLM के ओपन-एंडेड आत्म-सुधार को सक्षम बनाता है, जिससे एक प्रपोजर (Proposer) मॉडल को चुनौतीपूर्ण प्रश्न और संकेत उत्पन्न करने के लिए प्रशिक्षित किया जाता है, जिससे एक जनरेटर (Generator) मॉडल DPO के माध्यम से उनसे सीखता है, और इस प्रकार बाहरी जजों की सीमाओं को दरकिनार करता है।