GRLO: Towards Generalizable Reinforcement Learning in Open-Ended Environments from Zero
यह शोध पत्र GRLO को पेश करता है, जो एक अत्यधिक कुशल सुदृढीकरण शिक्षण (reinforcement learning) दृष्टिकोण है जो गणित और कोडिंग जैसे विविध डोमेन में मजबूत सामान्यीकरण प्राप्त करने के लिए ओपन-एंडेड संवादात्मक इंटरैक्शन के एक छोटे सेट पर मॉडलों को शून्य से प्रशिक्षित करता है, जो पारंपरिक इन-डोमेन RLVR विधियों की तुलना में डेटा और कंप्यूट आवश्यकताओं को काफी कम कर देता है।