On the Generalization Gap in Self-Evolving Language Model Reasoning
यह शोध पत्र क्लोज्ड-लूप सेल्फ-इवॉल्विंग लैंग्वेज मॉडल्स में जनरलाइजेशन गैप की जांच करता है, जिसमें यह पाया गया है कि हालांकि सेल्फ-जेनरेटेड सुपरविजन बेस मॉडल्स की तुलना में रीजनिंग परफॉरमेंस को बेहतर बनाता है, लेकिन यह उन्नत मल्टी-टर्न रिवीज़न रणनीतियों के साथ भी ओरैकल-सुपरवाइज्ड ट्रेनिंग की प्रभावशीलता से पूरी तरह मेल बिठाने में लगातार विफल रहता है।