Credit Assignment with Resets in Language Model Reasoning
यह शोध पत्र मध्यवर्ती अवस्थाओं पर रीसेट करने और निरंतरता को पुन: नमूनाकरण (resampling) करने के माध्यम से सटीक क्रेडिट असाइनमेंट को सक्षम करके भाषा मॉडल तर्क में सुधार के लिए रैंडम-रीसेट और सेल्फ-रीसेट पॉलिसी ऑप्टिमाइज़ेशन (RRPO और SRPO) का प्रस्ताव करता है, जिसमें SRPO बाहरी पर्यवेक्षण के बिना त्रुटिपूर्ण चरणों को स्वायत्त रूप से स्थानीयकृत और सुधार कर श्रेष्ठ प्रदर्शन प्राप्त करता है।