Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning
यह शोध पत्र स्टेट वैल्यू एस्टीमेशन बेंचमार्क (SVEB) को पेश करके और दो नवीन तकनीकों, Numca और Hista, का प्रस्ताव देकर LLM सुदृढीकरण शिक्षण (reinforcement learning) में सटीक स्टेट वैल्यू अनुमान की चुनौती को संबोधित करता है, जो बिना किसी महत्वपूर्ण कम्प्यूटेशनल ओवरहेड के प्रशिक्षण स्थिरता और प्रदर्शन में काफी सुधार करते हैं।