Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States
यह शोध पत्र POISE प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो एक पॉलिसी मॉडल की आंतरिक अवस्थाओं पर प्रशिक्षित एक हल्के प्रोब (lightweight probe) का लाभ उठाकर नगण्य लागत पर वैल्यू बेसलाइन का अनुमान लगाता है, जिससे अलग क्रिटिक्स या कई रोलआउट्स के कम्प्यूटेशनल ओवरहेड के बिना स्थिर और कुशल पॉलिसी अनुकूलन प्राप्त होता है।