Breaking the Capability Ceiling of LLM Post-Training by Reintroducing Markov States
यह शोध पत्र मानक सुदृढीकरण शिक्षण (reinforcement learning) की क्षमता सीमा को पार करने के लिए एलएलएम (LLM) पोस्ट-ट्रेनिंग में स्पष्ट मार्कोव अवस्थाओं (Markov states) को पुन: पेश करने का प्रस्ताव देता है, जो सैद्धांतिक रूप से नमूना जटिलता (sample complexity) को कम करता है और इतिहास-निर्भर मॉडलिंग से संरचित मार्कोवियन प्रतिनिधित्वों की ओर स्थानांतरित होकर जटिल तर्क पहेलियों पर बेहतर प्रदर्शन को अनुभवजन्य रूप से प्रदर्शित करता है।