Step-by-Step Optimization-like Reasoning in LLMs over Expanding Search Spaces
यह शोध पत्र OPT* प्रस्तुत करता है, जो अनुकूलन-शैली (optimization-style) के कार्यों का एक स्केलेबल परिवार है जिसमें विस्तृत खोज स्थान (expanding search spaces) शामिल हैं, जो सॉल्वर-निर्देशित ऑनलाइन पॉलिसी ऑप्टिमाइज़ेशन और सर्च-आधारित ऑफलाइन रीइन्फोर्समेंट लर्निंग, दोनों के माध्यम से LLMs को स्टेप-बाय-स्टेप ऑप्टिमाइज़ेशन-जैसे तर्क पर प्रशिक्षित करने और उनका मूल्यांकन करने में सक्षम बनाता है।