Prompting Policies for Multi-step Reasoning and Tool-Use in Black-box LLMs with Iterative Distillation of Experience
यह शोध पत्र एक सुदृढीकरण अधिगम (Reinforcement Learning) ढांचे का प्रस्ताव करता है जो अनुभव के पुनरावृत्ति आसवन (iterative distillation) के माध्यम से एक हल्के प्रॉमप्टर मॉडल को अनुकूलित करता है ताकि फ्रोजन ब्लैक-बॉक्स एलएलएम (LLMs) की बहु-चरणीय तर्क और टूल-उपयोग क्षमताओं को महत्वपूर्ण रूप से बढ़ाया जा सके, जिससे अत्याधुनिक विकासवादी बेसलाइनों की तुलना में बेहतर प्रदर्शन और नमूना दक्षता प्राप्त होती है।