MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation
यह शोध पत्र MENTOR का प्रस्ताव करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो सुपरवाइज्ड फाइन-ट्यूनिंग की सामान्यीकरण सीमाओं और सख्त प्रक्षेपवक्र मिलान (trajectory matching) की बाधाओं को दूर करने के लिए एक लचीले, प्रक्रिया-जागरूक पुरस्कार संरचना का उपयोग करके बड़े भाषा मॉडलों से टूल-उपयोग क्षमताओं को छोटे भाषा मॉडलों में संकुचित (distill) करता है।