RLSF: Fine-tuning LLMs via Symbolic Feedback
यह शोध पत्र 'रिनफोर्समेंट लर्निंग वाया सिम्बोलिक फीडबैक' (RLSF) को प्रस्तुत करता है, जो एक नवीन फाइन-ट्यूनिंग प्रतिमान है जो सूक्ष्म, टोकन-स्तरीय फीडबैक प्रदान करने के लिए प्रतीकात्मक तर्क उपकरणों (सिम्बोलिक रीजनिंग टूल्स) का लाभ उठाता है, जिससे छोटे LLMs विशिष्ट डोमेन-आधारित तार्किक संरेखण वाले कार्यों पर बड़े क्लोज्ड-सोर्स मॉडल्स को महत्वपूर्ण रूप से पीछे छोड़ने में सक्षम होते हैं।