Goal-Conditioned Supervised Learning for LLM Fine-Tuning
यह शोध पत्र गोल-कंडीशन्ड सुपरवाइज्ड लर्निंग (GCSL) प्रस्तुत करता है, जो एक कुशल ऑफलाइन फाइन-ट्यूनिंग फ्रेमवर्क है जो फीडबैक संकेतों को स्पष्ट लक्ष्यों के रूप में मानता है और बड़े भाषा मॉडलों (LLMs) को गुणवत्ता थ्रेशोल्ड को लगातार प्राप्त करने के लिए निर्देशित करने हेतु प्राकृतिक भाषा का लाभ उठाता है, जिससे यह ऑनलाइन सुदृढीकरण शिक्षण (reinforcement learning) की उच्च लागतों से बचते हुए मानक सुपरवाइज्ड विधियों से बेहतर प्रदर्शन करता है।