Internalizing Curriculum Judgment for LLM Reinforcement Fine-Tuning
यह शोध पत्र METIS को प्रस्तुत करता है, जो एक नवीन ढांचा है जो LLM सुदृढीकरण फाइन-ट्यूनिंग (Reinforcement Fine-Tuning) के लिए प्रॉम्प्ट-के-भीतर रिवॉर्ड वेरिएंस (within-prompt reward variance) का लाभ उठाकर पाठ्यक्रम निर्णय (curriculum judgment) को एक मूल मेटाकॉग्निटिव क्षमता के रूप में आंतरिक रूप से स्थापित करता है, जिससे बाहरी ह्यूरिस्टिक्स पर निर्भरता समाप्त होती है और काफी तेज़ अभिसरण (convergence) के साथ बेहतर प्रदर्शन प्राप्त होता है।