DynamixSFT: Dynamic Mixture Optimization of Instruction Tuning Collections
यह शोध पत्र DynamixSFT का प्रस्ताव करता है, जो एक गतिशील और स्वचालित विधि है जो समस्या को प्रायर-स्केल्ड बोल्ट्ज़मैन एक्सप्लोरेशन (Prior-scaled Boltzmann Exploration) और 1-स्टेप लुक-अहेड रिवॉर्ड (1-Step Look-ahead Reward) के साथ एक मल्टी-आर्म्ड बैंडिट (multi-armed bandit) के रूप में फ्रेम करके इंस्ट्रक्शन-ट्यूनिंग डेटासेट मिश्रणों को अनुकूलित करती है, जो न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ कई बेंचमार्क पर मॉडल के प्रदर्शन को प्रभावी रूप से बढ़ाती है।