Mix, MinHash, and Match: Cross-Source Agreement for Multilingual Pretraining Datasets
यह शोधपत्र MixMinMatch को प्रस्तुत करता है, जो एक लागत प्रभावी विधि है जो अरबी, तुर्की और हिंदी के लिए उच्च-गुणवत्ता वाले बहुभाषी प्रीट्रेनिंग डेटासेट उत्पन्न करने हेतु क्रॉस-सोर्स रिडंडेंसी (cross-source redundancy) का एक मुफ्त गुणवत्ता फिल्टर के रूप में लाभ उठाती है, जिससे सिंगल-सोर्स बेसलाइन की तुलना में महत्वपूर्ण टोकन विविधता और प्रदर्शन सुधार प्राप्त होता है।