Toward Cross-Lingual Quality Classifiers for Multilingual Pretraining Data Selection
यह शोध पत्र प्रदर्शित करता है कि एम्बेडिंग स्पेस में क्रॉस-लिंगुअल निरंतरता का लाभ उठाना उच्च-संसाधन वाली भाषाओं को निम्न-संसाधन वाली भाषाओं के लिए गुणवत्ता फ़िल्टरिंग को सब्सिडी देने की अनुमति देता है, जिससे मोनोलिंगुअल बेसलाइन की तुलना में मल्टीलिंगुअल प्रीट्रेनिंग में बेहतर रैंक स्थिरता और सटीकता प्राप्त होती है, विशेष रूप से थर्ड क्वार्टाइल सैंपलिंग और रिटेंशन रेट ट्यूनिंग जैसी रणनीतियों के संयोजन के साथ।