Bridging Linguistic Gaps: Cross-Lingual Mapping in Pre-Training and Dataset for Enhanced Multilingual LLM Performance
यह शोध पत्र बड़े भाषा मॉडलों (Large Language Models) के प्री-ट्रेनिंग चरण में एक क्रॉस-लिंगुअल मैपिंग टास्क और एक लैंग्वेज अलाइनमेंट कोएफिशिएंट (Language Alignment Coefficient) को पेश करता है ताकि डेटा असंतुलन और मोनोलिंगुअल पूर्वाग्रह को प्रभावी ढंग से संबोधित किया जा सके, जिसके परिणामस्वरूप मोनोलिंगुअल प्रवाह से समझौता किए बिना मशीन अनुवाद, प्राकृतिक भाषा समझ और प्रश्न उत्तर कार्यों में महत्वपूर्ण प्रदर्शन सुधार प्राप्त होते हैं।