MultiLexNorm++: A Unified Benchmark and a Generative Model for Lexical Normalization for Asian Languages
यह शोध पत्र मौजूदा इंडो-यूरोपीय-केंद्रित डेटासेट की सीमाओं को दूर करने के लिए चार लिपियों में पाँच एशियाई भाषाओं को कवर करने वाला एक एकीकृत बेंचमार्क, MultiLexNorm++ पेश करता है, और एक नया लार्ज लैंग्वेज मॉडल-आधारित आर्किटेक्चर प्रस्तावित करता है जो इन विविध भाषाओं के लिए लेक्सिकल नॉर्मलाइजेशन (lexical normalization) हेतु अधिक सुदृढ़ प्रदर्शन प्रदर्शित करता है।