5-Dialects-BN: Unmasking the Impact of Transliteration on Bangla Dialectal LLMs
تقدم هذه الورقة 5-Dialects-BN، وهو أول معيار متعدد التوسيم يربط بين النسخ الصوتي بالحروف اللاتينية والنصوص اللهجية والقياسية والإنجليزية إلى جانب تسميات الذاتية لخمسة تنوعات إقليمية رئيسية للغة البنغالية، بهدف سد فجوة الموارد وتمكين التقييم المنهجي للنماذج اللغوية الكبيرة المدركة للهجات.
المؤلفون الأصليون:Md Mahir Jawad, Galib Mahmud Jim, Rafid Ahmed, Mir Sazzat Hossain, Md Fahim, Md Farhad Alam Bhuiyan
ليست اللغة كتلة واحدة صلبة، بل هي مشهد حي يتغير ويتحول مع تنقل الناس عبر المناطق. في عالم الذكاء الاصطناło، أصبحت النماذج اللغوية الكبيرة ماهرة للغاية في فهم وتوليد النصوص، لكنها تعلمت إلى حد كبير من نسخة محددة ورسمية للغاية من اللغات. وعندما تواجه هذه العقول الرقمية الواقع الفوضوي والنابض بالحياة لكيفية تحدث الناس فعلياً في أحياءهم المحلية، فإنها غالباً ما تتعثر. ويتجلى هذا بوضوح في اللغة البنغالية، وهي لغة يتحدث بها مئات الملايين من الناس عبر بنغلاديش والهند. وبينما النسخة القياسية والرسمية من اللغة موثقة جيداً، فإن العديد من اللهجات الإقليمية التي يتحدث بها الناس في مدن مثل تشيتاغونغ وسيلهيت وباريسال ظلت غير مرئية للتكنولوجيا إلى حد كبير. وغالباً ما يكتب الناس في هذه المناطق بمزيج من لهجتهم المحلية والحروف الإنجليزية، وهي ممارسة تُعرف بالنقحرة (transliteration)، مما يخلق صوتاً رقمياً فريداً تجد الأنظمة الحالية صعوبة في سماعه.
لقد شرع فريق من الباحثين في رسم خريطة لهذا الإقليم غير المستكشف من خلال إنشاء مورد جديد يسمى 5-DIALECTS-BN. قاموا بجمع 6000 جملة حقيقية من وسائل التواصل الاجتماعي والمنتديات عبر الإنترنت، لتجسيد الطريقة الطبيعية التي يتحدث بها الناس في خمس لهجات إقليمية متميزة: تشيتاغونغ، وباريسال، ونواخالي، وسيلهيت، ورانجبور. ومع كل جملة، لم يكتفوا بتسجيل الكلمات فحسب؛ بل بنوا جسراً كاملاً بين الطرق المختلفة التي يعبر بها الناس عن الفكرة نفسها. يتضمن كل مدخل النص الأصلي باللهجة المحلية، ونسخة مكتوبة بالحروف الإنجليزية (النقحرة)، وترجمة إلى البنغالية القياسية، وترجمة إلى الإنجليزية، وتصنيفاً يوضح ما إذا كانت الجملة تعبر عن رأي شخصي أو حقيقة بسيطة. ويضمن هذا العمل الدقيق والمُدقق بشرياً أن تعكس البيانات الفروق الدقيقة الحقيقية للغة، بدءاً من الكلمات العامية الفريدة وصولاً إلى التحولات الطفيفة في النطق التي تغير معنى الجملة.
ثم وضع الباحثون قاعدة البيانات الجديدة هذه قيد الاختبار، حيث طلبوا من سبعة نماذج لغوية كبيرة مختلفة أداء ثلاث مهام محددة: ترجمة اللهجة إلى الإنجليزية، وتحديد ما إذا كانت الجملة رأياً أم حقيقة، وتحويل اللهجة المحلية مرة أخرى إلى البنغالية القياسية. واختبروا النماذج بعدة طرق، بما في ذلك إعطاؤها دون أمثلة، أو عرض بضعة أمثلة للتعلم منها، أو استخدام طريقة تسمح للنماذج بـ "التفكير" في المشكلة خطوة بخوة قبل الإجابة. كما جربوا تقنية تسمى "الضبط الدقيق" (fine-tuning)، حيث علموا النماذج باستخدام عدد صغير فقط من الأمثلة — 160 جملة لكل لهجة — لمعرفة ما إذا كان القليل من التعليم المباشر يمكن أن يساعدها على الفهم بشكل أفضل.
كشفت النتائج عن خلل مفاجئ وحرج في كيفية تعامل هذه النماذج القوية مع اللغة. وجد الباحثون أنه عندما يكون النص المدخل مكتوباً بالحروف الإنجليزية (منقحراً)، فإن أداء النماذج يتراجع بشكل ملحوظ في جميع المجالات، بغض النظر عن مدى ذكاء النموذج أو عدد الأمثلة التي قُدمت له. حدث هذا لأن عملية تحويل الأصوات المحلية إلى حروف إنجليزية غالباً ما تؤدي إلى فقدان معلومات حاسمة. فالأصوات المختلفة في اللهجة المحلية يمكن أن تبدو متطابقة عند كتابتها بالحروف الإنجليزية، مما يخلق ارتباكاً لا تستطيع النماذج حله. الأمر يشبه مستمعاً يحاول فهم محادثة من خلال جدار يحجب ترددات معينة؛ الكلمات موجودة، لكن الخصائص المميزة التي تجعلها واضحة قد تلاشت. وحتى عندما تم تزويد النماذج بقدر قليل من التدريب المباشر للمساعدة، ظلت الفجوة بين فهم الخط الأصلي ونسخة الحروف الإنجليزية واسعة، مما يثبت أن فقدان المعلومات في الترجمة إلى الحروف الإنجليزية يصعب استرداده.
ومع ذلك، قدمت الدراسة مساراً واضحاً للمضي قدماً. فعندما استخدم الباحثون طريقة الضبط الدقيق باستخدام 160 مثالاً فقط لكل لهجة، تحسنت النماذج مفتوحة المصدر بشكل كبير. وبدأت في التفوق حتى على النماذج الأكثر تقدماً والمغلقة المصدر التي لم ترَ هذه البيانات المحددة من قبل. وهذا يشير إلى أن العائق الأكبر أمام فهم هذه اللهجات ليس نقص القدرة الحوسبية أو الذكاء، بل هو ببساطة نقص البيانات المتوافقة والمحددة. النماذج قادرة على تعلم هذه اللهجات إذا تم تزويدها بالأمثلة الصحيحة. وتخلص الدراسة إلى أنه بينما تعاني التكنولوجيا الحالية مع غموض النص المنقحر، فإن تزويدها بأمثلة عالية الجودة ومُدقق عليها بشرياً يسمح لها بجسر الفجوة. يضع هذا العمل أساساً لبناء أنظمة يمكنها حقاً فهم الطرق المتنوعة والغنية التي يتواصل بها الناس في حياتهم اليومية، متجاوزة المعايير الرسمية لتشمل الطيف الكامل للغة.
ملخص تقني: 5-DIALECTS-BN: كشف تأثير النسخ الصوتي على النماذج اللغوية الكبيرة للهجات البنغالية
بيان المشكلة بينما حققت النماذج اللغوية الكبيرة (LLMs) تقدماً ملحوظاً في معالجة اللغات الطبيعية (NLP)، إلا أن قدراتها تتدهور بشكل حاد في البيئات ذات الموارد المنخفضة والتنوع اللهجي. وتعد اللغة البنغالية، التي يتحدث بها أكثر من 270 مليون نسمة، نموذجاً لهذا الفجوة: حيث تستهدف الموارد الحالية بشكل مفرط لغة البنغال القياسية (Cholito)، مما يترك اللهجات الإقليمية دون المعايير اللازمة لتطوير أو تقييم الأنظمة المدركة للهجات. علاوة على ذلك، يقوم المستخدمون عبر الإنترنت في جنوب آسيا بكتابة البنغالية اللهجية بشكل متكرر باستخدام الخط اللاتيني (الروماني/البنغلي - Banglish)، ومع ذلك لا يزال تأثير هذا النسخ الصوتي (Transliteration) على أداء النماذج اللغوية الكبيرة الحديثة غير مدروس بشكل كافٍ. إن غياب معايير التقييم متعددة التعليقات يجعل من الصعب تشخيص إخفاقات النماذج أو تقييم الأنظمة بطريقة قابلة للتكرار.
المنهجية يقدم المؤلفون 5-DIALECTS-BN، وهو معيار تم تنسيقه يدوياً ويضم 6,000 مدخل موثق عبر خمس لهجات بنغالية إقليمية رئيسية هي: تشيتاغونغ، باريسال، نواكهالي، سيلهيت، ورانجبور. تم بناء مجموعة البيانات من خلال عملية مكونة من أربع مراحل: حصاد البيانات من المصادر العامة عبر الإنترنت (يوتيوب، فيسبوك، ريديت، الأخبار)، التحقق من الأصالة بواسطة متحدثين أصليين، التعليق المتعدد بمساعدة الأدوات، والتحقق من اتفاق المحللين المتعددين.
يحتوي كل مدخل في مجموعة البيانات على خمسة حقول متوافقة:
النص اللهجي الأصلي بالخط البنغالي.
النسخ الصوتي الروماني (باستخدام اصطلاح Avro).
الترجمة إلى البنغالية القياسية (Cholito).
الترجمة إلى الإنجليزية.
تسمية موضوعية ثنائية (ذاتي مقابل موضوعي).
قام المؤلفون باختبار سبعة نماذج لغوية كبيرة معاصرة (ثلاثة مغلقة المصدر: Gemini 3 Flash، وGPT-4o-mini، وClaude Haiku 4.5؛ وأربعة مفتوحة المصدر: Qwen-3-4B، وGemma-4-4B، وLlama-3.1-8B، وMistral-7B) عبر ثلاث مهام أساسية:
الترجمة الآلية من اللهجة إلى الإنجليزية.
التصنيف الثنائي للذاتية.
تطبيع (Normalization) اللهجة إلى البنغالية القياسية.
أُجري التقييم تحت أربعة أنظمة: التعلم من الصفر (zero-shot)، التعلم من أمثلة قليلة (few-shot)، التلقين بسلسلة الأفكار (CoT)، والضبط الدقيق الفعال للمعلمات (LoRA) باستخدام 160 مثالاً لكل لهجة. كما أجرت الدراسة تحليلات سببية لآثار النسخ الصوتي، بما في ذلك ضوابط النسخ الصوتي العكسي للرحلة الذهابية والإياب وتحليل تراجع التجزئة (tokenization regression).
المساهمات الرئيسية
إصدار مجموعة البيانات: يعد 5-DIALECTS-BN أول معيار بنغالي متعدد التعليقات يضع النسخ الصوتي الروماني كحقل من الدرجة الأولى جنباً إلى جنب مع الخط الأصلي، والبنغالية القياسية، والإنجليزية، وتسميات الذاتية. وهو يوسع نطاق العمل السابق (مثل DIALTSA-BN) بعشرة أضعاف ويتضمن لهجة رانجبور التي كانت تفتقر للموارد سابقاً.
مقاييس الموثوقية: تضع مجموعة البيانات موثوقية عالية بين المحللين، مع معامل كوهين كابا (κ) قدره 0.78 للذاتية، و0.74 لتقديم البنغالية القياسية، ومتوسط ROUGE-L قدره 0.84 للترجمات الإنجليزية.
التقييم التجريبي: توفر الورقة تقييماً شاملاً للنماذج اللغوية الكبيرة عبر المدخلات الأصلية والرومانية، مما يكشف عن أنماط فشل محددة مثل "تداخل الأمثلة" (demonstration interference) في Llama-3.1-8B و"انهيار التنسيق" (format collapse) في Qwen-3-4B.
التحليل السببي للنسخ الصوتي: تعزل الدراسة الآليات الكامنة وراء تدهور الأداء في النصوص الرومانية، وتحدد فقدان المعلومات "متعدد-إلى-واحد" وتجزئة الرموز الفرعية (subword token fragmentation) كأسباب رئيسية.
النتائج
الإشراف يسد فجوة الموارد: يتفوق الضبط الدقيق للنماذج مفتوحة المصدر باستخدام LoRA على 160 مثالاً فقط لكل لهجة بشكل كبير على النماذج مغلقة المصدر في أنظمة zero-shot وfew-shot. على سبيل المثال، حقق Mistral-7B درجة 73.6 BLEU في الترجمة، متجاوزاً درجة Gemini 3 Flash في نظام zero-shot البالغة 46.4 BLEU.
النسخ الصوتي يضر بالنماذج اللغوية الكبيرة الحالية: خلافاً للنتائج السابقة على النماذج الأصغر، يؤدي إدخال النصوص المنسوخة صوتياً بالرومانية باستمرار وبشكل حاد إلى تدهور أداء النماذج اللغوية الكبيرة الحالية عبر جميع النماذج والأنظمة. يعود هذا العقاب إلى فقدان المعلومات الفونيمية غير القابل للاسترداد (مثل طول المصوتات أو الهمس) وتجزئة الرموز الفرعية. أكدت ضوابط النسخ الصوتي العكسي للرحلة الذهابية والإياب أن استعادة الخط الأصلي لا تستعيد سوى القليل جداً من الأداء المفقود، مما يشير إلى تدمير المعلومات أثناء عملية النسخ الصوتي.
الآثار الجانبية للتلقين: وجدت الدراسة أن استراتيجيات التلقين يمكن أن تؤدي إلى تفاعلات مربكة. عانى Llama-3.1-8B من "تداخل الأمثلة"، حيث تسبب التلقين بأسلوب few-shot في تجاهله للمدخل الأصلي لصالح جمل توضيحية ذات سجل لغوي سلس ولكن غير مرتبط بالموضوع. وعلى العكس من ذلك، حسن التلقين بسلسلة الأفكار (CoT) تصنيف الذاتية، لكنه أدى إلى تدهور دقة سطح الترجمة بسبب انحراف الصياغة (paraphrase drift).
التباعد اللغوي: عكست معدلات الخطأ المسافة اللغوية عن البنغالية القياسية. العناصر ذات التباين المعجمي العالي (مثل أفعال تشيتاغونغ غير المشتقة من الأصل) ظلت مقاومة للتكيف، بينما تم إتقان التحولات الفونولوجية (مثل تجمعات باريسال) بسرعة.
الأهمية تجادل الورقة بأن 5--DIALECTS-BN يتيح التقييم المنهجي للنماذج اللغوية الكبيرة على اللهجات البنغالية المتنوعة ويضع أساساً لمعالجة اللغات الطبيعية منخفضة الموارد والمدركة للهجات. وتتمثل النتيجة المركزية في أن الإشراف المتوافق مع اللهجة هو العائق الحرج لفهم اللهجات البنغالية؛ فبينما يمكن للضبط الدقيق باستخدام LoRA التغلب على نقص بيانات التدريب، فإنه لا يستطيع إعادة بناء التمايزات التي دمرها قناة النسخ الصوتي. يسلط العمل الضوء على أنه بالنسبة للنشر العملي في جنوب آسيا، حيث ينتشر النسخ الصوتي الروماني، تواجه النماذج الحالية عقوبة "نسخ صوتي" شديدة تتطلب المعالجة من خلال تحسين التجزئة (tokenization) أو المعايير الكتابية، بدلاً من الاعتماد فقط على التلقين أو الضبط الدقيق المحدود. ويخلص المؤلفون إلى أنه بينما تكفي 160 عينة للتفوق على التلقين بنظام zero-shot، إلا أنها غير كافية لاستعادة التمايزات الدلالية المفقودة في النسخ الصوتي بالكامل.