LEVOS: Leveraging Vocabulary Overlap with Sanskrit to Generate Technical Lexicons in Indian Languages
تقترح الورقة البحثية LEVOS، وهو نهج مبتكر يستفيد من التجزئة على مستوى الحروف القائمة على اللغة السنسكريتية ونموذج المحولات (Transformer) لتحسين ترجمة المصطلحات التقنية إلى اللغات الهندية ذات الموارد المنخفضة، محققاً مكاسب كبيرة في الأداء ومعززاً إمكانية الوصول التعليمي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم طفل في قرية نائية كيفية فهم مفاهيم علمية معقدة مثل "التمثيل الضوئي" أو "ميكانيكا الكم". المشكلة هي أن الكتب المدرسية الوحيدة المتاحة هي باللغة الإنجليزية، وهي لغة لا يتحدثها الطفل. ستحتاج إلى ترجمة هذه الكلمات إلى لغته المحلية (مثل الماراثية، أو الكانادا، أو الأوديا).
ولكن هناك عقبة: هذه اللغات المحلية هي لغات "منخفضة الموارد"، مما يعني عدم وجود قواميس رقمية كافية أو حواسيب مدربة عليها. إذا طلبت من ذكاء اصطناعي قياسي ترجمة كلمة "photosynthesis" مباشرة، فقد يخمن كلمة تبدو صحيحة ولكن معناها مختلف تماماً، أو قد يستسلم ببساطة ويترك الكلمة الإنجليزية كما هي.
هذه الورقة البحثية، LEVOS، تقترح حلاً ذكياً لهذه المشكلة باستخدام "آلة زمن لغوية": السنسكريتية.
إليك قصة كيف فعلوا ذلك، مقسمة إلى خطوات بسيطة:
1. المشكلة: لعبة "الضياع في الترجمة"
فكر في الكلمات التقنية (مثل "revaluation" أو "injection") كأنها هياكل "ليغو" معقدة. في الإنجليزية، تُبنى هذه الكلمات باستخدام قطع محددة. وفي اللغات الهندية، تُبنى أيضاً باستخدام قطع، لكن تعليمات كيفية تجميعها غال مورد مفقودة بسبب عدم وجود بيانات كافية لتعليم الكمبيوتر.
عندما تحاول ترجمة هذه الكلمات مباشرة من الإنجليزية إلى لغة محلية، يرتبك الكمبيوتر. الأمر يشبه محاولة بناء منزل باستخدام مخطط مكتوب بلغة تكاد لا تفهمها.
2. المكون السري: السنسكريتية كـ "جدٍّ" للأصل
أدرك المؤلفون أن العديد من اللغات الهندية (مثل الهندية، والماراثية، والتاميلية) تشبه أبناء العمومة البعيدين. جميعها تشترك في سلف مشترك: السنسكريتية.
- التشبيه: تخيل أن الإنجليزية هي هاتف ذكي حديث. اللغات الهندية المحلية هي هواتف قديمة ومتينة. السنسكريتية هي المخطط الأصلي الذي استند إليه كل من الهاتف الذكي والهواتف القديمة.
- على الرغم من تغير اللغات المحلية بمرور الوقت، إلا أنها لا تزال تشترك في قدر كبير من المفردات وقطع البناء مع الس Sanskrit.
كانت فكرة الفريق بسيطة: لا تترجم مباشرة من الإنجليزية إلى اللغة المحلية. بدلاً من ذلك، استخدم السنسكريتية كجسر.
3. الخطوة الأولى: "مُجزئ الكلمات" (CharSS)
تشتهر السنسكريتية بقواعد "ساندي" (Sandhi). هذا يشبه الغراء السحري. عندما توضع كلمتان سنسكريتيتان معاً، غالباً ما تذوبان في كلمة واحدة طويلة غير منقطعة.
- مثال: "Nara" (رجل) + "Indra" (ملك) تصبح "Narendra".
لاستخدام السنسكريتية كجسر، يحتاج الكمبيوتر أولاً إلى معرفة كيفية فك لصق هذه الكلمات. بنى المؤلفون أداة ذكاء اصطناعي خاصة تسمى CharSS (تقسيم السنسكريتية على مستوى الحروف).
- التشبيه: فكر في CharSS كطاهٍ ماهر يمكنه أخذ رغيف خبز ضخم وملتحم (كلمة سنسكريتية مركبة) وتقطيعه بدقة إلى مكوناته الفردية الأصلية (الكلمات الفرعية).
- قاموا بتدريب هذا الذكاء الاصطناعي باستخدام نموذج قوي يسمى ByT5، وهو بارع في النظر إلى النص حرفاً بحرف (أو بايت ببايت) للعثيد الأنماط الخفية.
4. الخطوة الثانية: "مساعد المترجم"
بمجرد تمكنهم من تقسيم الكلمات السنسكريتية، استخدموا حيلة ذكية لمساعدة المترجم الرئيسي (ذكاء اصطناعي يسمى NLLB).
- الإعداد: لديهم كلمات إنجليزية وترجماتها الهندية (الهندية لغة "غنية" بالبيانات، مما يعني أن الكمبيوتر يعرفها جيداً).
- السحر: أخذوا الترجمة الهندية، وجردوها من الأجزاء الخاصة باللغة الهندية، واستخدموا "مجزئ الكلمات" الخاص بهم (CharSS) لتحويل الكلمة الهندية إلى "جذورها" السنسكريتية.
- التعزيز: قدموا للكمبيوتر الكلمة الإنجليزية بالإضافة إلى هذه الجذور السنسكريتية كإشارات إضافية.
التشبيه: تخيل أنك تحاول تخمين كلمة في لعبة "تمثيل الأدوار الصامتة" (Charades).
- بدون الحيلة: تعرف فقط أن الكلمة هي "Mass". قد تخمن "جسم ثقيل" (في الفيزياء) أو "حشد من الناس" (في السياق الاجتماعي). أنت تخمن في الظلام.
- مع الحيلة: تُعطى بطاقة تلميح تقول: "هذه الكلمة تأتي من جذر سنسكريتي يعني 'الناس'". فجأة، تعرف أن الإجابة هي "حشد"، وليست "جسم ثقيل".
5. النتائج: جسر أكثر سلاسة
اختبر الفريق عملهم في ثلاثة مجالات صعبة: الإدارة، والتكنولوجيا الحيوية، والكيمياء.
- النتيجة: بإضافة هذه "التلميحات" السنسكريتية، ارتكب الذكاء الاصطناعي أخطاءً أقل بكثير. لقد ترجم المصطلحات التقنية بدقة أكبر بكثير.
- الاختبار البشري: حتى أنهم طلبوا من البشر التحقق من النتائج. أنتج الذكاء الاصطناعي، باستخدام هذا الجسر السنسكريتي، ترجمات وجدها البشر أكثر فائدة ودقة من الطريقة القياسية.
لماذا يهم هذا؟
هذا ليس مجرد علوم حاسوب؛ إنه يتعلق بالتعليم والمساواة.
- حالياً، إذا أردت تعلم العلوم المتقدمة بلغة هندية محلية، فغالباً لن تستطيع لأن الكلمات غير موجودة في شكل رقمي.
- باستخدام هذه الطريقة، يمكننا إنشاء قواميس تقنية عالية الجودة للغات التي تمتلك موارد قليلة جداً.
- الصورة الكبيرة: الأمر يشبه بناء جسر فوق نهر من الجهل. "الجسر السنسكريتي" يسمح للمعرفة بالتدفق من الكتب المدرسية الإنجليزية إلى أيدي الطلاب في القرى الذين يتحدثون الماراثية، أو الكانادا، أو الأوديا، مما يجعل التعليم متاحاً للجميع.
باخت//ة: علم المؤلفون الكمبيوتر كيف يتحدث "اللغة القديمة" للسنسكريتية لمساعدته على فهم كيفية ترجمة الكلمات التقنية الحديثة إلى اللغات الهندية المحلية، مما يجعل التعلم أسهل للملايين من الناس.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.