← أحدث الأبحاث
💬 NLP

Naamah: A Large Scale Synthetic Sanskrit NER Corpus via DBpedia Seeding and LLM Generation

تقدم هذه الورقة "نامة" (Naamah)، وهي مجموعة بيانات اصطناعية واسعة النطاق لتعرّف الكيانات المسماة باللغة السنسكريتية تضم أكثر من 100,000 جملة تم إنشاؤها عبر دمج استخراج كيانات "دي بييديا" (DBpedia) مع نموذج استدلال هجين بـ 24 مليار معلمة، والذي يُستخدم بعد ذلك لاختبار معايير بنيات المحولات (transformer architectures) متعددة اللغات والخاصة باللغات الهندية.

المؤلفون الأصليون: Akhil Rajeev P, Annarao Kulkarni

نُشر 2026-04-30
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Akhil Rajeev P, Annarao Kulkarni

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مكتبة ضخمة وقديمة من الكتب السنسكريتية. هذه الكتب مليئة بأسماء الآلهة، والملوك، والمدن، والمنظمات. لتعليم الكمبيوتر فهم هذه الكتب، تحتاج إلى إظهار آلاف الأمثلة حيث يتم تسليط الضوء على هذه الأسماء وتصنيفها (مثل "هذا شخص"، "هذا مكان").

المشكلة؟ لم يقم أحد بكتابة تلك التصنيفات بعد. إن قراءة تلك النصوص القديمة وتصنيفها يدويًا يشبه محاولة العثور على إبرة في كومة قش وأنت ترتدي عصبة عين؛ فالأمر يستغرق سنوات من الخبراء ويكلف ثروة طائلة.

تقدم هذه الورقة البحثية حلاً يسمى Naamah (سمي تيمناً بشخصية في الأدب السنسكريتي، رغم أن الورقة لا تشرح معنى الاسم صراحةً، إلا أنه يعمل كعنوان للمشروع). إليك كيف بنوا هذا النظام وما وجدوه، مشروحاً ببساطة:

1. الوصفة: كيف صنعوا البيانات

بدلاً من توظيف البشر لتصنيف الكتب، قام المؤلفون ببناء "روبوت طباخ" ليطهو لهم البيانات.

  • المكونات (DBpedia): بدأوا بموسوعة رقمية ضخمة تسمى DBpedia. استخرجوا منها قائمة بأسماء حقيقية — أشخاص، أماكن، ومنظمات. وللتأكد من أن الروبوت لن يحفظ الأسماء الشهيرة فحسب، قاموا بخلطها بأسماء أجنبية حديثة (مثل "Giacomo Libera") مكتوبة بالخط السنسكريتي. هذا أجبر الكمبيوتر على تعلم قواعد اللغة السنسكريتية، وليس مجرد التعرف على الوجوه الشهيرة.
  • الطباخ (نموذج الذكاء الاصطناعي): استخدموا نموذج ذكاء اصطناعي ذكي جداً، يحتوي على 24 مليار معامل (Hybrid Reasoning Model)، تم تدريبه خصيصاً لفهم اللغات الهندية.
  • عملية الطهي: بدلاً من إجبار الذكاء الاصطناعي على استخدام قوالب جمل جامدة ومكتوبة مسبقاً (مثل "راما ذهب إلى الغابة")، طلبوا من الذكاء الاصطناعي دمج هذه الأسماء بشكل طبيعي في الجمل. سمح هذا للذكاء الاصطناعي بتوليد آلاف الجمل الفريدة والصحيحة نحوياً حيث تظهر الأسماء في أشكال قواعدية مختلفة (وهو أمر شائع جداً في السنسكريتية).
  • مراقبة الجودة: قاموا بتمرير المخرجات عبر مرشح (فلتر) لالتقاط الأخطاء الواضحة. والنتيجة؟ 102,942 جملة من بيانات "المستوى الفضي" (Silver Standard). وكلمة "فضي" تعني أنها ليست مثالية (مثل الذهب)، ولكنها عالية الجودة بما يكفي لتدريب الكمبيوتر بفعالية.

2. التجربة: طالبان مختلفان

لاختبار ما إذا كانت هذه المجموعة الجديدة من البيانات قد نجحت، علموا نموذجين مختلفين من الكمبيوتر كيفية العثور على هذه الأسماء:

  1. الطالب متعدد اللغات العملاق (XLM-RoBERTa): هذا نموذج ضخم يتحدث لغات كثيرة. إنه مثل طالب قرأ قليلاً عن كل شيء ولكنه ليس متخصصاً في السنسكريتية.
  2. المتخصص المدمج (IndicBERTv2): هذا نموذج أصغر وأخف وزناً مصمم خصيصاً للغات الهندية. إنه مثل طالب قضى حياته كلها يدرس اللهجات والخطوط الخاصة بالمنطقة.

3. النتائج: الحجم ليس كل شيء

عندما اختبروا كلا الطالبين على مجموعة البيانات الجديدة، فاز المتخصص (IndicBERTv2)، على الرغم من كونه أصغر بكثير.

  • الدرجة: حصل المتخصص على درجة 0.96، بينما حصل الطالب متعدد اللغات العملاق على 0.95.
  • السبب الحقيقي (مشكلة "التصدع"): وجدت الورقة سبباً رائعاً لخسارة العملاق. الكلمات السنسكريتية غالباً ما تلتصق ببعضها البعض مثل الغراء (وهي ميزة تسمى sandhi).
    • تخيل أن كلمة "في كروكشترا" هي كلمة واحدة طويلة وملتحمة.
    • المتخصص رأى الكلمة كاملة وقال بصحة: "هذا مكان".
    • العملاق حاول تقطيع الكلمة إلى أجزاء لأن قاموسه لم يُبنَ للسنسكريتية. رأى الجزء الأول كـ "مكان"، لكن الجزء الصغير المتبقي في النهاية اعتبره كلمة منفصلة ومربكة، فخمن خطأً أنها "منظمة".

التشبيه: الأمر يشبه محاولة قراءة جملة حيث تم مسح المسافات بين الكلمات. المتخصص يعرف اللغة جيداً بما يكفي ليخمن أين تنتهي الكلمات وتبدأ الأخرى. أما العملاق، المعتاد على المسافات في اللغة الإنجليزية، فيصاب بالارتباك ويقسم الكلمات في أماكن خاطئة، مما يؤدي إلى أخطاء.

4. الخلاصة

تخلص الورقة إلى أنه بالنسبة للغات القديمة والمعقدة مثل السنسكريتية:

  • البيانات الاصطناعية تعمل: يمكنك استخدام الذكيبة الاصطناعي لتوليد بيانات تدريب إذا فعلت ذلك بعناية، مما يوفر الحاجة لآلاف الساعات من التصنيف البشري اليدوي.
  • الأداة المناسبة أهم من الأداة الأكبر: النموذج الأصغر الذي يفهم الخط والقواعد الخاصة باللغة (IndicBERTv2) كان أفضل أداءً من النموذج العملاق العام (XLM-RoBERTa) لأنه لم يقم بتفكيك الكلمات بشكل خاطئ.

باختصار، لقد بنوا دليلاً تدريبياً ضخماً مولداً بالذكاء الاصطناعي للعثور على الأسماء في السنسكريتية، وأثبتوا أن عقلاً حاسوبياً متخصصاً وأصغر حجماً هو أفضل في قراءة هذه اللغة القديمة من عقل عملاق وعام.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →