A Comparative Study of Language Models for Khmer Retrieval-Augmented Question Answering
تقدم هذه الورقة دراسة مقارنة لنظام توليد مدعوم بالاسترجاع للمستندات الخاصة بقطاع الاتصالات باللغة الخميرية، حيث حددت نموذج BGE-M3 كأفضل نموذج استرجاع، وأثبتت أنه في حين لا يهيمن نموذج توليد واحد على جميع مقاييس الأداء، إلا أن النماذج المختلفة تتفوق في مجالات محددة مثل الأمانة، أو الصحة الواقعية، أو التشابه الدلالي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول الإجابة على سؤال محدد للغاية حول قوانين الاتصالات في كمبوديا، لكنك لا تملك الإجابة في ذاكرتك. لديك مكتبة ضخمة من المستندات ("المسترجع") ومساعد ذكي ولبق ("المولد") يمكنه قراءة تلك المستندات وكتابة إجابة لك.
هذه الورقة البحثية تشبه اختبار تذوق ومراجعة أداء لأدوات مختلفة تُستخدم لبناء هذا النظام، وتحديداً لـ اللغة الخميرية (لغة كمبوديا). ولأن اللغة الخميرية تستخدم خطاً فريداً وتمتلك موارد رقمية أقل من اللغة الإنجليزية، أراد الباحثون معرفة أي الأدوات تعمل بشكل أفضل معاً.
إليك تفصيل تجربتهم، مشروحاً ببساة:
1. أمين المكتبة (المسترجع)
أولاً، احتاج الفريق إلى "أمين مكتبة" مهمته هي العثور على الصفحات الصحيحة في المكتبة عندما تطرح سؤالاً. لقد اختبروا ثلاثة أمناء مكتبة مختلفين (نماذج ذكاء اصطناعي):
- BGE-M3
- Jina-Embeddings-v3
- Qwen3-Embedding
النتيجة: كان BGE-M3 هو الفائز الواضح. كان الأمر يشبه امتلاك أمين مكتبة يعرف بالفعل نظام ديوي العشري.
- عندما طُلب منه العثود إلى المستند الصحيح، وجد BGE-M3 الملف المصدر الصحيح بنسبة 70% من المرات.
- أما أمينا المكتبة الآخران فقد وجدا الملف الصحيح بنسبة 50% فقط تقريباً.
- تحول مثير للاهتمام: أحد الأمناء الخاسرين (Jina) أعطى أعلى "درجة تشابه" (مثل قول: "هاتان الصفحتان متشابهتان جداً!")، لكن الصفحة كانت خاطئة في الواقع. علّم هذا الباحثين أن درجة التشابه العالية لا تعني دائماً أن الإجابة موجودة هناك بالفعل.
2. الكاتب (المولد)
بمجرد أن يجد أمين المكتبة الصفحات الصحيحة، يقوم "الكاتب" (نموذج لغوي كبير) بقراءتها وكتابة الإجابة النهائية. اختبر الفريق خمسة كتاب مختلفين:
- Qwen3 و Qwen3.5 (كتاب متعدد اللغات بشكل عام)
- Sailor2 (متخصص في جنوب شرق آسيا)
- SeaLLMs (متخصص في جنوب شرق آسيا)
- Llama-SEA-LION (متخصص في جنوب شرق آسيا)
لم يكتفوا بسؤال: "هل الإجابة جيدة؟"، بل استخدموا ست طرق مختلفة لتقييم الكتاب، مثل معلم يستخدم نموذج إجابة:
- الأمانة (هل التزم الكاتب بالحقائق؟): كان Qwen3.5 الأكثر أمانة. نادراً ما اخترع أشياء من عنده والتزم بدقة بما ورد في المستندات.
- الصحة الواقعية (هل حصل الكاتب على الأرقام والأسماء بشكل صحيح؟): كان Qwen3 الأفضل في الحصول على التفاصيل المحددة (مثل أرقام الهواتف أو رموز القوانين) بدقة تامة.
- الصلة والتشابه (هل بدت الإجابة كأنها ما سيقوله البشر؟): كان SeaLLMs الأفضل في الظهور بمظهر طبيعي ومطابقة أسلوب الإجابات "المعيارية الذهبية".
- الخاسر: عانى Llama-SEA-LION أكثر من غيره، حيث كان غالباً ما يخترع حقائق أو يتجاهل المستندات.
3. النتائج الرئيسية الكبرى
وجد الباحثون أنه لا يوجد "روبوت مثالي" واحد. الأمر يعتمد على ما تحتاه:
- إذا كنت بحاجة إلى الثقة (التأكد من أن الذكاء الاصطناعي لا يكذب)، فاستخدم Qwen3.5.
- إذا كنت بحاجة إلى الدقة (الحصول على الأرقام الدقيقة)، فاستخدم Qwen3.
- إذا كنت تريد أن تبدو الإجابة طبيعية وتطابق الصياغة البشرية، فاستخدم SeaLLMs.
عنق الزجاجة:
المشكلة الكبرى لم تكن في "الكاتب"؛ بل كانت في "أمين المكتبة". فحتى أفضل أمين مكتبة (BGE-M3) لم يجد المستند الصحيح إلا بنسبة 28% تقريباً عند البحث في أفضل 3 نتائج. وهذا يعني أن النظام بأكمله مقيد لأن العثور على المعلومات الصحيحة في المقام الأول أمر صعب.
4. ملاحظة (العيب)
تعترف الورقة ببعض القيود:
- الاختبار: اختبروا 200 سؤال فقط. ورغم أنها مختارة بعناية، إلا أنها قد لا تغطي كل سؤال ممكن قد يطرحه المواطن.
- المقيم: استخدموا ذكاءً اصطناعياً آخر (GPT-4o-mini) لتقييم الإجابات، وليس بشر حقيقيين. ورغم أن هذا أمر معتاد، إلا أن التعليقات البشرية ستكون الاختبار النهائي.
- الإعداد: تم اختبار بعض الكتاب على إعدادات حاسوبية مختلفة، مما قد يؤدي إلى انحراف طفيف في النتائج.
الملخص
باختصار، بناء نظام للإجابة على الأسئلة باللغة الخميرية يشبه بناء فريق سباق تتابع. أنت بحاجة إلى عداء رائع ليجد العصا (أمين المكتبة) وعداء رائع ليحملها إلى خط النهاية (الكاتب). وجد الباحثون أن BGE-M3 هو أفضل عداء للعثور على العصا، لكن أفضل عداء لحملها يعتمد على ما إذا كنت تقدر الأمانة، أو الدقة، أو الأسلوب. والأهم من ذلك، أن السباق بطيء حالياً لأن العثور على العصا لا يزال أمراً صعباً للغاية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.