← أحدث الأبحاث
💬 NLP

LIT-RAGBench: Benchmarking Generator Capabilities of Large Language Models in Retrieval-Augmented Generation

تقدم هذه الورقة LIT-RAGBench، وهو مجموعة بيانات معيارية وإطار تقييم شامل مصمم لتقييم قدرات النماذج اللغوية الكبيرة في التوليد المعزز بالاسترجاع بشكل منهجي عبر خمس فئات حرجة — التكامل، والاستدلال، والمنطق، والجداول، والامتناع — باستخدام مزيج من الأسئلة اليابانية التي صاغها البشر وترجمات إنجليزية منسقة لتوجيه اختيار النماذج وتطويرها من أجل عمليات نشر RAG العملية.

المؤلفون الأصليون: Koki Itai, Shunichi Hasegawa, Yuta Yamamoto, Gouki Minegishi, Masaki Otsuki

نُشر 2026-03-09
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Koki Itai, Shunichi Hasegawa, Yuta Yamamoto, Gouki Minegishi, Masaki Otsuki

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك توظف مساعد باحث فائق الذكاء (نموذج لغوي كبير، أو LLM) للإجابة على أسئلة شركتك. تقول له: "لا تكتفِ بالتخمين؛ اذهب وابحث عن الحقائق في ملفات شركتنا أولاً". هذا الإعداد يسمى RAG (التوليد المعزز بالاسترجاع).

ما هي المشكلة؟ حتى المساعدين الأذكياء قد يرتكبون أخطاءً أحياناً. فقد:

  • يهلوس (Hallucinate): يختلق حقائق لأنه واثق من نفسه ولكنه مخطئ.
  • يخطئ في فهم الجوهر: يجد الملف الصحيح لكنه يفشل في الربط بين وثيقتين مختلفتين.
  • يرتبك بسبب الجداول: ينظر إلى جدول بيانات ويسيء قراءة الأرقام تماماً.
  • يرفض الإجابة: أو الأسوأ من ذلك، يرفض الإجابة بينما يمكنه العثور على الإجابة بالفعل.

حتى الآن، لم يكن هناك "اختبار قيادة" جيد لمعرفة مدى جودة هؤلاء المساعدين في هذه المهارات المحددة في آن واحد.

إليكم: LIT-RAGBench

قام مؤلفو هذه الورقة البحثية ببناء اختبار صارم جديد يسمى LIT-RAGBench. فكر فيه كأنه مضمار عقبات متعدد المهارات مصمم لاختبار جاهزية المساعد للعمل في العالم الحقيقي.

الاسم يرمز إلى: Logic (المنطق)، Integration (التكامل)، Table (الجدول)، Reasoning (الاستنتاج)، و Abstention (الامتناع). إليكم كيف يبدو كل جزء من مضمار العقبات هذا، باستخدام استعارات بسيطة:

1. التكامل (سيد الألغاز - Integration)

  • الاختبار: يُعطى المساعد ثلاث وثائق مختلفة. الإجابة ليست في وثيقة واحدة فقط؛ بل هي لغز حيث القطعة (أ) موجودة في الوثيقة 1، والقطعة (ب) موجودة في الوثيقة 2.
  • الاستعارة: تخيل أنك تسأل: "من فاز بالجائزة؟". يجب على المساعد قراءة نشرة إخبارية (الوثيقة 1) تقول "أليس فازت"، ورسالة بريد إلكتروني منفصلة (الوثيقة 2) تقول "أليس من فريق التسويق". يجب عليه دمج المعلومات ليقول: "أليس من فريق التسويق هي الفائزة". إذا قرأ وثيقة واحدة فقط، فسيفشل.

2. الاستنتاج (المحقق - Reasoning)

  • الاختبار: الإجابة ليست مذكورة بشكل مباشر. يتعين على المساعد القيام بعملية استنتاج "متعددة الخطوات".
  • الاستعارة: تقول الوثيقة: "تم نقل الاجتماع إلى يوم الثلاثاء". وتقول وثيقة أخرى: "يوم الثلاثاء هو عطلة رسمية". يجب على المساعد أن يستنتج: "لذلك، الاجتماع قد أُلغي فعلياً أو تم نقله مرة أخرى"، رغم أن أحداً لم يكتب صراحةً كلمة "أُلغي". كما يختبر هذا الجزء المهارات الرياضية، مثل حساب إجمالي الأرباح من قائمة مبيعات، وهو أمر يعاني منه العديد من نماذج الذكاء الاصطناعي بشكل مفاجئ.

3. المنطق (المترجم - Logic)

  • الاختبار: السؤال يستخدم كلمات مختلفة عن تلك الموجودة في الوثيقة.
  • الاستعارة: تسأل: "هل ميزانية الـ 10,000 دولار معتمدة؟". الوثيقة تقول: "إن صندوق الـ عشرة آلاف دولار قد تمت الموافقة عليه". الإنسان يعرف أن هذين التعبيرين هما نفس الشيء، لكن الذكاء الاصطناعي قد يرتبك ويقول: "لا أرى 10,000 دولار"، وبذلك يفقد المرادف. كما يختبر ما إذا كان الذكاء الاصطناعي يفهم الحدود (على سبيل المثال: "هل شخص عمره 39 عاماً مؤهل لفئة 'تحت سن الـ 40'؟").

4. الجدول (قارئ المخططات - Table)

  • الاختبار: المعلومات مخفية داخل جداول بيانات فوضوية، أو جداول HTML، أو ملفات CSV.
  • الاستعارة: تخيل جدولاً حيث الصفوف والأعمدة مدمجة معاً (مثل ورقة إكسل معقدة). يجب على الذكاء الاصطناعي العثور على رقم محدد في خلية هي جزء من كتلة مدمجة. هذا يشبه محاولة العثيد على مقعد محدد في مسرح حيث تغيب لوحات الممرات والصفوف مدمجة. الكثير من نماذج الذكاء الاصطناعي تضيع هنا.

5. الامتناع (اختبار الأمانة - Abstention)

  • الاختبار: يُسأل المساعد سؤالاً حيث لا تحتوي الوثائق على الإجابة، أو حيث تتعارض الوثائق مع بعضها البعض.
  • الاستعارة: تسأل: "ما هو اللون المفضل للمدير التنفيذي؟". الوثائق تتحدث فقط عن استراتيجية العمل الخاصة بالمدير التنفيذي. المساعد الجيد يجب أن يقول: "لا أعرف، الوثائق لا تذكر ذلك". أما المساعد السيئ فسيخترع لوناً (مثل "الأزرق") لمجرد أن يكون "مفيداً". يختبر هذا القسم ما إذا كان الذكاء الاصطناعي يعرف متى يصمت ويعترف بجهله.

النتائج: من اجتاز الاختبار؟

قام الباحثون بتشغيل هذا الاختبار على العديد من أذكى نماذج الذكاء الاصطناعي في العالم (مثل GPT-5، وClaude، وLlama، وQwen).

  • المفاجأة الكبرى: لم يحصل أي نموذج على درجة كاملة. في الواقع، لم يصل أي نموذج حتى إلى دقة 90%. حتى "أذكى" النماذج تعثرت في أنواع معينة من الألغاز.
  • نقاط الضعف:
    • الرياضيات والمنطق: عانت العديد من النماذج مع الحسابات البسيطة أو فهم أن "10k" تعني "10,000".
    • الجداول: كانت قراءة جداول البيانات الفوضوية كابوساً للجميع تقريباً.
    • الأمانة: كانت بعض النماذج متحمسة جداً للإجابة (مما يؤدي للهلوسة)، بينما كانت نماذج أخرى خائفة جداً من الإجابة (ترفض الإجابة حتى عندما تملك الحقائق). وهذا ما يسمى بمشكلة "الإفراط في الامتناع" (Over-Abstention).

لماذا يهم هذا الأمر؟

فكر في LIT-RAGBench كأنه قائمة مراجعة لضبط الجودة للشركات.

إذا كنت شركة تحاول بناء "روبوت دردشة" لموظفيك، فلا يمكنك مجرد اختيار الذكاء الاصطناعي "الأكثر شهرة". أنت بحاجة لمعرفة:

  • "هل يرتبك هذا النموذج بسبب جداولنا المالية؟" (مهارة الجدول - Table skill)
  • "هل سيخترع حقائق إذا كانت البيانات مفقودة؟" (مهارة الامتناع - Abstention skill)
  • "هل يمكنه ربط النقاط عبر تقارير مختلفة؟" (مهارة التكامل - Integration skill)

الخلاة النهائية:
الذكاء الاصطناعي يصبح ذكياً للغاية، لكنه ليس مثالياً بعد. يوضح لنا هذا المعيار الجديد بدقة أين ينهار أداؤه. إنه يخبرنا أنه قبل أن نثق في الذكاء الاصطناعي لإدارة أعمالنا، نحتاج إلى إصلاح قدرته على قراءة المخططات، وإجراء العمليات الحسابية، ومعرفة متى يقول: "لا أعرف".

لقد جعل المؤلفون هذا الاختبار مفتوح المصدر، بحيث يمكن لأي شخص استخدامه لتدريب مساعدي ذكاء اصطناعي أفضل وأكثر موثوقية للعالم الحقيقي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →