← أحدث الأبحاث
🤖 AI

Towards Query-Agnostic RAG Evaluation via Query Coverage and Claim Verifiability

تقدم الورقة البحثية إطار عمل Q-CARE، وهو إطار عمل غير معتمد على الاستعلام أو المرجع يقوم بتفكيك الاستعلامات والإجابات إلى وحدات ذرية لإنشاء مقاييس موحدة لتغطية المسترجع وقابلية تحقق الادعاءات للمولد، مما يظهر ارتباطاً فائقاً مع الأحكام البشرية مقارنة بطرق تقييم RAG الحالية.

المؤلفون الأصليون: Jeonghwan Choi, Taewon Yun, Minjeong Ban, Gyeonghun Sun, Jae-Gil Lee, Hwanjun Song

نُشر 2026-08-13
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jeonghwan Choi, Taewon Yun, Minjeong Ban, Gyeonghun Sun, Jae-Gil Lee, Hwanjun Song

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك محقق تحاول حل لغز ما. لديك مساعد فائق الذكاء (نموذج لغوي كبير) يمكنه كتابة القصص، والإجابة على الأسئلة، وشرح المواضيع المعقدة. لكن هذا المساعد لديه مشكلة: أحياناً يختلق أشياء من عنده، أو ينسى مراجعة ملاحظاته. ولإصلاح ذلك، نعطي المساعد مجموعة من الكتب المرجعية (الأدلة المسترجعة) ونقول له: "أجب فقط باستخدام ما تجده في هذه الكتب". هذا ما يسمى بالاسترجاع المعزز بالتوليد (Retrieval-Augmented Generation)، أو RAG. الأمر يشبه إعطاء المحقق بطاقة مكتبة حتى لا يضطر للتخمين.

لكن الجزء الصعب هنا هو: كيف نعرف ما إذا كان المحقق قد قام بعمل جيد؟ إذا كان السؤال بسيطاً، مثل "من هو الرئيس؟"، فمن السهل التحقق من الإجابة. ولكن ماذا لو كان السؤال معقداً، مثل "اشرح تاريخ القهوة وكيف تؤثر على الاقتصاد"؟ قد تكون الإجابة طويلة، ومليئة بالأفكار المختلفة، وصعبة التقييم. كانت الطرق القديمة للتحقق من الإجابات تشبه معلماً صارماً لا يعطي درجات إلا إذا تطابقت إجابة الطالب كلمة بكلمة مع "المعيار الذهبي". لقد نجح هذا في الحقائق البسيطة، لكنه فشل فشلاً ذريعاً في القصص المعقدة. لم يكن بإمكانه معرفة ما إذا كان الطالب قد أغفل نقطة رئيسية أو ما إذا كان قد اختلق حقيقة تبدو جيدة ولكنها ليست موجودة في الكتب. كنا بحاجة إلى طريقة جديدة للتقييم تعمل لأي نوع من الأسئلة، سواء كانت حقيقة بسيطة أو شرحاً عميقاً، دون الحاجة إلى نموذج إجابة مثالي للمقارنة به.

هنا يأتي دور Q-CARE، وهو إطار تقييم جديد اقترحه الباحث "جيونغهوان تشوي" وفريقه في جامعة KAIST. فكر في Q-CARE كأنه مساعد تدريس فائق التنظيم والتركيز، لا ينظر فقط إلى المقال النهائي؛ بل يفكك العملية بأكملها إلى قطع صغيرة يمكن إدارتها ليرى بالضبط أين نجح المحقق أو أين أخفق.

بدلاً من النظر إلى الإجابة ككل، يعمل Q-CARE مثل شيف ماهر يقوم بتفكيك طبق معقد. أولاً، يأخذ السؤال الأصلي ويقطعه إلى "أسئلة فرعية" أصغر وسهلة الهضم. إذا كان السؤال "كيف أخبز كعكة؟"، فإنه يفككه إلى "ما هي المكونات التي أحتاجها؟"، و"كم مدة الخبز؟"، و"ما هي درجة الحرارة؟". وهو يفعل الشيء نفسه مع الإجابة، حيث يفكك الفقرة الطويلة إلى "ادعاءات" أو حقائق فردية، مثل "الكعكة تحتاج إلى دقيق" أو "تُخبز عند 350 درجة".

ثم يحدث السحر. يلعب Q-CARE لعبة "توصيل النقاط" باستخدام الكتب المرجعية فقط التي سُمح للمحقق باستخدامها. فهو يطرح ثلاثة أسئلة حاسمة:

  1. هل غطت الكتب الأسئلة الفرعية؟ (هل كان لدى المكتبة معلومات عن المكونات؟)
  2. هل غطت الإجابة الأسئلة الفرعية؟ (هل كتب الطالب بالفعل عن المكونات؟)
  3. هل يمكن إثبات ادعاءات الإجابة من خلال الكتب؟ (هل ادعاء "تُخبز عند 350 درجة" مكتوب بالفعل في الكتاب، أم أن الطالب خمن ذلك؟)

يتيح هذا النهج لـ Q-CARE قياس شيئين رئيسيين: التغطية (هل تناولت الإجابة كل ما طلبه السؤال؟) والقابلية للتحقق (هل كل جملة مدعومة بالأدلة؟).

اختبر الباحثون هذه الطريقة الجديدة على اختبار مرجعي ضخم يتضمن ثمانية أنواع مختلفة من مجموعات البيانات، بدءاً من أسئلة الأخبار البسيطة وصولاً إلى التفسيرات العلمية المعقدة. وقارنوا Q-CARE بأربعة أدوات تقييم أخرى شائعة. كانت النتائج واضحة: اتفقت Q-CARE بشكل أكبر بكثير مع الحكام البشريين مقارنة بالطرق الأخرى. في الواقع، حققت ارتباطاً قدره 0.55 مع الأحكام البشرية فيما يتعلق بالاسترجاع للأسئلة مغلقة النهايات، و0.69 للقابلية للتحقق في الأسئلة مفتوحة النهايات، متفوقة بشكل كبير على منافسيها مثل RAGEval وRAGChecker، اللذين غالباً ما واجها صعوبة عندما تصبح الأسئلة معقدة أو مفتوحة النهايات.

أحد أروع ميزات Q-CARE هو أنه لا يحتاج إلى "معيار ذهبي" ليعمل. إنه "خالٍ من المرجع" (reference-free)، مما يعني أنه يمكنه تقييم مقال الطالب حتى لو لم يكن لدى المعلم مفتاح الإجابة، طالما أن الطالب استخدم الكتب المدرسية الصحيحة. وجد الفريق أن هذه الطريقة تعمل بنفس الكفاءة لأسئلة مثل "من هو الرئيس؟" البسيطة كما تعمل لمقالات مثل "اشرح نظرية النسبية".

ومع ذلك، تشير الورقة البحثية أيضاً إلى أن حجم "الدماغ" (نموذج الذكاء الاصطناعي) الذي يقوم بالتقييم أمر مهم. فعندما استخدموا نموذج ذكاء اصطناعي أصغر لتشغيل Q-CARE، لم تكن الدرجات موثوقة بنفس القدر، خاصة بالنسبة للأسئلة الصعبة مفتوحة النهايات. ولكن عندما استخدموا نموذجاً أكبر وأذكى (مثل Qwen3-30B)، أصبح التقييم أكثر دقة، مما يشقى إلى أن وجود "معلم" قوي ضروري لاستخدام نظام التقييم الجديد هذا بفعالية.

باختاً، يشير Q-CARE إلى أنه من خلال تفكيك الأسئلة والإجابات إلى قطع صغيرة قابلة للتحقق، يمكننا أخيراً بناء نظام تقييم عادل، ومتسق، وقادر على التعامل مع كامل نطاق الفضول البشري، من الحقائق البسيطة إلى الاستكشاف العميق مفتوح النهايات. إنها خطوة نحو التأكد من أن مساعدينا من الذكاء الاصطناعي ليسوا فقط يبدون أذكياء، بل هم مفيدون وصادقون حقاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →