LayerRAG-Bench: A Cross-Layer Reliability Benchmark for Agentic Retrieval-Augmented Generation
تقدم هذه الورقة LayerRAG-Bench، وهو معيار مرجعي شامل يوضح أنه في حين أن تطبيع المخطط (schema normalization) يعالج بفعالية انحراف المخطط (schema drift) في أنظمة RAG الوكيلية، إلا أنه يفشل في حل مشكلات موثوقية حرجة أخرى مثل الأدلة القديمة أو أخطاء الأذونات، مما يدعو إلى تقييم مستهدف خاص بكل طبقة بدلاً من الاعتماد على الإصلاحات الشاملة أو مقاييس التجذر (groundedness) فقط.
تخيل أنك تقوم ببناء مساعد آلي فائق الذكاء يمكنه قراءة مكتبة ضخمة، وتذكر أسرارك الشخصية، واستخدام صندوق أدوات من الأدوات التقنية لحل مشكلاتك. هذا هو عالم "الاسترجاع المعزز بالتوليد الوكيل" (Agentic Retrieval-Augmented Generation - RAG). فكر في "الاسترجاع" (Retrieval) على أنه قدرة الروبوت على الركض إلى رفوف المكتبة وجلب الكتاب المناسب. و"التوليد" (Generation) هو قدرة الروبوت على قراءة هذا الكتاب وكتابة قصة لك. لكن صفة "الوكيل" (Agentic) تضيف لمسة جديدة: الروبوت لا يكتفي بالقراءة فحسب؛ بل يحاول أيضاً استخدام أدوات (مثل الآلة الحاسبة أو التقويم)، والتحقق مما إذا كان لديه إذن لدخول غرفة ما، وتذكر ما حدث في محادثتك قبل خمس دقائق.
السؤال الكبير الذي يطرحه العلماء هو: كيف نعرف ما إذا كان هذا الروبوت موثوقاً حقاً؟ من السهل خداع الروبوت لجعله يبدو واثقاً. فقد يجلب كتاباً قديماً ومنتهي الصلاحية، أو يستخدم أداة لا يملك ترخيصاً لها، أو يخلط بين محادثتك ومحادثة جارك. إذا كتب الروبوت جملة مثالية بناءً على الكتاب الخطأ أو الإذن الخطأ، فسيظهر الأمر كأنه نجاح، لكنه في الواقع كارثة تنتظر وقوعها. نحن بحاجة إلى طريقة لا تختبر فقط ما إذا كانت إجابة الروبوت تبدو جيدة، بل تختبر أيضاً ما إذا كان قد جلب الكتاب الصحيح، واستخدم الأداة الصحيحة، واحترم القواعد.
هذا هو بالضبط ما يعالجه البحث الجديد، LayerRAG-Bench. لقد صمم الباحثون مضمار عقبات ضخم ومحكم لهذه الروبوتات الذكية. أنشأوا 240 مهمة مختلفة عبر 8 عوالم تجارية مختلفة (مثل القانون أو التمويل) واختبروا 9 نماذج ذكاء اصطناعي مختلفة من كبرى الشركات. لم يكتفوا بسؤال الروبوتات عن إجابات، بل تعمدوا إفساد الأشياء بطرق محددة ليروا كيف ستتفاعل الروبوتات. لقد أدخلوا "أعطالات" مثل إعطاء الروبوت أداة بدليل تعليمات معطل (انحراف المخطط - schema drift)، أو إخفاء الكتاب الذي يحتاجه (نقص الأدلة - missing evidence)، أو قفل الباب الذي يحتاج للدخول منه (رفض الإذن - permission denied)، أو إظهار كتاب من مكتبة العام الماضي له (فهرس قديم - stale index).
الاكتشاف الرئيسي هو بمثابة صدمة للواقع: إصلاح جزء واحد مكسور لا يصلح كل شيء. وجد الباحثون أنه إذا قاموا بـ "إصلاح" دليل التعليمات المعطل (وهو إصلاح يسمى تطبيع المخطط - schema normalization)، فإن معدل نجاح الروبوت قفز من 0% إلى 91.3%. وهذا فوز هائل! ولكن هنا تكمن الخدعة: هذا الإصلاح نفسه لم يفعل أي شيء للمشكلات الأخرى. فإذا كان الكتاب مفقوداً، أو تم رفض الإذن، أو كان الروبوت ينظر إلى ملاحظات جلسة أخرى، فإن "الإصلاح" لم يساعد على الإطلاق؛ حيث ظل معدل النجاح عند 0%.
كما يحذرنا البحث عن فخ شائع: مجرد كون الإجابة تبدو "مستندة إلى نص" (أي أنها تقتبس النص الذي وجدته) لا يعني بالضرورة أنها صحيحة. وجد الباحثون أنه في الحالات التي نظر فيها الروبوت إلى جلسة خاطئة أو فهرس قديم، كان بإمكانه إنتاج إجابات مستندة تماماً إلى النص الخاطئ، مما يؤدي إلى عدد هائل من الإنذارات الكاذبة.
باخت عقد، يجادل البحث بأننا يجب أن نتوقف عن معاملة موثوقية الذكاء الاصطناعي كدرجة واحدة. بدلاً من ذلك، نحتاج إلى فحص كل "طبقة" من عقل الروبوت بشكل منفصل. فإصلاح عقد أداة مكسورة ليس عصا سحرية لمشكلات نقص البيانات أو الخروقات الأمنية. لبناء مساعدي ذكاء اصطناعي موثوقين حقاً، نحتاج إلى معرفة أي طبقة هي المعطلة بالضبط وتطبيق الإصلاح المناسب لتلك الطبقة المحددة، بدلاً من الأمل في أن يحل حل عام واحد جميع المشكلات.
ملخص تقني: LayerRAG-Bench
بيان المشكلة
تدمج أنظمة التوليد المعزز بالاسترجاع الوكيل (Agentic RAG) الأدلة الخارجية، واستدعاء الأدوات، والواجهات المهيكلة، والأذونات، والحالة المستمرة. وبينما تقيم المقاييس الحالية مدى الأمانة النصية وصحة الإجابة، إلا أنها غالبًا ما تخلط بين الإخفاقات الناجمة عن طبقات تشغيلية متميزة. فقد ينتج النظام استجابة تبدو مستندة نصيًا إلى الأدلة، ومع ذلك تفشل بسبب أدلة قديمة، أو عدم تطابق في المخططات (schemas)، أو رفض الأذونات، أو سياقات جلسات خاطئة. وتخاطر مناهج التقييم الحالية بإساءة عزو النجاح؛ فعلى سبيل المثال، قد يقوم إصلاح تطبيع المخطط (schema normalization) بمعالجة خطأ في عقد الأداة، لكنه لا يستطيع استعادة الأدلة المفقودة أو تجاوز رفض الأذونات. هناك نقص في الاختبارات المرجعية التي تعزل حالات الفشل المحددة هذه لتحديد ما إذا كانت استراتيجية التخفيف تعالج بالفعل الطبقة المقصودة دون حجب الضوابط السلبية.
المنهجية
LayerRAG-Bench هو اختبار مرجعي موثوق عبر الطبقات، مصمم لربط تسعة سيناريوهات محددة للأعطال بطبقات تشغيلية متميزة داخل بنية RAG.
بناء مجموعة البيانات: يستخدم الاختبار المرجعي مجموعة بيانات enterprise_v2 التي تحتوي على 8 مجالات مؤسسية، و80 مواصفة سياسات، و160 وثيقة، و240 مهمة. تتضمن كل مهمة وثائق حالية وأخرى مستبدلة مع ثلاثة متغيرات من الأسئلة القوالبية.
سيناريوهات الأعطال: يقدم الاختبار المرجعي أعطالاً تشغيلية غير عدائية عبر تسعة سيناريوهات:
نظيف (خط الأساس)
فهرس قديم (حداثة الأدلة)
انزياح المخطط (عقد الأداة)
مخرجات أداة مفقودة (توافر الأداة)
أدلة متضاربة
رفض الإذن (التحكم في الوصول)
مهلة أداة جزئية (اكتمال الأداة)
بيانات وصفية تالفة
حالة جلسة خاطئة (سياق الجلسة)
بروتوكول التقييم:
إطار عمل حتمي: يقيم 240 مهمة دون استدعاء النماذج باستخدام مسترجع tfidf_domain_validity لتحديد الحقيقة الأرضية لاسترجاع الوثائق وصحتها.
المصفوفة الحية: يطبق نفس تعريفات المهام والسيناريوهات على تسعة نماذج من OpenAI وAnthropic وGemini. ينتج عن ذلك مصفوفة من 9 نماذج × 9 سيناريوهات × نمطي عقد (صارم مقابل إصلاح) × 240 مهمة، مما يؤدي إلى 38,880 سجلًا.
أنماط العقد:
صارم (Strict): يرفض مخرجات الأدوات التي لا تطابق المخطط المتوقع.
إصلاح (Repair): يطبق تطبيع المخطط المحدود لمحاولة استعادة الانزياح في المخطط، ولكنه لا يعيد بناء الأدلة المفقودة أو يتجاوز الأذونات أو يجدد الفهارس أو يصحح سياق الجلسة بشكل صريح.
المقاييس: يُعرف النجاح بأنه اقتران لأربعة شروط: التطابق الدقيق المعياري (Et)، واسترجاع جميع معرفات الأدلة المطلوبة (Rt)، والاستشهاد الصحيح بالأدلة المسترجعة (Gt)، وتلبية مخططات استدعاء الأدوات (Vt). ويمنح مقياس "الاستجابة الآمنة" المنفصل ائتمانًا للإجابات غير المهيكلة في الحالات غير الآمنة.
المساهمات الرئيسية
اختبار مؤسسي قابل لإعادة الإنتاج: إطار عمل يربط تسعة سيناريوهات أعطال تشغيلية متميزة بطبقات موثوقية محددة، متجاوزًا درجات جودة الإجابة العامة.
مطابقة ظروف "الصارم" و"الإصلاح": تصميم يختبر ما إذا كان تدخل معين (إصلاح المخطط) يحسن الأداء في طبقته المستهدفة (انزياح المخطط) مع التحقق من أنه لا "يصلح" زيفًا الإخفاقات غير ذات الصلة (مثل الأدلة القديمة أو رفض الأذونات).
أرشيفات آمنة الخصوصية: أرشيفات مسجلة متاحة علنًا تحتوي على 38,880 سجلًا عبر المزودين و144 خلية تكامل مركزة. تسمح هذه الأرشيفات بإعادة حساب المجاميع، ومكاسب الإصلاح، وتحليل عدم اليقين الهرمي دون الحاجة إلى الوصول إلى واجهة برمجة تطبيقات المزود أو كشف نصوص النماذج الخام.
النتائج
استعادة انزياح المخطط: يعد تطبيع المخطط فعالاً للغاية لهدفه المحدد. ففي سيناريو "انزياح المخطط"، تبلغ نسبة نجاح الحالة الصارمة 0.000، بينما ترتفع نسبة نجاح الإصلاح إلى 0.913. ويمثل هذا تحسنًا قدره 91.3 نقطة مئوية مع فاصل ثقة هرمي بنسبة 95% يتراوح بين [85.4، 95.6].
القيود الخاصة بالطبقة: التدخلات ليست عالمية. بالنسبة للسيناريوهات التي تتضمن فهارس قديمة، أو مخرجات أدوات مفقودة، أو رفض أذونات، أو حالات جلسة خاطئة، تظل نسبة نجاح الإصلاح عند 0.000، وهو ما يماثل فشل الحالة الصارمة. لا يمكن لتطبيع المخطط استعادة الأدلة المفقودة أو تجاوز ضوابط الوصول.
الإيجابيات الكاذبة في الاستناد إلى الأدلة: يؤدي الاعتماد فقط على "الاستناد إلى الأدلة" (الدعم النصي) إلى إيجابيات كاذبة كبيرة في السيناريوهات غير المتعلقة بالمخطط.
في سيناريوهات "حالة الجلسة الخاطئة"، كانت 77.6% من السجلات الصارمة و78.8% من سجلات الإصلاح مستندة إلى النص المسترجع ومع ذلك فشلت في الاختبار بسبب السياق الخاطئ.
في سيناريوهات "الفهرس القديم"، فشلت 100% من السجلات المستندة إلى الأدلة في تحقيق النجاح الصارم.
حساسية المسترجع: تظهر عمليات التدقيق الحتمية أن الوعي بالصلاحية (التمييز بين الوثائق الحالية والمستبدلة) أمر بالغ الأهمية. إن إزالة إعادة ترتيب الصلاحية يخفض استدعاء (top-1) النظيف من 0.896 إلى 0.483. ومع ذلك، فإن التصفية الصريحة للمجال هشة؛ فعند فساد البيانات الوصفية، ينخفض الاستدعاء إلى 0.000.
التكامل المركز: أظهرت دراسة أصغر باستخدام LangChain أن إضافة ضوابط LayerRAG حققت 100% من الاستجابة الآمنة (إجابات صحيحة في الظروف القابلة للإجابة + إجابات غير مهيكلة في الظروف غير الآمنة)، بينما حقق خط الأساس 50% فقط.
الأهمية والادعاءات
تجادل الورقة البحثية بضرورة وجود مبدأ تقييم خاص بالطبقة: يجب منح الائتمان لتدخل الموثوقية فقط لإصلاح طبقته المستهدفة، ولا ينبغي الخلط بينه وبين حل عالمي.
الرؤية الهيكلية: النتيجة الأساسية هي هيكلية وليست متعلقة بقوائم المتصدرين. يقوم إصلاح العقد باستعادة انزياح المخطط باستمرار، في حين أن الإخفاقات المتعلقة بالحداثة، والتفويض، والاكتمال، والحالة تتطلب ضوابط منفصلة ومتميزة.
التكامل: يتم وضع LayerRAG-Bench كمكمل للاختبارات المرجعية الحالية للاسترجاع، والاستناد إلى الأدلة، والواقعية. إنه يقيم تحديدًا ما إذا كانت استراتيجية التخفيف تعالج الطبقة التي تدعي معالجتها.
حياد النموذج: تشير هياكل الفشل المتشابهة عبر مختلف المزودين (OpenAI، Anthropic، Gemini) إلى أن النماذج الأساسية القوية لا تلغي الحاجة إلى ضوابط نظام خاصة بالطبقة.
تواضع الادعاءات: يصرح المؤلفون صراحةً بأن المصفوفة الحية هي تقييم لأنظمة بميزانية ثابتة، وليس تصنيفًا تجاريًا مدعومًا للنماذج. تدعم الدراسة التفسيرات على مستوى الآلية (على سبيل المثال، "انزياح المخطط قابل للإصلاح لأن الأدلة لا تزال موجودة") بدلاً من ادعاءات الدقة الصارمة العامة لنماذج معينة.
تخلص هذه الأعمال إلى أن الموثوقية التشغيلية في RAG الوكيل تتطلب التمييز بين أخطاء التنسيق (القابلة للإصلاح عبر تطبيع المخطط) وأخطاء المضمون (التي تتطلب فحص الحداثة، أو الامتناع الواعي بالأذونات، أو عزل الجلسة).