← أحدث الأبحاث
🤖 AI

RAG-TESTER: Automated End-to-End Testing of Retrieval-Augmented Large Language Models

تقدم الورقة البحثية RagTester، وهو إطار عمل آلي للاختبار من البداية إلى النهاية يقوم بتوليد حالات اختبار متنوعة لتقييم أنظمة التوليد المعزز بالاسترجاع، مما يثبت قدرته على اكتشاف عدد أكبر بكثير من الإخفاقات مقارنة بالطرق المرجعية عبر مختلف تكوينات النماذج.

المؤلفون الأصليون: Ange Maiztegi, Jon Ayerdi, Miren Illarramendi, Aitor Arrieta

نُشر 2026-08-04
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ange Maiztegi, Jon Ayerdi, Miren Illarramendi, Aitor Arrieta

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك صديقاً آلياً ذكياً للغاية، يمكنه كتابة القصص، وحل المسائل الرياضية، والدردشة حول أي شيء تريده. هذا الروبوت موهوب بشكل لا يصدق، لكن لديه سر: هو لا يعرف إلا ما تعلمه في المدرسة منذ سنوات مضت. إذا سألته عن قصة إخبارية من يوم أمس أو عن قاعدة محددة في دليل شركتك، فقد يخمن، أو يختلق أشياءً، أو يكتفي بالقول إنه لا يعرف. هذا هو عالم نماذج اللغات الكبيرة (LLMs) — عقول ذكاء اصطناعي قوية بارعة في التحدث ولكنها سيئة أحياناً في معرفة أحدث الحقائق.

ولإصلاح ذلك، اخترع المهندسون حيلة تسمى الاسترجاع المعزز بالتوليد (RAG). فكر في (RAG) كأنك تعطي ذلك الروبوت مكتبة سحرية ضخمة وأميناً للمكتبة فائق السرعة. قبل أن يجيب الروبوت على سؤالك، يهرع أمين المكتبة للعثور على الصفحات الدقيقة في الكتب التي تحتوي على الإجابة. ثم يقرأ الروبوت تلك الصفحات ويكتب إجابته بناءً فقط على ما وجده. يبدو الأمر مثالياً، أليس كذلك؟ لكن هنا تكمن المشكلة: قد يلتقط أمين المكتبة الكتاب الخطأ، أو قد يتجاهل الروبوت الصفحة الصحيحة، أو قد يرتبك بسبب فقرة غير منظمة. إذا أخطأ أي جزء من هذا الفريق، فسيقدم الروبوت إجابة خاطئة. ولأن هناك طرقاً كثيرة يمكن أن يفشل بها هذا الفريق، فنحن بحاجة إلى طريقة لاختبارهم جميعاً قبل أن نتركهم يتحدثون مع الناس الحقيقيين.

هنا يأتي دور أداة جديدة تسمى RAG-TESTER. أراد الباحثون وراء هذه الأداة معرفة ما إذا كان بإمكانهم بناء "صائد أخطاء" آلي يعمل مثل مراهق فضولي وصارم يختبر لعبة فيديو جديدة. بدلاً من مجرد طرح بعض الأسئلة العشوائية على الروبوت، يقوم RAG-TESTER ببناء ساحة اختبار كاملة. أولاً، يقوم تلقائياً بإنشاء وثائق استرجاع (ملفات PDF) تحتوي على أقسام معقدة، صعبة، وحتى مملة. ثم يكتب آلاف الأسئلة المصممة لاستدراج الروبوت وإيقاعه في الفخ: بعض الأسئلة تتعلق بأشياء غير موجودة في الكتب (لمعرفة ما إذا كان الروبوت سيكذب)، وبعضها يتعلق بفقرات يصعب قراءتها، وبعضها يتطلب من الروبوت تجميع الأدلة من أجزاء مختلفة من النص.

بمجرد تجهيز الأسئلة، يقوم RAG-TESTER بتمريرها عبر 24 تركيبة مختلفة من الروبوتات وأمناء المكتبات (باستاستخدام نماذج ذكاء اصطعي وأدوات بحث مختلفة). ثم يستخدم "ذكاءً اصطناعياً حكماً" لتقييم الإجابات، والتحقق مما إذا كان الروبوت صادقاً، وما إذا كان قد أجاب على السؤال الصحيح، وما إذا كان قد أغفل أي تفاصيل مهمة. كانت النتائج مذهلة. عبر 72,000 عملية اختبار، وجد RAG-TESTER 21,633 فشلاً. هذا عدد كبير من الأخطاء! لقد وجد أن حتى "أذكى" الروبوتات كانت تهلوس (تختلق معلومات) عندما تُسأل عن أشياء لم تكن موجودة في كتبها، أو أنها ارتبكت أمام النصوص المعقدة.

كما قارنت الدراسة بين RAG-TESTER وطريقة اختبار أبسط وأقل ذكاءً. وجد المختبر الآلي الذكي 6.6% أكثر من حالات الفشل مقارنة بالطريقة البسيطة. قد لا يبدو هذا رقماً ضخماً، ولكن في عالم الذكاء الاصطناعي، يعد اكتشاف تلك الأخطاء الإضافية أمراً بالغ الأهمية. هذا يعني أن المختبر الذكي أفضل بكثير في العثور على الفخاخ الخفية التي تجعل الروبوتات تكذب أو ترتبك. ومن المثير للاهتمام أن الباحثين وجدوا أن استخدام وثائق من العالم الحقيقي (مثل ملفات PDF الفعلية من الإنترنت) كان أصعب بكثير على الروبوتات من استخدام الوثائق التي أنشأتها الأداة. فالوثائق الحقيقية كانت ذات تنسيقات فوضوية وهياكل غريبة عانت معها الروبوتات، مما يثبت أنه بينما يمكننا صنع مواد اختبار، يظل الواقع هو "المستوى الأخير" الأكثر صعوبة.

باختصار، يوضح لنا RAG-TESTER أن بناء نظام ذكاء اصطناعي موثوق ليس مجرد اختيار أذكى روبوت؛ بل يتعلق باختبار كيفية عمل ذلك الروبوت مع مكتبته بصرامة. تشير الأداة إلى أنه لا يمكننا مجرد الثقة في هذه الأنظمة كما هي؛ نحن بحاجة إلى اختبار منهجي وآلي للإمساك بالطرق الخفية التي تفشل بها — سواء كان ذلك عبر قيام الروبوت بتأليف حقائق، أو تجاهل الكتاب الصحيح، أو الضياع في جملة معقدة. ومن خلال استخدام هذا النوع من الاختبار، يمكن للمطورين إصلاح هذه المشكلات قبل أن يبدأ الذكاء الاصطناعي في تقديم المشورة للأطباء، أو المحامين، أو أي شخص آخر يحتاج إلى الحقيقة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →