← أحدث الأبحاث
💻 computer science

Deepchecks: Evaluating Retrieval-Augmented Generation (RAG)

تقدم هذه الورقة Deepchecks، وهو إطار عمل شامل مصمم لمعالجة التحديات المعقدة لتقييم أنظمة التوليد المعزز بالاسترجاع (RAG) من خلال توفير تقييم متعدد الأوجه، وتحليل الأسباب الجذرية، ومراقبة الإنتاج لضمان الموثوقية، والصلة، والتوافق مع المتطلبات الخاصة بالتطبيق.

المؤلفون الأصليون: Assaf Gerner, Netta Madvil, Nadav Barak, Alex Zaikman, Jonatan Liberman, Liron Hamra, Rotem Brazilay, Shay Tsadok, Yaron Friedman, Neal Harow, Noam Bresler, Shir Chorev, Philip Tannor, Lior Rokach

نُشر 2026-05-15
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Assaf Gerner, Netta Madvil, Nadav Barak, Alex Zaikman, Jonatan Liberman, Liron Hamra, Rotem Brazilay, Shay Tsadok, Yaron Friedman, Neal Harow, Noam Bresler, Shir Chorev, Philip Tannor, Lior Rokach

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً ذكياً جداً ومحبّاً للحديث (نموذج لغوي كبير، أو LLM). هذا المساعد بارع في كتابة القصص والإجابة على الأسئلة، لكن لديه عادة سيئة: أحياناً يختلق الأمور تماماً، أو يقدم إجابات عامة لا تناسب الموقف المحدد تماماً. هذا يشبه طالباً حفظ الكتاب المدرسي عن ظهر قلب ولكنه نسي التحقق من تفاصيل الواجب المنزلي، مما أدى إلى تقديم إجابات واثقة ولكنها خاطئة.

لإصلاح ذلك، ابتكر المطورون نظاماً يسمى RAG (التوليد المعزز بالاسترجاع). فكر في RAG كأنك أعطيت ذلك المساعد الذكي بطاقة مكتبة وأميناً للمكتبة.

  1. أمين المكتبة (الاسترجاع): قبل أن يجيب المساعد، يقوم أمين المكتبة بالبحث بسرعة في المكتبة (قاعدة بيانات المستندات) للعثد على الصفحات الدقيقة ذات الصلة بالسؤال.
  2. المساعد (التوليد): يقرأ المساعد تلك الصفحات ثم يكتب الإجابة، مستخدماً كتب المكتبة كمصدر للحقيقة.

المشكلة:
حتى مع وجود أمين مكتبة، لا يزال بإمكان النظام الفشل. قد يسحب أمين المكتبة الكتب الخاطئة، أو قد يتجاهل المساعد الكتب ويختلق أشياء من عنده على أي حال. توضح الورقة البحثية أن التحقق مما إذا كان هذا النظام بأكمله يعمل بشكل جيد هو أمر صعب للغاية بسبب كثرة الأجزاء المتحركة فيه.

الحل: Deepchecks
يقدم المؤلفون Deepchecks، والذي يعمل مثل مراقب جودة صارم للغاية لأنظمة RAG هذه. بدلاً من مجرد إعطاء درجة "ناجح/راسب" واحدة، يقوم Deepchecks بتفكيك النظام إلى "خصائص" محددة للتحقق منها، تماماً مثل ميكانيكي السيارات الذي يفحص أجزاء مختلفة من المحرك.

إليك كيف يقوم Deepchecks بفحص النظام، باستخدام تشبيهات بسيطة:

1. الفحوصات الثلاثة الرئيسية (الخصائص)

يبحث Deepchecks في ثلاثة أشياء محددة لضمان جودة الإجابة:

  • صلة الاسترجاع (هل وجد أمين المكتبة الكتب الصحيحة؟):
    • تشبيه: إذا سألت "كيف أخبز كعكة؟"، فلا ينبغي لأمين المكتبة أن يسلمك كتاباً عن "كيفية إصلاح سيارة". يتحقق Deepchecks مما إذا كانت المستندات التي تم سحبها مفيدة حقاً للسؤال.
  • الاستناد إلى السياق (هل التزم المساعد بالكتب؟):
    • تشبيه: هذا هو كاشف "الهلوسة". إذا قال الكتاب إن الكعكة تحتاج بيضتين، لكن المساعد قال 10 بيضات، فإن Deepchecks يضبط تلك الكذبة. إنه يتحقق من أن كل حقيقة في الإجابة مدعومة بالفعل بالمستندات التي وجدها أمين المكتبة.
  • الاكتمال (هل أجاب المساعد على السؤال كاملاً؟):
    • تشبيه: إذا سألت "كيف أخبز كعكة وما هي درجة حرارة الفرن؟"، فلا ينبغي للإجابة أن تقول فقط "ضعها في الفرن". يتحقق Deepches مما إذا كان المساعد قد غطى جميع أجزاء طلبك.

(هناك أيضاً فحص السلامة للتأكد من أن المساعد ليس وقحاً، أو يسرب معلومات خاصة، أو يقول أي شيء خطير.)

2. الدرجة الشاملة (الدرجة النهائية)

معظم الأدوات تعطيك فقط قائمة بالدرجات للأجزاء المذكورة أعلاه. يذهب Deepchecks خطوة أبعد من ذلك؛ فهو يستخدم "آلية تجميع" ذكية (صيغة متعلمة) لدمج كل تلك الدرجات في درجة نهائية واحدة: إيجابي، سلبي، أو غير معروف.

  • إيجابي: وجد أمين المكتبة الكتب الصحيحة، وأجاب المساعد بشكل مثالي بناءً عليها.
  • سلبي: حدث خطأ ما (كتب خاطئة، حقائق مختلقة، أو إجابة غير مكتملة).
  • غير معروف: لم يكن الأمر سيئاً، لكنه لم يصل تماماً إلى المعايير العالية لـ "المثالية".

3. أدوات التحري (تحليل السبب الجذري)

إذا حصل النظام على درجة "سلبية"، فإن Deepchecks لا يكتفي بإخبارك أنه فشل؛ بل يعمل كالمحقق ليخبرك لماذا.

  • تشبيه: تخيل أن سيارة تعطلت. الميكانيكي العادي يقول: "إنها معطلة". أما Deepchecks فيقول: "المحرك سليم، لكن الإطارات فارغة من الهواء".
  • يساعد هذا المطورين في معرفة مكان إصلاح المشكلة بالضبط: هل يحتاجون إلى أمين مكتبة أفضل (استرجاع أفضل)؟ أم يحتاجون إلى تدريب المساعد على الاستماع بشكل أفضل (توليد أفضل)؟

4. "آلة الزمن" (مقارنة الإصدارات والمراقبة)

يتيح لك Deepchecks أيضاً مقارنة إصدارات مختلفة من نظامك جنباً إلى جنب.

  • تشبيه: إنه مثل مقارنة أداء السيارة قبل وبعد تغيير إطاراتها. هل جعلت الإطارات الجديدة السيارة أسرع؟
  • كما يراقب النظام أثناء تشغيله في العالم الحقيقي. إذا بدأ النظام يزداد سوءاً بمرور الوقت (ربما لأن كتب المكتبة تغيرت أو تغيرت أسئلة المستخدمين)، فإن Deepchecks يطلق إنذاراً فورياً.

ما وجدته الورقة البحثية

اختبر المؤلفون Deepchecks مقابل أدوات شائعة أخرى (مثل RAGAS و LangSmith) باستخدام:

  1. مجموعات البيانات العامة: أسئلة اختبار قياسية يعرفها الجميع.
  2. مجموعات بيانات العملاء: أمثلة من الواقع لشركات فعلية (مثل دردشات الدعم الفني ومراجعات المرشحين للوظائف).

النتيجة: كان Deepchecks أفضل في رصد الأخطاء، خاصة في بيانات العملاء الواقعية. بينما فات بعض الأدوات الأخرى الأخطاء أو أعطت درجات غير متسقة، كان Deepchecks أكثر دقة في تحديد متى كان النظام يكذب (يهلوس) أو يعطي إجابات غير ذات صلة.

باختة:
Deepchecks هو مجموعة أدوات شاملة تضمن أن مساعدك الذكي لا يتحدث بثقة فحسب، بل إنه يقول الحقيقة بالفعل بناءً على المستندات التي قدمتها له. إنه يفحص أمين المكتبة، ويفحص الكاتب، ويفحص السلامة، ويعطيك تقريراً واضحاً لتتمكن من إصلاح ما تعطل بالضبط.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →