RAGtio: A Modular Framework for Systematic Evaluation of Hybrid Retrieval-Augmented Generation Pipelines
تقدم هذه الورقة RAGtio، وهو إطار عمل مفتوح المصدر ومعياري مبني على Haystack وQdrant، يتيح التقييم المنهجي والقابل للتكرار لخطوط أنابيب استرجاع RAG الهجينة في المجال الطبي الحيوي من خلال أوضاع تقييم مزدوجة وواجهات سهلة الاستخدام لكل من المستخدمين التقنيين وغير التقنيين.
تخيل أن لديك روبوتاً فائق الذكاء يمكنه كتابة المقالات، والإجابة على الأسئلة، ورواية القصص. إنه يشبه طالباً نابغاً قرأ كل الكتب تقريباً في العالم. لكن هناك مشكلة: هذا الروبوت ينسى الأخبار الحديثة قليلاً، وأحياناً، عندما لا يعرف الإجابة، يقوم بتأليف شيء ما ليبدو واثقاً من نفسه. هذه مشكلة إذا كنت بحاجة إلى الحقيقة، خاصة في الأماكن الجادة مثل المستشفيات أو مختبرات الأبحاث. ولحل هذه المشكلة، اخترع العلماء حيلة تسمى "التوليد المعزز بالاسترجاع" (أو RAG اختصاراً). فكر في الأمر كأنك تعطي الروبوت حقيبة ظهر مليئة بالكتب المدرسية المحددة. عندما تسأله سؤالاً، لا يعتمد الروبوت فقط على ذاكرته؛ بل يفتح أولاً حقيبة الظهر، ويجد الصفحات الصحيحة، ويقرأها، ثم يجيب. هذا يجعل الروبوت أكثر موثوقية. ولكن الجزء الصعب هو: كيف تعرف ما إذا كان الروبوت يجد الصفحات الصحيحة بالفعل؟ إذا كانت حقيبة الظهر فوضوية، أو إذا كان الروبوت يبحث عن كلمات رئيسية خاطئة، فقد يلتقط الصفحة الخطأ ويعطيك إجابة خاطئة. لذا يحتاج العلماء إلى طريقة لاختبار ما إذا كان جزء "محرك البحث" في الروبوت يعمل بشكل مثالي قبل أن يتركوه يتحدث إلى المرضى أو الباحثين.
هذا هو بالضبط موضوع ورقة بحثية بعنوان "RAGtio". فقد قام المؤلفون، وهم فريق من جامعات في إيطاليا، ببناء أداة جديدة مفتوحة المصدر تسمى RAGtio لتعمل بمثابة "تجربة قيادة" صارمة لمحركات بحث هذه الروبوتات. لقد أدركوا أنه بينما يبني الكثير من الناس أنظمة RAG هذه للطب وعلم الأحياء، فإنهم غالباً ما يتجاهلون الجزء الصعب: التحقق بشكل منهجي مما إذا كان البحث جيداً بالفعل. RAGtio هو إطار عمل معياري، ويمكنك التفكير فيه كمجموعة ضخمة ومخصصة من قطع "الليغو" للاختبار. فبدلاً من بناء اختبار جديد في كل مرة، يمكن للباحثين توصيل "استراتيجيات بحث" مختلفة (مثل البحث عن الكلمات الدقيقة مقابل البحث عن المعنى) ومعرفة أي منها يعمل بشكل أفضل على مجموعة وثائقهم الخاصة.
الأداة ذكية لأنها توفر طريقتين مختلفتين لاختبار النظام. الطريقة الأولى، وتسمى النمط (أ) - Mode A، تشبه "سباق السرعة". يستخدم النظام ذكاءً اصطناعياً ذكياً لاختراع آلاف الأسئلة تلقائياً بناءً على الوثائق التي لديه، ثم يتحقق مما إذا كان محرك البحث يمكنه العثور على الإجابات. إنها طريقة سريعة وممتاة لرؤية كيف يتعامل النظام مع حجم هائل من البيانات. أما الطريقة الثانية، النمط (ب) - Mode B، فهي "فحص الخبير". هنا، يقوم متخصص بشري بكتابة أسئلة حقيقية وصعبة، ويحدد بدقة الصفحات التي تحتوي على الإجابات. هذا الأمر أصعب ولكنه يعطي صورة أكثر صدقاً لكيفية أداء النظام في العالم الحقيقي، حيث قد تُصاغ الأسئلة بطرق لم تستخدمها الوثائق أبداً.
اختبر الباحثون RAGtio في أربعة مواضيع طبية مختلفة: السرطان (الأورام)، والسكري، والأدوية (علم الصيدلة)، والأمراض المعدية. وقد جربوا أربع طرق بحث مختلفة: البحث عن تطابقات الكلمات الدقيقة، والبحث عن المعاني المتشابهة، ومزيج من كليهما، ومزيج يحصل فيه على رأي ثانٍ من "مُعيد ترتيب" (re-ranker) لصقل النتائج. تشير نتائجهم إلى أن النهج "الهجين" (hybrid)—الذي يجمع بين مطابقة الكلمات الدقيقة والبحث القائم على المعنى، ثم إعطاء نظرة ثانية سريعة لأفضل النتائج—هو عادةً الأقوى أداءً. في اختباراتهم، وجد هذا النهج المعلومات الصحيحة مبكراً في قائمة النتائج باستمرار. على سبيل المثال، في اختبارات السرطان، وجد النظام الإجابة الصحيحة في أفضل 5 نتائج بنسبة 73% تقريباً عند استخدام الاختبارات الآلية، وبنسبة أفضل عند فحصها من قبل خبراء بشريين.
ومع ذلك، فإن الورقة البحثية حذرة في عدم الادعاء بأن هذا حل سحري لكل شيء. فقد أشار المؤلفون إلى أن اختباراتهم أجريت على عدد صغير نسبياً من الوثائق (حوالي 20 ورقة بحثية إجمالاً عبر المواضيع الأربعة) وأن الخبراء البشريين الذين فحصوا الإجابات كانوا شخصاً واحداً فقط وليس فريقاً كاملاً. كما ذكروا أنه بينما نجح النهج الهجين بشكل جيد في إعدادهم الخاص، فإن الأداة مصممة بحيث يمكن للمستخدمين استبدال محركات البحث لمعرفة ما يناسب مكتبتهم الخاصة من الوثائق. النتيجة الرئيسية ليست أنهم وجدوا "أفضل" محرك بحث للعالم أجمع، بل أنهم بنوا ورشة عمل شفافة وسهلة الاستخدام حيث يمكن لأي شخص اختبار ومقارنة محركات البحث الخاصة به دون الحاجة لأن يكون خبيراً في البرمجة. ومن خلال جعل هذه الأداة مفتوحة ومجانية، يأملون في مساعدة الأطباء والباحثين على بناء مساعدين ذكاء اصطناعي أكثر موثوقية، لا يكتفون فقط بالظهور بمظهر الذكي، بل يتقنون الحصول على الحقائق بدقة.
ملخص تقني: RAGtio
بيان المشكلة
بينما يتم اعتماد أنظمة التوليد المعزز بالاسترجاع (RAG) بشكل متزايد في المجال الطبي الحيوي للتخفيف من قيود النماذج اللغوية الكبيرة (LLMs) مثل الهلوسة والمعرفة القديمة، لا يزال تقييم مكونات الاسترجاع الخاصة بها يفتقر إلى المعايير الموحدة. تركز الأدبيات الحالية بشكل أساسي على دقة الإجابة على الأسئلة (QA) من البداية إلى النهاية، مما يجعل من الصعب عزل المساهمة المحددة لمرحلة الاسترجاع. علاوة على ذلك، تُطبق مقاييس الاسترجاء بشكل غير متسق، وغالباً ما تُنفذ مسارات التقييم على أساس عشوائي. هذا النقص في أدوات التقييم المنهجية والقابلة لإعادة الإنتاج يعيق قدرة المستخدمين غير التقنيين (مثل الأطباء والباحثين في المجالات المتخصصة) على تقييم جودة الاسترجاع بصرامة، لا سيما فيما يتعلق بـ "التحيز المرجعي الذاتي" حيث قد تؤدي الاستعلامات الاصطناعية إلى تضخيم مقاييس الأداء بشكل مصطنع.
المنهجية
تقدم الورقة البحثية RAGtio، وهو إطار عمل معياري مفتوح المصدر مصمم للتقييم المنهجي لمسارات استرجاع RAG الهجينة. تم بناء النظام باستخدام مكتبة Haystack واستخدام Qdrant كقاعدة بيانات متجهة، ويتم نشره عبر Docker Compose لضمان قابلية إعادة الإنتاج.
بنية النظام
يدير إطار العمل خمس مراحل متميزة:
إدخال المستندات: يدعم تنسيقات متنوعة (PDF، DOCX، CSV، JSON، إلخ) ويعالجها من خلال "منظف المستندات" (Document Cleaner) و"مقسم مستندات" (Document Splitter) قابل للضبط (يدعم تقسيم النصوص بناءً على عدد الحروف، أو التقسيم المتكرر، أو الفقرات).
الفهرسة: توليد كل من التضمينات الكثيفة (عبر نماذج sentence-transformers المتوافقة مع FastEmbed ONNX) والتمثيلات المتفرقة (عبر BM25). يتم تخزين هذه البيانات في Qdrant مع فهرسة تشابه جيب التمام (cosine similarity).
الاسترجاع: تنفيذ أربعة تكوينات قابلة للتبديل يمكن اختيارها عبر ملفات YAML دون الحاجة لتغيير الكود البرمجي:
المتفرق (Sparse): الاسترجاع المعجمي باستخدام BM25.
الكثيف (Dense): الاسترجاع الدلالي باستخدام تضمينات sentence-transformer.
الهجين مع إعادة الترتيب (Hybrid with Re-ranking): يتم تنقيح المخرجات الهجينة بشكل أكبر بواسطة نموذج إعادة ترتيب (cross-encoder re-ranker).
توليد الإجابة: بناء مطالبات (prompts) للنماذج اللغوية الكبيرة (تدعم الاستدلال المحلي عبر Ollama أو واجهات برمجة التطبيقات المتوافقة مع OpenAI) باستخدام أجزال النصوص المسترجعة، مع تعليمات بالالتزام بالسياق المقدم.
التقييم: تقييم جودة الاسترجاع باستخدام أربعة مقاييس قياسية لاسترجاع المعلومات (IR): Recall@K، وHit Rate@K، وMean Reciprocal Rank (MRR)، وnDCG@K.
أوضاع التقييم المزدوجة
المساهمة المنهجية الجوهرية هي تنفيذ وضعين متكاملين للتقييم لمعالجة التحيز:
الوضع أ (الاصطناعي - Synthetic): يقوم بتوليد استعلامات تلقائياً من أجزاء مستندات مختارة عشوائياً باستخدام نموذج لغوي كبير. يتيح ذلك تقييماً سريعاً واسع النطاق، ولكنه عرضة للتحيز المرجعي الذاتي.
الوضع ب (اليدوي - Manual): يقبل أزواج (الاستعلام-الصلة) التي يوفرها المستخدم والتي تم تنسيقها من قبل خبراء المجال. يوفر هذا تقديراً غير متحيز لجودة الاسترجاع بناءً على استعلامات جديدة حقاً، مما يقلل من التحيز المتأصل في الوضع (أ).
المساهمات الرئيسية
إطار عمل معياري: منصة مستقلة عن المجال تغطي عمليات الإدخال، الفهرسة، الاسترجاع، التوليد، والتقييم المرتكز على الاسترجاع، وهي متميزة عن الأعمال السابقة التي غالباً ما تربط التقييم بمجموعات بيانات أو مهام محددة.
استراتيجيات استرجاع قابلة للضبط: القدرة على مقارنة الاستراتيجيات المتفرقة، والكثيفة، والهجينة، والهجينة المعاد ترتيبها ضمن بيئة واحدة محكومة باستخدام نفس الفهارس ومجموعات الاستعلامات.
بروتوكول تقييم متكامل: يسمح تقديم الوضع (أ) والوضع (ب) للمستخدمين بفحص حساسية أداء الاسترجاع تجاه تحيز توليد الاستعلامات، وهو عامل حاسم في المجالات المتخصصة مثل الطب الحيوي.
سهولة التشغيل: على عكس العديد من النماذج الأولية البحثية، يتم توفير RAGtio كمجموعة برمجيات قابلة للنشر داخل حاويات (containerized)، مع واجهة تهيئة تعتمد على YAML وواجهة رسومية للويب. يتيح ذلك للمستخدمين غير التقنيين إجراء التقييمات، وفحص النتائج، وتنسيق أحكام الصلة دون الحاجة لخبرة في البرمجة.
النتائج
تم تقييم إطار العمل عبر أربعة مجالات طبية حيوية: الأورام، السكري، علم الصيدلة، والأمراض المعدية.
الأداء الكمي: باستخدام التكوين الهجين مع إعادة الترتيب عبر الـ cross-encoder، أظهر النظام فعالية ثابتة. في الوضع (أ) (الاصطناعي)، حقق مجال الأورام قيمة MRR بلغت 0.657 وRecall@10 بلغت 0.732. وسجل مجال علم الصيدلة أقوى أداء بـ MRR بلغ 0.778.
رؤى الوضع (ب): كشف التقييم اليدوي (الوضع ب) أنه بينما ينجح النظام في إظهار ممر واحد ذي صلة على الأقل فوراً (Hit Rate@1 بلغ 0.800 في الأورام)، كانت مقاييس الاستدعاء (recall) أقل. وعزا المؤلفون ذلك إلى طبيعة الوضع (ب)، حيث غالباً ما تمتلك الاستعلامات التي صنفها الخب विशेषज्ञों مجموعة أوسع من الأجزاء ذات الصلة مقارنة بالاستعلامات الاصطناعية، مما يجعل التغطية الكاملة ضمن نافذة محدودة من الـ top-K أمراً أكثر صعوبة.
الأسئلة والأجوبة التفاعلية: في الاختبارات النوعية، أنتجت الاستعلامات المرتبطة بدرجات ثقة عالية من نموذج إعادة الترتيب إجابات صحيحة بشكل عام. ومع ذلك، تشير الدراسة إلى أن الثقة العالية في الاسترجاع لا تضمن إجابات مثالية، وبالعكس، يمكن للنموذج اللغوي الكبير أحياناً التعويض عن الاسترجاع متوسط الضجيج إذا كان الجزء الأعلى تصنيفاً ذا صلة عالية.
الأهمية والادعاءات
تضع الورقة البحثية RAGtio ليس كخوارزمية استرجاع جديدة، بل كـ بنية تحتية منهجية للتقييم. تكمن أهميته الأساسية في سد الفجوة بين الدقة المنهجية وسهولة الوصول العملية.
قابلية إعادة الإنتاج: من خلال توفير سير عمل يعتمد على الحاويات والتهيئة، يتيح إطار العمل للباحثين إعادة إنتاج تجارب الاسترجاع دون الحاجة لإعادة بناء مسارات معقدة.
تخفيف التحيز: يعالج بروتوكول التقييم المزدوج (الوضع أ والوضع ب) صراحةً "التحيز المرجعي الذاتي" الشائع في دراسات RAG، مما يوفر تقييماً أكثر واقعية لجودة الاسترجاع من خلال معايير منسقة من قبل الخبراء.
سهولة الاستخدام: تخفض الواجهة الويب حاجز الدخول أمام خبراء المجال، مما يسمح لهم بالتحقق من أنظمة RAG على مجموعات البيانات الخاصة بهم دون مهارات تطوير البرمجيات.
يقر المؤلفون بتواضع بوجود بعض القيود، بما في ذلك النطاق الصغير للتعليقات اليدوية (معلق واحد)، والتركيز على نموذج تضمين واحد في دراسة الحالة، والاستخدام الحصري للتكوين الهجين في التقييم الرئيسي. ويؤطرون عملهم كخطوة تأسيسية نحو تقييم أكثر شفافية ومعيارية لـ RAG، لا سيما في المجالات المتخصصة مثل الطب الحيوي.