← أحدث الأبحاث
💬 NLP

AccurateRAG: A Framework for Building Accurate Retrieval-Augmented Question-Answering Applications

تقدم هذه الورقة البحثية AccurateRAG، وهو إطار عمل مبتكر يعمل على تبسيط تطوير تطبيقات التوليد المعزز بالاسترجاع (RAG) عالية الأداء من خلال مسار شامل لمعالجة البيانات، وضبط النماذج، والتقييم، محققاً في نهاية المطاف نتائج رائدة على مجموعات البيانات المرجعية.

المؤلفون الأصليون: Linh The Nguyen, Chi Tran, Dung Ngoc Nguyen, Van-Cuong Pham, Hoang Ngo, Dat Quoc Nguyen

نُشر 2026-03-04
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Linh The Nguyen, Chi Tran, Dung Ngoc Nguyen, Van-Cuong Pham, Hoang Ngo, Dat Quoc Nguyen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول بناء أمين مكتبة فائق الذكاء يمكنه الإجابة على أي سؤال تطرحه حول مكتبة ضخمة ومتربة من المستندات. لديك مشكلتان رئيسيتان:

  1. أمين المكتبة لا يعرف الكتب المحددة: أمين المكتبة (الذكاء الاصطناعي) ذكي جداً ولكنه يعرف فقط ما كان موجوداً في بيانات تدريبه. هو لا يعرف ملفات الـ PDF الخاصة بشركتك أو أخبار اليوم.
  2. المكتبة في حالة فوضى: مستنداتك عبارة عن ملفات PDF وجداول ورسوم بيانية فوضوية. إذا قمت فقط بصبها في المكتبة، فلن يتمكن أمين المكتبة من العثور على الصفحة الصحيحة بسرعة.

AccurateRAG هو "مجموعة أدوات بناء" تساعدك في بناء أمين المكتبة المثالي وتنظيم المكتبة بحيث يستطيع أمين المكتبة إعطاء الإجابة الدقيقة تماماً في كل مرة.

إليك كيف يعمل هذا الإطار، مقسماً إلى خطوات بسيطة مع تشبيهات:

1. "الماسح الذكي" (المعالج المسبق - Preprocessor)

المشكلة: تحاول معظم الأنظمة قراءة ملف PDF وتحويله ببساطة إلى نص عادي. هذا يشبه أخذ كتاب طبخ رائع ومصور، وتمزيق الصور منه، ثم كتابة المكونات في فقرة واحدة طويلة. أنت تفقد الهيكل (مثل أي المكونات تتبع أي خطوة).

حل AccurateRAG: "الماسح الذكي" الخاص بهم يشبه الأرشيفي الدقيق. إنه يقرأ ملفات PDF الخاصة بك ويحولها إلى Markdown (تنسيق نصي نظيف ومنظم).

  • الخدعة السحرية: يستخدم أداتين مختلفتين لمسح المستند. إحداهما ممتاية في قراءة النصوص لكنها سيئة في الجداول؛ والأخرى ممتازة في الجداول لكنها تفقد بعض النصوص. يقوم AccurateRAG بدمجهما مثل وحش فرانكشتاين المثالي — يأخذ الأفضل من كليهما لضمان أن تبدو الجداول كجداول وأن يكون النص قابلاً للقراءة.
  • النتيجة: يقوم بتقطيع المستندات إلى "قطع" (أجزاء صغيرة) منطقية بذاتها، مثل تقطيع فصل من كتاب إلى مشاهد منطقية، بدلاً من مجرد قطعه في منتصف جملة.

2. "سيد المسابقات" (مولد بيانات الضبط الدقيق - Fine-tuning Data Generator)

المشكلة: لتعليم أمين المكتبة الخاص بك كيف يكون جيداً في إيجاد الإجابات، تحتاج إلى التدرب معه. لكن ليس لديك قائمة من الأسئلة والأجوبة لمستنداتك الخاصة.

حل AccurateRAG: هذا المكون هو سيد مسابقات ذكاء اصطناعي. يقرأ قطع النصوص التي مسحتها للتو ويكتب تلقائياً مجموعة من الأسئلة والأجوبة التدريبية لها.

  • العملية: يطلب من الذكاء الاصطناي: "إليك فقرة عن التمويل. اكتب 5 أسئلة عنها، بعضها سهل وبعضها صعب". ثم يتحقق من الإجابات للتأكد من أنها صحيحة بالفعل.
  • لماذا يهم الأمر: هذا ينشئ دليلاً تدريبياً مخصصاً لأمين المكتبة الخاص بك، يعلمه بالضبط كيف يفكر فيما يتعلق بمستنداتك المحددة.

3. "فريق البحث" (المسترجع - Retriever)

المشكلة: عندما تطرح سؤالاً، كيف يجد أمين المكتبة الصفحة الصحيحة؟

  • الخيار (أ) (البحث الدلالي/المعنوي): "ابحث لي عن الصفحة التي تشعر بأنها تتحدث عن المال". (جيد للمفاهيم، سيء للكلمات الدقيقة).
  • الخيار (ب) (البحث التقليدي): "ابحث لي عن الصفحة التي تحتوي على كلمة 'ربح' فيها". (جيد للكلمات الدقيقة، سيء للمفاهيم).

حل AccurateRAG: يستخدم فريق بحث هجين.

  • يقوم بتشغيل كلا نوعي البحث في وقت واحد.
  • ثم يستخدم "حكماً" (وحدة التقييم) ليرى أي طريقة بحث كانت الأفضل أثناء التدريب.
  • الفائز: يختار الاستراتيجية الأفضل (أو يجمع بينهما) لجلب أكثر القطع النصية صلة بسؤالك.

4. "الكاتب النهائي" (مولد الإجابة - Answer Generator)

المشكلة: الآن يمتلك أمين المكتبة الصفحات الصحيحة. كيف يكتب الإجابة النهائية؟

  • المشكلة: إذا أعطيت الذكاء الاصطناعي الصفحات الخام فقط، فقد يرتبك أو يهلوِس (يختلق معلومات من عنده).

حل AccurateRAG: هذا هو المحرر النهائي.

  • يأخذ أفضل الصفحات التي وجدها فريق البحث ويغذي بها ذكاءً اصطناعياً قوياً (LLM).
  • والأهم من ذلك، أنه يقوم بعمل ضبط دقيق (Fine-tuning) لهذا الذكاء الاصطناعي باستخدام بيانات "سيد المسابقات". إنه يعلم الذكاء الاصطناعي: "عندما ترى هذه الأنواع المحددة من المستندات، أجب بهذه الطريقة".
  • يستخدم تقنية تسمى LoRA (تخيلها كـ "قبعة تدريب" خفيفة يرتديها الذكاء الاصطناعي) للتعلم بسرعة دون الحاجة إلى حاسوب خارق.

5. "لوحة التحكم" (واجهة المستخدم - User Interface)

عادةً ما يتطلب بناء كل هذا كتابة أكواد معقدة. يوفر لك AccurateRAG واجهة مستخدم (UI) — لوحة تحكم بسيطة بها أزرار.

  • تقوم برفع ملفات PDF الخاصة بك.
  • تضغط على "ابدأ" (Start).
  • يقوم النظام بكل عمليات المسح، وصنع المسابقات، والتدريب، والاختبار في الخلفية.
  • تحصل على نافذة دردشة حيث يمكنك طرح الأسئلة ورؤية النتائج.

لماذا يعد هذا أمراً كبيراً؟ (النتائج)

اختبر المؤلفون هذا النظام على معايير واقعية (مثل التقارير المالية والأسئلة الطبية).

  • المنافسون: حققت الأنظمة الأخرى حوالي 19% إلى 35% من الدقة.
  • AccurateRAG: حقق 42% إلى 82%+ من الدقة، محطماً الرقم القياسي لـ "أحدث ما توصل إليه العلم" (SOTA).

الخلاصة:
فكر في AccurateRAG كأنه مصنع جاهز للتشغيل لبناء مساعدين يعملون بالذكاء الاصطناعي. بدلاً من استئجار فريق من المهندسين لبناء سيارة من الصفر (كتابة أكواد للمسح، والتدريب، والبحث)، يمكنك ببساطة الدخول إلى المصنع، اختيار طرازك، والخروج بسيارة كاملة التجميع، عالية الأداء وجاهزة للسباق. إنه يجعل بناء تطبيقات الذكاء الاصطناعي الدقيقة والموثوقة متاحاً للجميع، وليس فقط لخبراء البرمجة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →