← أحدث الأبحاث
💬 NLP

Decomposing Retrieval Failures in RAG for Long-Document Financial Question Answering

تحدد هذه الورقة وتعالج نمط الفشل الحرج في أنظمة استرجاع المعلومات المعزز بالتوليد (RAG) المالية، حيث يتم استرجاع المستند الصحيح ولكن تُفقد الصفحة المحددة التي تحتوي على الإجابة، وتقترح مُقيّم صفحات مضبوطاً بدقة لنطاق العمل (domain fine-tuned page scorer) يحسن بشكل كبير أداء الاسترجاع على مستوى الصفحة والقطعة في التقارير التنظيمية الطويلة.

المؤلفون الأصليون: Amine Kobeissi, Philippe Langlais

نُشر 2026-02-23
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Amine Kobeissi, Philippe Langlais

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك محقق مالي تحاول حل لغز ما. لديك مكتبة ضخمة تضم آلاف الكتب (هذه هي التقارير الصادرة عن هيئة الأوراق المالية والبورصات SEC، وهي طويلة ومملة ومليئة بالأرقام). مهمتك هي الإجابة على سؤال محدد، مثل: "كم ربحت الشركة (س) العام الماضي؟"

ولمساعدتك، لديك مساعد آلي فائق الذكاء (وهو الذكاء الاصطناعي) يمكنه القراءة والكتابة والإجابة. لكن الروبوت "أعمى"؛ فهو لا يستطيع رؤية المكتبة بأكملة في وقت واحد. لذا، أنت بحاجة إلى أمين مكتبة (وهو المسترجع - Retriever) ليجد الصفحات الصحيحة ويسلمها للروبوت.

المشكلة: العثور على الكتاب الصحيح، ولكن الصفحة الخطأ

في الماضي، اعتقد الباحثون أن المشكلة الرئيسية كانت في العثور على الكتاب الصحيح. إذا سلم أمين المكتبة التقرير السنوي الصحيح للروبوت، افترض الجميع حينها أن الروبوت سيقوم بعمل رائع.

لكن هذه الورقة البحثية اكتشفت نمط فشل مخادعاً: أمين المكتبة يجد الكتاب الصحيح، لكنه يسلم الصفحات الخطأ.

تخيل أنك تطلب وصفة "كعكة الشوكولاتة". يقوم أمين المكتبة بإحضار كتاب الطبخ الصحيح (المستند - Document)، لكنه يسلمك الصفحات المتعلقة بـ "كيفية غسل الأطباق" أو "تاريخ الدقيق" بدلاً من وصفة الكعكة. الروبوت، الذي يرى الكتاب الصحيح ولكن الصفحات الخطأ، يحاول تخمين الوصفة. قد يبدو كلامه منطقياً، لكنه خاطئ.

في عالم المال، هذا أمر خطير. فإذا خمن الروبوت رقم الربح بشكل خاطئ، فقد يخسر المستثمرون أموالهم.

الحل: "كشاف الصفحات" (Page Scout)

أدرك المؤلفون أن مجرد تسليم قطع نصية للروبوت لم يكن كافياً. كانوا بحاجة إلى طريقة أذكى للعثور على الصفحات المحددة داخل الكتاب قبل حتى النظر في قطع النص الصغيرة.

لقد بنوا أداة جديدة تسمى "كشاف الصفحات" (Page Scout) (وهو مقيّم صفحات متخصص في المجال).

إليك كيف يعمل نظامهم الجديد باستخدام التشبيه:

  1. الطريقة القديمة (البحث المباشر عن القطع النصية): تسأل أمين المكتبة: "ابحث لي عن النص المتعلق بالكعكة". يقوم أمين المكتبة بمسح المكتبة بالكامل، ويستخرج مقتطفات عشوائية مكونة من 10 صفحات من كل مكان، ويأمل أن تحتوي إحداها على الوصفة. الأمر يشبه البحث عن إبرة في كومة قش عن طريق التقاط حفنات عشوائية من القش.
  2. الطريقة الجديدة (الصفحة ثم القطعة النصية):
    • الخطوة 1 (الكشاف): أولاً، ينظر "كشاف الصفحات" إلى جدول المحتويات أو كعب الكتاب. ويسأل: "أي صفحات محددة في هذا الكتاب من المرجح أن تحتوي على وصفة الكعكة؟". إنه يتجاهل الـ 90% الأخرى من الكتاب التي تتحدث فقط عن غسل الأطباق.
    • الخطوة 2 (البحث): بمجرد أن يقول الكشاف: "إنها بالتأهيد في الصفحات من 40 إلى 45"، يبدأ أمين المكتبة في البحث فقط في تلك الصفحات المحددة للعثور على الفقرة المطلبة بالضبط.

لماذا هذا مهم؟

اختبر المؤلفون هذا النظام على مجموعة بيانات تسمى FinanceBench (150 سؤالاً مالياً صعباً).

  • "اختبار الأوراكل" (الاختبار المثالي): تخيلوا سيناريو مثالياً حيث يعرف الإنسان تماماً أي كتاب وأي صفحات هي الصحيحة. وحتى في ذلك السيناريو، عانى الروبوت إذا لم يحصل على النص بالضبط. وهذا أثبت أن العثور على الصفحات الصحيحة هو الجزء الأصعب.
  • النتائج: كان نظام "كشاف الصفحات" الجديد أفضل بكثير من الطرق القديمة.
    • لقد وجد الصفحات الصحيحة 55% من الوقت، مقارنة بالطرق القديمة التي وجدت الصفحات بنسبة 34-46% فقط.
    • ولأن الروبوت حصل على الصفحات الصحيحة، فقد أعطى إجابات صحيحة في كثير من الأحيان أكثر.

العقبة (القيود)

الورقة البحثية صريحة بشأن حدودها:

  • التدريب: تم تدريب "كشاف الصفحات" بشكل أساسي على تقارير 10-K (التقارير السنوية الضخمة). إنه يعمل بشكل رائع هناك، مثل متخصص يعرف تقارير 10-K من الداخل والخارج. ولكن عندما جربوه على مكالمات الأرباح (وهي أشبه بالمحادثات العفوية/النصوص المكتوبة)، ارتبك الكشاف لأن شكل "الكتاب" كان مختلفاً.
  • البيانات: اختبروا النظام على 150 سؤالاً فقط. وللتأكد حقاً من نجاحه للجميع، سيحتاجون إلى اختباره على آلاف الأسئلة الأخرى.

الخلاصة الكبرى

في عالم الذكاء الاصطناعي والتمويل، العثور على المستند الصحيح ليس كافياً. يجب عليك العثور على الصفحة الصحيحة داخل ذلك المستند.

فكر في الأمر هكذا: إذا كنت تبحث عن اقتباس محدد في رواية من 500 صفحة، فإن العثور على الكتاب يمثل 50% فقط من المعركة. الـ 50% الأخرى هي معرفة أي صفحة يجب فتحها بالضبط. تعلمنا هذه الورقة البحثية كيف نبني "كشاف صفحات" أفضل حتى لا يكتفي ذكاؤنا الاصطناعي بتخمين الإجابة، بل يجد الدليل الفعلي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →