From BM25 to Corrective RAG: Benchmarking Retrieval Strategies for Text-and-Table Documents
تقوم هذه الورقة البحثية بتقييم عشر استراتيجيات استرجاع على مجموعة بيانات ضخمة للأسئلة والأجوبة القائمة على النصوص والجداول المالية، كاشفةً أن خط معالجة استرجاع هجين يعتمد على إعادة الترتيب العصبي يتفوق على الأساليب أحادية المرحلة، وأن خوارزمية BM25 غالباً ما تتفوق على الاسترجاع الكثيف في الوثائق المالية، مع تقديم رؤى عملية حول الفائدة المحدودة لتوسيع الاستعلام بالنسبة للاستعلامات الرقمية الدقيقة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك محقق يحاول حل لغز مالي معقد. لديك مكتبة ضخمة من المستندات (تقارير سنوية، بيانات أرباح) وهي مزيج من القصص (نصوص) والجداول الحسابية (جداول). هدفك هو العثور على الصفحة الدقيقة والرقم الدقيق الذي يجيب على سؤال محدد، مثل "كم بلغت أرباح الشركة (X) في عام 2023؟"
هذه الورقة هي في الأساس تجربة كبرى لمعرفة أفضل طريقة يمكن للكمبيوتر (الذكاء الاصطناعي) من خلالها البحث في هذه المكتبة للعثور على تلك الإبرة في كومة القش. لقد اختبر الباحثون 10 "استراتيجيات بحث" مختلفة لمعرفة أيهما يعمل بشكل أفضل مع هذه المستندات الصعبة.
إليك تفاصيل نتائجهم باستخدام تشبيهات بسيطة:
1. المشكلة: فخ "النص مقابل الجدول"
معظم أدوات البحث المدعومة بالذكاء الاصطناعي بارعة في العثور على القصص. إذا سألت: "حدثني عن تاريخ الشركة"، فإن بحث الذاء الاصطناعي القياسي يعمل مثل أمين مكتبة يعرف بالضبط أي كتاب يسحبه من الرف بناءً على الكلمات المفتاحية.
لكن المستندات المالية مخادعة. فهي تحتوي على جداول مليئة بالأرقام.
- المشكلة: إذا سألت: "ما هو نمو الإيرادات؟"، فقد يرتبك الذكاء الاصطناعي القياسي. قد يبحث عن كلمة "الإيرادات" في النص ولكنه قد يفتقد الرقم المختبئ في خلية جدول بيانات. أو قد يفهم مفهوم النمو ولكنه قد يخطئ في السنة المحددة لأن الصياغة كانت مختلفة قليلاً.
- التشبيه: الأمر يشبه محاولة العثور على مكون محدد في وصفة طعام. "البحث بالكلمات المفتاحية" يجد كلمة "سكر"، لكن "البحث الدلالي" (فهم المعنى) قد يجد "محلي". ولكن في التمويل، أنت تحتاج إلى الوزن الدقيق بالجرام. إذا حصلت على الرقم الخطأ، فإن الوصفة بأكملها ستفشل.
2. المتنافسون: من هم الذين تم اختبارهم؟
وضع الباحثون استراتيجيات بحث مختلفة في مواجهة بعضها البعض:
- المدرسة القديمة (BM25): هذا يشبه أمين مكتبة صارم للغاية لا يجد الكتب إلا إذا استخدمت الكلمات الدقيقة المكتوبة على كعب الكتاب. إنه لا يفهم المرادفات، لكنه بارع للغاية في العثور على مصطلحات محددة مثل "اسم الشركة" أو "2023".
- الذكاء الاصطناعي الحديث (الاسترجاع الكثيف - Dense Retrieval): هذا يشبه مساعداً ذكياً يفهم "جو" السؤال ومعناه. يمكنه العثور على المستندات حتى لو استخدمت كلمات مختلفة، لكنه أحياناً يكون غامضاً بشأن الأرقام الدقيقة.
- الهجين (RRF): هذا يعني توظيف كليهما (أمين المكتبة الصارم والمساعد الذكي)، ثم تركهما يصوتان على أي كتاب هو الأفضل.
- "تخمين الإجابة" (HyDE): هذه الاستراتيجية تطلب من الذكاء الاصطناعي أن يتظاهر بأنه يعرف الإجابة بالفعل، ويكتب مستنداً وهمياً، ثم يبحث بناءً عليه. (فكر في الأمر كأن المحقق يرسم وصفاً تقريبياً للمشتبه به قبل العثين عليه).
- "الرأي الثاني" (إعادة التصنيف - Reranking): هذا بمثابة محرر رئيسي ينظر إلى أفضل 50 كتاباً وجدها البحث ويعيد ترتيبها للتأكد من أن الأفضل على الإطلاق هو الموجود في المقدمة.
3. المفاجآت الكبرى (النتائج)
🏆 الفائز: "خط الإنتاج ذو المرحلتين" (Two-Stage Pipeline)
أفضل استراتيجية لم تكن مجرد أداة واحدة؛ بل كانت نهج عمل جماعي.
- الخطوة 1: استخدام الطريقة الهجينة (أمين المكتبة + المساعد الذكي) لإلقاء شبكة واسعة والقبض على أفضل 50 مستنداً محتملاً.
- الخطوة 2: تمرير هذه المستندات الخمسين إلى "محرر فائق" (إعادة تصنيف عبر Cross-Encoder) يقرأ السؤال والمستند معاً لاختيار المطابقة الأفضل والوحيدة.
- لماذا فاز؟ لأنه جمع بين سرعة إلقاء الشبكة الواسعة ودقة الغوص العميق. لقد وجد المستند الصحيح بنسبة 81.6% من المرات، متفوقاً على الجميع بفارق كبير.
🚫 الخاسر: "تخمين الإجابة" (HyDE)
جرب الباحثون استراتيجية جعل الذكاء الاصطناعي يخمن الإجابة أولاً.
- النتيجة: جعلت الأمور أسوأ.
- التشبيه: تخيل محققاً يرسم وصفاً تقريبياً للمشتبه به بناءً على وصف غامض. في التمويل، إذا "هلوس" (خمن) الذكاء الاصطناعي رقماً مثل "50 مليون دولار" بينما الرقم الحقيقي هو "48 مليون دولار"، فإن البحث سيصاب بالارتباك ويبحث في المكان الخطأ. بالنسبة للأرقام الدقيقة، التخمين أمر خطير.
🤔 المفاجأة: أمين المكتبة القديم فاز (أحياناً)
اعتقد الجميع أن "المساعد الذكي" (الذكاء الاصطناعي الكثيف) سيهزم "أمين المكتبة الصارم" (BM25) لأن الذكاء الاصطناعي من المفترض أن يكون أذكى.
- النتيجة: في المستندات المالية، تفوق أمين المكتبة الصارم (BM25) على المساعد الذكي.
- لماذا؟ التقارير المالية مليئة بالمصطلحات المتخصصة (رموز الشركات، أسماء المقاييس الدقيقة). أحياناً يصبح الذكاء الاصطناعي "ثرثاراً" أكثر من اللازم ويخطئ في المطابقة الدقيقة، بينما يقوم أمين المكتبة بمطابقة الكلمات بدقة تامة.
4. ماذا يجب أن تفعل؟ (الخلاصة)
إذا كنت تبني نظام ذكاء اصطناعي لقراءة التقارير المالية أو المستندات التي تحتوي على جداول، فإليك الوصفة التي يقترحها المؤلفون:
- لا تعتمد على طريقة بحث واحدة فقط. ادمج البحث بـ "الكلمات المفتاحية" مع البحث بـ "المعنى".
- أضف خطوة "الرأي الثاني". اجعل دائماً ذكاءً اصطناعياً قوياً يعيد فحص أفضل النتائج لضمان أن الأفضل موجود في المقدمة. هذه هي أكبر ترقية يمكنك القيام بها.
- أضف "السياق" قبل البحث. قبل فهرسة المستندات، اطلب من الذكاء الاصطناعي كتابة ملخص قصير حول موضوع هذا المستند (مثلاً: "هذا هو تقرير شركة أبل لعام 2023") وأرفقه بالملف. هذا يساعد محرك البحث على فهم المستند بشكل أفضل.
- توقف عن التخمين. لا تستخدم الاستراتيجيات التي تحاول "الهلوسة" بإجابة للمساعدة في البحث. في التمويل، الدقة هي الملك.
- اختبر على بياناتك الخاصة. لا تثق فقط في معايير الذكاء الاصطناعي العامة. المستندات المالية فريدة من نوعها؛ ما ينجح مع المقالات الإخبارية قد يفشل مع الجداول الحسابية.
ملخص
تثبت الورقة أنه بالنسبة للمستندات المعقدة التي تمزداً بين النصوص والأرقام، القوة الغاشمة وحدها لا تكفي، والحدس النقي للذكاء الاصطناعي وحده لا يكفي أيضاً. السر يكمن في العمل الجماعي الهجين: ألقِ شبكة واسعة، ثم دع محرراً فائق الذكاء يختار الفائز. وتذكر، عندما تتعامل مع المال، الكلمات الدقيقة أهم من المعاني الغامضة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.