← أحدث الأبحاث
💻 computer science

Enhancing Financial Report Question-Answering: A Retrieval-Augmented Generation System with Reranking Analysis

تقدم هذه الورقة نظاماً للتوليد المعزز بالاسترجاع للإجابة على الأسئلة المتعلقة بتقارير (10-K) الخاصة بمؤشر S&P 500، حيث تُظهر أن دمج مرحلة إعادة ترتيب عصبية يحسن دقة الإجابة بشكل كبير بمقدار 15.5 نقطة مئوية ويقلل من معدلات الخطأ مقارنة بالطرق المرجعية.

المؤلفون الأصليون: Zhiyuan Cheng, Longying Lai, Yue Liu, Kai Cheng, Xiaoxi Qi

نُشر 2026-03-19
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhiyuan Cheng, Longying Lai, Yue Liu, Kai Cheng, Xiaoxi Qi

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك محقق مالي تحاول حل لغز ما. أدلتك مخبأة داخل تقارير 10-K — وهي تقارير سنوية ضخمة مكونة من 300 صفحة تقدمها شركات مثل أبل أو أمازون. هذه الوثائق تشبه مكتبات عملاقة وكثيفة حيث قد يكون الجواب على سؤالك مدفوناً في الصفحة 247، مختبئاً داخل فقرة من المصطلحات القانونية المعقدة.

لسنوات، كان العثور على هذه الإجابات يشبه البحث عن إبرة في كومة قش باستخدام مغناطيس صدئ. كان عليك قراءة صفحة تلو الأخرى، حتى تتعب، ومن المرجح أن تفوتك التفاصيل الحاسمة.

يقدم هذا البحث مساعداً ذكياً للغاية يعمل بالذكاء الاصطناعي صُمم ليكون شريكك المحقق. إنه يستخدم تقنية تسمى الاسترجاع المعزز بالتوليد (RAG). لا تنظر إلى تقنية RAG كأنها عرافة سحرية تعرف كل شيء، بل كأمين مكتبة يذهب أولاً إلى الرفوف، ويجلب الكتب الصحيحة، ثم يقرؤها ليكتب إجابتك.

إليك التوضيح البسيط لكيفية بناء هذا النظام وما اكتشفوه:

1. المشكلة: "الإبرة في كومة القش"

التقارير المالية ضخمة. إذا سألت حاسوباً: "ما مقدار المخاطر التي تواجهها الشركة X؟"، فقد يقوم ذكاء اصطناعي قياسي بمجرد التخمين بناءً على ما يتذكره من تدريبه (والذي قد يكون خاطئاً أو قديماً). أو، قد تجد عملية بحث بسيطة صفحة تذكر كلمة "مخاطر" ولكنها تتحدث في الواقع عن نوع مختلف تماماً من المخاطر.

2. الحل: عملية تحقيق من ثلاث خطوات

بنى المؤلفون مسار عمل يعمل كفريق بحث عالي التقنية:

  • الخطوة 1: المسح الشامل (البحث الهجين)
    تخيل أنك تبحث عن شخص معين في حشد من الناس. ستستخدم طريقتين في آن واحد:

    • البحث بالكلمات المفتاحية: أنت تصرخ باسمه (مثل "أبل"). هذا يجد المطابقات الدقيقة.
    • البحث الدلالي: أنت تصف وجهه (مثل "الرجل الذي يرتدي قبعة حمراء"). هذا يجد الأشخاص الذين يشبهون الشخص الذي تريده، حتى لو لم تكن تعرف اسمه.
      يقوم النظام بدمج هاتين القائمتين للحصول على "قائمة قصيرة" تضم أكثر 30 صفحة مرجحة.
  • الخطوة 2: "إعادة الترتيب" (نجم العرض)
    هذا هو الاكتشاف الرئيسي للبحث.
    تخيل أن قائمتك القصيرة المكونة من 30 صفحة تشبه كومة من السير الذاتية. النظام الأساسي يأخذ ببساطة أفضل 10 صفحات ويعطيها للذكاء الاصطناعي ليقرأها.
    لكن المؤلفين أضافوا "إعادة ترتيب عصبية" (Neural Reranker). فكر في هذا كأنه محرر أول ينظر إلى أفضل 3๐ سيرة ذاتية ويقول: "انتظر، الصفحة 12 تبدو جيدة، لكن الصفحة 5 هي المطابقة المثالية لهذا السؤال تحديداً. لنضع الصفحة 5 في المقدمة ونرمي الصفحة 28، فهي مجرد حشو لا قيمة له".

    هذا "المحرر" يستخدم نموذجاً متطوراً لفهم العلاقة بعمق بين سؤالك والنص، مما يؤدي إلى تصفية الضجيج وترقية أفضل الأدلة.

  • الخطوة 3: الإجابة (التوليد)
    أخيراً، يقرأ الذكاء الاصطناعي فقط الصفحات الأكثر صلة (أفضل 5 إلى 10 صفحات بعد إعادة الترتيب) ويكتب الإجابة لك.

3. التجربة: هل ساعد "المحرر"؟

اختبر الفريق هذا النظام على 1,500 سؤال حقيقي من محللين ماليين. أجروا التجربة مرتين:

  1. بدون المحرر: المسح الشامل وأفضل 10 صفحات فقط.
  2. مع المحرر: المسح الشامل، ثم محرر إعادة الترتيب، ثم أفضل الصفحات.

كانت النتائج دراماتيكية:

  • بدون المحرر: حصل النظام على إجابة "صحيحة بشكل أساسي" بنسبة 33.5% فقط. وارتكب الكثير من الأخطاء السخيفة (في 35% من الحالات، كانت الإجابة خاطئة تماماً).
  • مع المحرر: قفز معدل الإجابات "الصحيحة بشكل أساسي" إلى 49.0%.
  • التحسن: هذا يمثل زيادة قدرها 15.5 نقطة مئوية. والأهم من ذلك، انخفض عدد الإجابات "الخاطئة تماماً" بنسبة تقارب 13%.

4. الخلاصة

يثبت هذا البحث أنه في عالم الوثائق المالية، طريقة اختيارك للمعلومات لا تقل أهمية عن طريقة كتابتك للإجابة.

إذا أعطيت ذكاءً اصطناعياً ذكياً الصفحات الخاطئة ليقرأها، فسيعطيك إجابة واثقة ولكنها خاطئة (ما يسمى بـ "الهلوسة"). ولكن إذا استخدمت "مُعيد ترتيب" (Reranker) ليعمل كمرشح صارم، يضمن أن الذكاء الاصطناعي يقرأ فقط الصفحات الأكثر صلة، فإن جودة الإجابة سترتفع بشكل هائل.

باخت ملخص:
تخيل الذكاء الاصطناعي كطاهٍ بارع.

  • بدون إعادة الترتيب: تعطي الطاهي سلة بها 10 مكونات عشوائية (بعضها طازج وبعضها فاسد). يحاول الطاهي إعداد طبق، لكن مذاقه سيء بسبب المكونات الفاسدة.
  • مع إعادة الترتيب: لديك مساعد طاهٍ (مُعيد الترتيب) يفحص السلة، ويرمي الأشياء الفاسدة، ويسلم الطاهي فقط المكونات الطازجة والمثالية. النتيجة هي طبق لذيذ.

يخبرنا هذا البحث أنه بالنسبة للتحليل المالي، فإن إضافة خطوة "مساعد الطاهي" هذه هي المفتاح للحصول على إجابات دقيقة وموثوقة من الوثائق الضخمة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →