← أحدث الأبحاث
💬 NLP

Empirical Evaluation of PDF Parsing and Chunking for Financial Question Answering with RAG

تقدم هذه الورقة دراسة تجريبية لتقييم مختلف أدوات تحليل ملفات PDF واستراتيجيات التجزئة ضمن أنظمة التوليد المعزز بالاسترجاع (RAG) للإجابة على الأسئلة المالية، مقدمةً معياراً جديداً يسمى TableQuest لتوفير إرشادات عملية لبناء مسارات قوية لفهم المستندات.

المؤلفون الأصليون: Omar El Bachyr, Yewei Song, Saad Ezzini, Jacques Klein, Tegawendé F. Bissyandé, Anas Zilali, Ulrick Ble, Anne Goujon

نُشر 2026-04-15
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Omar El Bachyr, Yewei Song, Saad Ezzini, Jacques Klein, Tegawendé F. Bissyandé, Anas Zilali, Ulrick Ble, Anne Goujon

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك محلل مالي تحاول العثور على رقم محدد في تقرير ضخم مكون من 200 صفحة عن أرباح إحدى الشركات. المشكلة؟ هذا الملف بصيغة PDF مصمم ليقرأه البشر، وليس لتفهمه الحواسيب. الأمر يشبه كتاباً مزخرفاً بجمال حيث تختلط النصوص والجداول والرسوم البيانية معاً دون تسميات واضحة. إذا سألت الحاسوب "ما هو هامش الربح؟"، فقد يرتبك، ويبحث في الصفحة الخطأ أو يخلط بين الأرقام من جداول مختلفة.

هذه الورقة البحثية هي في الأساس اختبار تذوق علمي لمعرفة أفضل طريقة لتعليم الحواسيب كيفية قراءة ملفات PDF المالية الفوضوية هذه والإجابة على الأسئلة بدقة.

إليك تفصيل الأمر باستخدام تشبيهات بسيطة:

1. المشكلة: "المكتبة الفوضوية"

تخيل ملف PDF المالي كأنه مكتبة حيث تم تمزيق جميع الكتب وإلقاؤها في كومة ضخمة.

  • الهدف: تريد العثين على جملة محددة (مثل: "ما هي الإيرادات في عام 2023؟").
  • التحدي: قبل أن يتمكن الحاسوب من العثور على تلك الجملة، عليه أن يقوم بـ:
    1. إعادة تجميع الصفحات (Parsing): تحديد أي نص ينتمي إلى جدول وأي نص ينتمي إلى فقرة.
    2. تقطيع الصفحات إلى قطع صغيرة سهلة الهضم (Chunking): الحواسيب لا تستطيع قراءة كتاب كامل من 200 صفحة دفعة واحدة؛ فلديها "مدى انتباه قصير" (ذاكرة محدودة). لذا، عليك تقطيع النص إلى قطع صغيرة.
    3. العثور على القطعة الصحيحة (Retrieval): عندما تطرح سؤالاً، يحتاج النظام إلى جلب القطعة المناسبة فوراً.

2. التجربة: "مسابقة الطبخ"

وضع الباحثون تجربة ضخمة لمعرفة أي "طهاة" (أدوات) وأي "أساليب تقطيع" (استراتيجيات) تعمل بشكل أفضل. لقد اختبروا ذلك على نوعين من "الوصفات":

  • FinanceBench: أسئلة تعتمد على النصوص (مثل قراءة قصة).
  • TableQuest (جديد!): أسئلة تعتمد على الجداول (مثل قراءة جدول بيانات). وهذا أمر بالغ الأهمية لأن معظم الاختبارات السابقة تجاهلت الجداول، وهي المكان الذي تختبئ فيه بيانات الأموال الحقيقية عادةً.

لقد اختبروا:

  • 6 أنواع من "المقصات" (محللات PDF): بعضها مقصات عادية (تقطع النص فقط)، والبعض الآخر أدوات قطع ليزر عالية التقنية يمكنها رؤية الجداول والصور.
  • 6 أنواع من "أساليب التقطيع" (Chunking): بعضها يقطع كل 50 كلمة، وبعضها يقطع عند كل جملة، وبعضها يستخدم الذكاء الاصطناعي للقطع فقط حيث يتغير المعنى.
  • محركات بحث مختلفة (Retrievers): كيف يبحث الحاسوب عن القطعة الصحيحة.
  • أدمغة مختلفة (LLMs): الذكاء الاصطناعي الذي يقرأ القطعة فعلياً ويجيب على السؤال.

3. النتائج الرئيسية (الـ "خلطة السرية")

🏆 أفضل المقصات (Parsing)

  • للنصوص: كانت الأداة المسماة pdfminer هي البطلة. إنها مثل أمين مكتبة دقيق يقرأ تدفق النص الخام بدقة شديدة.
  • للجداول: فازت أداة pdfplumber. إنها مثل متخصص يعرف تماماً كيف يفصل جدول البيانات عن النص المحيط به.
  • فخ "الكل في واحد": الأداة المتطورة التي تستخدم ذكاءً اصطناعياً ثقيلاً (Unstructured) كانت دقيقة للغاية ولكنها بطيئة للغاية. إنها مثل استخدام كمبيوتر خارق لتقطيع بصلة واحدة؛ إنها تعمل، لكنها تستغرق وقتاً طويلاً جداً. بالنسبة للأعمال، السرعة مهمة.

✂️ أفضل أسلوب للتقطيع (Chunking)

  • لا تقطع بدقة مفرطة: إذا قطعت النصوص إلى قطع صغيرة وعشوائية، فستفقد السياق (مثل قطع جملة في المنتصف).
  • خدعة "التداخل" (Overlap): وجد الباحثون أنه عندما تقطع النص، يجب أن تجعل القطع تتداخل قليلاً (مثل تداخل بلاط السقف). إذا قطعت الصفحة إلى قطع، تأكد من أن آخر 25% من قطعة واحدة تتكرر في بداية القطعة التالية. هذا يضمن أنه إذا تم تقسيم رقم أو جملة بسبب القطع، فإن الحاسوب سيظل يرى الصورة الكاملة.
  • الفائز: "القطع العصبي" (الذكاء الاصطناعي الذي يفهم المعنى) كان يعمل بشكل أفضل، لكن "القطع بالجمل" البسيط كان جيداً جداً تقريباً وأرخص وأسرع بكثير.

🧠 أفضل دماغ (نموذج الذكاء الاصطناعي)

  • الأكبر هو الأفضل (لكن بحدود): نماذج الذكاء الاصطناعي الأكبر (مثل GPT-5 أو النماذج مفتوحة المصدر الكبيرة) أعطت إجابات أفضل بكثير من النماذج الصغيرة.
  • نقطة التوازن المثالية: لست بحاجة إلى أكبر نموذج وأغلاها للحصول على 90% من النتيجة. غالباً ما يعطي النموذج "متوسط" الحجم أفضل توازن بين التكلفة والدقة.

4. اكتشاف "TableQuest"

أدرك الباحثون أن الاختبارات السابقة كانت تشبه اختبار سيارة على طرق سريعة ممهدة فقط (نصوص). لذا بنوا TableQuest لاختبار السيارة على تضاريس وعرة (الجداول).

  • النتيجة: العديد من الأنظمة التي كانت بارعة في قراءة النصوص فشلت فشلاً ذريعاً في قراءة الجداول. لم تتمكن من معرفة أي صف وأي عمود ينتمي إليه الرقم.
  • الدرس: إذا كنت تريد بناء ذكاء اصطناً مالياً، يجب أن تختبره على الجداول، وإلا سيفشل في العالم الحقيقي.

5. الخلاصة النهائية للأعمال

إذا كنت بنكاً أو شركة تحاول بناء ذكاء اصطناعي لقراءة التقارير المالية:

  1. لا تعقد الأمور: لست بحاجة إلى أكثر الأدوات تكلفة وبطئاً. مزيج من pdfplumber (للجداول) وتداخل بنسبة 25% عند تقطيع النصوص سيحقق نتائج رائعة.
  2. التداخل هو المفتاح: اجعل قطع النصوص تتداخل قليلاً دائماً حتى لا تفقد السياق.
  3. الاختبار على الجداول: لا تختبر فقط ما إذا كان ذكاؤك الاصطناعي يمكنه قراءة الفقرات؛ اختبر ما إذا كان بإمانه قراءة جداول البيانات.

باختصار: هذه الورقة هي دليل إرشادي يقول: "إليك الوصفة الدقيقة لبناء ذكاء اصطناعي مالي لا يهذي، ولا يرتبك أمام الجداول، ويعمل بالسرعة الكافية ليكون مفيداً في بنك حقيقي".

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →