← أحدث الأبحاث
💻 computer science

FinDocMRE: A Benchmark for Document-Level Financial Multimodal Reasoning Evaluation

تقدم هذه الورقة FinDocMRE، وهو معيار مرجعي شامل متعدد الصور على مستوى المستند يتكون من أكثر من 12,000 عينة من التقارير المالية لتقييم وكشف أوجه القصور في النماذج اللغوية الكبيرة متعددة الوسائط الحالية في دمج النصوص والجداول والصور من أجل الاستدلال المالي المعقد.

المؤلفون الأصليون: Jiayong Zhu, Jiangtong Li, Jinru Ding, Dawei Cheng, Jie Xu, Feng Yu

نُشر 2026-05-19
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jiayong Zhu, Jiangtong Li, Jinru Ding, Dawei Cheng, Jie Xu, Feng Yu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك توظف محللاً مالياً جديداً. لديك تقرير ضخم مكون من 100 صفحة مليء بالنصوص، والجداول المعقدة، والرسوم البيانية الملونة المنتشرة عبر صفحات مختلفة. تريد أن ترى ما إذا كان موظفك الجديد يستطيع رؤية الصورة الكاملة، وربط النقاط بين رسم بياني في الصفحة 5 وجدول في الصفحة 40، والقيام بالعمليات الحسابية بشكل صحيح ليعطيك إجابة دقيقة.

هذا هو بالضبط ما يدور حوله هذا البحث، FinDocMRE. إنه بمثابة "امتحان نهائي" عملاق مصمم لاختبار مدى قدرة الذكاء الاصطناعي (AI) على التعامل مع هذه الوثائق المالية الفوضوية في العالم الحقيقي.

إليك تفصيل لما قام به الباحثون وما توصلوا إليه، باستخدام تشبيهات بسيطة:

1. المشكلة: فخ "الرسم البياني المنفرد"

حتى الآن، كانت معظم اختبارات الذكاء الاصطناعي تشبه عرض مسألة رياضية واحدة معزولة على ورقة لطالب؛ حيث يمكن للذكاء الاصطناعي حلها بسهولة. لكن في عالم المال الحقيقي، المعلومات ليست معزولة. إنها تشبه لغز الصور المقطوعة (Jigsaw Puzzle) حيث تتناثر القطع عبر كتاب كامل.

  • المشكلة: نماذج الذكاء الاصطناعي الحالية بارعة في النظر إلى رسم بياني واحد والقول: "أوه، هذا الخط يتجه للأعلى". لكنها تعاني عندما يُطلب منها قول: "خذ الرقم من الرسم البياني في الصفحة 10، واضربه في النسبة المئوية الموجودة في الجدول في الصفحة 30، وأخبرني بالتكلفة الإجمالية".
  • الفجوة: لم يكن هناك اختبار ضخم وصعب يجبر الذكرا الاصطناعي على القيام بهذا النوع من الاستنتاج على "مستوى المستند".

2. الحل: بناء امتحان "FinDocMRE"

قام الفريق بإنشاء معيار مرجعي جديد وضخم (مجموعة اختبار) يسمى FinDocMRE. اعتبر الأمر كأنك تبني صالة ألعاب رياضية لتدريب الذكاء الاصطناعي على رفع الأوزان الثقيلة.

  • مجموعة البيانات: جمعوا 2,878 تقريراً مالياً حقيقياً (مثل التقارير السنوية للشركات الكبرى) واستخرجوا منها 12,207 سؤالاً محدداً.
  • "وصفة" الجودة: لم يكتفوا بجعل الكمبيوتر يكتب الأسئلة، لأن الكمبيوتر قد يبتكر حقائق من عنده (وهي مشكلة تسمى "الهلوسة"). بدلاً من ذلك، استخدموا وصفة من ثلاث خطوات:
    1. الطاهي الآلي: قام ذكاء اصطناعي بتوليد الأسئلة بناءً فقط على الصور والرسوم البيانية، متجاهلاً النص المحيط لإجباره على "رؤية" البيانات.
    2. مختبرو التذوق البشري: قام ثلاثة خبراء ماليين حقيقيين (مثل كبار المحللين) بمراجعة كل سؤال على حدة. إذا كان السؤال مربكاً، أو كانت العملية الحسابية خاطئة، أو كان المرجع للرسم البياني غير دقيق، فإنهم يستبعدونه تماماً.
    3. القطع النهائي: اجتاز حوالي 55% فقط من الأسئلة المولدة الاختبار. هذا ضمن أن يكون الامتحان النهائي عالي الجودة وصعباً للغاية.

3. النتائج: تقسيم "المحلل مقابل الآلة الحاسبة"

اختبر الباحثون 11 نموذجاً من أذكى نماذج الذكاء الاصطناست المتاحة (بما في ذلك أسماء كبيرة مثل GPT-5 وGemini وQwen) مقابل هذا الامتحان. كما استعانوا بخبراء ماليين بشريين لمعرفة مدى مقارنة الذكاء الاصطناعي بهم.

إليكم ما اكتشفوه:

  • لوحة النتائج: حصل أفضل نموذج ذكاء اصطناعي على حوالي 64 من 100. بينما حصل الخبراء البشر على حوالي 79. لا تزال هناك فجوة كبيرة.
  • "الحكواتي" مقابل "نابغة الرياضيات":
    • جيد في القصص: نماذج الذكاء الاصطناعي جيدة بشكل مفاجئ في كتابة ملخصات متماسكة وطويلة. إذا سألت: "ما هو الاتجاه العام لهذه الشركة؟"، يمكنهم كتابة فقرة رائعة.
    • سيء في الرياضيات والملاحة: عندما طُلب منها إجراء حسابات دقيقة أو العثور على رقم محدد مخفي في رسم بياني في الصفحة 45 أثناء النظر إلى رسم بياني في الصفحة 5، فإنها غالباً ما تفشل. كانوا يخطئون في الأرقام أو يخلطون بين الرسم البياني والسنة الصحيحة.
  • تأثير "الضياع في المنتصف": كلما زادت طول المستندات واضطر الذكاء الاصطناعي للنظر في المزيد من الصور (مثل 3 أو 4 رسوم بيانية مختلفة في وقت واحد)، انخفض أداء الذكاء الاصطناعي. الأمر يشبه محاولة تذكر ثلاثة أرقام هواتف مختلفة في وقت واحد؛ فكلما أضفت المزيد، زاد احتمال خلطك بينها.

4. الخلاصة الكبرى

يخلص البحث إلى أنه بينما يتحسن الذكاء الاصطناعي في "الرؤية" و"التحدث"، فإنه لا يزال يعاني ليعمل كـ محلل مالي محترف.

  • العقبة: المشكلة الرئيسية ليست في أن الذكاء الاصطناعي لا يستطيع قراءة الكلمات؛ بل في أنه لا يستطيع بفعالية تأسيس استنتاجاته على الأدلة المرئية المحددة المنتشرة عبر مستند معقد. الأمر يشبه طالباً يعرف نظريات المحاسبة، لكنه يستمر في النظر إلى السطر الخاطئ في جدول البيانات أثناء إجراء العمليات الحسابية.

باختصار: يعد FinDocMRE اختبار جهد صارم يظهر أن الذكاء الاصطناعي الحالي هو "كاتب مقالات" جيد ولكنه "آلة حاسبة" مهزوزة عند التعامل مع التقارów المالية المعقدة متعددة الصفحات. ويشير البحث إلى أنه لكي يتمكن الذكاء الاصطناعي من استبدال المحللين البشريين حقاً، فإنه يحتاج إلى أن يصبح أفضل بكثير في التنقل عبر هذه الألغاز المرئية دون أن يضيع.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →