← أحدث الأبحاث
💻 computer science

EDINET-Bench: Evaluating LLMs on Complex Financial Tasks using Japanese Financial Statements

تقدم هذه الورقة EDINET-Bench، وهو معيار مرجعي مفتوح المصدر وتحدي مستمد من عشر سنوات من التقارير المالية اليابانية لتقييم النماذج اللغوية الكبيرة في مهام معقدة مثل كشف الاحتيال والتنبؤ بالأرباح، مما يكشف أن النماذج الحالية تعاني بشكل كبير دون دعامات متخصصة ويسلط الضوء على الحاجة إلى أطر تقييم أكثر واقعية.

المؤلفون الأصليون: Issa Sugiura, Takashi Ishida, Taro Makino, Chieko Tazuke, Takanori Nakagawa, Kosuke Nakago, David Ha

نُشر 2026-03-06
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Issa Sugiura, Takashi Ishida, Taro Makino, Chieko Tazuke, Takanori Nakagawa, Kosuke Nakago, David Ha

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت عبقري وفائق الذكاء كيف يصبح محققاً مالياً. تريد أن ترى ما إذا كان هذا الروبوت قادراً على قراءة التقرير السنوي لشركة ما، ورصد الأكاذيب الخفية، والتنبؤ بما إذا كانت الشركة ستجني مزيداً من المال العام المقبل، أو تخمين نوع العمل الذي تقوم به بمجرد النظر إلى الأرقام.

هذه الورقة البحثية، EDINET-Bench، هي في الأساس "امتحان نهائي" تم إنشاؤه لاختبار هذه الروبوتات (النماذج اللغوية الكبيرة، أو LLMs) في هذه المهام الصعبة تحديداً.

إليك تفاصيل الورقة بكلمات بسيطة:

1. المشكلة: الروبوت جيد في الرياضيات، لكنه سيء في التمويل

لقد رأينا الذكاء الاصطناعي يصبح بارعاً جداً في حل المسائل الرياضية وكتابة الأكواد البرمجية. لكن التمويل مختلف. الأمر يشبه الفرق بين حل لغز "سودوكو" وبين تشخيص مريض بمرض نادر. يتطلب التمويل القراءة ما بين السطور، وربط الأدلة الصغيرة عبر مئات الصفحات، وفهم السلوك البشري والقواعد المعقدة.

حتى الآن، لم تكن هناك الكثير من الاختبارات "الصعبة" للذكاء الاصطناعي في مجال التمويل. معظم الاختبارات الموجودة حالياً تشبه سؤال: "ما هو ربح الشركة س؟" (عملية بحث بسيطة عن معلومة). لكن هذه الورقة أرادت أن تسأل: "هل الشركة (س) تكذب بشأن أرباحها؟" (تحقيق معقد).

2. الحل: EDINET-Bench (صالة الألعاب الرياضية المالية)

قام الباحثون ببناء ساحة تدريب جديدة تسمى EDINET-Bench.

  • المصدر: استخدموا وثائق حقيقية من نظام "EDINET" الياباني، وهو يشبه نظام EDGAR التابع لهيئة الأوراق المالية والبورصات الأمريكية. إنه مكتبة ضخمة من التقارير السنوية التي قدمتها الشركات اليابانية على مدار السنوات العشر الماضية.
  • الأدوات: قاموا ببناء أداة خاصة (تسمى edinet2dataset) للبحث في هذه التقارير، وتحويل ملفات PDF والجداول غير المنظمة إلى بيانات نظيفة يمكن للذكاء الاصطناعي قراءتها.
  • التحديات الثلاثة (أسئلة الامتحان):
    1. كشف الاحتيال: هل يستطيع الذكاء الاصطناعي رصد شركة تتلاعب بالدفاتر؟ (مثل البحث عن إبرة في كومة قش من الأرقام).
    2. التنبؤ بالأرباح: هل يستطيع الذكاء الاصطناعي النظر في تقرير هذا العام وتخمين ما إذا كانت الشركة ستجني مالاً أكثر أو أقل في العام المقبل؟
    3. التنبؤ بالقطاع: هل يستطيع الذكاء الاصطناعي النظر في الميزانية العمومية لشركة ما وتخمين ما إذا كانت بنكاً، أو مصنع سيارات، أو شركة أغذية؟

3. النتائج: الروبوتات تعثرت

اختبر الباحثون أذكى نماذج الذكاء الاصطناعي المتاحة (مثل GPT-4o، وClaude 3.7، وغيرها) في هذا الامتحان.

الحكم النهائي: لم يؤدِّ الذكاء الاصطناعي بشكل جيد.

  • التشبيه: تخيل طالباً حفظ القاموس بأك its بالكامل، لكنه فشل في اختبار رياضيات أساسي لأنه لا يفهم كيفية تطبيق الأرقام.
  • الواقع: أدت نماذج الذكاء الاصطناعي أداءً أفضل قليلاً فقط من طريقة إحصائية قديمة وبسيطة تسمى "الانحدار اللوجستي" (Logistic Regression). وفي بعض الحالات، كان أداؤها بالكاد أفضل من رمي عملة معدنية.
  • لماذا؟ أُعطي الذكاء الاصطناعي التقرير كاملاً وطُلب منه "أن يقرأه فقط". لكن الاحتيال المالي يكون دقيقاً للغاية؛ فهو لا يظهر عادةً كعلامة حمراء صارخة، بل كتعارض بسيط في ملاحظة هامشية يتناقض مع جدول في الصفحة الثالثة. الذكاء الاصطناعي، في وضعه الحالي "للقراءة فقط"، فشل في إدراك هذه الروابط.

4. الدرس الكبير: القراءة ليست كافية

تخلص الورقة إلى أن مجرد تسليم وثيقة للذكاء الاصطناعي ليس كافياً لجعله خبيراً مالياً.

  • الاستعارة: إعطاء الذكاء الاصطناعي كومة من التقارير السنوية يشبه إعطاء محقق رواية غموض مكونة من 500 صفحة وقول: "حل الجريمة". المحقق يحتاج إلى عدسة مكبرة، وسبورة لتوصيل الأدلة، وربما فريق من الخبراء للتحدث إليهم.
  • المستقبل: لجعل الذكको الاصطناعي مفيداً في التمويل، نحتاج إلى بناء "سقالات" (Scaffolding). وهذا يعني تزويد الذكاء الاصطناعي بأدوات لمحاكاة سيناريوهات العالم الحقيقي، والسما- له بطرح الأسئلة، والسما له بمراجعة البيانات وتقاطعها، ودعم عملية الاستنتاج لديه. نحن بحاجة للانتقال من "القارئ السلبي" إلى "المحلل النشط".

ملخص

EDINET-Bench هي جرس إنذار. فهي تظهر أنه بينما يبدو الذكاء الاصطناعي مذهلاً في أشياء كثيرة، إلا أنه لا يزال متعثراً عندما يتعلق الأمر بعالم التحليل المالي المعقد والدقيق. يقوم الباحثون بإصدار بياناتهم وأدواتهم للجمهور حتى يتمكن علماء آخرون من المساعدة في بناء ذكاء اصطناعي أفضل وأكثر "ثقافة مالية" للمستقبل.

باختصار: الذكاء الاصطنا_ ذكي، لكنه ليس مستعداً بعد ليكون محللاً في "وول ستريت". إنه يحتاج إلى المزيد من التدريب وأدوات أفضل لفهم القصص الخفية وراء الأرقام.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →