← أحدث الأبحاث
💬 NLP

FinTagging: Benchmarking LLMs for Extracting and Structuring Financial Information

تقدم هذه الورقة FinTagging، وهو أول معيار مرجعي شامل يفكك المهمة المعقدة لوسم XBRL إلى تحديد الأرقام المالية وربط المفاهيم المالية، ليكشف أن النماذج اللغوية الكبيرة، رغم تفوقها في استخراج الكيانات المالية، تعاني بشكل كبير في ربطها بتصنيف US GAAP الكامل تحت ظروف واقعية تراعي الهيكلية.

المؤلفون الأصليون: Yan Wang, Lingfei Qian, Xueqing Peng, Yang Ren, Keyi Wang, Yi Han, Dongji Feng, Fengran Mo, Shengyuan Lin, Qinchuan Zhang, Kaiwen He, Chenri Luo, Jianxing Chen, Junwei Wu, Chen Xu, Ziyang Xu, Jimin Hu
نُشر 2026-02-20
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yan Wang, Lingfei Qian, Xueqing Peng, Yang Ren, Keyi Wang, Yi Han, Dongji Feng, Fengran Mo, Shengyuan Lin, Qinchuan Zhang, Kaiwen He, Chenri Luo, Jianxing Chen, Junwei Wu, Chen Xu, Ziyang Xu, Jimin Huang, Guojun Xiong, Xiao-Yang Liu, Qianqian Xie, Jian-Yun Nie

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة FinTagging البحثية، مترجم إلى لغة بسيطة وعملية مع بعض التشبيهات الإبداعية.

المشكلة الكبرى: كابوس "أمين المكتبة" المالي

تخيل أنك أمين مكتبة مسؤول عن مكتبة ضخمة تحتوي على مليوني كتاب (تقارير مالية للشركات). كل يوم، تمتلئ هذه الكتب بآلاف الأرقام: الأرباح، الديون، الرواتب، والضرائب.

لجعل هذه الأرقام مفيدة للحواسيب، والجهات التنظيمية، والمستثمرين، يجب أن يحمل كل رقم منها تسمية (وسماً/Tag) محددة من قاموس ضخم يسمى US-GAAP. هذا القاموس يحتوي على 17,688 تسمية مختلفة.

  • الطريقة القديمة: تشبه مطالبة إنسان بقراءة كتاب ووضع ملصق يدويًا على كل رقم يقول: "هذا هو الإيراد" أو "هذا هو الدين". إنها عملية بطيئة، مملة، والبشر يرتكبون فيها أخطاء.
  • الأمل في الذكاء الاصطناعي: أردنا استخدام نماذج اللغات الكبيرة (LLMs) — وهي العقول الذكية جداً وراء أدوات مثل ChatGPT — للقيام بعملية الوسم هذه تلقائياً.

العقبة: الاختبارات السابقة لهذه الأنواع من الذكاء الاصطناعي كانت تشبه إعطاءهم اختباراً قصيراً يحتوي على 5 أسئلة سهلة فقط. أما في العالم الحقيقي، فيتعين على الذكاء الاصطناعي الإجابة على 17,000 سؤال في وقت واحد، وغالباً ما يكون ذلك بالنظر في جداول بيانات فوضوية ونصوص مربكة. الاختبارات القديمة لم تكن توضح لنا ما إذا كان الذكاء الاصطناعي ذكياً بما يكفي للوظيفة الحقيقية.


الحل: FinTagging (الرقصة ذات الخطوتين)

ابتكر مؤلفو هذه الورقة اختباراً جديداً وأكثر صعوبة يسمى FinTagging. بدلاً من مطالبة الذكاء الاصطناعي بتخمين التسمية في قفزة واحدة عملاقة، قاموا بتقسيم المهمة إلى رقصة من خطوتين:

الخطوة 1: "الباحث عن الحقائق" (FinNI)

  • التشبيه: تخيل محققاً يمسح مسرح الجريمة. وظيفته الوحيدة هي العثات على الأدلة (الأرقام) وتحديد نوع هذا الدليل.
  • ماذا يفعل: يقرأ الذكاء الاصطناعي المستند (نص أو جداول) ويقول: "لقد وجدت رقماً: 50 مليون دولار. إنه مبلغ نقدي، وليس نسبة مئوية أو عدداً للأشخاص".
  • النتيجة: الذكاء الاصطناعي جيد جداً في هذا. إنه مثل محقق بارع في رصد آثار الأقدام.

الخطوة 2: "خاطبة التسميات" (FinCL)

  • التشبيه: الآن يمتلك المحقق الدليل، لكنه يحتاج إلى وضعه في الدرج الصحيح داخل خزانة تحتوي على 17,000 درج. هذا هو الجزء الصعب. هل الـ "50 مليون دولار" هي "نقد متوفر"؟ أم "نقد مقيد"؟ أم "دخل استثماري"؟
  • ماذا يفعل: ينظر الذكاء الاصطناعي إلى السياق (الجمل المحيطة بالرقم) ويحاول مطابقتها مع التسمية المثالية في القاموس الضخم.
  • النتيجة: هنا يعاني الذكاء الاصطناعي. حتى النماذج الأكثر ذكاءً تصاب بالارتباك. قد يختارون درداً "قريباً" ولكن ليس دقيقاً تماماً. الأمر يشبه معرفة كلمة "تفاحة" ولكن عدم معرفة ما إذا كان الشخص يقصد الفاكهة أم شركة التكنولوجيا دون مزيد من السياق.

ماذا اكتشفوا؟

اختبر الباحثون 13 نموذجاً مختلفاً من الذكاء الاصطناعي (بما في ذلك أسماء كبيرة مثل GPT-4o و Llama و DeepSeek) على هذا الاختبار الجديد والأكثر واقعية. وإليكم ما وجدوه:

  1. "فجوة الاستخراج": الذكاء الاصطناعي محقق رائع (الخطوة 1). يمكنه العثور على الأرقام في الجداول والنصوص الفوضوية بشكل شبه مثالي.
  2. "فجوة المواءمة": الذكاء الاصطناعي أمين مكتبة مرتبك (الخطوة 2). عندما يتعين عليه اختيار التسمية الدقيقة من بين 17,000 خيار، فإنه غالباً ما يختار التسمية الخاطئة. هو يفهم الرقم، لكنه لا يفهم تماماً القواعد المحاسبية المحددة وراءه.
  3. الاختبارات القديمة كانت "غشاً": الاختبارات السابقة كانت تطلب من الذكاء الاصطناعي الاختيار من قائمة صغيرة تضم 100 تسمية فقط. هذا يشبه اختبار طيار عبر سؤاله فقط عن الهبوط على مدرج لا توجد به رياح. أما FinTagging فيختبرهم في وسط إعصار. عندما تختبرهم باستخدام القائمة الكاملة المكونة من 17,000 تسمية، ينخفض أداؤهم إلى الصفر تقريباً إذا لم تستخدم طريقة الخطوتين.

لماذا يهم هذا الأمر؟

تخيل أن التقارير المالية هي لغة المال. إذا كانت التسميات خاطئة، فإن "الترجمة" ستكون خاطئة أيضاً.

  • إذا أخطأ الذكاء الاصطناعي في تسمية "دين" على أنه "ربح"، فقد يشتري المستثمرون أسهماً في شركة تعاني في الواقع من مشاكل مالية.
  • إذا لم تتمكن الجهات التنظيمية من الوثوق بالوسوم، فلن تتمكن من تطبيق القواعد.

الخلاصة:
تقول هذه الورقة: "لا تثقوا فقط في الذكاء الاصطناعي للقيام بالمهمة كاملة في خطوة واحدة". نحن بحاجة لبناء أنظمة حيث يقوم الذكاء الاصطنا أولاً بإيجاد الأرقام (وهو بارع في ذلك) ثم يستخدم عملية ذكية وخطوة بخطوة لمطابقتها مع القواعد (وهو أمر يحتاج فيه إلى مساعدة).

لقد أطلقوا أيضاً مجموعة البيانات والبرمجيات (مثل كتاب الوصفات) لكي يتمكن باحثون آخرون من تجربة حل مشكلة "خاطبة التسميات" وبناء ذكاء اصطناعي مالي أفضل للجميع.

ملخص في جملة واحدة

يوضح اختبار FinTagging، وهو اختبار جديد وواقعي، أن الذكاء الاصطناعي بارع في العثور على الأرقام في التقارير المالية ولكنه لا يزال بحاجة إلى الكثير من المساعدة لتسميتها بشكل صحيح وفقاً للقواعد المحاسبية المعقدة، مما يثبت حاجتنا إلى نهج أكثر ذكاءً يعتمد على الخطوات المتعددة لأتمتة التقارير المالية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →