FinAuditing: A Financial Taxonomy-Structured Multi-Document Benchmark for Evaluating LLMs
تقدم هذه الورقة FinAuditing، وهو معيار مرجعي واسع النطاق ومتوافق مع التصنيفات مستمد من تقارير XBRL حقيقية، يقيم قدرات 13 نموذجاً لغوياً كبيراً من أحدث الطرازات عبر ثلاث مهام تدقيق مالي، مما يكشف عن فجوات كبيرة في قدرتها على إجراء المطابقة الدلالية الواعية بالهيكل، واستخراج العلاقات، والاستدلال الرياضي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك محقق تحاول حل لغز مالي ضخم. المشتبه به هو شركة عملاقة، والأدلة عبارة عن كومة من آلاف الصفحات من التقارير المالية. لكن هناك عقبة؛ فهذه ليست مجرد صفحات نصية عادية، بل هي أشبه بلعبة "ليغو" ضخمة ومترابطة، حيث يجب أن يتناسب كل رقم وكلمة وعلاقة بدقة تامة وفقاً لكتاب قواعد صارم يسمى US-GAAP (وهو "دستور" المحاسبة).
تقدم هذه الورقة أداة جديدة تسمى FINAUDITING، وهي في الأساس "امتحان نهائي" للذكاء الاصطناعي لترى ما إذا كان ذكياً بما يكفي ليكون محققاً مالياً.
إليك تفصيل المشكلة والحل، باستخدام تشبيهات بسيطة:
1. المشكلة: الأخطاء "غير المرئية"
تخيل أن شركة تقول: "لدينا 100 مليون دولار نقداً!" في ملخصها. ولكن عندما تنظر إلى الإيصالات التفصيلية في نهاية التقرير، تجد أن الحسابات لا تتجاوز 95 مليون دولار فقط.
في الماضي، كان على المراجع البشري فحص كل صفحة يدوياً للعثور على هذه الفجوة البالغة 5 ملايين دولار. الأمر يشبه محاولة العثور على خطأ مطبعي محدد في مكتبة تحتوي على مليون كتاب. إنها عملية بطيئة، مملة، وتسبب إرهاق البشر.
الآن، لدينا النماذج اللغوية الكبيرة (LLMs) — وهي ذكاءات اصطناعية فائقة الذكاء يمكنها قراءة وفهم النصوص. ولكن هل يمكنها القيام بهذه المهمة المحددة؟
- المشكلة: معظم أنظمة الذكاء الاصطناعي بارعة في كتابة القصائد أو الدردشة. لكن التدقيق المالي ليس مجرد قراءة كلمات؛ بل يتعلق بالتحقق من الهيكل، والرياضيات، والقواعد.
- الفجوة: الاختبارات الحالية للذكاء الاصطناعي تشبه سؤال: "هل يمكنك كتابة جملة عن المال؟" بينما يسأل اختبار FINAUDITING: "هل يمكنك العثور على كذبة الـ 5 ملايين دولار المختبئة داخل وثيقة قانونية مكونة من 30,000 كلمة تتبع كتاب قواعد يتكون من 1,000 صفحة؟"
2. الحل: FINAUDITING (النادي الرياضي المالي)
قام المؤلفون ببناء ساحة تدريب ضخمة وواقعية (معيار قياسي) باستخدام بيانات حقيقية من هيئة الأوراق المالية والبورصات الأمريكية (SEC). لقد أنشأوا ثلاثة "تمارين رياضية" محددة لاختبار عضلات الذكاء الاصطناعي:
التمرين (أ): اختبار "بطاقة الاسم" (المطابقة الدلالية المالية)
- التشبيه: تخيل مكتبة حيث يجب أن يكون لكل كتاب ملصق محدد على كعب الكتاب. إذا كان الكتاب عن "التفاح"، فيجب أن يُصنف تحت "فاكهة"، وليس "خضروات".
- المهمة: على الذكاء الاصطناعي النظر في تقرير مالي والتحقق مما إذا كانت الشركة قد استخدمت "الملصقات الرسمية" (الوسوم) الصحيحة لأرقامها. هل أطلقوا على "النقد" الاسم الذي ينص عليه كتاب القواعد؟
- النتيجة: واجهت أنظمة الذكاء الاصطناعي صعوبة. فقد كانت تختار غالباً الكلمة "الأقرب في النطق" بدلاً من الكلمة القانونية الصحيحة. الأمر يشبه تسمية "الملعقة" بأنها "سباتولا" لأن كليهما أدوات مطبخ، رغم أنهما ليسا الشيء نفسه.
التمرين (ب): اختبار "شجرة العائلة" (استخراج العلاقات المالية)
- التشبيه: فكر في شجرة العائلة. "الأب" يجب أن يكون والداً لـ "الابن". لا يمكنك وضع "حفيد" في قائمة آباء "الأب".
- المهمة: التقارير المالية تحتوي على تسلسلات هرمية. "إجمالي الأصول" يجب أن يكون هو الأصل لـ "الأصول المتداولة". على الذكاء الاصطناٍعي التحقق مما إذا كانت الشركة قد أفسدت شجرة العائلة. هل وضعوا "الابن" فوق "الأب"؟
- النتيجة: كان هذا صعباً للغاية. ارتبكت أنظمة الذكاء الاصطناعي بسبب الهيكل المعقد. كان بإمكانها قراءة الكلمات، لكنها لم تستطع فهم العلاقات بينها.
التمرين (ج): اختبار "التحقق من الحساب" (الاستدلال الرياضي المالي)
- التشبيه: لديك إيصال يقول "الإجمالي: 50 دولاراً". لكن العناصر المدرجة هي 20 دولاراً + 20 دولاراً + 15 دولاراً. الحسابات لا تتطابق.
- المهمة: على الذكاء الاصطناعي النظر في الأرقام، وإيجاد قواعد الحساب الخفية (مثل "الإجمالي = مجموع الأجزاء")، وحساب ما إذا كانت أرقام الشركة كاذبة أم لا.
- النتيجة: كان هذا هو الجزء الأصعب. حتى الأنظمة الأكثر ذكاءً فشلت في إجراء العمليات الحسابية بشكل صحيح. كان بإمكانها إيجاد الأرقام، لكنها لم تستطع إجراء الحسابات أو اتباع سلسلة المنطق لإثبات الكذبة.
3. الكشف الكبير: الذكاء الاصطناعي ليس مستعداً بعد
اختبر المؤلفون 13 نموذجاً من أذكى نماذج الذكاء الاصطناعي في العالم (بما في ذلك عمالقة مثل GPT-4o وأنظمة مالية متخصصة).
- الحكم: كانت النتائج مخيبة للآمال. حتى النماذج "فائقة الذكاء" أخطأت في معظم الأسئلة.
- لماذا؟ هذه الأنظمة تشبه القراء البارعين الذين هم محاسبون سيئون للغاية. يمكنهم فهم القصة، لكنهم لا يفهمون القواعد الصارمة، أو الرياضيات، أو الهيكل العميق المطلوب للتدقيق الحقيقي. إنهم يعتمدون على "التخمين" بناءً على الأنماط بدلاً من "الاستدلال" بناءً على الحقائق.
4. لماذا هذا مهم؟
هذه الورقة هي بمثابة جرس إنذار.
- للجمهور: هذا يعني أننا لا نستطيع الوثوق بالذكاء الاصطناعي لتدقيق أموالنا بعد. إذا تركناهم يعملون، فقد يغفلون عن فضائح ضخمة لأنهم لا يفهمون "قواعد اللعبة".
- للمستقبل: أطلق المؤلفون هذا "الامتحان" مجاناً. الآن، يمكن لعلماء آخرين استخدامه لبناء أنظمة ذكاء اصطناعي أفضل تفهم الهياكل والرياضيات حقاً، وليس مجرد الكلمات.
باختاً مختصراً:
FINAUDITING هو اختبار للواقع. إنه يوضح أنه بينما يبدع الذكاء الاصطناعي في الكتابة والدردشة، فإنه حالياً ليس ذكياً بما يكفي ليكون مدققاً مالياً. يحتاج إلى تعلم كيفية اتباع القواعد الصارمة، والتحقق من حساباته الخاصة، وفهم الهياكل المعقدة قبل أن يمكن الوثوق به في إدارة أموالنا.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.