← أحدث الأبحاث
🤖 machine learning

GAUGE: Grading Agent-Built Financial Models Without a Golden Answer

تقدم الورقة البحثية GAUGE، وهو معيار مرجعي مبتكر يقيم النماذج المالية التي تبنيها أنظمة الذكاء الاصطناعي مقابل الممارسات الملحوظة للمحللين بدلاً من إجابة "ذهبية" واحدة، مما يكشف أنه بينما تتفوق الوكلاء الحاليون في البناء الآلي للنماذج، إلا أنهم لا يزالون يتخلفون بشكل كبير عن المتخصصين البشريين في أحكام التقييم.

المؤلفون الأصليون: Jiacheng Lu, Sinuo Wang, Wentao Zhao, Rui Sun, Cheng Hua, Tao Song, Hui Cai, Beidi Luan, Zhengze Wu, Lingjing Teng, Yijia He, Jing Li, Daxin Jiang, Zuo Bai, Haibing Guan

نُشر 2026-07-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jiacheng Lu, Sinuo Wang, Wentao Zhao, Rui Sun, Cheng Hua, Tao Song, Hui Cai, Beidi Luan, Zhengze Wu, Lingjing Teng, Yijia He, Jing Li, Daxin Jiang, Zuo Bai, Haibing Guan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك حكم في برنامج طبخ. عادةً، يمتلك الحكام بطاقة وصفة واحدة "مثالية". إذا كان طبق المتسابق مختلفاً ولو قليلاً عن تلك البطاقة، فإنه يخسر النقاط. ولكن ماذا لو كانت هناك عشر طرق مختلفة لصنع لازانيا لذيذة؟ ماذا لو كانت الوصفة "المثالية" هي مجرد رأي شخص واحد، وكانت نسخة المتسابق لذيذة بنفس القدر ولكنها تستخدم توابل مختلفة؟ هذا هو المشكلة التي يواجهها العلماء عند اختبار الذكاء الاصطناعي في مهام معقدة مثل النمذجة المالية. النمذجة المالية تشبه بناء آلة تنبؤ مفصلة لمستقبل شركة ما؛ فهي تمزج بين الحقائق الصلبة (مثل المبيعات الماضية) والتخمينات المدروسة (مثل سرعة نمو الشركة). لعقود من الزمن، اختبرنا الذكاء الاصطناعي عبر مقارنة تخميناته بإجابة خبير واحد. ولكن إذا كان الخباء أنفسهم يختلفون حول أفضل تخمين، فإن معاقبة الذكاء الاصطناعي لامتلاكه إجابة مختلفة، ومع ذلك معقولة، لا يبدو أمراً عادلاً. هذا البحث يسأل: كيف نقيم الذكاء الاصطناعي عندما لا توجد إجابة واحدة "صحيحة"؟

قرر الباحثون وراء هذه الدراسة، والتي تحمل عنوان GAUGE، التوقف عن التظاهر بأن هناك نموذجاً مالياً واحداً مثالياً. لقد بنوا ساحة اختبار جديدة لمعرفة ما إذا كان بإمكان وكلاء الذكاء الاصطناعي بناء هذه "آلات التنبؤ" المالية المعقدة، والأهم من ذلك، ما إذا كان بإمكانهم اتخاذ "الأحكام" داخلها كما يفعل الخبراء البشريون.

أولاً، اختبروا الطريقة القديمة في التقييم. أخذوا 108 أزواج من النماذج المالية التي بناها خبراء بشريون مختلفون لنفس الشركات. وعندما قاموا بتقييم نموذج أحد الخبراء مقابل نموذج آخر باستخدام قاعدة "الإجابة المثالية الواحدة" القديمة، كانت النتائج صادمة. كان متوسط الدرجة 0.33 من أصل 1.0. في الواقع، سجل 92.6% من الأزواج أقل من 0.70. وهذا يعني أنه حتى البشر المحترفين، الذين يعتبرون جميعاً خبراء، يختلفون غالباً بدرجة كبيرة تجعلنا إذا اعتبرنا أحدهم هو "الحقيقة"، فإننا سنعتبر الآخر فاشلاً. اتضح أنه في التمويل، كونك "مختلفاً" لا يعني أنك "مخطئ".

ولإصلاح ذلك، ابتكر الفريق نظام GAUGE (تقييم النماذج المالية التي يبنيها الوكلاء دون وجود إجابة ذهبية). بدلاً من بطاقة وصفة واحدة، أنشأوا "غلاف سلامة" يعتمد على ما يفعله الخبراء الحقيقيون بالفعل. تخيل هدفاً حيث ليس مركز الهدف نقطة واحدة، بل حلقة واسعة. إذا وقع تخمين الذكاء الاصطناعي في أي مكان داخل حلقة "السلوك الخبير المعقول" هذه، فإنه يحصل على الدرجة. يتحقق النظام من شيئين:

  1. الآليات: هل نجحت الرياضيات؟ هل توازنت جداول البيانات؟ (مثل التحقق مما إذا كان الفرن قد تم تشغيله بالفعل).
  2. الحكم: هل وقعت تخمينات الذكاء الاصطناعي ضمن النطاق الذي يعتبره الخبراء الحقيقيون منطقياً؟ (مثل التحقق مما إذا كان التتبيل ضمن نطاق ذوق طباخ جيد).

لقد اختبروا 24 وكيل ذكاء اصطناعي مختلفاً على هذا النظام الجديد، جنباً إلى جنب مع مجموعة من 5ัด البشر تتراوح من طلاب التمويل إلى كبار المحللين. وإليكم ما وجدوه:

  • الذكاء الاصطناعي يصبح جيداً في الرياضيات، لكنه سيء في "الشعور الداخلي". كان وكلاء الذكاء الاصطناعي ممتازين في الأجزاء الميكانيكية. فقد اجتاز أفضل وكيل ذكاء اصطناعي 93% من الفحوصات الميكانيكية (التأكد من صحة صيغ جداول البيانات). ومع ذلك، عندما تعلق الأمر بأجزاء الحكم (إجراء التنبؤات الفعلية)، نجح أفضل وكيل ذكاء اصطناٍ فقط في 78% من الاختبارات.
  • "الفجوة" حقيقية. في المتوسط، كان وكلاء الذكاء الاصطناعي أفضل بـ 26 نقطة في بناء النموذج منها في إجراء أحكام التقييم. يمكنهم بناء السيارة، لكنهم ليسوا بارعين في قيادتها بعد.
  • البشر لا يزالون يفوزون. سجل أفضل ذكاء اصطناعي 53.4. كان هذا أفضل من متوسط طالب التمويل (43.2) ولكنه أسوأ من كل محلل أول (الذين بلغ متوسطهم 88.3) ومعظم المحللين المبتدئين. الذكاء الاصطناعي ذكي بما يكفي للقيام بالواجب المنزلي، لكنه ليس ذكياً بما يكفي ليكون هو المدير.

تشير الدراسة إلى أنه بينما أصبح الذكاء الاصطناعي قادراً جداً على إنشاء نماذج مالية معقدة، فإن الجزء الأصعب — وهو اتخاذ الأحكام الدقيقة والمنطقية التي يستخدمها الخبراء لتقييم شركة ما — لا يزال يمثل تحدياً كبيراً. لم يكتفِ المؤلفون بإيجاد درجة فحسب؛ بل أثبتوا أن الطريقة القديمة في التقييم (البحث عن إجابة واحدة مثالية) كانت غير عادلة لكل من البشر والآلات، وقدموا طريقة جديدة لقياس التقدم تحترم الواقع الفوضوي للاختلاف بين الخبراء.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →