FinTradeBench: A Financial Reasoning Benchmark for LLMs
تقدم الورقة البحثية FinTradeBench، وهو معيار شامل للاستدلال المالي يضم 1,400 سؤالاً تدمج بين أساسيات الشركات وإشارات التداول لتقييم وكشف القيود الحالية للنماذج اللغوية الكبيرة في التعامل مع مهام اتخاذ القرار المالي المعقدة ومتعددة الوسائط.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول اتخاذ قرار بشأن شراء منزل. لديك نوعان مختلفان تماماً من المعلومات للنظر فيهما:
- تقرير فحص المنزل (الأساسيات): هذه هي الأوراق الرسمية المملة والقانونية. يخبرك عدد الغرف في المنزل، وعمر السقف، وكم يدين المالك للبنك. إنها حقائق مكتوبة بنص، وتأتي من سجلات رسمية.
- طابع الحي (إشارات التداول): هذا هو الشعور العام في الخارج. هل الشارع مزدحم بالناس؟ هل لافتات "للبيع" تظهر وتختفي بكثرة؟ هل سعر المنزل يقفز وينخفض بجنون مثل الأفعوانية (الرولر كوستر)؟ الأمر يتعلق بـ الحركة، والسرعة، والشعور.
لفترة طويلة، كانت نماذج الذكاء الاصطناعي (الحواسيب الذكية) بارعة في قراءة تقرير فحص المنزل. يمكنها تلخيص الأوراق الرسمية بشكل مثالي. لكنها كانت سيئة جداً في فهم طابع الحي. كانت ترتبك عندما تسألها: "المنزل يبدو رائعاً على الورق، ولكن لماذا ينخفض السعر كل يوم؟ هل يجب أن أشتريه؟"
مرحباً بكم في FinTradeBench
قام الباحثون في جامعة سنترال فلوريدا ببناء "اختبار" جديد يسمى FinTradeBench. فكر في الأمر كأنه اختبار مفاجئ ضخم مكون من 1,400 سؤال للذكاء الاصطناعي، مصمم خصيصاً لمعرفة ما إذا كان بإمكانهم التعامل مع كل من الأوراق الرسمية وطابع الحي في وقت واحد.
إليك تفصيل بسيط لما وجدوه:
1. الاختبار: ثلاثة أنواع من الأسئلة
تكون الاختبار من ثلاثة أقسام:
- المحاسب: "ما هو ربح الشركة؟" (أوراق رسمية بحتة).
- المتداول: "هل سعر السهم يتحرك صعوداً أم هبوطاً؟" (حركة بحتة).
- الهجين: "الشركة مربحة، لكن سعر السهم ينهار. هل هذا وقت جيد للشراء؟" (هذا يتطلب دمج الاثنين معاً).
2. "النظارات السحرية" (RAG)
لمساعدة الذكاء الاصطناعي في الإجابة، منح الباحثونهم "نظارات سحرية" تسمى RAG (التوليد المعزز بالاسترجاع). هذا يشبه إعطاء الذكاء الاصطناعي بطاقة مكتبة ليتمكن من البحث عن الحقائق الدقيقة بدلاً من التخمين من ذاكرته.
- الأخبار الجيدة: عندما كانت الأسئلة تتعلق بـ المحاسب (الأوراق الرسمية)، عملت النظارات السحرية بشكل مذهل. ارتفعت درجات الذكاء الاصطناعي بنحو 37%. لقد تمكن أخيراً من قراءة التفاصيل الدقيقة دون اختلاق معلومات.
- الأخبار السيئة: عندما كانت الأسئلة تتعلق بـ المتداول (تحركات الأسعار)، أدت النظارات السحرية إلى إلحاق الضرر بالذكاء الاصطناعي. انخفضت الدرجات. لماذا؟ لأن الذكاء الاصطناعي شعر بالتشتت. كان يحدق في جدار من الأرقام الخام (مثل جدول بيانات أسعار الأسهم) ولم يعرف كيف يحول هذه الأرقام إلى قصة. لقد تشتت بسبب الضجيج.
3. الذكاء الاصطناعي "الأكثر ذكاءً" مقابل الذكاء الاصطناعي "الأسرع"
اختبر الباحثون 14 نموذجاً مختلفاً من نماذج الذكاء الاصطناعي.
- "المفكرون" (مثل DeepSeek-R1): هذه النماذج تشبه المحققين الذين يفكرون خطوة بخطوة. كانوا الأفضل في الأسئلة الهجينة. استطاعوا النظر إلى الربح وانخفاض السعر معاً وقول: "آه، السوق خائف، لكن الشركة في الواقع صحية. هذه فرصة للشراء".
- "الملخصون" (مثل LLaMA): هذه النماذج تشبه القراء السريعين الذين يلخصون النصوص. عندما مُنحوا النظارات السحرية، أصابهم الارتباك. قرأوا الوثيقة كاملة لكنهم فاتهم الجوهر. لقد "تشتتوا" بالمعلومات الإضافية وقدموا إجابات أسوأ مما لو لم ينظروا إلى النظارات السحرية على الإطلاق.
4. الدرس الكبير: "السياق هو الملك، لكن الهيكلية هي الملكة"
كان الاكتشاف الأكثر إثارة للدهشة يتعلق بـ كيفية تقديم المعلومات.
- عندما أُعطي الذكاء الاصطناعي بيانات خام (قائمة فوضوية من أسعار الأسهم)، فشل.
- عندما أُعطي رؤى محسوبة مسبقاً (على سبيل المثال: "السهم أعلى بنسبة 15% من متوسطه")، نجح.
التشبيه: تخيل أنك تطلب من طباخ أن يصنع حساءً.
- بدون RAG: تعطيه كتاب وصفات، لكن بدون مكونات. فيبدأ بالتخمين.
- RAG القياسي: تعطيه كتاب الوصفات و كيساً ضخماً من الخضروات الخام، غير المقشرة وغير المقطعة. يصبح مرتبكاً وهو يحاول تقطيع كل شيء أثناء قراءة الوصفة.
- RAG المثالي: تعطيه كتاب الوصفات و وعاءً من المكونات المقطعة والمقاسة بدقة. سيصنع حساءً مثالياً.
لماذا يهم هذا؟
حالياً، إذا سألت ذكاءً اصطناعياً: "هل يجب أن أشتري سهم تسلا؟"، فقد ينظر إلى تقرير الأرباح (جيد) ومخطط السهم (سيء) ويصاب بالارتباك، ويعطيك إجابة خاطئة.
يثبت هذا البحث ما يلي:
- الذكاء الاصطناعي يحتاج للمساعدة في الرياضيات والأرقام. مجرد إعطائهم المزيد من النصوص ليس كافياً؛ إنهم بحاجة إلى أدوات للحساب.
- الطريقة التي نغذي بها البيانات مهمة. إذا أردنا للذكاء الاصطناعي أن يكون مستشاراً مالياً، فلا يمكننا مجرد إلقاء البيانات الخام عليهم. نحن بحاجة إلى هيكلة البيانات بحيث يمكنهم "التفكير" فيها، وليس فقط "قراءتها".
باختصار: لقد بنينا اختباراً أفضل لنبين أنه بينما أصبح الذكاء الاصطناعي أكثر ذكاءً في قراءة التقارير المالية، فإنه لا يزال يعاني لفهم العالم الفوضوي والمتحرك لسوق الأسهم. ولإصلاح ذلك، نحتاج إلى تعليم الذكاء الاصطناعي كيفية القيام بالرياضيات، وليس فقط كيفية القراءة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.