FinDeepIndicator: Benchmarking Deep Research Agents in End-to-End Financial Indicator Construction
تقدم هذه الورقة FinDeepIndicator، وهو أول معيار تصميم لتقييم وكلاء البحث العميق عبر المراحل الأربع المتكاملة لبناء المؤشرات المالية، كاشفةً أنه في حين يتفوق هؤلاء الوكلاء على النماذج اللغوية الكبيرة القياسية المزودة بخاصية البحث، إلا أنهم لا يزالون يعانون من ضعف الموثوقية في استرجاع البيانات والتنفيذ الرقمي ضمن سيناريوهات التحليل المالي الواقعية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك محقق يحاول حل لغز ما، ولكن بدلاً من مجرد سؤال شاهد عيان "ماذا رأيت؟"، يتعين عليك القيام بالمهمة بأكملها بنفسك. عليك أن تحدد ما هو السؤال الذي ستطرحه، وتجد الشاهد في مدينة مزدحمة، وتستمع إلى قصته، وتدونها، وتقوم بالحسابات لترى ما إذا كانت القصة منطقية، وفي النهاية، تخبر القاضي بالحكم. هذا هو عالم وكلاء "البحث العميق" (Deep Research). هؤلاء هم برامج حاسوبية فائقة الذكاء مصممة لتعمل مثل الباحثين البشر: فهم لا يكتفون فقط بالإجابة على الأسئلة؛ بل يخرجون للبحث عن المعلومات، ويجمعون أجزاءها، ويحلون المشكلات المعقدة من الصفر. ولكن هنا تكمن العقبة: مجرد قدرة الحاسوب على التحدث كالبشر لا يعني أنه يستطيع التصرف كالبشر. قد يعرف التعريف الدقيق لكلمة ما، لكنه قد يفشل في العثور على الكتاب الصحيح في المكتبة أو يخطئ في عملية الجمع عند عد الصفحات.
في عالم التمويل، يعد هذا أمراً بالغ الأهمية. فالمؤشرات المالية تشبه لوحات النتائج للاقتصاد—وهي أرقام تخبرنا ما إذا كانت الشركة تتمتع بصحة جيدة، أو ما إذا كانت سوق الأسهم متوترة، أو ما إذا كانت الدولة في نمو. وللحصول على هذه الأرقام، لا يمكنك التخمين فحسب؛ بل يتعين عليك البحث في تقارير مالية تمتد لسنوات، والعثور على الأرقام الدقيقة لشركات معينة، ومعالجة البيانات. لقد عمل العلماء على بناء وكلاء "البحث العميق" هؤلاء للقيام بهذا العمل، آملين أن يحلوا محل المحللين البشر أو يساعدوهم. ولكن حتى الآن، لم يختبر أحد حقاً ما إذا كان بإمكان هؤلاء الوكلاء التعامل مع العملية برمتها من البداية إلى النهاية، أو ما إذا كانوا بارعين فقط في التحدث بذكاء بينما يرتكبون أخطاءً سخيفة في المنتصف.
هنا يبرز FinDeepIndicator، وهو "اختبار" جديد ابتكره فريق من الباحثين لاختبار هؤلاء المحققين الرقميين. اعتبر هذا المعيار بمثلة مسار عقبات ضخم مصمم خصيصاً للوكلاء الماليين. فبدلاً من مجرد طرح سؤال مثل: "ما هي أرباح الشركة (س)؟"، يجبر الاختبار الوكيل على القيام بأربعة أشياء متميزة: أولاً، تحديد الصيغة الرياضية الدقيقة المطلوبة (مثل معرفة أن "هامش الربح" يعني قسمة الربح على المبيعات)؛ ثانياً، الخروج والبحث عن الأرقام الخام من الإنترنت؛ ثالثاً، إجراء العمليات الحسابية فعلياً للحصول على النتائج الوسيطة؛ وأخيراً، تقديم الإجابة النهائية الصحيحة. وقد بنى الباحثون هذا المسار باستخدام 3,350 سؤالاً مختلفاً تغطي 234 نوعاً مختلفاً من الدرجات المالية، مستخرجة من 8اً00 شركة حقيقية في كل من الولايات المتحدة والصين على مدار 10 سنوات.
وعندما أجروا الوكلاء عبر مسار العقبات هذا، كانت النتائج مزيجاً من "ليس سيئاً" و"يا للهول". لقد كان الوكلاء جيدين بشكل مفاجئ في الخطوة الأولى: فهم القواعد. فقد استطاعوا تحديد الصيغ بشكل صحيح أكثر من 70% من الوقت، مما يظهر أنهم يفهمون حقاً ما تعنيه المصطلحات المالية. ومع ذلك، في اللحظة التي توجب عليهم فيها البحث عن البيانات، انهار كل شيء. فقد تراجعت الدقة بشكل حاد؛ حيث واجه الوكلاء صعوبة في العثد على الأرقام الصحيحة، وغالباً ما كانوا يلتقطون السنة الخطأ، أو الشركة الخطأ، أو يفقدون جزءاً حيوياً من المعلومات تماماً. وقد تبين أن خطوة "جمع البيانات" هذه هي أكبر عنق زجاجة، مما تسبب في أكبر انخفاض في الأداء.
حتى أذكى الوكلاء، الذين يمكنهم التخطيط للبحث واستخدام الأدوات بشكل أفضل من محرك بحث بسيط، لم يحصلوا على الإجابة النهائية الصحيحة إلا في حوالي 40% من الحالات. ووجد الباحثون أن الوكلاء كانوا سيئين بشكل خاص في المؤشرات "الاقتصادية الكلية" (مثل التضخم أو معدلات العمالة)، حيث تكون البيانات غير منظمة وتأتي من مصادر مختلفة، كما عانوا أكثر مع المؤشرات "الفنية" التي تتطلب حسابات معقدة ومتكررة. ومن المثير للاهتمام أن الوكلاء قدموا أداءً أفضل قليلاً في بيانات السوق الأمريكية مقارنة ببيانات السوق الصينية، مما يشير إلى أن الطريقة التي تُنظم وتُقدم بها البيانات في بلدان مختلفة تحدث فرقاً كبيراً.
الخلاصة هي أنه بينما يمتلك هؤلاء الوكلاء الذكاء الاصطناعي قدرة رائعة على معرفة النظرية المالية، إلا أنهم لا يزالون متعثرين في الممارسة الفعلية للبحث عن الحقائق وإجراء الحسابات دون ارتكاب أخطاء. وتشير الورقة البحثية إلى أنه إذا أردنا لهذه الوكلاء أن يكونوا مفيدين حقاً في العالم الحقيقي، فعلينا التوقف عن التركيز فقط على مدى براعتهم في الدردشة والبدء في إصلاح قدرتهم على إيجاد بيانات موثوقة ومعالجتها دون وقوع في الأخطاء. وحتى ذلك الحين، فهم يشبهون محققاً عبقرياً يعرف القانون تمام المعرفة، ولكنه يستمر في الضياع في طريقه إلى مسرح الجريمة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.