FinanceHarness: Autonomous Financial Deep Research Framework
تقدم الورقة البحثية FinanceHarness، وهو إطار عمل مستقل للبحث المالي العميق والمتكامل من البداية إلى النهاية يدمج أدوات متخصصة وسير عمل بتوجيه من الممارسين، إلى جانب FinanceGym، وهو معيار صارم يظهر فجوات أداء كبيرة في النماذج الحالية وتحسينات ملموسة من خلال النظام المقترح.
المؤلفون الأصليون:Yijia Xiao, Rujun Han, Yanfei Chen, Zifeng Wang, Ke Jiang, Zhongying CuiZhu, Vishy Tirumalashetty, Wei Wang, Burak Gokturk, Tomas Pfister, Chen-Yu Lee
تخيل أنك محقق يحاول حل لغز ما، ولكن هناك قاعدة صارمة: لا يمكنك استخدام سوى الأدلة التي كانت موجودة قبل وقوع الجريمة. لا يمكنك التلصص على تقرير الشرطة المكتوب في اليوم التالي، وبالتأكيد لا يمكنك قراءة مقال الصحيفة عن المحاكمة التي لم تبدأ بعد. هذا هو عالم البحث المالي العميق. إنه مجال يحاول فيه الذكاء الاصطناي (AI) أن يعمل كمحلل أسهم بشري، حيث ينقب في جبال من البيانات لمعرفة ما إذا كانت الشركة استثماراً جيداً. وللقيام بذلك بشكل جيد، يحتاج الذكاء الاصطناعي إلى شيئين: مكتبة ضخمة من الأخبار والتقارات الماضية ("الأدلة")، وطريقة للتفكير نقدياً فيما قد يحدث لاحقاً دون الغش عبر النظر إلى نموذج الإجابة.
لفترة طويلة، كان الذكاء الاصطناعي بارعاً في كتابة التقارير العامة، مثل تلخيص حبكة فيلم أو شرح كيفية عمل بركان. لكن التمويل وحش من نوع مختلف. الأمر لا يتعلق فقط بإيجاد الحقائق؛ بل يتعلق بربط النقاط بين أرباح شركة ما، ومنتج جديد لمنافس، وتغيير في السياسة الحكومية للتنبؤ بالمستقبل. المشكلة هي أن معظم أدوات الذكاء الاصطناعي تشبه الطلاب الذين يغشون بالنظر إلى إجابات الاختبار قبل إنهاء الامتحان. فهي "تسرب" المعلومات المستقبلية عن غير قصد، مما يجعلها تبدو أذكى مما هي عليه في الواقع. ولإصلاح ذلك، احتاج العلماء إلى طريقة لاختبار الذكاء الاصطناعي في ألغاز مالية حيث يكون "المستقبل" مغلقاً بدقة، مما يجبر الذكاء الاصطناعي على الاعتماد على مهارات التفكير الخاصة به بدلاً من التخمين المحظوظ.
هنا يأتي مشروع جديد يسمى FinanceHarness، ومعه ساحة تدريبه FinanceGym. فكر في FinanceGym كlevel في لعبة فيديو عالية المخاطر مصممة خصيصاً لاختبار الذكاء الاصطناعي المالي. لقد بنى المبتكرون مكتبة ضخمة مضادة للسفر عبر الزمن تحتوي على ملايين المقالات، ولكن مع لمسة سحرية: لكل سؤال يُطرح، تغلق المكتبة الباب أمام أي مقال نُشر بعد تاريخ معين. إذا حاول الذكاء الاصطناعي التلصص على تقرير من الشهر القادم، يظل الباب مغلقاً. هذا يضمن أنه عندما يقدم الذكاء الاصطناعي تنبؤاً، فإنه يستخدم عقله بالفعل، وليس مجرد نسخ حقيقة مستقبلية.
ثم بنى الباحثون FinanceHarness، وهو يشبه مجموعة أدوات متخصصة ومدرباً للذكاء الاصطناعي. فبدلاً من ترك الذكاء الاصطناعي يتجول في الإنترنت فحسب، يمنحه هذا الـ "harness" (السرج/الإطار) طريقة منظمة للعمل. فهو يجبر الذكاء الاصطناعي على جمع الأدلة، والتحقق من مصادره، وكتابة تقرير يستشهد بدقة بالمكان الذي وجد فيه معلوماته. إنه يشبه إعطاء محقق عدسة مكبرة، ودفتر ملاحظات، وقاعدة صارمة تقول: "يجب أن تثبت كل ادعاء تقدمه".
عندما اختبروا أذكى نماذج الذكاء الاصطناعي المتاحة على هذه اللعبة الجديدة والصعبة، كانت النتائج مفاجئة. فحتى أنظمة الذكاء الاصطناعي الأكثر تقدماً، والتي عادة ما تتفوق في اختبارات المعرفة العامة، عانت بشدة. في الواقع، لم تنجح أفضل النماذج إلا في حوالي 40% من الأسئلة. وهذا يشير إلى أنه بينما يتحسن الذكاء الاصطناعي في القراءة، فإنه لا يزال يجد صعوبة بالغة في التصرف كمحلل مالي خبير يمكنه النظر في البيانات الماضية والتنبؤ بثقة بما سيحدث لاحقاً. تُظهر الورقة البحثية أن امتلاك "دماغ أكبر" (نموذج ذكاء اصطناعي أكبر) ليس كافياً؛ بل يحتاج الذكاء الاصطناعي إلى الأدوات الصحيحة وبيئة صارمة ليتعلم كيف يفكر كالمحترفين.
وجد الفريق أن نظامهم الجديد، FinanceHarness، ساعد نموذج ذكاء اصطناعي قياسي مفتوح المصدر على القفز من 25.3% إلى 32.4%. ورغم أن هذا قد يبدو رقماً صغيراً، إلا أنه في عالم التحليل المالي المتخصص، يعد خطوة كبيرة للأمام. إنه يثبت أنه من خلال منح الذكاء الاصطناعي "السرج" (harness) المناسب — وهو مزيج من الأدوات المتخصصة، والقيود الزمنية الصارمة، والتوجيه الخبير — يمكننا البدء في بناء آلات لا تكتفي بمجرد قراءة الأخبار، بل تفهم بالفعل القصة المعقدة لعالم المال. وتخلص الورقة إلى أنه لا تزال هناك مساحة كبيرة للتحسين، حيث إن حتى الأنظمة الأفضل بعيدة تماماً عن المثالية، لكن هذا الإطار الجديد يعطينا طريقة واضحة وعادلة لقياس مدى التقدم الحقيقي الذي نحرزه.
ملخص تقني: FinanceHarness: إطار عمل للبحث المالي العميق المستقل
1. بيان المشكلة
بينما أصبحت وكلاء "البحث العميق" المدعومة بالنماذج اللغوية الكبيرة (LLMs) واسعة الانتشار لتوليد تقارير عامة، إلا أنها غير كافية لـ البحث المالي العميق. يتطلب التحليل المالي قدرات متخصلة تتجاوز البحث العام، بما في ذلك:
المعرفة المتخصصة: تحليل الأرباح التاريخية، وديناميكيات المنافسين، والاتجاهات الاقتصادية الكلية للتنبؤ بالأحداث المستقبلية.
القيود الزمنية: غالبًا ما يتضمن التفكير المالي الاحترافي "التنبؤ لما بعد تاريخ الانقطاع" (توقع النتائج بعد تاريخ محدد)، مما يتطلب إطار تقييم قائم على نقطة زمنية محددة (PIT) لمنع تسرب المعلومات المستقبلية إلى عملية البحث.
فجوات التقييم: تركز الاختبارات المرجعية الحالية إما على مهام معالجة اللغات الطبيعية المعزولة (مثل تحليل المشاعر، أو استعلام الملفات) أو البحث العميق العام الذي يفتقر إلى المعايير الصارمة والمقيدة زمنياً والمثبتة من قبل الخبراء اللازمة لقياس جودة التقارير المالية الشاملة.
2. المنهجية
يقدم البحث منظومة كاملة تضم بيئة بحث تجريبية (sandbox)، واختباراً مرجعياً، وإطار عمل للتنفيذ.
أ. بيئة البحث المالي بنقطة زمنية محددة (PIT)
لضمان النزاهة الزمنية، أنشأ المؤلفون مستودعاً ضخماً للبيانات عبر الويب (أكثر من 100 مليون مقال) مع استخراج تواريخ النشر بشكل موثوق.
البنية التحتية: يتم تضمين المقالات باستخدام Qwen3-Embedding-4B وتخزينها في فهرس FAISS.
التحكم في الوصول: يفرض خادم البحث عقداً صارماً حيث لا يمكن للوكلاء استرداد المستندات إلا إذا كانت تواريخ نشرها ≤ تاريخ الانقطاع المحدد لاستعلام معين. هذا يمنع تسرب المعلومات المستقبلية أثناء مرحلة البحث.
ب. FinanceGym: الاختبار المرجعي
إن FinanceGym هو اختبار مرجعي واسع النطاق ومثبت من قبل الخبراء، مبني فوق بيئة الـ PIT.
الإنشاء:
رسم بياني للكيانات: تم استخراج رسم بياني لكيانات التمويل من المستودع، واستخراج 4.37 مليون حافة (علاقات بين الكيانات، والأحداث، والقطاعات).
تنقيب المواقف: يتم توليد أسئلة بحثية عن طريق تنقيب "المواقف" (مثل الروابط عبر الفئات، السرديات الزمنية، والتناقضات مثل عمليات الترقية مقابل التخفيض) بدلاً من التجميع العنقودي الواسع.
اختيار تاريخ الانقطاع: يتم اختيار تواريخ الانقطاع بناءً على حجم الأحداث، وتنوع الكيانات، وإنتروبيا العلاقات لضمان سيناريوهات بحث عالية الجودة وغير بديهية.
التوليد غير المقيد: يقوم نموذج لغوي كبير بتوليد أسئلة بأسلوب المحللين، وأطروحات استثمارية، ومعايير تقييم ثنائية المستويات دون توجيه مسبق للفئة.
تصميم معايير التقييم:
معايير ما قبل الانقطاع: تختبر استرداد وتوليف الحقائق المتاحة قبل تاريخ الانقطاع.
معايير ما بعد الانقطاع: تختبر قدرة الوكيل على توقع النتائج التي لا يمكن التحقق منها إلا بعد تاريخ الانقطاع.
التحقق: تم تصفية مجموعة فرعية مكونة من 500 سؤال عبر برنامج خطي متكامل (ILP) لتحقيق التوازن عبر المواضيع والقطاعات وأنواع الاستدلال. قام خبراء خارجيون متخصصون بتدوين هذه الأسئلة، مما أدى إلى اختبار مرجعي نهائي مكون من 400 سؤال عالي الجودة مع 2,464 بنداً من معايير التقييم (بمعدل قبول من الخبراء بلغ 82%).
ج. FinanceHarness: إطار عمل التنفيذ
إن FinanceHarness هو إطار عمل للوكلاء موجه بالمعرفة الخبيرة، مصمم لتشغيل وتحسين الوكلاء داخل بيئة الـ PIT.
التصميم الطبقي:
طبقة النموذج: تستضيف العمود الفقري للمنسق (مثل Qwen3.6-27B) وقارئ خفيف الوزن.
طبقة وقت التشغيل: مستوى تحكم يدير حلقة الوكيل، والتحقق من المخطط (schema validation)، وإرسال الأدوات، وسياسات الاسترداد.
سطح الأدوات: واجهة متعددة المستويات تشمل البحث الأساسي، والأدوات المالية المؤجلة (التقييم، تحليل المخاطر)، ووصلات التوسعة.
الأنماط: يدعم أنماط البحث (القائم على الويب أولاً)، والتحليل (البيانات/الحسابات)، والأنماط التلقائية.
التدريب والتحسين: يسمح إطار العمل بالتحسين من البداية إلى النهاية. يعمل نفس "قاضي المعايير" المستخدم في التقييم كإشارة مكافأة لتدريب تحسين السياسة النسبي الجماعي (GRPO)، مما يضمن تعلم النموذج لتوزيع استخدام الأدوات المحدد ومتطلبات الاستشهاد في المجال المالي.
3. المساهمات الرئيسية
اختبار FinanceGym المرجعي: اختبار مرجعي قابل لإعادة الإنتاج، ومقيد بنقطة زمنية محددة (PIT)، يتكون من 400 سؤال مدون من قبل خبراء، يفصل بين استرداد الأدلة (ما قبل الانقطاع) وتوقع النتائج (ما بعد الانقطاع).
إطار عمل FinanceHarness: إطار عمل موجه بالخبرة يعمل على أتمتة بناء البيئة، وتنفيذ الوكيل، ونمذجة المكافآت تحت عقد زمني صارم.
تقييم شامل: تقييم 17 نظاماً رائعاً (بما في ذلك النماذج ذات الأوزان المفتوحة المضبوطة بدقة، وأنظمة البحث الوكيلية، والنماذج اللغوية الكبيرة المملوكة لشركات) يوضح أن الوكلاء الحاليين يعانون بشكل كبير في مجال البحث المالي العميق.
4. النتائج
قام المؤلفون بتقييم 17 نموذجاً أساسياً وFinanceHarness على FinanceGym. وتشمل النتائج الرئيسية ما يلي:
أداء عام منخفض: حتى النماذج اللغوية الكبيرة الرائدة والوكلاء المتخصصين سجلوا أقل من 40% في المعايير الإجمالية.
أفضل النماذج المملوكة: Claude-Opus-4.7 (34.1%)، Gemini-3.1-Pro (33.2%).
أفضل النماذج ذات الأوزان المفتوحة: FinanceHarness (32.4%) باستخدام عمود فقري 27B.
فجوة ما قبل/ما بعد الانقطاع: توجد فجوة أداء مستمرة عبر جميع الأنظمة. درجات ما قبل الانقطاع (الاسترداد/التوليف) أعلى بكثير (مثلاً ~45%) من درجات ما بعد الانقطاع (التنبؤ/التوقع، مثلاً ~12%)، مما يشير إلى أن الاسترداد وحده لا يحل مشكلة البحث المالي العميق.
فعالية إطار العمل:
باستخدام نفس العمود الفقري Qwen3.6-27B ، تفوق تكوين FinanceHarness (32.4%) بشكل كبير على النموذج الذي يعتمد على البحث فقط (25.3%) وعلى الإطار البدائي (29.6%).
أضاف تدريب GRPO الإضافي على مجموعة منفصلة منسقة بشرياً 0.4 نقطة فقط (32.8%)، مما يشير إلى أن هيكل إطار العمل نفسه هو الذي يوفر القيمة الأساسية.
الكفاءة: حقق FinanceHarness أداءً منافساً للنماذج ذات الأوزان المفتية الأكبر بكثير ويقترب من حدود النماذج المملوكة، رغم استخدامه لعمود فقري بـ 27 مليار معلمة.
5. الأهمية والادعاءات
يزعم البحث أن البحث المالي العميق لا يُحل بمجرد تعزيز الاسترداد وحده. إن الفجوة المستمرة بين أداء ما قبل الانقطاع وما بعد الانقطاع تسلط الضوء على أن الصعوبة الجوهرية تكمن في تحويل الأدلة التاريخية إلى أحكام استشرافية.
تكمن أهمية هذا العمل في:
وضع معيار قياسي: توفير أول اختبار مرجعي قابل للتوسع، وقابل لإعادة الإنتاج، ومقيد زمنياً للبحث المالي العميق، مما يعالج مشكلات التسرب في الاختبارات السابقة.
التحقق من نهج إطار العمل: إثبات أن إطار العمل الموجه بالخبرة، والذي يربط استخدام الأدوات، وقيود البيئة، ونمذجة المكافأة، ضروري لأتمتة التحليل المالي المعقد.
تحديد التحدي: إظهار أن الوكلاء الأكثر تقدماً حالياً يفشلون في تلبية المعايير المهنية للتقارير المالية، مما يترك مجالاً واسعاً للبحث المستقبلي في الاستدلال المالي الوكيل (agentic financial reasoning).
يخلص المؤلفون إلى أن التقييم، واستخدام الأدوات، والتحسين يجب أن يتشاركوا في نفس البيئة المتحكم بها زمنياً للنهوض بالمجال بشكل فعال.