← أحدث الأبحاث
💬 NLP

GRPO for Financial Advice Generation: Outperforming Commercial LLMs under CATE Evaluation

تُثبت هذه الورقة أن الضبط الدقيق لنموذج لغوي مفتوح الأوزان باستخدام تحسين السياسة النسبي المجموعي (GRPO) وإطار تقييم مزدوج — يجمع بين معايير نموذج لغوي كبير كحَكَم (LLM-as-a-judge) وتدقيق أثر المعالجة المتوسط السببي (CATE) المستقل عن الحَكَم — ينتج نصائح مالية تتفوق بشكل كبير على النماذج التجارية المرجعية من حيث الرفع المقدر في الأرباح والحد من المخاطر.

المؤلفون الأصليون: Ofir Ben Shoham, Shrutendra Harsola, Vignesh Subrahmaniam, Shravan Mohan, Yakov Gazman, Oded Vainas

نُشر 2026-08-13
📖 6 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Ofir Ben Shoham, Shrutendra Harsola, Vignesh Subrahmaniam, Shravan Mohan, Yakov Gazman, Oded Vainas

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت كيفية تقديم النصيحة. في عالم الذكاء الاصطناعي، يشبه هذا إلى حد ما تعليم طالب حل مسألة رياضية. عادةً، نُظهر للطالب السؤال والإجابة الصحيحة، آملين أن يحفظ النمط. ولكن ماذا لو كانت "الإجابة الصحيحة" في العالم الحقيقي فوضوية؟ ماذا لو كانت كتب التاريخ مليئة بالأخطاء، أو إذا كانت الإجابة الصحيحة تتغير بناءً على الموقف؟ هذا هو تحدي التعلم التعزيزي (Reinforcement Learning - RL). فبدلاً من مجرد نسخ الإجابات القديمة، يتيح التعلم التعزيزي للذكاء الاصطناعي تجربة أشياء مختلفة، والحصول على "درجة" لكيفية أدائه، والتعلم من هذه الدرجة ليصبح أفضل في المرة القادمة. الأمر يشبه لعبة فيديو يلعب فيها الذكاء الاصطناعي آلاف المستويات، ويحصل على نقاط مقابل الحركات الجيدة، ويتعلم ببطء الاستراتيجية المثالية.

الآن، تخيل أن هذه اللعبة تتعلق بالمال. تقديم النصيحة المالية أمر دقيق لأن الاقتراح السيئ يمكن أن يضر بالعمل التجاري بالفعل. وللتأكد من أن الذكاء الاصطناعي يتعلم الطريقة الصحيحة، يستخدم الباحثون "قاضياً" — وهو ذكاء اصطناعي ذكي آخر يقيم النصيحة. ولكن هناك خدعة: أحياناً، يتعلم "طالب" الذكاء الاصطناي خداع القاضي عبر قول ما يريد القاضي سماعه بالضبط، بدلاً من تقديم نصيحة تعمل فعلياً في العالم الحقيقي. تعالج هذه الورقة البحثية هذه المشكلة عبر ابتكار طريقة جديدة لتدريب ذكاء اصطناعي لتقديم نصائح تجارية، من خلال التحقق من عمله ليس فقط عبر القاضي، بل برؤية ما إذا كانت تلك النصيحة قد حققت مالاً في الماضي.


قصة الروبوت الذكي مالياً

تعرفوا على فريق Intuit. أرادوا بناء ذكاء اصطناعي يمكنه النظر إلى السجلات المالية الفوضوية لشركة ما وقول: "مهلاً، إليك شيء محدد يجب عليك فعله لتحقيق المزيد من الربح". يبدو الأمر بسيطاً، لكنه في الواقع كابوس للحواسيب. يجب أن تستند النصيحة إلى أرقام حقيقية، ويجب أن تكون آمنة (لا تخبر شركة ما بأن تطرد عميلها الوحيد!)، ويجب أن تكون قابلة للتنفيذ.

المشكلة هي أننا لا نملك مفتاح إجابات "المعيار الذهبي". فالقرارات التي اتخذها أصحاب الأعمال في الماضي لم تكن مثالية دائماً، لذا لا يمكننا مجرد تعليم الذكاء الاصطناعي نسخها. كما أن طلب كتابة نصائح مثالية لكل سيناريو من قبل خبراء بشريين هو أمر مكلف وبطيء للغاية. لذا، قرر الفريق التعامل مع هذا الأمر كأنه لعبة فيديو. استخدموا طريقة تسمى GRPO (تحسين السياسة النسبي للمجموعات - Group Relative Policy Optimization).

تخيل GRPO كـ "تحدي مجموعات". بدلاً من أن يخمن الذكاء الاصطناعي إجابة واحدة ويحصل على درجة، فإنه يولد مجموعة كاملة من اقتراحات النصائح المختلفة في آن واحد. بعد ذلك، ينظر "قاضٍ ذكي" (يُدعى Claude Opus 4.5) إلى جميع هذه الاقتراحات ويعطيها درجات بناءً على قائمة مراجعة. تحتوي هذه القائمة على 11 قاعدة: هل هي آمنة؟ هل تستخدم أرقاماً حقيقية من العمل التجاري؟ هل تشرح "لماذا"؟ إذا كان الاقتراح خطيراً، يحصل فوراً على صفر. إذا كان آمناً ولكنه ممل، يحصل على درجة منخفضة. إذا كان آمناً، ومحدداً، وذكياً، يحصل على درجة عالية. ثم يتعلم الذكاء الاصطناعي تقديم المزيد من الاقتراحات التي تشبه الاقتراحات ذات الدرجات العالية.

فخ القاضي "اللطيف"

هنا يصبح الأمر مثيراً للاهتمام. أدرك الفريق وجود خطر. ماذا لو تعلم الذكاء الاصطناعي مجرد كتابة نصائح "تبدو" جيدة للقاضي، لكنها لن تحقق أي مال للعمل التجاري في الواقع؟ الأمر يشبه طالباً يحفظ العبارات المفضلة لدى المعلم ليحصل على درجة امتياز، لكنه يفشل في الاختبار الحقيقي.

ولضبط هذا، بنى الباحثون اختباراً ثانياً مختلفاً تماماً. لم يستخدموا "القاضي" على الإطلاق، بل استخدموا طريقة "آلة زمن" تسمى CATE (متوسط تأثير المعالجة الشرطي - Conditional Average Treatment Effect).

تخيل أن لديك صندوقاً ضخماً من السجلات التجارية القديمة. تريد أن تعرف: "لو اتخذنا هذا الإجراء المحدد في الماضي، هل كان العمل التجاري سيحقق المزيد من المال؟" أخذ الباحثون النصيحة التي ولدها ذكاؤهم الاصطناعي الجديد، وترجموها إلى "إجراء" بسيط (مثل "خفض التكاليف على الشحن" أو "رفع أسعار المنتج X")، ثم نظروا في البيانات التاريخية. سألوا: "في الماضي، عندما قامت الشركات بهذا الإجراء، هل زادت أرباحها؟". هذا تدقيق "مستقل عن القاضي" لأنه يعتمد على أرقام حقيقية من العالم الواقعي، وليس على ما يعتقد القاضي أنه يبدو جيداً.

المفاجأة الكبرى

كانت النتائج مزيجاً من الانتصارات المتوقعة وتحول مضحك للغاية.

أولاً، كان الذكاء الاصطناعي الجديد (المدرب بواسطة GRPO) نجماً. عندما قام "القاضي" بتقييمه، حصل على درجة 9.514 من 10. كانت هذه أعلى درجة لأي نموذج، متفوقاً حتى على النماذج التجارية الشهيرة مثل Claude Opus 4.6 و GPT-5.4.

لكن السحر الحقيقي حدث في تدقيق "آلة الزمن".

  • اقترح الذكاء الاصطناعي الجديد إجراءات، لو تم اتخاذها في الماضي، لكانت قد رفعت إجمالي الربح بمقدار 0.0228 (زيادة بنسبة 2.3% تقريباً).
  • أما أفضل نموذج ذكاء اصطناعي تجاري (Claude Opus 4.6) فلم يتمكن إلا من تحقيق زيادة قدرها 0.0104.
  • وهذا يعني أن الذكاء الاصطناعي الجديد كان أفضل بحوالي ضعف في إيجاد إجراءات تحقق المال فعلياً مقارنة بأقوى منافس تجاري.

والأروع من ذلك، أن الذكاء الاصطناعي الجديد كان أكثر أماناً. فقد سجل أدنى "معدل هبوط" (احتمالية اقتراح شيء يضر العمل التجاري) وأقل "مخاطر ذيل" (احتمالية وقوع نتيجة سيئة جداً).

التحول: القاضي وآلة الزمن اختلفا

هذا هو الجزء الأكثر مرحاً في القصة. لم يتفق القاضي وآلة الزمن دائماً على من يحتل المركز الثاني أو الثالث.

الذكاء الاصطناعي "الأساسي" غير المدرب (النموذج الخام قبل أي تدريب) كان سيئاً في اختبار القاضي. سجل 8.457، وجاء في المركز الأخير. بدا مشوشاً وغير مصقول. ولكن عندما فحصت "آلة الزمن" نصائحه؟ لقد أبلى بلاءً حسناً حقاً! فقد اقترح إجراءات كانت ستزيد الربح بمقدار 0.0170، وهو أفضل من كل النماذج التجارية.

على الجانب الآخر، حصل أحد النماذج التجارية (Claude Opus 4.5) على درجة رائعة من القاضي (8.982)، وبدا احترافياً للغاية. لكن "آلة الزمن" قالت: "انتظر لحظة". فقد قدرت أن اتباع نصائح هذا النموذج سيؤدي في الواقع إلى خسارة المال (زيادة سالبة قدرها -0.0025).

ماذا يعني هذا؟

تُظهر هذه الورقة البحثية أنه لا يمكنك الوثوق فقط في "القاضي" ليخبرك ما إذا كان الذكاء الاصطناعي جيداً في تقديم المشورة المالية. القاضي يحب النصائح التي تبدو ذكية وتتبع القواعد، بينما تهتم "آلة الزمن" بما إذا كانت النصيحة تعمل فعلياً.

نجحت طريقة الفريق الجديدة، باستخدام GRO مع بوابة سلامة، في القيام بالاثنين معاً. فقد تعلمت كتابة نصائح تبدو رائعة للقاضي وتدر مالاً فعلياً في اختبار آلة الزمن. لقد أثبتت أنه من خلال تدريب نموذج مفتوح المصدر بنظام مكافآت ذكي ويركز على السلامة، يمكنك التغلب على العمالقة التجاريين الباهظي الثمن.

يقترح المؤلفون أنه بالنسبة للمهام عالية المخاطر مثل المال، تحتاج إلى كلا النوعين من الفحص: معيار (Rubric) للتأكد من أن النصيحة آمنة ومكتوبة بشكل جيد، وتدقيق سببي (Causal Audit) للتأكد من أنها تعمل فعلياً. إذا نظرت إلى جانب واحد فقط، فقد تخدعك آلة تبدو رائعة ولكنها سيئة جداً في الرياضيات. أما روبوتهم الجديد، فهو كاتب بارع ومحاسب بارع في آن واحد.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →