RealFin: How Well Do LLMs Reason About Finance When Users Leave Things Unsaid?
تقدم الورقة البحثية REALFIN، وهو معيار تقييم ثنائي اللغة يقيم التفكير المالي من خلال إزالة المقدمات الجوهرية من الأسئلة، مما يكشف أن النماذج اللغوية الكبيرة العامة والمتخصصة في التمويل تعاني في التعرف على المعلومات المفقودة وغالباً ما تفرط في الالتزام بإجابات غير مبررة.
البحث الأصلي مُهدى إلى الملك العام بموجب CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك توظف مستشاراً مالياً. ستسأله سؤالاً مثل: "هل يجب أن أشتري هذه السندات؟". المستشار الموثوق حقاً لن يكتفي بتخمين الإجابة فحسب؛ بل سيتأكد أولاً مما إذا كنت قد زودته بالمعلومات الكافية. إذا نسيت أن تذكر له مدى تحملك للمخاطر أو معدل التضخم الحالي، فإن المستشار الجيد سيقول: "لا يمكنني الإجابة على ذلك بعد؛ أحتاج إلى مزيد من التفاصيل".
هذه الورقة البحثية، RealFin، هي بمثابة "اختبار فخ" صارم مصمم لمعرفة ما إذا كانت المستشارين الماليين من الذكاء الاصطناعي (نماذج اللغات الكبيرة) يمتلكون نفس هذا الحذر.
إليك تفصيل لما فعله الباحثون وما وجدوه، باستخدام تشبيهات بسيطة:
1. الفخ: وصفة "المكون المفقود"
معظم اختبارات الذكاء الاصطناعي تشبه الطبخ بوصفة مثالية: "اخلط كوبين من الدقيق، بيضة واحدة، واخبز لمدة 30 دقيقة". يقوم الذكاء الاصطناعي فقط باتباع الخطوات ويقول: "كعكة!".
لقد غير فريق RealFin قواعد اللعبة. لقد أخذوا أسئلة من امتحانات مالية حقيقية وحذفوا منها سراً مكوناً رئيسياً (مثل درجة الحرارة أو نوع الدقيق) مع إبقاء الجملة تبدو طبيعية.
- الطريقة القديمة: يرى الذكاء الاصطناعي خطوة مفقودة لكنه يحاول التخمين على أي حال، قائلاً: "سأفترض أنها 350 درجة!" ثم يعطي إجابة واثقة.
- طريقة RealFin: يجب على الذكاء الاصطناعي أن يدرك: "مهلاً، لا يمكنني خبز هذه الكعكة دون معرفة درجة الحرارة. أحتاج إلى طلب هذه المعلومة".
2. التجربة: من وقع في الفخ؟
اختبر الباحثون 15 نموذجاً مختلفاً من الذكاء الاصطناعي، تتراوح بين نماذج "ذكية" عامة إلى نماذج "خبيرة متخصصة في التمويل". وقد أعطوهم ثلاثة أنواع من التحديات:
- الوصفة الكاملة: أسئلة تحتوي على جميع المعلومات (الاختبار السهل).
- المكون المفقود: أسئلة بها فجوة مخفية (الفخ).
- اختبار "لا شيء مما سبق": أسئلة حيث لا توجد أي إجابة صحيحة لأن المعلومات ناقصة.
النتائج:
- "العامّيون" المفرطون في الثقة: النماذج الكبيرة ذات الأغراض العامة (مثل تلك التي تدردش معها يومياً) كانت الأسوأ في الاعتراف بأنها لا تعرف. لقد تصرفوا كطالب يخمن الإجابة في الاختبار لمجرد الحصول على درجات، حتى عندما يكون السؤال مستحيلاً للحل. كانوا يقولون بثقة: "الإجابة هي ب!" حتى عندما كان السؤال معيباً.
- إخفاقات "المتخصصين": للمفارقة، كانت النماذج المدربة خصيصاً على بيانات مالية غالباً ما تكون أسوأ في اكتشاف المعلومات المفقودة. نظرًا لأنها حفظت الكثير من المصطلحات المالية، فقد كانت تُحفَّز فوراً بكلمات مثل "ضريبة" أو "تدقيق" وتبدأ في الحساب مباشرة، متجاهلة حقيقة أن السؤال غير مكتمل. الأمر يشبه ميكانيكياً يسمع "صوت محرك" فيبدأ فوراً في إصلاح المكبر دون التحقق مما إذا كانت السيارة تحتوي على محرك أصلاً.
- أبطال "الاستنتاج": أدت بعض النماذج الأحدث المصممة لـ "التفكير خطوة بخوة" (النماذج المعززة بالاستنتاج) أداءً أفضل. فقد كانت أكثر عرضة للتوقف، والنظر في القطعة المفقودة، والقول: "لا يمكنني الإجابة على هذا". ومع ذلك، حتى هذه النماذج كانت أحياناً تصبح متحمسة جداً وتبدأ في التخمين على أي حال.
3. التواء اللغة: الإنجليزية مقابل الصينية
وجدت الورقة البحثية فرقاً طريفاً بين اللغات:
- في الإنجليزية: عندما كانت كلمة رئيسية مفقودة، غالباً ما تبدو الجملة "غريبة" أو غير مكتملة، لذا كان من المرجح أن يلاحظ الذكاء الاصطناعي وجود خطأ ما.
- في الصينية: اللغة مرنة للغاية. يمكنك إزالة شرط حاسم، وتظل الجملة تبدو طبيعية وصحيحة نحوياً. لقد تم خداع الذكاء الاصطناعي بسهولة ليعتقد أن السؤال سليم، مما أدى به إلى التخمين بشكل عشوائي. إنه يشبه جملة تبدو كقصة كاملة، لكن الشخصية الرئيسية مفقودة.
4. الخلاصة الكبرى
تخلص الورقة إلى أن كونك ذكياً في الإجابة على الأسئلة ليس كافياً.
في العالم المالي الحقيقي، الخطأ الأكثر خطورة ليس ارتكاب خطأ في الحسابات؛ بل هو الإجابة على سؤال لا ينبغي الإجابة عليه بعد.
- نماذج الذكاء الاصطناعي الحالية تشبه سائقاً واثقاً ولكنه متهور، يسرع عبر الإشارة الحمراء لأنه يعتقد أنه يستطيع تجاوزها.
- نماذج الذكاء الاصطناعي الموثوقة يجب أن تكون مثل السائق الحذر الذي يتوقف عند الإشارة الحمراء، حتى لو لم يكن أحد يراقبه، لأنه يعرف القواعد.
يجادل المؤلفون بأنه لكي يكون الذكاء الاصطناعي آمناً في التمويل، يجب أن يتعلم مهارة "قول لا". يجب أن يعرف متى يتوقف عن الاستنتاج ويسأل: "مهلاً، لقد نسيت أن تخبرني بشيء مهم".
باختصار: تظهر الورقة أن نماذج الذكاء الاصطناعي الحالية تسعى جاهدة لإرضاء المستخدم. سوف تخمن إجابة حتى عندما يكون السؤال معيباً. لكي تكون موثوقة حقاً، يجب أن تتعلم أن الإجابة الصحيحة أحياناً هي "ليس لدي معلومات كافية".
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.