Capital Markets LLM Reliability Score (CM-LRS): From Plausible to Bankable
تقدم هذه الورقة البحثية "درجة موثوقية النماذج اللغوية الكبيرة في أسواق رأس المال" (CM-LRS)، وهو إطار تقييم مبتكر سباعي الأبعاد مصمم لتقييم مدى "قابلية الاعتماد المصرفي" لمخرجات النماذج اللغوية الكبيرة في تدفقات العمل المالية المنظمة، كاشفةً أنه بينما تتقارب النماذج الرائدة بشكل وثيق في الأداء العام، لا تزال هناك فجوات كبيرة في قدرات الاسترجاع والتركيب مقارنة بالنماذج الأساسية مفتوحة الأوزان.
تخيل أنك في مكتبة ضخمة حيث تم توظيف روبوت فائق الذكاء لكتابة تقارير لبنك. هذا الروبوت، وهو ذكاء اصطناعي (AI) يُعرف باسم "النموذج اللغوي الكبير" (LLM)، موهوب للغاية في الكتابة؛ إذ يمكنه أن يبدو كخبير متمرس، ويستخدم قواعد لغوية مثالية، ويروي قصة تتدفق بجمال. لكن هنا تكمن العقبة: في عالم التمويل عالي المخاطر، لا يكفي أن تبدو جيداً. فإذا اخترع الروبوت رقماً، أو نسي التحقق من مصادره، أو تخطى خطوة في عملية حسابية معقدة، فقد يكلف البنك الملايين أو يوقعه في مشاذا مع الجهات التنظيمية. السؤال الكبير ليس "هل يستطيع الروبوت كتابة جملة سلسة؟" بل "هل يستطيع الروبوت كتابة جملة يمكن لخبير بشري أن يثق بها في مسيرته المهنية؟" تغوص هذه الورقة في هذه المشكلة تحديداً، متجاوزة الاختبارات البسيطة لـ "هل حصل على الإجابة الصحيحة؟" إلى فحص أعمق بك much: "هل هذه الإجابة آمنة للاستخدام؟"
يقدم المؤلفون أداة جديدة تسمى CM-LRS (درجة موثوقية النماذج اللغوية الكبيرة في أسواق رأس المال). فكر في هذا كـ "مفتش سلامة" لتقارير الذكاء الاصطناعي. فبدلاً من مجرد إعطاء درجة نجاح أو رسوب، يفحص المفتش التقرير على سبعة مستويات مختلفة: هل القصة حقيقية؟ هل يمكنك الإشارة إلى الصفحة المحددة في المستند المصدر التي جاءت منها الحقيقة؟ هل الأرقام الحسابية متطابقة؟ هل أنهى الروبوت المهمة كاملة، أم تخطى خطوة ما؟ هل اخترع حقائق لملء الفجوات؟ هل التقرير مفيد فعلياً لاتخاذ قرار؟ وأخيراً، هل يمكن للبشر التحقق من عمل الروبوت بسهولة؟ اختبر الباحثون أربعة نماذج مختلفة من الذكاء الاصطناعي في خمس مهام مصرفية واقعية، مثل استخراج الأرقام من عقود السندات، وإيجاد صفقات سابقة مماثلة، وكتابة ملفات تعريف الشركات.
إليك ما وجدوه. أولاً، النماذج الثلاثة الأكثر تقدماً وتكلفة من "المصادر المغلقة" (من شركات مثل Anthropic وOpenAI) تعمل جميعها بمستوى عالٍ ومتقارب جداً من الموثوقية. إنها متقاربة جداً في الدرجات لدرجة أنه من الصعب القول بأن أحدها أفضل بوضوح من الآخرين في هذه المهام المحددة. ومع ذلك، هناك فجوة واضحة بين هذه النماذج رفيعة المستوى وبين نموذج واحد "مفتوح المصدر" (Llama 3.3 70B). فقد سجل النموذج مفتوح المصدر درجات أقل بكثير، خاصة في المهام التي تتطلب البحث في مستندات عديدة أو دمج المعلومات من مصادر مختلفة. لقد كان جيداً في المهام البسيطة مثل نسخ الأرقام من صفحة واحدة، لكنه عانى عندما تعين عليه البحث عن أدلة أو كتابة ملخص.
كان الاكتشاف الأكثر إثارة للدهشة يتعلق بجزء محدد من الدرجة يسمى "فائدة القرار" (Decision Usefulness). يقيس هذا الجزء ما إذا كان المصرفي البشري سيكون مستعداً بالفعل لاستخدام التقرير دون الحاجة إلى إعادة كتابة نصفه. وفي مهمة واحدة محددة (كتابة ملف تعريف شركة)، تباينت درجات هذا العامل الواحد بشكل كبير بين النماذج، مع فارق قدره 4 نقاط على مقياس من 5 نقاط. يشير هذا إلى أنه بينما يمكن للعديد من أنظمة الذكاء الاصطناعي الكتابة بطلاقة، فإن الأفضل منها فقط هي التي تستطيع إنتاج عمل "قابل للاعتماد المصرفي" (bankable) — أي أنه جاهز للاستخدام في العالم الحقيقي دون الحاجة إلى تدخل بشري لتصحيح الأخطاء. وتخلص الورقة إلى أنه بالنسبة للوظائف عالية المخاطر، لا ينبغي لنا فقط النظر إلى مدى جودة حديث الذكاء الاصطناعي؛ بل نحتاج إلى قائمة مراجعة صارمة مثل CM-LRS لضمان صحة الحسابات، وواقعية المصادر، وأن يكون العمل آمناً للثقة به.
ملخص تقني: درجة موثوقية النماذج اللغوية الكبيرة في أسواق رأس المال (CM-LRS)
بيان المشكلة تعتبر طرق تقييم النماذج اللغوية الكبيرة (LLM) الحالية في القطاع المالي غير كافية لسير العمل عالي المخاطر والمنظم في أسواق رأس المال. وبينما يمكن للنماذج الرائدة إنتاج مسودات سلسة ودقيقة ظاهرياً، فإن المعايكات الحالية (مثل MMLU وFinanceBench وFinQA) تقيم بشكل أساسي على مستوى أزواج (السؤال-الإجابة) أو على مستوى المكونات. وهي تفشل في تقييم "قابلية الاعتماد المصرفي" (bankability) لمخرجات سير العمل: أي قدرة المصرفي أو المحلل أو مسؤول الامتثال على الدفاع عن المخرج أمام طرف مقابل أو جهة تنظيمية. تشمل أوجه الفشل الحرجة التي لا تظهر في تسجيل درجات أزواج الأسئلة والأجوبة: الادعاءات التي تفتقر إلى تتبع المصدر، والتناقضات الرقمية في الأرقام المستمدة، وتخطي خطوات سير العمل، وإضافة محتوى غير مدعوم. تجادل الورقة بأن "الواقعية" (plausibility) رخيصة، ولكن "القابلية للاعتماد المصرفي" — وهي القدرة على التحقق من المخرج وتدقيقه والعمل بموجبه دون إعادة عمل رئيسية — هي المعيار الضروري للنشر.
المنهجية تقدم الورقة درجة موثوقية النماذج اللغوية الكبيرة في أسواق رأس المال (CM-LRS)، وهي مجموعة مقاييس مصممة لتقييم مخرجات النماذج اللغوية الكبيرة عند طبقة مخرجات سير العمل بدلاً من طبقة المهمة.
تصنيف سير العمل: يحدد المؤلفون تصنيفاً خماسياً لمهام أسواق رأس المال: الاستخراج، الاسترجاع، التوليف، المقارنة والاستنتاج، والمسودة. ويقوم هذا التصنيف بتوجيه وزن أبعاد التقييم لحالات استخدام محددة.
سبعة أبعاد للموثوقية: تقيم CM-LRS المخرجات عبر سبعة أبعاد، يتم تسجيل كل منها وفق مقياس ترتيبي من 0 إلى 5 مرتكز على إشارات عملية يستخدمها المراجعون المتخصصون:
D1 الدقة الواقعية: صحة الادعاءات الجوهرية مقابل المصادر.
D2 تتبع الأدلة: ربط الادعاءات بفقرات المصدر القابلة للتحقق.
D3 الاتساق الرقمي: صحة الأرقام المستخرجة والمحولة والمستمدة.
D4 اكتمال سير العمل: إتمام جميع خطوات المهمة المطلوبة دون حذف.
D5 الانضباط في المصدر: غياب الافتراضات غير المدعومة، أو التزييف، أو الحشو.
D6 جدوى القرار: المنفعة العملية لصانع قرار لاحق (مثل المصرفي).
D7 القابلية للمراجعة/التدقيق: القدرة للمراجع البشري على التحقق من الأصل وإعادة الإنتاج.
بروتوكول التسجيل:
النماذج التي تم تقييمها: تم اختبار أربعة نماذج: Claude Opus 4.7، وGPT-5.5، وClaude Sonnet 4.6، وLlama 3.3 70B Instruct.
المحكمون: للتحكم في التحيز الذاتي وتحيز العائلة، تم استخدام بروتوكول مكون من أربعة محكمين باستخدام ثلاث عائلات من النماذج: Sonnet 4.6 (داخل اللوحة)، وGPT-5.5 (داخل اللوحة)، وHaiku 4.5 (خارج اللوحة، نفس العائلة)، وGemini 2.5 Pro (خارج اللوحة، عائلة مختلفة).
مجموعات البيانات: تم بناء خمسة نماذج لسير العمل التجريبي باستخدام ملفات SEC EDGAR العامة، وبيان علاقات المستثمرين (IR) لعملية استحواذ بريطانية عامة، وملاحق اصطناعية على الطراز الإسكندنافي لضمان قابلية التكرار.
التجميع: الدرجة الإجمالية هي مجموع مرجح للأبعاد السبعة. يتم توفير الأوزان الافتراضية لكل فئة من فئات سير العمل، رغم أن الورقة تشير إلى إمكانية ضبط هذه الأوزان عبر طرق مثل AHP أو تحليل التفضيل المعلن.
النتائج الرئيسية أسفر التقييم عن ثلاث نتائج رئيسية فيما يتعلق بأداء النماذج وفائدة إطار عمل CM-LRS:
تقارب النماذج الرائدة: النماذج الثلاثة الرائدة مغلقة المصدر (Sonnet 4.6، Opus 4.7، GPT-5.5) متساوية إحصائياً من حيث موثوقية مخرجات سير العمل، حيث تتجمع ضمن نطاق 0.22 نقطة في متوسط المحكمين الأربعة لـ CM-LRS (Sonnet: 4.31، Opus: 4.30، GPT-5.5: 4.09). والترتيب بين هذه النماذج الثلاثة يعتمد على المحكم. في المقابل، سجل النموذج مفتوح الأوزان الأساسي (Llama 3.3 70B) درجة أقل بكثير بلغت 3.15، متأخراً عن تجمع النماذج الرائدة بنقطة واحدة تقريباً.
تركيز الفجوة: الفجوة في الأداء بين النماذج الرائدة مغلقة المصدر والنموذج مفتوح الأوزان ليست موحدة. فهي تتركز بشدة في مهام الاسترجاع (فجوة قدرها 2.23 نقطة) والتوليف (فجوة قدرها 2.15 نقطة). بينما تتقلص الفجوة بشكل كبير في مهام الاستخراج من وثيقة واحدة (فجوة قدرها 0.84 نقطة)، مما يشير إلى أن النماذج مفتوحة الأوزان تواجه صعوبة أكبر في التوليف متعدد الوثائق وعزو المصادر مقارنة باستخراج الحقول المهيكلة.
جدوى القرار (D6) كإشارة: أظهر بُعد جدوى القرار (D6) أكبر تشتت عبر النماذج (انتشار قدره 4.0 نقاط في سير عمل ملف تعريف المصدر) مع الحفاظ على أعلى مستويات الاتفاق بين المحكمين (متوسط معامل ارتباط بيرسون r=0.52). هذا المزيج يجعل D6 أوضح إشارة على مستوى البُعد للجاهزية للإنتاج؛ فهو يميز بفعالية المخرجات التي سيتخذ المراجع إجراءً بشأنها عن تلك التي تتطلب إعادة عمل رئيسية.
الأهمية والادعاءات تضع الورقة CM-LRS ليس كبديل لمعايكات الأسئلة والأجوبة، بل كمكمل ضروري لـ الجاهزية للنشر في البيئات المنظمة. وتكمن أهميتها في:
تشغيل "القابلية للاعتماد المصرفي": إنها تنقل التركيز التقييمي من "هل يمكن للنموذج الإجابة على سؤال؟" إلى "هل يمكن لبشر الدفاع عن هذا المخرج؟".
المواءمة مع الحوكمة: تم تصميم الإطار ليتكامل مع معايير حوكمة الذكاء الاصطناعي الناشئة، وتحديداً إطار عمل NIST لإدارة مخاطر الذكاء الاصطناعي (كأداة قياس/إدارة) وقانون الذكاء الاصطناعي في الاتحاد الأوروبي (كدليل على تقييم المطابقة للأنظمة عالية المخاطر).
توجيهات النشر العملية: تشير النتائج إلى أنه بالنسبة لسير عمل أسواق رأس المال عالية المخاطر، يجب أن يكون الاختيار بين النماذج الرائدة مغلقة المصدر مدفوعاً بالتكلفة، وزمن الاستجابة، وملاءمة فئة سير العمل، بدلاً من مقايسات الموثوقية العامة، حيث أن درجات CM-LHS الخاصة بها متكافئة فعلياً. وعلى العكس من ذلك، فإن الفجوة الكبيرة للنماذج مفتوحة الأوزر في التوليف والاسترجاع تشير إلى ضرورة توخي الحذر عند نشرها في مهام معقدة متعددة الوثائق دون ضوابط إضافية.
مبدأ "التنبؤ، الحساب، القرار": يعزز الإطار المبدأ التشغيلي الذي مفاده أن النماذج اللغوية الكبيرة يجب أن تُستخدم لتحليل النوايا والتنسيق، بينما يجب التعامل مع الحسابات الرقمية بواسطة كود حتمي، والقرارات النهائية بواسطة البشر. وتعمل CM-LRS كمقياس للتحقق من الالتزام بهذا المبدأ.
تخلص الورقة إلى أن CM-LRS يوفر مقياساً قابلاً للدفاع، وقابلاً للتتبع، ومتوافقاً مع المراجعين لتقييم مخرجات النماذج اللغوية الكبيرة قبل النشر، مما يعالج فجوة حرجة في التقييم المالي الحالي. وقد تم إصدار جميع جداول القياس، والمطالبات (prompts)، والبيانات علناً لدعم التوسع والنقد.