WorkstreamBench: Evaluating LLM Agents on End-to-End Spreadsheet Tasks in Finance
تقدم هذه الورقة البحثية WorkstreamBench، وهو معيار مرجعي جديد لتقييم وكلاء النماذج اللغوية الكبيرة (LLMs) في مهام الجداول البيانات المالية من البداية إلى النهاية باستخدام تصنيف متعدد الأبعاد يشمل الدقة، والصيغة، والتنسيق، مما يكشف أنه بينما تنتج النماذج الرائدة مثل Claude مخرجات ذات مظهر احترافي، إلا أن الوكلاء الحاليين لا يزالون يعانون من أجل التعامل بموثوقية مع التعقيد ومعايير الجودة المطلوبة لتدفقات العمل المالية في العالم الحقيقي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك توظف مساعداً جديداً لبناء نموذج مالي معقد لشركتك. أنت لا تريد منه مجرد حل مسألة رياضية واحدة؛ بل تريد منه بناء جدول بيانات احترافي كامل من الصفر لتتمكن من تسليمه لمديرك، ومستثمريك، ومدققيك.
هذه الورقة البحثية، WorkstreamBench، هي في الأساس بمثابة "امتحان نهائي" لوكلاء الذكاء الاصطناعي (البرامج الحاسوبية الذكية) لترى ما إذا كان بإمكانهم حقاً القيام بتلك الوظيفة.
إليك تفصيل ما قام به المؤلفون، باستخدام تشبيهات بسيطة:
1. المشكلة: "قطعة الليغو" مقابل "القلعة"
كانت الاختبارات السابقة للذكاء الاصطناعي تشبه طلب وضع "قطعة ليغو فوق قطعة أخرى" أو "البحث عن القطعة الحمراء". هذه مهام بسيطة ومعزولة (مثل الإجابة على سؤال أو تغيير رقم واحد).
لكن في عالم التمويل الحقيقي، لا يقوم المحترفون بمجرد تحريك قطعة واحدة؛ بل يبنون قلاعاً كاملة. إنهم يحتاجون إلى جدول بيانات:
- يربط بين ثلاثة تقارير مختلفة (قائمة الدخل، الميزانية العمومية، والتدفق النقدي) بحيث إذا قمت بتغيير رقم واحد، يتم تحديث كل شيء تلقائياً.
- يتعامل مع سيناريوهات "ماذا لو" (على سبيل المثال: "ماذا لو انخفضت المبيعات بنسبة 10%؟").
- يبدو احترافياً، وسهل القراءة، وسهل التعديل من قبل البشر لاحقاً.
أدرك المؤلفون أن الاختبارات الموجودة كانت سهلة للغاية. لم تكن تختبر ما إذا كان بإمكان الذكاء الاصطناعي بناء "القلعة بأكملها"، بل كانت تختبر فقط ما إذا كان بإمكانه وضع بضع قطع من الليغو.
2. الحل: "صالة ألعاب رياضية" جديدة للذكاء الاصطناعي
أنشأ المؤلفون WorkstreamBench، وهي ساحة اختبار جديدة مليئة بالتحديات المالية الواقعية المستمدة من المسابقات المهنية والدورات التدريبية.
بدلاً من مجرد التحقق مما إذا كان الرقم النهائي صحيحاً (مثل معلم الرياضيات الذي يراجع نموذج الإجابة)، أنشأوا معيار تقييم ثلاثي الأجزاء للحكم على جودة عمل الذكاء الاصطناعي، بشكل يشبه مراجعة مدير بشري لتقرير ما:
- الدقة (الرياضيات): هل الرقم النهائي صحيح؟ هل قام الذكاء الاصطناعي بالفعل بتحليل السيناريو المطلوب؟
- الصيغة (المنطق): هل "المحرك" الموجود تحت الغطاء مبني بشكل جيد؟
- تشبيه: تخيل سيارة. الباني السيئ قد يلصق أجزاء المحرك معاً باستخدام الغراء القوي (أرقام ثابتة/Hardcoded). إذا احتجت لتغيير المحرك لاحقاً، فستضطر لتفكيك السيارة بالكامل. أما الباني الجيد فيستخدم البراغي والمسامير (صيغ ديناميكية) بحيث يسهل إصلاح السيارة وتطويرها. الذكاء الاصطناعي مطالب باستخدام البراغي، لا الغراء.
- كما يتحققون مما إذا كان المنطق قابلاً للقراءة. الصيغة الضخمة والمربكة تشبه كرة الخيوط المتشابكة؛ أما الصيغة التي تسير خطوة بخطوة فهي تشبه دليل تعليمات واضح.
- التنسيق (العرض): هل يبدو العمل احترافياً؟
- هل الأرقام محاذية لبعضها؟ هل الأرقام السالبة موضوعة بين قوسين (وهو معيار مالي) بدلاً من علامة الناقص؟ هل الخط متناسق؟ إذا بدا جدول البيانات فوضوياً، فقد يرفضه المدير البشري حتى لو كانت الرياضيات صحيحة.
3. الاختبار: من خضع للامتحان؟
اختبر المؤلفون العديد من أذكى وكلاء الذكاء الاصطناعي المتاحين اليوم، بما في ذلك نسخ من Claude وChatGPT وGemini وغيرها. بعضها كانت نسخ "ويب" (تدردش عبر المتصفح) وبعضها نسخ "إكسل" (إضافات تعيش داخل برنامج الجداول الحسابية).
4. النتائج: التقرير "الصادق"
كانت النتائج مزيجاً من "الواعد" و"غير جاهز للاستخدام الفعلي".
- القائد: أدى وكيل Claude Web أفضل أداء. لقد بنى جداول بيانات أكثر احترافية وسهولة في القراءة والتعديل من قبل البشر.
- الفجوة: حتى أفضل ذكاء اصطناعي سجل حوالي 69 من 100.
- المعاناة: مع زيادة صعوبة المهام (التي تتطلب سلاسل طويلة من الحسابات)، انخفض أداء الذكاء الاصطناعي بشكل حاد.
- تشبيه: الأمر يشبه طالباً يمكنه حل مسألة جمع بسيطة ببراعة، ولكنه يرتبك ويرتكب أخطاء عندما يُطلب منه حل مسألة جبرية لفظية معقدة.
- الأخطاء الشائعة:
- تثبيت الأرقام (Hardcoding): بدلاً من كتابة صيغة تحسب رقماً ما، يقوم الذكاء الاصطناعي أحياناً بكتابة الرقم مباشرة. هذا يشبه كتابة "100" على شيك بدلاً من كتابة "100" في المربع وترك البنك يحسبها. إذا تغير المدخل، تصبح إجابة الذكاء الاصطناعي خاطئة.
- التنسيق الفوضوي: غالباً ما ينسى الذكاء الاصطناعي محاذاة الأرقام أو يستخدم ألواناً خاطئة، مما يجعل جدول البيانات يبدو غير احترافي.
- الاستسلام: في المهام الصعبة جداً، قد تترك بعض نماذج الذكاء الاصطناعي أقساماً كاملة من جدول البيانات فارغة أو تقوم ببساطة بتأليف أرقام من عندها.
5. الحكم النهائي
تخلص الورقة البحثية إلى أنه بينما أصبح وكلاء الذكاء الاصطناعي جيدين في المهام البسيطة، إلا أنهم ليسوا جاهزين بعد لبناء نماذج مالية احترافية بمفردهم بشكل موثوق.
إنهم يشبهون متدرباً موهوباً جداً يمكنه إجراء الحسابات، لكنه لا يزال بحاجة إلى مشرف بشري للتحقق من التنسيق، وإصلاح الأخطاء المنطقية، وضمان أن المنتج النهائي هو شيء يمكن للعميل الوثوق به فعلياً. التكنولوجيا موجودة، لكنها تحتاج إلى مزيد من العمل قبل أن تتمكن من استبدال المحلل المالي البشري.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.