Evaluating Semantic and Syntactic Understanding in Large Language Models for Payroll Systems
تقيم هذه الورقة قدرة نماذج اللغات الكبيرة المختلفة على معالجة مخططات وحسابات الرواتب المعقدة بدقة، مما يوفر إطارًا لتحديد متى يكون التوجيه النصي كافيًا مقابل متى تكون الأدوات الحسابية الصريحة ضرورية لضمان الدقة في الحالات عالية المخاطر.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
معضلة "الشاعر البارع في الرياضيات": هل يمكن للذكاء الاصطناعي أن يتولى راتبك؟
تخيل أنك وظفت شاعراً عبقرياً عالمياً ليكون محاسب شركتك. هذا الشاعر يمكنه كتابة سونيتات رائعة عن قانون الضرائب، وتلخيص دليل مكون من 500 صفحة في ثوانٍ، وشرح مفهوم الراتب بشكل أفضل من أي شخص آخر على وجه الأرض.
لكن هناك عقبة: الشاعر هو "شخص لغوي"، وليس "شخصاً رقمياً". هو يفهم معنى كلمة "استقطاع"، ولكن عندما يتعلق الأمر بطرح 42.57 دولاراً من 1,200.00 دولار، قد يتشتت انتباهه بجمال الأرقام ويمنحك بالخطأ 1,157.43 دولاراً.
هذا هو جوهر المشكلة التي يبحثها هذا البحث العلمي.
التجربة: اختبار الضغط على كشوف المرتبات
أراد الباحثون معرفة ما إذا كانت أشهر نماذج الذكاء الاصطنا في العالم (مثل GPT وClaude وGemini) يمكنها التعامل مع مهمة عالية المخاطر: حساب الرواتب.
حساب الرووات هو "اختبار الضغط" الأمثل للذكاء الاصطناعي لأنه لا يقتصر فقط على الرياضيات البسيطة؛ بل يتعلق بالمنطق والقواعد. إنه يشبه مسار عقبات معقد:
- عقبة الدلالة (المعنى): هل يفهم الذكاء الاصطناعي أن "اشتراك التقاعد قبل الضريبة 401k" يعني طرح هذا المبلغ قبل حساب الضرائب؟
- عقبة القاعدة: هل يعرف أنه إذا ربح شخص ما مبلغاً كبيراً جداً، فإن ضريبة الضمان الاجتماعي "تصل إلى حدها الأقصى" وتتوقف عن الزيادة؟
- عقبة الدقة: في حساب الرواتب، الخطأ بمقدار سنت واحد يُعد فشلاً. هل يمكن للذكاء الاصطناعي أن يكون "دقيقاً حتى السنت"؟
"مستويات الصعوبة"
أنشأ الباحثون خمسة مستويات من الصعوبة، تتراوح من عملية بسيطة مثل "اضرب عدد الساعات في معدل الأجر" إلى "كابوس بمستوى الزعيم" يتضمن عملات مختلفة، وضرائب ولايات متعددة، ومكافآت معقدة.
لاختبارهم، استخدموا أساليب "تعليمات" (مطالبات) مختلفة:
- المستوى 1 (المدير الكسول): "إليك جدول بيانات. أخبرني بصافي الراتب."
- المستوى 4 (المدير المجهري/المتدخل): "إليك جدول البيانات، وإليك الصيغة الرياضية الدقيقة لكل خطوة. اتبعها بدقة."
النتائج: ماذا تعلمنا؟
1. بالنسبة للأشياء السهلة، الذكاء الاصطناعي نجم خارق.
إذا كنت تحتاج فقط لحساب الأجور بالساعة بشكل أساسي، فإن الذكاء الاصطناعي مثالي تقريباً. الأمر يشبه أن تطلب من الشاعر عدّ التفاح؛ يمكنه القيام بذلك بسهولة.
2. بالنسبة للأشياء المعقدة، "الكلام" وحده لا يكفي.
عندما أصبحت القواعد فوضوية (مثل حساب الضرائب عبر دولتين مختلفتين)، بدأ الذكاء الاصطناعي في التعثر. كان يفهم فكرة الضريبة، لكنه كان يتعثر في الحسابات.
3. نهج "المدير المجهري" هو الأفضل.
وجدت الدراسة أنه إذا أعطيت الذكما الاصطناعي تعليمات غامضة، فإنه غالباً ما يفشل. ولكن إذا تصرفت كمدير مجهري وقدمت له الصيغ الرياضية الدقيقة (المستوى 4)، فإن الدقة ترتفع بشكل هائل. وكان نموذج Perplexity هو الوحال الذي حقق نتائج "مثالية" في الفئة الأصعب عند إعطائه هذه الصيغ الدقيقة.
4. لغز "Claude".
من المثير للاهتمام أن أحد أفضل النماذج (Claude) أصبح أسوأ فعلياً عند إعطائه المزيد من التعليمات. الأمر يشبه إعطاء الشاعر الكثير من القواعد؛ حيث يصاب بالارتباك ويبدأ في ارتكاب الأخطاء.
الخلاصة (ما الفائدة من ذلك؟)
إذا كنت صاحب عمل تفكر في استخدام الذكاء الاصطناعي لإدارة رواتب موظفيك، فإن هذا البحث يقدم لك تحذيراً واضحاً للغاية:
لا تطلب من الذكاء الاصطناعي فقط أن "يقوم بالحسابات".
إذا كنت تريد استخدام الذكاء الاصطناعي في أعمال دقيقة وعالية المخاطر، فلا يمكنك معاملته كموظف بشري يمكنك فقط إعطاؤه أمراً شفهياً. يجب أن تعامله كآلة حاسبة تمتلك عقلاً. يجب عليك تزويده بوصفات رياضية صريحة وخطوة بخطوة.
الخلاصة: الذكاء الاصطناعي هو راوٍ قصص بارع، ولكن إذا كنت تريده أن يكون محاسباً، فعليك تزويده بالرياضيات، وإلا سيبدأ في "الهلوسة" برصيدك البنكي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.