Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks
تقدم هذه الورقة Magis-Bench، وهو معيار مرجعي جديد مستمد من الاختبارات القضائية البرازيلية يقيم 23 نموذجاً من النماذج اللغوية الكبيرة المتطورة في مهام الاستدلال القانوني والكتابة على مستوى القضاة، كاشفاً أن حتى النماذج الأعلى أداءً تواجه صعوبة في تحقيق درجات عالية في صياغة القرارات القضائية المسببة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل مسابقة طبخ عالية المخاطر. عادةً، عندما نختبر الذكاء الاصطناعي، نطلب منه أن "يطهو" طبقاً (أي يكتب حجة قانونية أو عقداً). ولكن في نظام قانوني حقيقي، المهمة الأكثر أهمية ليست مجرد الطهي؛ بل هي أن تكون "القاضي" الذي يتذوق الطبق، ويقرر ما إذا كان جيداً أم لا، ويشرح سبب نجاحه أو فشله.
هذه الورقة البحثية، Magis-Bench، تدور حول اختبار الذكاء الاصطناعي في دور "القاضي" هذا.
المشكلة: هل يمكن للذكاء الاصطناعي أن يكون قاضياً؟
معظم اختبارات الذكاء الاصطنا في مجال القانون تطلب من الكمبيوتر أن يكون محامياً: "اكتب دفاعاً لهذا الموكل". لكن القاضي الحقيقي يتعين عليه القيام بشيء أصعب: الاستماع إلى كلا الطرفين، وتجاهل مشاعره الخاصة، وتطبيق قواعد صارمة، وكتابة قرار نهائي يصمد أمام التدقيق.
أراد المؤلفون معرفة: هل يمكن لنماذج الذكاء الاصطناعي الحالية أن تعمل كقاضٍ حقيقي؟
الاختبار: امتحان "المغستراتي" (Magistrate)
لاختبار ذلك، لم يبتكر الباحثون أسئلة وهمية. بل استخرجوا 74 سؤالاً حقيقياً من امتحانات برازيلية تنافسية للغاية تُستخدم لتوظيف قضاة حقيقيين بين عامي 2023 و2025.
فكر في هذه الامتحانات كأنها "امتحان النقابة" للقضاة. وهي تشمل:
- أسئلة مقالية: "إليك موقفاً قانونياً معقداً؛ اشرح القانون."
- مهام الصياغة: "إليك الوقائع؛ اكتب الحكم القضائي الرسمي الكامل (القرار النهائي)."
ومن الأهمية بمكان أن كل سؤال جاء مع نموذج إجابة رسمي (مقياس تقييم). هذا يشبه ورقة التصحيح الخاصة بالمعلم التي تحدد بالضبط عدد النقاط التي تحصل عليها مقابل ذكر قانون معين أو اتباع هيكل محدد.
المنهجية: الذكاء الاصطناعي ضد الذكاء الاصطناني
بما أن توظيف 23 قاضياً بشرياً لتصحيح 74 مقالاً لـ 23 نموذجاً مختلفاً من الذكاء الاصطناعي سيكون مكلفاً وبطيئاً للغاية، فقد استخدم الباحثون حيلة ذكية: لقد جعلوا الذكاء الاصطناعي يُقيّم الذكاء الاصطناعي.
- المتسابقون: اختاروا 23 نموذجاً من أذكى نماذج الذكاء الاصطناعي المتاحة (من شركات مثل Google وOpenAI وAnthropic وغيرها).
- القضاة: استخدموا أربعة نماذج أخرى قوية جداً من الذكاء الاصطناعي للقيام بدور المصححين.
- القواعد: كانت نماذج "الذكاء الاصطناعي القاضية" معزولة عن معرفة هوية من كتب الإجابات. لقد نظرت فقط إلى السؤال، ونموذج الإجابة الرسمي، واستجابة الذكال الاصطناعي، ثم أعطتها درجة من 0 إلى 10.
النتائج: "القضاة" من الذكاء الاصطناعي اتفقوا
إليك ما حدث:
- القضاة انسجموا معاً: اتفقت نماذج الذكاء الاصطناعي الأربعة مع بعضها البعض بشكل شبه مثالي (نسبة اتفاق 98.4%). هذا يشبه وجود أربعة نقاد طعام يتفقون تماماً على أي مطعم هو الأفضل. وقد منح هذا الباحثين الثقة بأن الدرجات كانت عادلة وليست عشوائية.
- الفائزون: كانت أفضل الأداء هي Gemini-3-Pro-Preview من Google (بدرجة: 6.97/10)، يليه Gemini-3-Flash و Claude-4.5-Opus.
- اختبار الواقع: حتى "الفائز" حصل فقط على 6.97 من 10. وهذا أقل من 70%.
ماذا يعني هذا؟
تخلص الورقة البحثية إلى أنه بينما يتحسن الذكاء الاصطناعي في المهام القانونية، فإن العمل كقاضٍ لا يزال أمراً صعباً للغاية بالنسبة لهم.
- الفجوة: نماذج الذكاء الاصطناعي الحالية تشبه الطلاب الذين يمكنهم تسميع الكتاب المدرسي ولكنهم يكافحون لتطبيق القواعد على موقف حقيقي ومعقد ببراعة وسلطة القاضي البشري.
- المعيار المرجعي: أصدر الباحثون جميع الأسئلة، والإجابات، وكود التصحيح حتى يتمكن علماء آخرون من الاستمرار في اختبار وتحسين هذه النماذج.
باختصار: لقد طلبنا من الذكاء الاصطناعي خوض امتحان قاضٍ حقيقي. أذكى النماذج نجحت بدرجة "C" أو "B"، مما يثبت أنه بينما يزدادون ذكاءً، إلا أنهم ليسوا مستعدين بعد لاستبدال القضاة البشر في قاعات المحاكم.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.