← أحدث الأبحاث
💬 NLP

LEXam: Benchmarking Legal Reasoning on 340 Law Exams

تقدم هذه الورقة LEXam، وهو معيار مرجعي شامل يتكون من 7,537 سؤالاً من 340 امتحاناً قانونياً عبر 116 مساقاً، لتقييم وإثبات القيود الحالية للنماذج اللغوية الكبيرة في أداء الاستدلال القانوني متعدد الخطوات والمنظم من خلال إطار عمل مُعتمد يعتمد على النموذج اللغوي الكبير كحَكَم (LLM-as-a-Judge).

المؤلفون الأصليون: Yu Fan, Jingwei Ni, Jakob Merane, Yang Tian, Yoan Hermstrüwer, Yinya Huang, Mubashara Akhtar, Etienne Salimbeni, Florian Geering, Oliver Dreyer, Daniel Brunner, Markus Leippold, Mrinmaya Sachan, Alexa
نُشر 2026-04-03
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yu Fan, Jingwei Ni, Jakob Merane, Yang Tian, Yoan Hermstrüwer, Yinya Huang, Mubashara Akhtar, Etienne Salimbeni, Florian Geering, Oliver Dreyer, Daniel Brunner, Markus Leippold, Mrinmaya Sachan, Alexander Stremitzer, Christoph Engel, Elliott Ash, Joel Niklaus

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت فائق الذكاء كيف يصبح محامياً. لا يمكنك ببساطة أن تطلب منه استرجاع القوانين كأنه قاموس؛ بل يجب أن تختبر ما إذا كان بإمكانه حقاً "التفكير" كالمحامي، عبر رصد المشكلات الخفية، وتطبيق القواعد على مواقف واقعية معقدة، وصياغة حججه خطوة بخطوة.

هذا هو بالضبط جوهر ورقة البحث LEXAM. إنها "امتحان نهائي" ضخم وجديد للذكاء الاصطناعي (AI) ليرى ما إذا كان قادراً حقاً على التعامل مع الاستنتاج القانوني.

إليك تفاصيل هذا البحث، مشروحة ببعض التشبيهات من الحياة اليومية:

1. المشكلة: الذكاء الاصطناعي بارع في الرياضيات، لكنه ضعيف في القانون

فكر في نماذج الذكاء الاصطناعي الحالية (مثل تلك التي تدردش معها) كأنها عباقرة في الرياضيات. فهي مذهلة في حل مسائل الفيزياء أو الألغاز الرياضية حيث توجد إجابة واحدة صحيحة وواضحة (مثل 2+2=42+2=4).

لكن القانون ليس رياضيات. القانون يشبه إلى حد كبير المسرح الارتجالي. إنه معقد، ويعتمد على السياق، وغالباً لا توجد فيه إجابة واحدة "صحيحة"، بل توجد "أفضل" حجة. الاختبارات السابقة للذكاء الاصطناعي كانت تشبه طلب حل مسألة فيزياء من عبقري رياضيات—كانت بسيطة للغاية ولم تختبر قدرة الذكاء الاصطناعي على التعامل مع الفروق الدقيقة في قاعة محكمة حقيقية أو عقد معقد.

2. الحل: LEXAM (أصعب امتحان في كلية الحقوق على الإطلاق)

ابتكر الباحثون LEXAM، وهو في الأساس مجموعة ضخمة تضم 340 امتحاناً قانونياً حقيقياً من جامعة زيورخ.

  • النطاق: يحتوي على أكثر من 7,500 سؤال.
  • التنوع: يتضمن نوعين من الأسئلة:
    1. الأسئلة متعددة الخيارات (MCQs): مثل الاختبارات القياسية، ولكن مع لمسة مختلفة. لقد أضافوا الكثير من الإجابات الخاطئة (المشتتات) لدرجة أنها تشبه محاولة العثور على إبرة في كومة من الإبر الأخرى.
    2. المقالات ذات النهايات المفتوحة: وهذا هو الاختبار الحقيقي. يجب على الذكاء الاصطناعي كتابة حجة قانونية طويلة ومنظمة، تماماً كما يفعل طالب الحقوق.

التشبيه: تخيل إعطاء طالب اختباراً متعدد الخيارات حيث يتعين عليه اختيار الإجابة الصحيحة من بين 32 خياراً (بدلاً من 4 المعتادة). ثم تطلب منه كتابة مقال من 5 صفحات ليشرح لماذا اختار تلك الإجابة، مع الاستشهاد بقوانين محددة. هذا هو LEXAM.

3. اللمسة الذكية: كيف تقوم بتقييم الذكاء الاصطناعي؟

هذا هو الجزء الأكثر ذكاءً في الورقة البحثية. كيف تقيم مقال روبوت؟

  • الطريقة القديمة: قد تستخدم برنامج كمبيوتر للتحقق مما إذا كان الروبوت قد استخدم نفس الكلمات الموجودة في نموذج الإجابة لدى المعلم. لكن في القانون، يمكنك قول الشيء نفسه بكلمات مختلفة تماماً وتظل مصيباً. أو يمكنك استخدام الكلمات الصحيحة ولكن ارتكاب خطأ منطقي.
  • الطريقة الجديدة ("لجنة من القضاة"): لم يكتفِ الباحثون باستخدام ذكاء اصطناعي واحد لتقييم الإجابات. بل أنشأوا لجنة من ثلاثة نماذج مختلفة من الذكاء الاصطناعي (مزيج من النماذج مفتوحة المصدر والنماذج التجارية الكبرى) لتعمل كقضاة.
    • قاموا بتدريب هؤلاء "القضاة الآليين" ليفكروا كأساتذة القانون.
    • تحققوا مما إذا كان "القضاة الآليون" يتفقون مع أساتذة القانون البشر.
    • النتيجة: اتفقت لجنة الذكاء الاصطناعي مع الأساتذة البشر بشكل شبه مثالي! وهذا يعني أنه يمكننا الآن استخدام الذكاء الاصطناعي لتقييم الذكاء الاصطناعي في الاستنتاج القانوني بشكل موثوق، مما يوفر آلاف الساعات من وقت التصحيح البشري.

4. ماذا وجدوا؟ (التقرير المدرسي)

عندما وضعوا أفضل نماذج الذكاء الاصطناعي تحت اختبار LEXAM، كانت النتائج مزيجاً من "واو" و"يا للهول".

  • الأخبار الجيدة: النماذج "الاستنتاجية" الأذكى (تلك المصممة للتفكير خطوة بخطوة) أبلت بلاءً حسناً في الأسئلة متعددة الخيارات. إنها تتحسن في رصد الإجابة الصحيحة.
  • الأخبار السيئة:
    • معاناة "المقال الطويل": عندما طُلب منها كتابة حجة قانونية منظمة، واجهت حتى أفضل نماذج الذكاء الاصطناعي صعوبة. غالباً ما كانت تغفل عن أهم قضية قانونية أو تطبق القانون الخاطئ.
    • فخ "المشتتات": كلما زادت صعوبة الأسئلة متعددة الخيارات (بزيادة عدد الإجابات الخاطئة)، انهار أداء الذكاء الاصطناعي. يبدو أن النماذج كانت تخمن بناءً على الأنماط بدلاً من الفهم الحقيقي للقانون.
    • التحيز اللغوي: أظهرت النماذج أداءً أفضل بكثير باللغة الإنجليزية مقارنة بالألمانية، مما يوضح أنها لا تزال منحازة للغة التي تدربت عليها بشكل أكبر.

5. لماذا يهم هذا؟

اعتبر LEXAM بمثابة اختبار جهد لمستقبل الذكاء الاصطناعي القانوني.

إذا تركنا محامي الذكاء الاصطناعي ينطلقون في العالم الحقيقي دون اختبارهم في هذه الامتحانات الصعبة، فقد يقدمون نصائح سيئة تضر أشخاصاً حقيقيين. تقول هذه الورقة: "مهلاً، قبل أن نثق في ذكاء اصطناعي لصياغة عقد أو الترافع في قضية، نحتاج للتأكد من قدرته على اجتياز امتحان كلية الحقوق".

باخت مختصر:
LEXAM هو امتحان قانوني ضخم وصعب يثبت أن الذكاء الاصطناعي الحالي لا يزال "مبتدئاً" عندما يتعلق الأمر بالاستنتاج القانوني المعقد. إنه ذكي بما يكفي لاجتياز اختبار سريع، لكنه لا يزال بحاجة إلى الكثير من الدراسة قبل أن يمكن الوثوق به للمرافعة في المحكمة. كما صمم الباحثون "آلة تقييم بالذكاء الاصطناعي" فائقة الدقة لمساعدتنا في اختبار النماذج المستقبلية بشكل أسرع وأفضل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →