UA-Legal-Bench: A Benchmark for Evaluating Large Language Models on Ukrainian Legal Reasoning
تقدم هذه الورقة البحثية UA-Legal-Bench، وهو معيار مرجعي شامل يتكون من خمس مهام مستمدة من السجل الموحد الضخم لقرارات المحاكم في أوكرانيا لتقييم نماذج اللغات الكبيرة في الاستدلال القانوني الأوكراني، مما يكشف عن رؤى نقدية حول تأثيرات التعلم بلقطات قليلة (few-shot) المعتمدة على المهمة، ومزالق الدقة في البيانات غير المتوازنة، وسلوكيات التوسع المتفاوتة عبر عائلات النماذج المختلفة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مكتبة ضخمة من الكتب القانونية، لكنها مكتوبة بلغة (الأوكرانية) لا يتحدثها معظم الروبوتات الذكية في العالم بطلاقة بعد. معظم الاختبارات التي نستخدمها للتحقق مما إذا كانت هذه الروبوتات "ذكية" مكتوبة باللغة الإنجليزية. الأمر يشبه اختبار قدرة طاهٍ على إعداد الطعام الإيطالي عبر إعطائه اختباراً فقط حول كيفية صنع السوشي؛ قد يفوتك حقيقة أنه لا يستطيع تقطيع البصل، أو أنه يرتبك من التوابل الخاصة بالمنطقة.
تقدم هذه الورقة البحثية UA-Legal-Bench، وهو "اختبار رخصة قيادة" جديد مصمم خصيصاً لروبوتات الذكاء الاصطناعي لإثبات قدرتها على فهم القانون الأوكراني.
إليك تفصيل لما قام به الباحثون وما وجدوه، باستخدام تشبيهات بسيطة:
1. تجربة القيادة (المعيار المرجعي)
قام الباحثون ببناء اختبار باستخدام 99.5 مليون قرار قضائي حقيقي من أوكرانيا. واختاروا عينة صغيرة يمكن التحكم فيها مكونة من 2,000 قضية لإنشاء خمسة تحديات مختلفة، تتراوح من السهل إلى الصعب جداً:
- اختبار "ما هذا؟" (نوع القضية): هل يستطيع الذكاء الاصطناعي تحديد ما إذا كانت الوثيقة تتعلق بنزاع مدني، أو جريمة، أو صفقة تجارية، أو مسألة إدارية؟ (مثل فرز البريد في صناديق مختلفة).
- اختبار "ما نوع هذه الورقة؟" (شكل الحكم): هل يستطيع الذكاء الاصطناعي التمييز بين الحكم النهائي، أو القرار المؤقت، أو القرار الإداري؟ (مثل التمييز بين "الامتحان النهائي" و"الاختبار المفاجئ" حتى لو بدا كلاهما متشابهاً).
- اختبار "ماذا حدث؟" (نتيجة القضية): هذا هو الأصعب. يقرأ الذكاء الاصطناعي وقائع قضية ما (مع إخفاء الإجابة) وعليه أن يخمن ما إذا كان الشخص قد فاز، أو خسر، أو أُدين. هذا يتطلب تفكيراً حقيقياً، وليس مجرد مطابقة الأنماط.
- اختبار "ابحث عن القاعدة" (استخراج المعايير): هل يمكن للذكاء الاصطناعي العثور على القوانين المحددة المستشهد بها في النص؟ (مثل العثور على الصفحة المحددة في كتاب القواعد داخل دليل تعليمات فوضوي).
- اختبار "عن ماذا يتحدث هذا؟" (فئة السبب): هل يمكن للذكاء الاصطناعي تصنيف القضية ضمن 22 موضوعاً واسعاً مثل "السرقة"، أو "الأسرة"، أو "العقود"؟
2. المتسابقون (نماذج الذكاء الاصطناعي)
قاموا باختبار 11 نموذجاً مختلفاً من نماذج الذكاء الاصطناعي (تتراوح من النماذج الصغيرة والفعالة إلى الضخمة وفائقة الذكاء) من خمس عائلات مختلفة (مثل Mistral وLlama وQwen). وقد أجرو هذه الاختبارات بطريقتين:
- التعلم من الصفر (Zero-Shot): يحصل الذكاء الاصطناعي على السؤال دون أي مساعدة.
- التعلم من أمثلة قليلة (Few-Shot): يحصل الذكاء الاصطناعي على السؤال بالإضافة إلى بعض الأمثلة لكيفية الإجابة على أسئلة مماثلة أولاً (مثل إعطاء طالب اختباراً تجريبياً قبل الاختبار الحقيقي).
3. النتائج المفاجئة
"السؤال الخادع" للدقة
وجدت الورقة البحثية فخاً رئيسياً: الدقة يمكن أن تكون كاذبة.
- التشبيه: تخيل اختبار اختيار من متعدد حيث تكون 60% من الإجابات هي "أ". الروبوت الذي يخمن "أ" في كل مرة سيحصل على 6ما يعادل 60% من الإجابات الصحيحة. يبدو هذا جيداً! ولكنه في الواقع غبي لأنه لم يقرأ الأسئلة.
- النتيجة: حصل أحد نماذج الذكاء الاصطناعي الكبيرة على أعلى "دقة" في المهمة الأصعب، لكنه كان في الغالب يخمن النتيجة الأكثر شيوعاً. عندما استخدم الباحثون مقياساً أكثر ذكاءً (Macro-F1) يتحقق مما إذا كان الذكاء الاصطناعي قد أصاب الإجابات النادرة أيضاً، بدا ذلك الروبوت سيئاً للغاية. الروبوت "الأفضل حقاً" سجل درجة أقل في الدقة الخام، لكنه في الواقع فهم القضايا.
"ورقة الغش السحرية" (التعلم من أمثلة قليلة)
كان إعطاء أمثلة للذكاء الاصطناعي قبل الاختبار يعمل بشكل رائع لبعض المهام ولكن ليس للآخرين.
- التشبيه: بالنسبة لاختبار "ما نوع هذه الورقة؟"، كان عرض بعض الأمثلة للذكاء الاصطناعي بمثابة تسليمه ورقة غش. قفز أحد النماذج الصغيرة من درجة الرسوب إلى الامتياز بمجرد رؤية بضعة أمثلة.
- التحول: بالنسبة لاختبار "ماذا حدث؟" (الاستنتاج)، لم تساعد ورقة الغش كثيراً. بل إنها أربكت الذكاء الاصطناعي في بعض الأحيان. وهذا يثبت أنه لا يمكنك افتراض أن "المزيد من الأمثلة = نتائج أفضل" لكل مهمة قانونية.
الحجم لا يهم دائماً
عادةً ما تكون نماذج الذكاء الاصطناي الأكبر هي الأكثر ذكاءً. لكن ليس هنا.
- التشبيه: فكر في سيارة سباق صغيرة ورشيقة مقابل شاحنة ضخمة. على طريق سريع مستقيم (مهام بسيطة مثل فرز البريد)، كانت السيارة الصغيرة سريعة تماماً مثل الشاحنة. ولكن في مسار وعر ومعقد، احتاجت الشاحنة لأن تكون ضخمة للتعامل معه.
- النتيجة: كان نموذج صغير بـ 8 مليارات معلمة (parameter) جيداً بقدر نموذج ضخم بـ 675 مليار معلمة في المهام البسيطة. ومع ذلك، في مهام الاستنتاج الصعبة، فازت النماذج الأكبر عموماً—ولكن فقط إذا كانت من "العائلة" الصحيحة للذكاء الاصطناعي. بعض العائلات احتاجت لأن تكون ضخمة لتعمل، بينما كانت عائلات أخرى ذكية حتى وهي صغيرة.
4. لماذا تعتبر الأوكرانية صعبة على الذكاء الاصطناعي؟
تشرح الورقة أن اللغة الأوكرانية صعبة على الذكاء الاصطناعي لثلاثة أسباب رئيسية:
- الأبجدية: تستخدم الأبجدية السيريلية، التي لم يتم تدريب العديد من نماذج الذكاء الاصطناعي عليها جيداً مثل الإنجليزية.
- القواعد: تتغير نهايات الكلمات في الأوكرانية كثيراً (مثل "أنا أذهب"، "هو يذهب"، "نحن ذهبنا"). هذا يربك "عداد الكلمات" الداخلي للذكاء الاصطناعي، مما يجعله يستخدم قدرة حوسبية أكبر لمجرد قراءة الجملة.
- النظام: تستخدم أوكرانيا نظام "القانون المدني" (القائم على القوانين المكتوبة)، بينما تم تدريب معظم نماذج الذكاء الاصطناعي على "القانون العام" (القائم على السوابق القضائية السابقة). إنه يشبه تعليم محامٍ يعرف فقط كيف يجادل بناءً على السوابق السابقة، ليجد نفسه فجأة مضطراً لاتباع كتاب قواعد صارم.
الخلاصة
لقد طور المؤلفون طريقة جديدة وأكثر عدلاً لاختبار الذكاء الاصطناعي في القانون الأوكراني. وقد اكتشفوا ما يلي:
- لا تثق في الدرجات البسيطة: درجة الدقة العالية قد تعني فقط أن الذكاء الاصطناعي يخمن الإجابة الأكثر شيوعاً.
- الأمثلة تساعد، ولكن ليس دائماً: عرض الأمثلة يساعد الذكاء الاصطناعي على التعرف على أنواع الوثائق، لكنه لا يجعله بالضرورة مفكراً قانونياً أفضل.
- الصغير ليس دائماً ضعيفاً: بالنسبة لبعض المهام القانونية، يكون الذكاء الاصطناعي الصغير والرخيص بجودة الذكاء الاصطناعي الضخم والمكلف.
لقد جعل الباحثون جميع بياناتهم واختباراتهم ونتائجهم متاحة للجمهور حتى يتمكن الآخرون من استخدامها لبناء أدوات ذكاء اصطناعي قانونية أفضل وأكثر عدلاً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.