← أحدث الأبحاث
💬 NLP

LegalBench-BR: A Benchmark for Evaluating Large Language Models on Brazilian Legal Decision Classification

تقدم هذه الورقة البحثية LegalBench-BR، وهو أول معيار عام لتصنيف القرارات القانونية البرازيلية باستخدام 3,105 إجراءً استئنافياً مشروحاً، مما يثبت أن نموذج BERT الذي تم ضبطه بدقة باستخدام تقنية LoRA يتفوق بشكل كبير على النماذج اللغوية الكبيرة التجارية الرائدة في الدقة والتمييز الخاص بالمجال مع القضاء على الانحيازات المنهجية تجاه القانون المدني.

المؤلفون الأصليون: Pedro Barbosa de Carvalho Neto

نُشر 2026-04-22
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Pedro Barbosa de Carvalho Neto

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مكتبة ضخمة من الوثائق القانونية من البرازيل، لكنها جميعاً مختلطة في كومة فوضوية عملاقة. يحتاج المحامون والقضاة إلى فرز هذه الوثائق في خمس حاويات محددة: المدني، المستهلك، الضرائب، الإداري، والجنائي. القيام بذلك يدوياً بطيء ومكلف. لذا، السؤال هو: هل يمكننا فقط أن نطلب من ذكاء اصطناعي فائق الذكاء وعام الأغراض (مثل أمين مكتبة عالي التقنية) أن يقوم بفرزها لنا؟

هذه الورقة البحثية، LegalBench-BR، تقول: "ليس تماماً. ليس بعد."

إليك قصة كيف اكتشفوا ذلك، مشروحة ببساطة.

1. المشكلة: "العام" مقابل "المتخصص"

أراد الباحثون اختبار ما إذا كانت نماذج الذكاء الاصطنا-عي الشهيرة والكبيرة (مثل GPT-4o mini و Claude 3.5) جيدة بما يكفي لفرز القضايا القانونية البرازيلية. هذه النماذج تشبه أمين مكتبة عام: يعرف القليل عن كل شيء، من وصفات الطبخ إلى فيزياء الكم.

لكن القانون البرازيلي معقد. لديه لغته الخاصة، وقواعد محددة، وطريقة تنظيمية معينة للغاية. قام الباحثون ببناء "اختبار" جديد (معيار مرجعي) باستخدام 3,105 قضية محكمة حقيقية من سانتا كاتارينا، البرازيل. لقد تأكدوا من أن الاختبار عادل عبر إعطاء الذكاء الاصطناعي عدداً متساوياً من القضايا من كل فئة من الفئات القانونية الخمس، حتى لا يتمكن الذكاء الاصطناعي من مجرد التخمين بناءً على الفئة الأكثر شيوعاً والحصول على درجة عالية.

2. السباق: من يفوز؟

أجروا سباقاً بين ثلاثة متسابقين:

  1. GPT-4o mini (ذكاء اصطناٍعي سحابي شهير ومكلف).
  2. Claude 3.5 Haiku (ذكاء اصطناعي سحابي شهير ومكلف آخر).
  3. BERTimbau-LoRA (نموذج صغير تم تدريبه خصيصاً ويعمل على جهاز كمبيوتر قياسي).

النتيجة: فاز النموذج المخصص بفارق هائل.

  • النموذج المخصص: حصل على 87.6% صحيحة.
  • الذكاء الاصطناعي الشهير: حصلوا فقط على 60-65% صحيحة.

3. المفاجأة الكبرى: فخ "القانون المدني"

الجزء الأكثر إثارة للاهتمام في القصة هو كيف فشل الذكاء الاصطناعي الشهير. لم يرتكبوا أخطاء عشوائية؛ بل وقعوا في فخ محدد يسمى "انحياز الافتراض المدني" (Civil Default Bias).

التشبيه: تخيل خبير أرصاد جوية اعتاد رؤية المطر كثيراً، لدرجة أنه كلما رأى سحابة، يصرخ "مطر!" دون النظر إلى السماء. حتى لو كان الثلج يتساقط أو الشمس مشرقة، فإنه يصر على أنه مطر.

  • ماذا حدث: عندما كان الذكاء الاصطناعي الشهير غير متأكد بشأن قضية ما، كان يلجأ تلقائياً لتخمين "القانون المدني" (وهو النوع الأكثر شيوعاً للقضايا في البرازيل).
  • الكارثة: بالنسبة لقضايا القانون الإداري (التي تتعامل مع البيروقراطية الحكومية)، حصل الذكاء الاصطناعي الشهير على 0% صحيح. لم يستطيعوا التمييز بين نزاع ضريبي حكومي وبين دعوى مدنية عادية.
  • الفائز: النموذج المخصص، الذي تمت "دراسته" خصيصاً على النصوص القانونية البرازيلية، تعلم الإشارات الدقيقة (مثل أسماء المحاكم المحددة أو المصطلحات القانونية) التي تفصل بين هذه الفئات. وقد حقق نسبة 91% صحيحة في القانون الإداري.

4. لماذا فاز النموذج المخصص (سر الـ "LoRA")

قد تعتقد أن النموذج المخصص هو سوبر كمبيوتر ضخم. لكنه ليس كذلك. في الواقع، هو صغير وغير مكلف.

  • التشبيه: فكر في الذكاء الاصطناعي الكبير كأنه سكين سويسري (Swiss Army Knife). يحتوي على شفرة، ومفك براغي، وفتاحة زجاجات. هو رائع لأشياء كثيرة، ولكن إذا كنت بحاجة لقطع نوع معين من الخشب، فهو ليس الأداة الأكثر حدة.
  • النموذج المخصص: هذا يشبه أخذ ذلك السكين السويسري وشحذ شفرة واحدة محددة فقط (باستخدام تقنية تسمى LoRA).
  • السحر: لقد غيروا فقط 0.3% من دماغ النموذج. الأمر يشبه تعليم أمين مكتبة عام كيفية قراءة القوانين القانونية البرازيلية فقط لمدة 30 دقيقة. فجأة، يصبح خبيراً قانونياً.
  • التكلفة: يعمل النموذج المخصص على كمبيوتر محمول عادي (أو حتى على وحدة معالجة رسوميات مجانية من Google Colab) وتكلفته 0 دولار للتشغيل. أما الذكاء الاصطناعي الكبير فيكلف مالاً مقابل كل سؤال ويستغرق وقتاً أطول للإجابة.

5. لماذا يهم هذا في العالم الحقيقي

هذا ليس مجرد تجربة علمية؛ بل له عواقب حقيقية.

  • الخصوصية: ترسل أنظمة الذكاء الاصطناعي الكبيرة بياناتك إلى السحابة (الولايات المتحدة أو دول أخرى). في البرازيل، تنص القوانين (LGPD) على أنه لا يمكنك مجرد إرسال بيانات قانونية خاصة إلى طرف ثالث. النموذج المخصص يبقي البيانات على جهاز الكمبيوتر الخاص بك.
  • الكفاءة: إذا استخدمت شركة محاماة الذكاء الاصطناعي الذي يعاني من "الانحياز المدني"، فقد يرسلون قضية ضريبية حكومية إلى القسم الخطأ، مما يسبب تأخيرات وارتباكاً.
  • الدرس المستفاد: لا يمكنك فقط شراء ذكاء اصطناعي "واحد يناسب الجميع" للمهام المتخصصة. إذا كنت تريد فرز الوثائق القانونية في البرازيل، فأنت بحاجة إلى نموذج درس بالفعل القانون البرازيلي، وليس مجرد نموذج يعرف الكثير من الكلمات الإنجليزية والبرتغالية.

الملخص

تثبت الورقة البحثية أنه للمهام المتخصصة مثل فرز القضايا القانونية البرازيلية، النموذج الصغير والمخصص والمدرب خصيصاً يتفوق على العمالقة الكبار والمكلفين وعامّي الأغراض. العمالقة كسولون جداً (أو منحازون) لدرجة تمنعهم من التدقيق في التفاصيل، بينما النموذج المخصص، الذي تم تدريبه خصيصاً لهذه المهمة، يرى الإشارات التي تفوت الآخرين.

الخلاصة: لا تستخدم دائماً الأداة الأكثر شهرة للقيام بالمهمة؛ فأحياناً، تحتاج إلى شحذ أداة محددة لمهمة محددة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →