Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics
تقدم هذه المساهمة مجموعة بيانات LEGIT، وهي مجموعة بيانات واسعة النطاق تضم 24,000 مسار استدلال قانوني بمستوى الخبراء مهيكلة كأشجار مشكلات هرمية، وتعمل كإطار تقييم قوي لتقييم وتوضيح كيف يمكن لتعزيز التوليد باسترجاع المعلومات والتعلم التعزيزي أن يتكاملا لتعزيز شمولية وصحة الاستدلال القانوني في النماذج اللغوية الكبيرة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك وظفت محامياً مبتدئاً لمساعدتك في حل لغز قانوني معقد. أنت لا تريد منه مجرد تخمين النتيجة النهائية (مثل "سيدفع المدعى عليه 50,000 دولار")؛ بل يجب عليك مراجعة "دفتر ملاحظاته". هل نظر في جميع الأدلة الصحيحة؟ هل ربط النقاط ببعضها بشكل صحيح؟ أم أنه أغفل قطعة حاسمة من الأدلة ومع ذلك وصل إلى النتيجة الصحيحة عن طريق الصدفة؟
هذا العمل، الذي يحمل عنوان "تقييم مسارات الاستدلال القانوني باستخدام نماذج شجرة القضايا القانونية"، يقدم طريقة جديدة لتقييم المحامين الآليين (نماذج اللغات الكبيرة) ليس فقط من خلال حكمهم النهائي، ولكن من خلال جودة عملية استدلالهم.
إليك تفصيل لعملهم باستخدام تشبيهات بسيطة:
1. المشكلة: "الصندوق الأسود" لاستدلال الذكاء الاصطناعي
تتفوق نماذج الذكاء الاصطناعي الحالية في حل المسائل الرياضية أو كتابة الأكواد البرمجية لأن الإجابات عادة ما تكون صحيحة أو خاطئة بشكل واضح. أما في القانون، فالأمر أكثر فوضوية. قد يتوقع الذكاء الاصطناعي الحكم القضائي الصحيح (على سبيل المثال: "تُرفض الدعوى")، ولكنه يصل إلى ذلك عبر تجاهل حقائق مهمة أو تطبيق منطق معيب.
إذا سألت الذكاء الاصطناعي: "لماذا قررت المحكمة بهذا الشكل؟" وقدم تفسيراً خاطئاً، فإن ذلك يعد أمراً خطيراً في المجالات عالية المخاطر مثل القانون. الطرق الحالية لتقييم "مسارات الاستدلال" هذه (خطوات التفكير المتتالية) غامضة للغاية، تماماً مثل معلم يعطي طالباً درجة "جيد" في مقال دون شرح السبب.
2. الحل: LEGIT (شجرة القضايا القانونية)
أنشأ المؤلفون مجموعة بيانات ضخمة وجديدة تسمى LEGIT (أشجار القضايا القانونية). تخيل القضية القانونية ليس كسؤال واحد، بل كـ شجرة عائلة من الحجج.
- الجذر: الادعاء الرئيسي (مثلاً: "ادفع لي أموال التأمين الخاصة بي").
- الأغصان: لإثبات الجذر، يجب إثبات أشياء أصغر (مثلاً: "هل كان الحدث مفاجئاً؟"، "هل كان خارجياً؟"، "هل كانت هناك حالة مرضية سابقة؟").
- الأوراق: الحقائق المحددة (مثلاً: "الضحية اختنقت بقطعة من كعكة الأرز").
في LEGIT، قاموا بتحويل الأحكام القضائية الحقيقية إلى هذه الأشجار المهيكلة. تعمل هذه الشجرة كـ نموذج تقييم (قائمة مراجعة).
3. كيف يقيمون الذكاء الاصطناعي: تشبيه "نموذج التقييم"
بدلاً من سؤال الذكاء الاصطناعي: "هل هذا الاستدلال جيد؟" (وهو سؤال غامض)، يطلبون منه التحقق من مربعات محددة مقابل "شجرة القضايا":
- التغطية (Coverage): هل ذكر الذكاء الاصطناعي هذا الغصن المحدد من الشجرة؟ (هل لاحظ حجة "الحالة المرضية السابقة"؟)
- الدقة (Accuracy): هل توصل الذكاء الاصطناعي إلى الاستنتاج الصحيح لهذا الغصن؟ (هل قرر بشكل صحيح أن الحالة المرضية السابقة هي التي تسببت على الأرجح في الوفاة؟)
لقد عرضوا مجموعة البيانات هذه على محامين بشريين للتقييم. وقد اتفق المحامون بشكل شبه تام، مما يثبت أن طريقة "الشجرة" هذه هي وسيلة عادلة وموضوعية لتقييم الاستدلال القانوني.
4. ماذا وجدوا: نقاط ضعف الذكاء الاصطناعي
عندما اختبروا أفضل نماذج الذكاء الاصطناعي على LEGIT، وجدوا أن حتى أذكى الأنظمة تعاني. لقد حددوا نوعين رئيسيين من "الأخطاء":
- خطأ التفكيك (Decomposition Error) (الأغصان المفقودة): ينسى الذكاء الاصطناعي النظر في غصن كامل من الشجرة. إنه يتجاهل تماماً سؤالاً قانونياً حاسماً.
- خطأ الاستنتاج (Deduction Error) (المنطق المعيب): ينظر الذكاء الاصطناعي إلى الغصن ولكنه يستخلص استنتاجاً خاطئاً من الحقائق.
الاكتشاف الكبير: إذا أغفل الذكاء الاصطناعي غصناً واحداً أو أخطأ في تقدير غصن صغير، فإنه في الغالب سيصل إلى النتيجة النهائية الخاطئة أيضاً. لا يمكنك بناء منزل مستقر إذا تخطيت الأساسات أو استخدمت أخشاباً مهترئة للجسور.
5. طريقتان لتحسين الذكاء الاصطناعي: RAG مقابل RL
اختبر المؤلفون طريقتين شائعتين لتحسين الذكاء الاصطناعي ووجدا أن لهما تأثيرات متضادة:
RAG (التوليد المعزز بالاسترجاع): "الاختبار المفتوح"
- كيف يعمل: قبل أن يجيب الذكاء الاصطناعي، يقوم النظام بالبحث في مكتبة من القوانين والقضايا السابقة ويقدم الصفحات ذات الصلة للذكاء الاصطناعي.
- النتيجة: يصبح الذكاء الاصطناعي "باحثاً" أفضل. فهو يجد المزيد من أغصان الشجرة (تغطية أفضل) ويحتج بشكل أفضل لأنه يمتلك القواعد أمامه. إنه يحسن كل شيء.
RL (التعلم التعزيزي): "مدرب الصاعقة"
- كيف يعمل: يتم تدريب الذكاء الاصطناعي بواسطة قاضٍ حاسوبي لا يمنح النقاط إلا إذا حصل على النتيجة النهائية الصحيحة.
- النتيجة: يصبح الذكاء الاصطناعي "مخمناً شديد التركيز". فهو يصل إلى الحكم النهائي بشكل صحيح في كثير من الأحيان (دقة أفضل) ولكنه يبدأ في تخطي الأغصان الصعبة والمعقدة لتجنب الأخطاء. إنه يضحي بـ التغطية في سبيل الدقة.
الخلاصة الجوهرية: يساعد RAG الذكاء الاصطناعي على فهم الصورة الكاملة، بينما يساعد RL الذكاء الاصطناعي على الوصول إلى الإجابة النهائية الصحيحة ولكنه يجعله كسولاً بشأن فحص كل التفاصيل. يقترح المؤلفون استخدام كليهما معاً لتحقيق أفضل النتائج.
ملخص
أنتج هذا العمل "مفتاح تصحيح" ضخماً ومنظماً يعتمد على قضايا حقيقية لتعليمنا كيفية تقييم المحامين الآليين. وجدوا أن أنظمة الذكاء الاصطناعي الحالية غالباً ما تغفل تفاصيل قانونية مهمة أو تستدل بشكل ضعيف، وأنه بينما يساعد منحهم الوصول إلى القوان Laws (RAG) على التفكير بشكل واسع، فإن تدريبهم فقط على "إعطاء الإجابة الصحيحة" (RL) يجعلهم يتخطون الخطوات. لإنشاء ذكاء اصطناعي موثوق حقاً للقانون، يجب علينا مراجعة دفاتر ملاحظاتهم، وليس مجرد درجاتهم النهائية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.