Annotating Topical Legal Insights from Case Proceedings
تقدم هذه الورقة LeDA، وهو نظام قائم على الويب لتوسيم البيانات القانونية يتيح التوسيم الديناميكي للمفاهيم داخل إجراءات القضايا دون الحاجة إلى أنطولوجيا لإنشاء تمثيلات دلالية مهيكلة لمهام لاحقة مثل استرجاع القضايا السابقة والتنبؤ بالأحكام.
تخيل عالم علوم الحاسوب كمكتبة ضخمة تحاول فيها الآلات قراءة وفهم القصص البشرية. لفترة طويلة، كانت الحواسيب مثل قراء سريعين جداً، لكنهم حرفيون للغاية. إذا أعطيتهم كتاباً، كان بإمكانهم عدّ كم مرة ظهرت كلمة "كلب"، لكنهم غالباً ما كانوا يفتقدون "القصة" الكامنة وراء هذا الكلب. هل كان الكلب بطلاً؟ أم شريراً؟ أم مفقوداً؟ هذا هو الفرق بين "حقيبة الكلمات" (مجرد كومة من المفردات) وفهم "الرؤية الموضوعية" (الموضوع أو المعنى الفعلي). في العالم القانوني، هذا أمر بالغ الأهمية. فقضية المحكمة ليست مجرد قائمة من الحقائق؛ بل هي دراما معقدة ذات دوافع، وأدلة، وأحداث محددة مثل "القتل أثناء الإفراج المشروط". إذا لم تستطع الحواسيب استيعاب هذه المواضيع، فلن تتمكن من مساعدة المحامين في العثور على قضايا سابقة مماثلة أو التنبؤ بكيفية حكم القاضي. هذا هو التحدي الذي سعى الباحثون في هذه الورقة البحثية لحله: تعليم الحواسيب فهم "المواضيع" في الوثائق القانونية، وليس مجرد الكلمات.
تقدم الورقة أداة جديدة تسمى LeDA (تعليق البيانات القانونية)، والتي تعمل كقلم تحديد ذكي ومرن للوثائق القانونية. أدرك المؤلفون، وهم فريق من الباحثين من الهند والمملكة المتحدة، أن الأدوات الموجودة كانت جامدة للغاية. كانت تشبه كتب التلوين حيث لا يمكنك سوى استخدام الألوان المتوفرة في الصندوق. لكن القضايا القانونية فوضوية وفريدة من نوعها؛ فأحياناً تتضمن القضية "جريمة قتل ثانية" أو "مخطط انتقام" لا يتناسب مع فئة معدة مسبقاً. يحل LeDA هذه المشكلة من خلال السماح للأشخاص الذين يقرأون الوثائق (المعلقين) بابتكار "وسوم" أو فئات جديدة بشكل فوري. إذا قرأ المعلق فقرة وفكر: "هذا موقف 'قتل أثناء الإفراج المشروط'"، ولكن هذا الوسم غير موجود بعد، يمكنه إنشاؤه فوراً.
اختبر الفريق هذا النظام مع ثلاثة خبراء قانونيين قاموا بتحليل 200 وثيقة محكمة حقيقية من المحكمة العليا الهندية. ووجدوا أن LeDA سمح لهم بالتقاط تفاصيل دقيقة فاتت الأدوات الأخرى. على سبيل المثال، بدلاً من مجرد تحديد كلمة "قتل"، كان بإمكانهم وسم قسم كامل من النص كـ "قتل أثناء الإفراج المشروط" أو "جريمة قتل ثانية"، مما يلخص "الموضوع" لهذا الجزء من القصة بشكل فعال. يتضمن النظام أيضاً "معلقاً فائقاً" يعمل كحكم. فعندما يقوم شخصان مختلفان بتحديد نفس النص ولكن باستخدام وسوم مختلفة، ينظر المعلق الفائق في النسختين ويقرر أيهما الأفضل، أو يدمجهما. ساعدت هذه العملية الفريق في قياس مدى اتفاق الخبراء مع بعضهم البعض (وهو مقياس يسمى اتفاق المعلقين - Inter-Annotator Agreement) وضمنت أن تكون مجموعة البيانات النهائية عالية الجودة.
تشير الورقة إلى أن مجموعة البيانات الجديدة الغنية بالمواضيع هذه يمكن استخدامها لمهام مستقبلية مثل العث_ور على قضايا سابقة مماثلة أو التنبؤ بالأحكام، لكن المؤلفين حذروا من أن هذه الأداة هي وسيلة لبناء البيانات، وليست منتجاً نهائياً يحل جميع المشكلات القانونية بعد. كما أكدوا أنه بينما تُستخدم أداتهم حالياً في القضايا المتعلقة بالقتل، فإنهم يخططون لتوسيع نطاقها لتشمل مجالات قانونية أخرى لاحقاً. ومن خلال تحويل النصوص القانونية المعقدة إلى "حقائب مفاهيم" منظمة، يهدف LeDA إلى جعل البحث القانوني أسرع وأكثر دقة، مما يسد الفجوة بين الفهم البشري والمعالجة الآلية.
ملخص تقني: LeDA – نظام لتوسيم البيانات القانونية
بيان المشكلة تتميز الوثائق القانونية بكبر حجمها وتعقيدها المتأصل، مما يجعل استخراج المعلومات تحدياً كبيراً للمجتمع البحثي. وبينما تستخدم التقنيات الحالية مثل استخراج العبارات المفتاحية، واستخراج الأدلة، واستخراج شهادات الشهود أساليب مثل "تردد المصطلح - عكس تردد المستند" (TF-IDF) ونماذج معالجة اللغات الطبيعية (مثل Bi-LSTM)، إلا أن هذه النهج غالباً ما تفشل في التقاط رؤية "موضوعية" أو "موضوعاتية" للوثيقة. قد تستخرج الطرق الحالية عبارات محددة (مثل "قتل" أو "إفراج مشروط")، ولكنها لا تستطيع صياغة المعلومات الدقيقة أو الأحداث التي تحدد "جوهر" القضية (على سبيل المثال: "شخص قتل زوجته أثناء فترة الإفراج المشروط") بشكل فعال. إن القراءة اليدوية للوثائق بأكملها لتحديد هذه المفاهيم الموضوعية عملية مستهلكة للوقت ومجهدة، مما يستلزم تمثيلاً مهيكلاً للوثائق القانونية كـ "حقائب من المفاهيم" بدلاً من مجرد نصوص مسطحة.
المنهجية لمعالجة هذه القيود، يقترح المؤلفون نظام LeDA (توسيم البيانات القانونية)، وهو نظام قائم على الويب مصمم لتوسيم وتحديد الكيانات والمفاهيم داخل الوثائق القانونية. تم بناء النظام باستخدام واجهة أمامية مطورة بلغات HTML وCSS وJavaScript، وواجهة خلفية مدعومة بإطار عمل Django القائم على لغة Python، والمستضاف على خادم PythonAnywhere.
تتميز المنهجية الجوهرية لـ LeDA عن أدوات التسمية التسلسلية القياسية من خلال آليتين رئيسيتين:
إنشاء الوسوم الديناميكي: على عكس الأدوات التي تعتمد على أنطولوجيات ثابتة ومحددة مسبقاً، يسمح LeDA للموسمين بإنشاء وسوم جديدة ديناميكياً. وهذا أمر بالغ الأهمية في المجالات القانونية حيث قد لا تكون المفاهيم معروفة بالكامل مسبقاً ويجب اكتشافها أثناء فحص الموسمين للوثائق. يمكن للموسمين طلب إضافة وسوم جديدة إذا واجهوا معلومات دقيقة لا تغطيها القائمة الحالية.
التوسيم الفائق والتحكيم: يستخدم النظام سير عمل يتضمن موسمين متعددين و"موسم فائق" (خبير قانوني رفيع المستوى). يقوم الموسمون بتوسيم نطاقات نصية بشكل مستقل باستخدام الوسوم. ثم يقوم الموسم الفائق بإجراء "التوسيم الفائق" (meta-annotation)، حيث يعمل كعملية دمج لحل النزاعات بين التوسيمات المختلفة. تتضمن هذه العملية حساب "اتفاق الموسمين" (IAA) لقياس جودة التوسيم. بالنسبة للوثائق ذات درجات IAA المنخفضة (على سبيل المثال، أقل من 0.5)، يقوم الموسم الفائق بالتوفيق بين الاختلافات من خلال فحص المدخلات المتعارضة واختيار الوسم الأكثر ملاءمة أو استبعاد التعارض.
تتضمن عملية التوسيم اختيار وثيقة، وتظليل نطاقات نصية محددة، وربطها بوسوم (إما من قائمة محددة مسبقاً أو وسوم تم إنشاؤها حديثاً)، وحفظ البيانات بتنسيق JSON. يدعم النظام البحث عن الوثائق بواسطة الوسوم وحساب درجات اتفاق الموسمين (IAA) بناءً على النطاق الموسوم، والوسوم المستخدمة، ورقم الجملة.
المساهمات الرئيسية
نظام LeDA: تطوير أداة متخصصة تدعم إنشاء الوسوم الديناميكي والتوسيم الفائق، وهي ميزات غالباً ما تغيب عن الأدوات العامة مثل BRAT أو GATE أو Label Studio عند تطبيقها على البيانات القانونية المعقدة.
الإطار المفاهيمي: اقتراح مجموعة متنوعة من المفاهيم القانونية (مثل "القتل أثناء الإفراج المشروط"، "القتل الثاني"، "وكالة التحقيق") لتمثيل الإجراءات القضائية كحقائب من المفاهيم.
بناء مجموعة البيانات: تطبيق LeDA لتوسيم 200 من إجراءات قضايا المحكمة العليا الهندية بمشاركة ممارسين قانونيين تابعين لجامعة غرب البن الوطنية للعلوم القانونية.
حساب مبتكر لاتفاق الموسمين (IAA): تقديم طريقة محددة لحساب اتفاق الموسمين تأخذ في الاعتبار فروق التوسيم القانوني، مثل تداخل النطاقات واستخدام وسوم متعددة لقطعة نصية واحدة.
النتائج استُخدم النظام من قبل ثلاثة مقيمين (خبيرين قانونيين وموسم فائق) لتوسيم 200 وثيقة قانونية. تشمل الملاحظات الرئيسية من البيانات الموسمة ما يلي:
ضرورة استخدام وسوم متعددة لتوسيم نطاقات نصية واحدة من أجل التمثيل الدقيق.
حقيقة أن النطاقات الموسومة غالباً ما تتجاوز حدود الجمل، مما يشير إلى الحاجة لالتقاط المعلومات بما يتجاوز الجمل الفردية.
تباين طول النطاق اعتماداً على الوسم (على سبيل المثال، قد يتطلب "القتل العمد" جملة واحدة، بينما قد يتطلب "شهادة شاهد خبير" من 4 إلى 5 جمل).
كانت ردود أفعال الخبراء القانونيين مرضية للغاية، حيث لم يتم تقديم أي مقترحات لميزات جديدة، مما يؤكد فعالية الأداة للغرض المقصود منها.
الأهمية والادعاءات يزعم البحث أن LeDA يقلل بفعالية من الجهد المطلوب لتوسيم الوثائق القانونية بالمفاهيم الموضوعية، مما يتيح بناء تمثيلات دلالية مناسبة للمهام اللاحقة. يصرح المؤلفون صراحةً بأن مجموعة البيانات الناتجة من المفاهيم القانونية مخصصة للاستخدام في مهام مثل استرجاع القضايا السابقة والتنبؤ بالأحكام. النظام مستخدم حالياً لهذه الأغراض، ويخطط المؤلفون لتوسيع نطاق العمل ليشمل مجالات قانونية أخرى تتجاوز قضايا القتل. بالإضافة إلى ذلك، يعتزم المؤلفون استكشاف الاستخراج الآلي للمفاهيم باستخدام مجموعة البيانات الموسومة للتخفيف من الوقت والتكلفة اللازمين للتوسيم اليدوي في المستقبل. يضع البحث نفسه كنسخة موسعة من ورقة عرض تجريبي لـ JURIX 2023، مؤكداً على الفائدة العملية للأداة في سيناريو واقعي لتوسيم البيانات القانونية.