HUKUKBERT: Domain-Specific Language Model for Turkish Law
تقدم هذه الورقة البحثية HukukBERT، وهو نموذج لغوي قانوني تركي متطور تم تدريبه على متن لغوي متخصص يبلغ حجمه 18 جيجابايت باستخدام استراتيجية قناع هجينة، والذي يتفوق بشكل كبير على النماذج الحالية في مهام التنبؤ بالمصطلحات القانونية وتقسيم القرارات القضائية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم طالب نابغ ومثقف كيف يصبح محامياً في تركيا. لديك خياران:
- العام (The Generalist): تمنحه مكتبة تضم 84 مليار كتاب عن الحياة اليومية، والأخبار، وويكيبيديا، والمحادثات العادية. سيصبح ذكياً جداً بشأن العالم بشكل عام.
- المتخصص (The Specialist): تمنحه مكتبة أصغر، لكنها منتقاة بعناية، تضم 21 مليار كلمة، ولكن كل كتاب فيها يدور حصرياً حول القانون التركي، والأحكام القضائية، والمدونات القانونية.
تقدم هذه الورقة البحثية HukukBERT، وهو المتخصص. يجادل المؤلفون بأنه بالنسبة لعالم القانون التركي المعقد والدقيق، فإن "العام" لا يكفي، مهما كان عدد الكتب التي قرأها.
إليك قصة كيفية بناء HukukBERT، مشروحة ببساة:
1. المشكلة: كارثة "الترجمة"
اللغة التركية لغة "لاصقة" للغاية (يسميها اللغويون لغة إلصاقية - agglutinative). يمكنك لصق العديد من القطع الصغيرة معاً لتكوين كلمة واحدة طويلة.
- خطأ النماذج العامة: تخيل نموذج ذكاء اصطناعي عام يحاول قراءة وثيقة قانونية. يرى عبارة قانونية معقدة مثل "قرار توحيد الأحكام" ويحاول تقطيعها إلى فتات صغير عديم المعنى مثل "قرار"، "على"، "الـ"، "توح"، "يد"، "الأحكام".
- النتيجة: يفقد الذكاء الاصطناعي المعنى. الأمر يشبه محاولة فهم وصفة طعام من خلال قراءة الحروف "د"، "ق", "ي", "ق" منفصلة بدلاً من كلمة "دقيق".
- فخ "الانزياح الدلالي": في القانون، الكلمات الشائعة تعني شيئاً مختلفاً تماماً. في الحياة اليومية، قد تعني كلمة "Estate" منزلاً كبيراً. أما في القانون التركي، فإن كلمة محددة (tereke) تعني "إجمالي أصول الشخص المتوفى". نماذج الذكاء الاصطناعي العامة تخمن المعنى الشائع ("منزل" أو "ميراث") وتخطئ في الإجابة القانونية.
2. الحل: بناء مجموعة أدوات مخصصة
لم يكتفِ المؤلفون بتغذية نموذج موجود بمزيد من البيانات، بل بنوا مجموعة أدوات مخصصة من الصفر:
- "المكتبة النظيفة" (البيانات): جمعوا 21 جيجابايت من النصوص القانونية الخام (أحكام المحاكم، القوانين، الأوراق الأكاديمية). لكن النصوص القانونية مليئة بالعبارات "النمطية" المتكررة (مثل "يعتبر من الضروري..."). استخدموا مرشحاً ذكياً لإزالة المكررات ووازنوا المكتبة حتى لا يقوم الذكاء الاصطناعي بحفظ أحكام المحاكم فحسب، بل يتعلم أيضاً من القوانين والنظريات الأكاديمية.
- (القاموس المخصص/المجزئ - Tokenizer): هذا هو الجزء الأهم. أنشأوا قاموساً جديداً يضم 48,000 كلمة مصممة خصيصاً للقانون.
- التشبيه: بدلاً من قاموس يقطع كلمة "Unification" إلى "Uni-fic-ation"، يعامل قاموسهم المفهوم القانوني بأكمله كـ كتلة واحدة. هذا يمنع الذكاء الاصطناعي من الارتباك بسبب الأجزاء "اللاصقة" في الكلمات التركية.
- "التدريب على المستوى الصعب" (القناع - Masking): عند تدريب الذكاء الاصطناعي، لم يقموا بإخفاء كلمات عشوائية فحسب. بل استخدموا استراتيجية خاصة حيث أخفوا مفاهيم قانونية كاملة أو مصطلحات قانونية رئيسية.
- التشبيه: بدلاً من سؤال الطالب: "ما هي [الفراغ] في الجملة؟" (حيث قد يخمن كلمة قواعدية)، سألوا: "في قضية ميراث، ما هو المصطلح القانوني المحدد لإجمالي أصول المتوفى؟". هذا أجبر الذكاء الاصطناعي على تعلم منطق القانون، وليس مجرد القواعد اللغوية.
3. النتائج: المتخصص يفوز
اختبروا HukukBERT مقابل "العموميين" (مثل TabiBERT، الذي قرأ 84 مليار توكن من النصوص العامة) و"المتخصصين القدامى" (نماذج قانونية تركية أقدم).
- اختبار الفراغات القانوني (Legal Cloze Test): أنشأوا اختباراً يتكون من 750 سؤالاً قانونياً صعباً.
- النماذج العامة: حصلت على حوالي 60-70% من الإجابات الصحيحة. كانت تستمر في تخمين الكلمات الشائعة بدلاً من المصطلحات القانونية.
- HukukBERT: حصل على 84.4% من الإجابات الصحيحة. عرف تماماً متى يستخدم المصطلح القانوني الدقيق بدلاً من الكلمة اليومية.
- الاختبار الواقعي (تقسيم المستندات): طلبوا من الذكاء الاصطناعي أخذ قرار محكمة فوضوي مكون من 50 صفحة وتقسيمه تلقائياً إلى أقسام (العنوان، الادعاء، الدفاع، الحكم، إلخ).
- HukukBERT: نجح في تقسيم المستند بشكل صحيح بنسبة 92.8% من المرات.
- الآخرون: فشلوا كثيراً، حيث تاهوا في الجمل الطويلة والمعقدة.
4. لماذا هذا مهم؟
فكر في القانون التركي كغابة كثيفة وقديمة.
- الذكاء الاصطناعي العام يشبه رحالة لديه خريطة جيدة للبلاد بأكملها ولكن ليس لديه بوصلة لهذه الغابة تحديداً. سوف يتوه في الأدغال.
- HukukBERT هو دليل مشى في هذه الغابة تحديداً آلاف المرات. يعرف بالضبط أين توجد المسارات المخفية وما هو اسم كل نبات غريب.
الخلاصة
لقد أطلق المؤلفون HukukBERT، وقاموسه المخصص، واختبارهم للجمهور. إنهم يقولون: "إذا كنت تريد بناء ذكاء اصطناعي قانوني لتركيا، فلا تكتفِ بصب المزيد من البيانات العامة في نموذج عام. أنت بحاجة إلى نموذج يتحدث اللغة المحددة، واللاصقة، والدقيقة للقانون التركي."
هذه خطوة كبيرة للأمام في مجال "التقنية القانونية" (LegalTech) في تركيا، مما يجعل من الممكن بناء أدوات يمكنها حقاً فهم أحكام المحاكم، والتنبؤ بالنتائج، وتنظيم الوثائق القانونية دون خطأ بشري.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.