Benchmarking Legal RAG: The Promise and Limits of AI Statutory Surveys
تقوم هذه الورقة البحثية بقياس أداء أدوات استرجاع المعلومات المعزز بالتوليد (RAG) القانونية الناشئة مقابل مجموعة بيانات LaborBench، كاشفةً أنه في حين أن منصات الذكاء الاصطناي التجاري لا تؤدي أداءً جيداً مقارنةً بـ RAG القياسي، فإن أداة مخصصة (STARA) تحسن الدقة بشكل ملحوظ، رغم أن المزيد من التحليل يشير إلى أن أداءها الحقيقي أعلى حتى بسبب حالات الحذف التي لم تُحسب سابقاً في بيانات الحقيقة الأرضية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك محامٍ تحاول الإجابة على سؤال محدد للغاية: "هل تسمح ولاية كاليفورنيا للعامل بالاحتفاظ بمزايا البطالة الخاصة به أثناء بدء مشروع صغير؟"
للحصول على الإجابة الصحيحة، لا يمكنك مجرد سؤال شخص واحد. عليك مراجعة كتب القواعد لجميع الولايات الخمسين. لكل ولاية كتابها الخاص الضخم والمعقد من المصطلحات القانونية، المكتوبة بلغة قانونية مربكة، مع قواعد تتغير بناءً على السنة، أو نوع الوظيفة، أو حتى حجم الشركة.
القيام بذلك يدويًا يشبه محاولة العثز في 50 كومة من القش للبحث عن إبرة محددة، حيث الإبر مصنوعة من الزجاج وكومات القش مشتعلة بالنيران. إنها مهمة تتطلب فريقًا من الخبراء وتستغرق شهورًا.
هذه الورقة البحثية تدور حول اختبار الذكاء الاصطناعي (AI) لمعرفة ما إذا كان بإمكانه القيام بهذه المهمة بشكل أسرع وأفضل. قام الباحثون بإعداد "رحلة تجريبية" (تسمى معيارًا مرجعيًا) لمعرفة مدى قدرة أدوات الذكاء الاصطناعي المختلفة على قراءة كتب قواعد الولايات الخمسين هذه والإجابة على الأسئلة بدقة.
إليك تفاصيل ما وجدوه، باستخدام تشبيهات بسيطة:
1. المتنافسون الثلاثة
وضع الباحثون ثلاثة "طلاب ذكاء اصطناعي" مختلفين تحت الاختبار:
- الطالب المتخصص (STARA): أداة متخصصة صممها الباحثون خصيصًا لقراءة القوانق القانونية. إنه مثل طالب حفظ المكتبة بأكملها ويعرف بالضبط كيفية العثين على كتاب من خلال عنوانه.
- الطالب من العلامة التجارية الكبرى (أ) (Westlaw AI): أداة قانونية شهيرة وباهظة الثمن تُسوق للمحامين. إنه مثل موسوعة عامة تدعي معرفة كل شيء لكنها تحاول حل مسألة رياضية محددة جدًا.
- الطالب من العلامة التجارية الكبرى (ب) (Lexis+ AI): أداة قانونية شهيرة أخرى، مشابهة للطالب (أ)، تدعي أنها "مغيرة لقواعد اللعبة".
2. النتائج: من اجتاز الاختبار؟
كان الاختبار عبارة عن سلسلة من أسئلة الصواب والخطأ حول قوانين البطالة في جميع أنحاء الولايات المتحدة.
الطالب المتخصص (STARA) تفوق ببراعة: حصل على 83% من الإجابات الصحيحة. وعندما راجع الباحثون الإجابات "الخاطئة"، أدركوا أن الطالب كان في الواقع على حق، ولكن نموذج الإجابة الرسمي (الذي وضعه خبراء بشريون) كان هو الخطأ. وبمجرد تصحيح نموذج الإجابة، قفزت درجة هذا الطالب إلى 92%.
- التشبيه: هذا الطالب لم يقم بالتخمين فحسب؛ بل قرأ التفاصيل الدقيقة بالفعل. حتى أنه وجد قواعد فات خبراء البشر ملاحظتها!
الطلاب من العلامات التجارية الكبرى تعثروا:
- Westlaw AI حصل على حوالي 58% من الإجابات الصحيحة. كان متحمسًا جدًا لقول "نعم" لدرجة أنه اخترع قواعد غير موجودة (هلوسة).
- Lexis+ AI حصل على حوالي 64% من الإجابات الصحيحة. كان حذرًا جدًا ونادرًا ما يقول "نعم"، لكن هذا يعني أنه فوت الكثير من القواعد الصالحة (قال "لا" بينما كانت الإجابة "نعم").
- التشبيه: كان Westlaw AI مثل طالب يخمن "صواب" لكل شيء ليحصل على درجات، حتى عندما لا يعرف الإجابة. أما Lexis+ AI فكان مثل طالب يخشى الوقوع في الخطأ لدرجة أنه يترك معظم الأسئلة فارغة.
3. المفاجأة الكبرى: "نموذج الإجابة" كان خاطئًا
الاكتشاف الأكثر صدمة لم يكن يتعلق بالذكاء الاصطناعي؛ بل كان يتعلق بالبشر.
تم تقييم الاختبار بناءً على تقرير رسمي أعدته وزارة العمل الأمريكية (DOL). تم إعداد هذا التقرير بواسطة فرق من المحامين البشر الذين قضوا ستة أشهر في قراءة القوانين يدويًا. افترض الباحثون أن هذا التقرير هو "الحقيقة المطلقة".
ولكن عندما فحصوا الإجابات "الخاطئة" للذكاء الاصطناعي، وجدوا أن الذكاء الاصطناعي كان غالبًا على حق، والخبراء البشريين كانوا على خطأ.
- فات خبراء البشر ملاحظة قوانين صالحة في عدة ولايات.
- وجد الذكاء الاصطناعي هذه القوانين المفقودة لأنه قرأ النص الخام بدقة أكبر من الفريق البشري المرهق.
- التشبيه: تخيل معلمًا يصحح اختبارًا باستخدام نموذج إجابة قديم وغير محدث. الطالب (الذكاء الاصطناعي) يكتب الإجابة الصحيحة، لكن المعلم يعتبرها خاطئة لأن النموذج يفتقر إلى التحديث. أدرك الباحثون أن "المعلم" (وزارة العمل) كان بحاجة لتحديث نموذجه!
4. لماذا فشلت العلامات التجارية الكبرى؟
توضح الورقة أن الأدوات التجارية (Westlaw و Lexis) لديها عيوب تصميمية رئيسية لهذا العمل المحدد:
- فخ "حد عدد الحروف": لدى Westlaw AI حد صارم على كمية النص التي يمكنك كتابتها فيه. إنه مثل محاولة شرح سؤال قانوني معقد باستخدام تغريدة فقط. يجب عليك حذف كل التفاصيل المهمة، مما يؤدي إلى ارتباك الذكاء الاصطناعي.
- فخ "الكلمات المفتاحية": تبحث هذه الأدوات غالبًا عن كلمات تبدو متشابهة بدلاً من فهم المعنى. إذا سألت عن "البطالة"، فقد تستخرج قانونًا عن "التمييز في التوظيف" لمجرد أنهما يشتركان في كلمة "التوظيف".
- مشكلة "الصندوق الأسود": نحن لا نعرف بالضبط كيف تعمل هذه الأدوات التجارية. إنها مثل "كرة 8 سحرية". تسأل سؤالاً، فيعطيك إجابة، لكنه لن يريك الصفحة المحددة من القانون التي استخدمها لاتخاذ القرار. وهذا يجعل من الصعب الوثوق بها.
5. الخلاصة
تخلص الورقة إلى أن للذكاء الاصطناعي إمكانات هائلة في البحث القانوني، لكننا بحاجة لبنائه بشكل مختلف.
- لا تستخدم الذكاء الاصطناعي العام فقط: لا يمكنك مجرد توصيل روبوت دردشة عام بقاعدة بيانات قانونية وتوقع أن يعمل. أنت بحاجة إلى أدوات مصممة خصيصًا لفهم هيكل القوانين (مثل STRA).
- الخبراء البشريون يرتكبون الأخطاء أيضًا: حتى أفضل الفرق البشرية قد تفوت بعض الأشياء. يمكن للذكاء الاصطناعي أن يساعد البشر من خلال مراجعة عملهم والعثور على القواعد التي أغفلوها.
- الشفافية هي المفتاح: يجب أن يوضح الذكاء الاصطناعي طريقة عمله. لا ينبغي أن يقول "نعم" أو "لا" فحسب؛ بل يجب أن يقول "نعم، وإليك الفقرة المحددة في القانون التي تثبت ذلك".
باختًا: تفوق الطالب المتخصص في الذكاء الاصطناعي (STARA) على العلامات التجارية التجارية الشهيرة، بل ووجد أخطاء في عمل الخبراء البشريين. يبدو أنه عندما يتعلق الأمر بقراءة التفاصيل الدقيقة لـ 50 قانون ولاية مختلف، فإن روبوتًا متخصصًا وذكيًا قد يكون أفضل من فريق بشري مرهق أو أداة تجارية براقة وعامة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.