Temporal Misgrounding in Legal RAG: A Versioned-Corpus Benchmark for French Tax Law
تقدم هذه الورقة البحثية FiscalQA Pro، وهو معيار مرجعي يوضح أن أنظمة استرجاع المعلومات المعززة بالتوليد (RAG) القانونية القياسية تفشل في التعامل مع الخطأ الزمني في تحديد المراجع في قانون الضرائب الفرنسي من خلال استرجاع النسخ الحالية فقط من المواد، وتُظهر أن نظام استرجاع مدرك للإصدارات يمكنه تحقيق دقة بنسبة 98.3% مقارنة بالأداء الذي يقترب من الصفر للنهج الثابت.
المؤلفون الأصليون:Rose Cymbler, Daniel Guez, Laurent Fabre
تخيل أنك تحاول حل لغز ما، لكن المكتبة التي تبحث فيها تتبع قاعدة غريبة للغاية: في كل مرة تُضاف صفحة جديدة إلى كتاب أو تتغير جملة فيه، لا يضع أمين المكتبة كتاباً جديداً على الرف، بل يمسح الصفحات القديمة ويعيد كتابة الكتاب الحالي، تاركاً النسخة الأحدث فقط مرئية. إذا سألت: "ماذا قال الكتاب في عام 1995؟" وسلمك أمين المكتبة نسخة عام 2025 فقط، فستحصل على الإجابة الخاطئة، رغم أن الكتاب يبدو متطابقاً تماماً من حيث الغلاف. هذا هو عالم الذكاء الاصطناي القانوني، وهو مجال تحاول فيه الحواسيب قراءة القوانين والإجابة على الأسئلة مثل المحامي. وللقيام بذلك، يستخدمون تقنية تسمى RAG (التوليد المعزز بالاسترجاع)، وهي تشبه طالباً ذكياً جداً يُسمح له بالبحث عن الحقائق في كتاب مدرسي قبل الإجابة على سؤال في اختبار. المشكلة هي أن معظم هذه الكتب المدرسية تُعامل كما لو أنها لا تتغير أبداً. لكن القوانين تتغير بالفعل، وغالباً في كل عام. إذا لم يدرك الكمبيوتر أن قانوناً من عام 2018 يختلف عن قانون اليوم، فسيقدم لك نصيحة خاطئة بكل ثقة، وهو أمر قد يكون كارثياً في أمور مثل دفع الضرائب أو فهم حقوقك.
هذه الورقة البحثية، التي تحمل عنوان "الخطأ الزمني في التأسيس القانوني" (Temporal Misgrounding in Legal RAG)، تحقق في هذه المشكلة تحديداً في قانون الضرائب الفرنسي. اكتشف المؤلفون نمط فشل محدد أطلقوا عليه اسم الخطأ الزمني في التأسيس (temporal misgrounding). يحدث هذا عندما يتجاهل الكمبيوتر، عند سؤاله عن قانون من الماضي، التاريخ المذكور في السؤال ويقوم ببساطة بجلب النسخة الحالية من القانون لأنها النسخة الوحيدة التي يمكنه العثور عليها بسهولة. لقد بنوا مكتبة ضخمة "للسفر عبر الزمن" للقانون الضريبي الفرنسي، تحتوي على 32,436 نسخة مختلفة من المواد الممتدة على مدار 93 عاماً (من 1938 إلى 2031). ثم أنشأوا اختباراً صعباً يسمى FiscalQA Pro يحتوي على 209 سؤالاً راجعها خبراء، تتطلب هذه الأسئلة تحديداً معرفة القانون من تاريخ ماضٍ، وليس قانون اليوم.
كانت النتائج صادمة. فعندما اختبروا 11 نموذجاً مختلفاً للذكاء الاصطناعي (بما في ذلك النماذج الأكثر تقدماً المتاحة)، فشلت الحواسيب فشلاً ذريعاً عندما لم تتمكن من البحث عن النسخة الصحيحة. بدون مساعدة، أجاب الذكاء الاصطناعي بشكل صحيح 3.0% فقط من المرات. وعندما أعطوهم "كتاباً مدرسياً" معيارياً يحتوي فقط على القانون الحالي، كان أداؤهم أسوأ، حيث حققوا 2.7% فقط من الإجابات الصحيحة. في الواقع، استرجع النظام المعياري النسخة التاريخية الصحيحة بنسبة 0% من المرات؛ فقد استشهد بثقة بالقانون الحالي وكأنه قانون الماضي. ومع ذلك، عندما بنى المؤلفون نظاماً يمكنه بالفعل البحث عبر مكتبتهم "للسفر عبر الزمن" للعثور على النسخة المحددة من القانون التي كانت سارية في التاريخ المذكور في السؤال، ارتفرت دقة الذكاء الاصطناعي بشكل هائل لتصل إلى 98.3%.
تثبت الورقة أن المشكلة ليست في أن الذكاء الاصطناعي ليس ذكياً بما يكفي لفهم القانون، بل في أن المكتبة التي يبحث فيها "معطلة". يجادل المؤلفون بأننا بحاجة إلى التوقف عن معاملة الوثائق القانونية كأشياء ثابتة والبدء في معاملتها كأشياء حساسة للوقت. لقد أظهروا أنه بمجرد إصلاح نظام الاسترجاع للبحث عن التاريخ الصحيح، يمكن للذكاء الاصطناعي حل هذه المشكلات بشكل مثالي تقريباً. كما أطلقوا مجموعة البيانات الضخمة الخاصة بهم والكود البرمجي لنظام البحث الخاص بهم المراعي للوقت، آملين في مساعدة الباحثين الآخرين على بناء ذكاء اصطناعي لا يقدم لك نصائح قانونية قديمة بكل ثقة.
ملخص تقني: الخطأ في التوجيه الزمني في أنظمة الاسترجاع المعزز بالتوليد (RAG) القانونية
تعريف المشكلة: الخطأ في التوجيه الزمني (Temporal Misgrounding)
تحدد الورقة البحثية الخطأ في التوجب الزمني كنمط فشل منهجي في أنظمة الاسترجاع المعزز بالتوليد (RAG) القانونية. تحدث هذه الظاهرة عندما يقوم النظام باسترجاع والاستشهاد بالنسخة الحالية السارية من مادة قانونية، حتى عندما يكون القانون الواجب التطبيق لسؤال معين هو نسخة سابقة أو مستقبلية.
يجادل المؤلفون بأن أنظمة الـ RAG القانونية القياسية تعامل المتن (corpus) ككيان ثابت، بينما تعتبر الإجابة على الأسئلة القانونية بطبيعتها مشكلة استرجاع مرتبطة زمنياً. وينتج هذا الفشل عن ثلاثة أسباب هيكلية جذرية:
التحيز للوقت الراهن في المعلمات (Parametric Recency Bias): يتم تدريب النماذج اللغوية الكبيرة (LLMs) على لقطات (snapshots) تمثل بشكل مفرط الحالات القانونية الحديثة، مما يوجه الأولويات نحو القانون الحالي.
غياب الشرط الزمني (Absence of Temporal Conditioning): تقوم أدوات الاسترجاع الكثيفة القياسية بالفهرسة بناءً على التشابه الدلالي دون اشتراط التاريخ الضمني في السؤال.
تطابق أرقام المواد (Article-Number Aliasing): تستمر معرفات المواد (مثل المادة 219 من قانون الضرائب العام CGI) عبر النسخ المختلفة، لكن محتواها الجوهري (المعدلات، العتبات) يتغير. ولا يمكن للاسترجاع البسيط التمييز بين النسخة المقصودة.
وتفترض الورقة أن النماذج اللغية الكبيرة الأكبر أو الأحدث لا تحل هذه المشكلة في معلماتُها، وذلك بسبب الحجم الهائل للنسخ التاريخية وصعوبة التمييز بين النصوص المتشابهة جداً دون تغييرات هيكلية في عملية الاسترجاع.
المنهجية وتصميم المعيار (Benchmark)
متن FiscalQA Pro
لمعالجة ذلك، أنشأ المؤلفون FiscalQA Pro، والذي يتكون من:
متن متعدد النسخ: 32,436 نسخة من مواد قانون الضرائب الفرنسي (CGI، وملاحقه، وLPF) تغطي 93 عاماً (1938–2031). ويتضمن هذا أيضاً نسخاً ستدخل حيز التنفيذ مستقبلاً بموجب قوانين المالية الأخيرة.
ربط الاجتهاد القضائي: مجموعة بيانات مساعدة تضم 69,208 رابط استشهاد تربط القرارات القضائية بنسخ المواد المحددة التي كانت سارية وقت صدور القرار (بدقة تتراوح بين 98-99%).
البناء: تم استخراج البيانات من واجهة برمجة تطبيقات PISTE Légifrance الرسمية، مما يضمن إمكانية تتبع المصدر بالكامل على مستوى نسخة المادة مع حقول صريحة لـ تاريخ البدء وتاريخ الانتهاء.
مسار الاستدلال الزمني R3
المعيار الأساسي هو مسار R3، المصمم لعزل الخطأ في التوجيه الزمني.
النطاق: 209 سؤالاً تم تقييمها بدقة من قبل خبراء عبر 33 مادة من قانون الضروت (CGI) (تم إصدار 221 مادة، واستبعاد 12 منها لأسباب تتعلق بالنطاق).
الصعوبة: المجموعة هي "صعبة على جميع النماذج" (all-model-hard). حيث ضمن مرشح المعرفة المعلمية (parametric knowledge filter) عدم قدرة أي نموذج تم تقييمه (عبر 11 نموذجاً و4 عمليات سحب عشوائي) على الإجابة على الأسئلة من ذاكرته وحدها.
آلية التسجيل: يتم تسجيل الإجابات بشكل حتمي عبر "جزيئات" (nuggets) من الحقيقة الأرضية (التي تطابق عبر التعبيرات النمطية own regex-matched article identifiers والقيم الرقمية مع هامش سماح). ويرفض المؤلفون صراحةً استخدام "النموذج اللغوي كحكم" (LLM-as-judge) في التسجيل لتجنب توريث نفس التحيز الزمني الذي يهدف النظام لتقييمه.
أنظمة الأسئلة: تركز الورقة على R3 (الاستدلال الزمني)، حيث تعتمد الإجابة الصحيحة على نسخة القانون في تاريخ محدد. وقد تم إصدار أنظمة أخرى (R1: استخراج الاستشهاد، R2: الحساب الحتمي، R4: التركيب متعدد المستندات) كمسارات إضافية.
التصميم التجريبي
أجرى المؤلفون تجربة مضبوطة من ثلاثة شروط على مجموعة فرعية R3 باستخدام 11 نموذجاً (5 نماذج مفتوحة المصدر/مغلقة API، و1 نموذج بديل، و5 نماذج ذات أوزان مفتوحة):
الحالة (A) (النموذج اللغوي فقط): المعرفة المعلمية فقط (بدون استرجاع).
الحالة (B) (RAG ثابت): الاسترجاع عبر متن ثابت يحتوي على النسخة الحالية فقط (يمثل الأنظمة المنشورة حالياً). يُعطى النموذج معرف المادة الصحيح ولكن النسخة الحالية فقط.
الحالة (C) (RAG مدرك للنسخ): الاسترجاء عبر متن متعدد النسخ زمنياً.
Cor (المرجع/الأوراكل): يُعطى النموذج معرف المادة الصحيح ولكن يجب عليه اختيار النسخة الصحيحة من الفهرس.
Cprod (العملية الكاملة/من البداية للنهاية): يجب على النموذج استرجاع كل من المادة الصحيحة والنسخة الصحيحة بدون مساعدة من "أوراكل".
النتائج الرئيسية
فشل النهج الثابت
المعرفة المعلمية (الحالة A): بلغ متوسط الدقة الصارمة عبر 11 نموذجاً 3.0%.
RAG الثابت (الحالة B): بلغ متوسط الدقة الصارمة 2.7%، وهو غير مختلف إحصائياً عن الحالة A. والأهم من ذلك، أن RAG الثابت استرجع النسخة الصالحة للتاريخ بنسبة 0% من المرات. لقد استشهد بثقة بنسخ حقيقية ولكنها غير قابلة للتطبيق (الحالية).
الاستنتاج: يفشل نظام RAG القياسي ليس بصمت، بل بثقة، حيث يستبدل القانون التاريخي بالقانون الحالي.
نجاح الاسترجاع المدرك للنسخ
اختيار النسخة عبر الأوراكل (Cor): عندما تم توفير المادة الصحيحة واختار النموذج النسخة الصحيحة، وصل متوسط الدقة الصارمة إلى 99.1%. وهذا يثبت أنه بمجرد توفر النسخة الصحيحة، يمكن للنماذج استخراج القيمة الصحيحة.
الاسترجاع من البداية للنهاية (Cprod): حقق المسترجع المتكامل، بدون أوراكل، متوسط دقة صارمة قدره 98.3%.
تحليل عنق الزجاجة: الفجوة بين Cor (99.1%) وCprod (98.3%) هي 0.8 نقطة، وتُعزى بالكامل إلى الاستدعاء في المرحلة الأولى (تحديد المادة الصحيحة) وليس اختيار النسخة. كانت النسخة الذهبية موجودة في أفضل 5 نتائج مسترجعة لـ 99% من الأسئلة.
الأهمية والادعاءات
تدعي الورقة أن الإجابة على الأسئلة القانونية يجب إعادة صياغتها كمسألة استرجاع مرتبطة زمنياً. المساهمة الرئيسية هي إثبات أن عنق الزجاجة في RAG القانوني للأسئلة الحساسة للوقت ليس حجم النموذج أو قدرة الاستدلال، بل غياب الفهرسة المدركة للنسخ والاسترجاع المشروط بالتاريخ.
هيكلي مقابل معلمي: فشل التوجيه الزمني هو أمر هيكلي في بنية الاسترجاع، وليس قصوراً في معلمات النموذج اللغوي. ، بل هو مسألة هيكلية في بنية الاسترجاع، وليس قصوراً في معلمات النموذج اللغوي.
التقييم الحتمي: من خلال استخدام التعبيرات النمطية (regex) والجزيئات الرقمية بدلاً من أحكام النماذج اللغية، يتجنب المعيار التحيز الدائري، مما يوفر مقياساً موثوقاً للتوجيه الزمني.
التعميم: رغم التركيز على قانون الضرائب الفرنسي، يجادل المؤلفون بأن الخطأ في التوجيه الزمني هو مشكلة هيكلية لأي متن تشريعي مدني يتم تعديله في مكانه (مثل الأنظمة الألمانية أو السويسرية أو البلجيكية)، كما هو مثبت في النتائج المستقلة المتزامنة في الأسئلة التشريعية الألمانية.
يقدم العمل أول متن متعدد النسخ ومعيار مصمم خصيصاً لقياس وتخفيف الخطأ في التوجيه الزمني، مع إتاحة المتن، والمعيار، واستجابات النماذج، وكود خط الإنتاج (pipeline) للمجتمع العلمي.