Annotated Surrogate Retrieval for Polish Statutory Law
تقدم هذه الورقة البحثية وتقيّم ثلاث طرق لاسترجاع القانون التشريعي البولندي تستخدم بدائل وثائق مُولدة بواسطة النماذج اللغوية، حيث تُظهر أن تسلسل ASCR-H مع إعادة التصنيف يتفوق بشكل كبير على النماذج المرجعية الحالية في دقة الترتيب العلوي في أسئلة الامتحانات القانونية، بينما يحقق بديل أكثر كفاءة من حيث التكلفة (DTF) أداءً مماثلاً في مقدمة الترتيب مع زمن انتقال وتكلفة أقل بكثير.
في المكتبة الشاسعة لقوانين أمة ما، يعد العثور على الفقرة الوحيدة التي تجيب على سؤال قانوني محدد مهمة تتطلب دقة متناهية. تخيل مكتبة تحتوي على أكثر من ثمانين ألف مادة متميزة، كل منها قطعة صغيرة من لغز قانوني ضخم. عندما يطرح محامٍ أو طالب سؤالاً، فإن الإجابة ليست ملخصاً عاماً أو مجموعة من الأفكار ذات الصلة؛ بل هي جملة واحدة محددة مدفونة في مكان ما داخل ذلك الجبل من النصوص. إذا استرجع نظام حاسوبي المادة الصحيحة ولكنه وضعها في المرتبة العاشرة في قائمة الاقتراحات، فقد يغفل عنها القارئ البشري الذي يتصفح النتائج الأولى تماماً، مما يجعل عملية البحث عديمة الفائدة. هذا هو التحدي الجوهري لاسترجاع النصوص التشريعية: يجب ألا يكتفي النظام بإيجاد المستند الصحيح فحسب، بل يجب أن يضعه في مقدمة القائمة تماماً. وما يزيد هذه المشكلة تعقيداً هو طبيعة اللغة نفسها؛ ففي اللغة البولندية، تتغير أشكال الكلمات بناءً على دورها في الجملة، مما يعني أن السؤال وإجابته القانونية قد يتشاركان المعنى نفسه ولكنهما قد يبدوان مختلفين تماماً من الناحية الظاهرية.
وضع الباحثون هدفاً لحل هذه المشكلة المحددة للقانون البولندي عبر اختبار ثلاث استراتيجيات مختلفة لمساعدة الحواسيب في العثور على المادة القانونية الصحيحة. وقد بنوا اختبارهم على أسئلة حقيقية من امتحانات دخول المتدربين القانونيين لعامي 2024 و2025 في بولندا. هذه أسئلة عالية المخاطر حيث تكون الإجابة الصحيحة هي مادة قانونية واحدة. أنشأ الفريق نظاماً لا يكتفي بقراءة النص الخام للقوانين فحسب، بل يلحق أيضاً "بديلاً" (surrogate) بكل مادة. تخيل هذا البديل كأنه مجموعة من الملاحظات المفيدة التي كتبها مساعد ذكي لكل مادة قانونية قبل بدء عملية البحث. تتضمن هذه الملاحظات ملخصاً، وقائمة بالمواضيع، ومجموعة من الأسئلة الافتراضية التي يمكن للمادة أن تجيب عليها. وعندما يطرح المستخدم سؤالاً، يمكن للحاسوب أن يطابق السؤال مع هذه الملاحظات المكتوبة مسبقاً، والتي غالباً ما تسد الفجوة بين كيفية طرح الشخص للسؤال وبين كيفية صياغة القانون.
اختبرت الدراسة ثلاثة مناهج متميزة لاستخدام هذه الملاحظات. المنهج الأول، الذي يسم الله الباحثون ASCR-H، يعمل مثل محرر دقيق؛ فهو يستخدم الملاحظات أولاً لتضييق نطاق البحث إلى القوانين الأكثر واعدة، ثم يستخدم طريقة بحث كثيفة لإيجاد احتمالات أخرى، وأخيراً يستخدم نموذج لغة قوياً لإعادة ترتيب المرشحين الأوائل. هذه الطريقة بطيئة ومكلفة لأنها تطلب من الحاسوب التفكير بعمق في القائمة عدة مرات. أما المنهج الثاني، DTF، فهو أسرع وأرخص بكثير؛ إذ يتخطى مرحلة التفكير العميق وإعادة الترتيب، وبدلاً من ذلك، يدمج النتائج من ثلاث طرق بحث مختلفة — إحداها تنظر في الملاحظات، وأخرى تنظر في النص الخام، وثالثة تنظر في هيكلية القانون — ويدمجها في قائمة واحدة باستخدام قاعدة رياضية ثابتة. والمنهج الثالث هو حل وسط، حيث يتخلى عن خطوة إعادة الترتيب لكنه يحتفظ بعملية التصفية الأولية.
كشفت النتائج عن مقايضة واضحة بين السرعة والدقة في أعلى القائمة. كان منهج "المحرر الدقيق" (ASCR-H) الأكثر نجاحاً في وضع المادة الصحيحة في المرتبة الأولى، حيث نجح بنسبة 72.3%، متفوقاً بشكل ملحوظ على جميع الطرق الأخرى التي لم تكن تعرف الإجابة مسبقاً. أما المنهج السريع (DTF)، فقد وضع المادة الصحيحة في الصدارة بنسبة 51.9% فقط، بفارق يزيد عن عشرين نقطة. ومع ذلك، تتغير القصة إذا نظرت إلى أسفل القائمة؛ فبينما كان "المحرر الدقيق" أفضل في المقدمة، إلا أن المنهج السريع استدرك الفارق بسرعة. وبحلول الوقت الذي تصل فيه إلى أول عشرين نتيجة، يصبح المنهجان متماثلين إحصائياً، بل ويبدأ المنهج السريع في الأداء بشكل أفضل قليلاً في المستويات الأعمق. وهذا يشير إلى أنه إذا كان الإنسان مستعداً لتصفح قائمة أطول، فإن النظام الأسرع والأرخص سيكون فعالاً بنفس القدر.
كما اكتشف الباحثون ما لم ينجح. فقد اختبروا العديد من الحيل الشائعة المستخدمة في أنظمة البحث الأخرى، مثل إعادة كتابة سؤال المستخدم لجعله أكثر وضوحاً، أو استخدام تقنية تسمى "التغذية الراجعة لصلة شبه حقيقية" (pseudo-relevance feedback)، والتي تحاول تحسين البحث من خلال التظاهر بأن النتائج الأولى صحيحة واستخدامها لتنقيح الاستعلام. لم تنجح أي من هذه الحيل؛ بل إن بعضها جعل النتائج أسوأ. كما وجدوا أن مجرد استخدام قاموس لتجريد الكلمات من نهاياتها — وهو حل شائع للغات ذات القواعد المعقدة — لم يقدم أي فائدة لأن أسئلة الامتحان كانت مكتوبة بالفعل بلغة قريبة جداً من لغة القوانين نفسها.
ولعل النتيجة الأكثر إثارة للدهشة هي أن جعل المادة الصحيحة في رأس القائمة لم يؤدِ بالضرورة إلى تحسين الإجابة النهائية. فقد اختبر الباحثون ما إذا كان برنامج حاسوبي، يعمل كقاضٍ، يمكنه اختيار الإجابة الصحيحة من متعدد بناءً على المواد المسترجعة. ووجدوا أن الحاسوب كان بارعاً بالفعل في الإجابة على هذه الأسئلة من معرفته الداخلية، لدرجة أنه لم يكن يهم كثيراً ما إذا كانت المادة الصحيحة مصنفة في المرتبة الأولى أو الخامسة. لقد وصل النظام إلى حالة التشبع؛ فهو يعرف الإجابة دون الحاجة إلى النص. وهذا يعني أنه بالنسبة لهذا النوع من الامتحانات، فإن الجهد الهائل المطلوب للوصول إلى الترتيب المثالي في المقدمة قد لا يستحق التكلفة، لأن النتيجة النهائية ستكون هي نفسها. وتخلص الدراسة إلى أن الأداة المثلى للبحث القانوني تعتمد كلياً على الهدف: إذا كنت بحاجة إلى أفضل فرصة لرؤية القانون الصحيح فوراً، فإن المنهج المكلف والدقيق هو الأفضل. ولكن إذا كنت بحاجة إلى تغطية نطاق واسع من الاحتمالات بسرعة وبتكلفة منخفضة، فإن المنهج السريع والبسيط لا يقل كفاءة، بشرط أن تكون مستعداً للبحث بعمق أكبر في النتائج.
تعريف المشكلة يتناول هذا العمل استرجاع نصوص تشريعية محددة للأسئلة القانونية البولندية، وهي مهمة تتميز بهدف ضيق للغاية: تحديد مادة واحدة حاكمة من بين عشرات الآلاف. وخلافاً لمعايير استرجاع المعلومات القانونية الحالية (مثل BSARD) التي غالباً ما تتضمن مهام تصنيف أو صلة متعددة الملصقات، يركز هذا البحث على دقة الرتبة الأولى (rank-one accuracy)، حيث يكون أداء المولد اللاحق (downstream generator) أكثر حساسية لموضع النص التشريعي الصحيح في رأس القائمة. وتزداد المشكلة تعقيداً بسبب الصرف الاشتقاقي للغة البولندية (سبع حالات إعرابية)، مما يخلق عدم تطابق في المفردات بين أسئلة الاختبار والنص التشريعي الفعلي. علاوة على ذلك، فإن موارد الاسترجاع البولندية الحالية إما تعتمد على مجموعات بيانات أصغر، أو تركز على استرجاع الفقرات بدلاً من مستوى المادة، أو تستخدم مجموعات بيانات مشتقة مباشرة من مفاتيح الإجابات، مما يجعلها غير كافية لتقديم تحدٍ حقيقي.
المنهجية يقترح المؤلف عائلة من طرق الاسترجاع القائمة على البدائل المستندية (document surrogates): وهي تعليقات نموذج لغوي يتم إنشاؤها مرة واحدة لكل مادة عند مرحلة الفهرسة. تتكون هذه البدائل من ملخص، وموضوع، ومجموعة مفاهيم، وأسئلة افتراضية يمكن للمادة الإجابة عليها. تدرس الدراسة ثلاثة تصميمات متميزة تغطي نطاقاً في زمن الاستجابة يصل إلى تسعة أضعاف، إلى جانب أربعة عشر خط أساس (baselines) وأربعة ضوابط (controls)، وذلك على متن يتكون من 82,588 مادة من 1,133 قانوناً.
ASCR (التتالي البديل المشروح): نظام استرجاع مكون من مرحلتين.
مرحلة المستند: يتم تسجيل درجات القوانين بناءً على تجميع مجموعات المفاهيم، والملخصات، ومطابقة النطاق.
مرحلة المادة: يتم تسجيل درجات المواد داخل القوانين المختارة باستخدام مطابقة الموضوع، والمفهوم، والأسئلة الافتراضية.
إعادة الترتيب (Reranking): يقوم نموذج لغوي (gemini-3.1-flash-lite) بإجراء عملية إعادة ترتيب قائمة واحدة (listwise) لأفضل 40 مرشحاً.
ASCR-H (ASCR مع دمج الأدلة الكثيفة): يعزز ASCR عبر دمج استرجاع كثيف (باستخدام multilingual-e5-large) في التتالي قبل مرحلة إعادة الترتيب. هذا يكشف مرحلة إعادة الترتيب عن مواد موجودة في قوانين تم استبعادها في مرحلة المستند الأولية، مما يحسن الاستدعاء (recall) دون إضافة زمن استجائي فعلي، حيث يعمل الفرع الكثيف بالتوازي مع تحليل الاستعلام.
DTF (الدمج الثلاثي الحتمي للإشارات): تصميم منخفض زمن الاستجابة يلغي استدعاءات النماذج المسبقة. يقوم بدمج ثلاثة مسترجعات:
يتم إعادة تسجيل القائمة المدمجة باستخدام أولوية حتمية تستغل اسم القانون المذكور صراحة في نص السؤال، مما يؤدي إلى معاقبة المواد الملغاة وتعزيز المواد المذكورة في الاستعلام.
المساهمات الرئيسية
ثلاثة تصميمات قائمة على البدائل: يحدد البحث رسمياً ثلاثة بنى استرجاع توازن بين زمن الاستجابة والدقة، مما يثبت إمكانية دمج التعليقات البديلة بفعالية في الاسترجاع التشريعي.
تقييم منضبط: تقييم صارم لـ 17 تكويناً و4 ضوابط على 300 سؤال امتحاني (264 منها قابلة للاسترجاع) من امتحانات المحاماة ودخول المستشارين القانونيين لعامي 2024 و2025 في بولندا. تستخدم الدراسة اختبارات McNemar المقترنة مع تصحيح الاستمرارية لتقييم الدلالة الإحصائية عبر ستة أعماق استرجاع.
التقارب المعتمد على العمق: يحدد المؤلف تباعداً في الأداء بناءً على عمق الاسترجاع؛ حيث تهيمن إعادة الترتيب عند الرأس (الرتبة 1)، بينما يتصدر الدمج الحتمي عند العمق (الرتبة 20+)، مما يشير إلى أن الدقة والتغطية تُكتسبان بآليات مختلفة.
الاستئصال والنتائج السلبية: تعزل الدراسة مساهمة كل مكون وتورد ثلاث نتائج سلبية: فشل كل من التجذير (lemmatisation)، والتغذية الراجعة لصلة شبه حقيقية (pseudo-relevance feedback)، وإعادة كتابة الاستعلام في تحسين الاسترجاع لهذه المهمة المحددة.
النتائج
دقة الرتبة الواحدة: يحقق ASCR-H أعلى دقة للرتبة الأولى بنسبة 72.3%، متفوقاً بشكل كبير على جميع التكوينات الأخرى غير "الأوراكل" (oracle) باستثناء أحد عمليات الاستئصال الخاصة به (no-concepts). يمثل هذا تحسناً كبيراً عن BM25 (61.7%) والاسترجاع الكثيف (52.3%). وتتحمل مرحلة إعادة الترتيب وحدها مسؤولية زيادة قدرها 27.6 نقطة في دقة الرتبة الأولى.
الأداء عند العمق: لا يستمر تفوق ASCR-H عند القطوع الأعمق. فبحلول قطع 10، يصبح الفارق في الأداء بين ASCR-H و DTF غير ذي دلالة إحصائية. وعند قطع 20، يتصدر DTF في تقدير النقاط (86.0% مقابل 84.5%) ويحقق أعلى معدل ضرب للمستند (92.0%) ودقة استشهاد (70.3%، مطابقة لسقف الأوراكل) بنموذج زمن استجابة أقل بمرة واحدة وتكلفة أقل من نصف تكلفة ASCR-H.
دقة الاستشهاد مقابل الترتيب: النتيجة الحاسمة هي أن مكاسب الترتيب لا تترجم إلى دقة الاستشهاد. فبينما يضع ASCR-H المادة الصحيحة في الرتبة الأولى بشكل أكثر تكراراً، فإن قدرة المولد على الاستشهاد بالمادة قد وصلت إلى حالة التشبع؛ حيث يطابق DTF دقة استشهاد "الأوراكل" رغم تراجعه عن ASCR-H بـ 20 نقطة في الرتبة الأولى. يشير هذا إلى أن المولد حساس لوجود المادة الصحيحة في نافذة السياق ولكنه متسامح مع موقعها المحدد داخل تلك النافذة.
النتائج السلبية:
التجذير (Lemmatisation): لم يقدم أي فائدة، ويرجع ذلك على الأرجح إلى أن أسئلة الامتحانات تقتبس اللغة التشريعية بدقة.
التغذية الراجعة لصلة شبه حقيقية: أضرت بدقة الرأس (انخفاض Hit@1 بمقدار 6.1 نقطة) مع تحقيق مكاسب عند العمق، وهي مقايضة غير مواتية لمهام الرتبة الأولى.
إعادة كتابة الاستعلام: فشلت في تحسين الاسترجاع الكثيف أو المعجمي المستقل، رغم أنها قدمت قيمة عند استخدامها لتكييف الحقول داخل تسلسل ASCR.
استبدال البدائل: استخدام البدائل بدلاً من النص الفعلي (bm25-surrogate) كان أداؤه أسوأ من النص الفعلي، مما يشير إلى أن البدائل هي إشارات مكملة وليست بديلة.
الأهمية والادعاءات يزعم البحث أنه بالنسبة للقانون التشريعي البولندي، فإن إعادة الترتيب هي المكون المهيمن لتحقيق دقة عالية في الرتبة الأولى، مع عدم تحديد بديل أرخص. ومع ذلك، بالنسبة للتطبيقات التي تعطي الأولوية للتغطية وكفاءة التكلفة، فإن الدمج الحتمي (DTF) يوفر بديلاً قابلاً للتطبيق يطابق دقة استشهاد "الأوراكل" بجزء ضئيل من التكلفة.
يشير المؤلف بتواضع إلى أن أسئلة المعيار تقيس الاختيار من متعدد، وتقتبس اللغة التشريعية عن كثب، وتسمي القانون الحاكم صراحة، مما قد يرفع تقديرات الأداء مقارنة باستعلامات الممارسين. كما أفصح عن محدودية تتعلق بـ تغطية البدائل: فبينما تغطي البدائل 27% من المتن، فإنها تغطي 100% من المواد المرجعية في المعيار بسبب إعطاء الأولوية للقوانين الرئيسية. قد تساهم هذه التباينية في أداء الطرق القائمة على البدائل، وإن كان المؤلف يجادل بأن هذا لا يبطل النتائج المقارنة بين الخطوط الأساسية غير البديلة.
في النهاية، تخلص الدراسة إلى أنه بينما تعد دقة الرتبة الأولى مقياساً ذا معنى لأنظمة الاسترجاع، إلا أنها ليست مؤشراً موثوقاً لجودة الإجابة النهائية في هذا المجال المحدد، حيث غالباً ما تكفي المعرفة المعلمية للمولد للإجابة على السؤال حتى بدون السياق المسترجع. يوفر العمل معياراً عاماً، ومخرجات لكل سؤال، واختبارات دلالة لتسهيل المزيد من الأبحاث في الاسترجاع القانوني.