← أحدث الأبحاث
💬 NLP

Annotated Surrogate Retrieval for Polish Statutory Law

تقدم هذه الورقة البحثية وتقيّم ثلاث طرق لاسترجاع القانون التشريعي البولندي تستخدم بدائل وثائق مُولدة بواسطة النماذج اللغوية، حيث تُظهر أن تسلسل ASCR-H مع إعادة التصنيف يتفوق بشكل كبير على النماذج المرجعية الحالية في دقة الترتيب العلوي في أسئلة الامتحانات القانونية، بينما يحقق بديل أكثر كفاءة من حيث التكلفة (DTF) أداءً مماثلاً في مقدمة الترتيب مع زمن انتقال وتكلفة أقل بكثير.

المؤلفون الأصليون: Orkun Yiğit Cengiz

نُشر 2026-09-01✓ Author reviewed
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Orkun Yiğit Cengiz

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في المكتبة الشاسعة لقوانين أمة ما، يعد العثور على الفقرة الوحيدة التي تجيب على سؤال قانوني محدد مهمة تتطلب دقة متناهية. تخيل مكتبة تحتوي على أكثر من ثمانين ألف مادة متميزة، كل منها قطعة صغيرة من لغز قانوني ضخم. عندما يطرح محامٍ أو طالب سؤالاً، فإن الإجابة ليست ملخصاً عاماً أو مجموعة من الأفكار ذات الصلة؛ بل هي جملة واحدة محددة مدفونة في مكان ما داخل ذلك الجبل من النصوص. إذا استرجع نظام حاسوبي المادة الصحيحة ولكنه وضعها في المرتبة العاشرة في قائمة الاقتراحات، فقد يغفل عنها القارئ البشري الذي يتصفح النتائج الأولى تماماً، مما يجعل عملية البحث عديمة الفائدة. هذا هو التحدي الجوهري لاسترجاع النصوص التشريعية: يجب ألا يكتفي النظام بإيجاد المستند الصحيح فحسب، بل يجب أن يضعه في مقدمة القائمة تماماً. وما يزيد هذه المشكلة تعقيداً هو طبيعة اللغة نفسها؛ ففي اللغة البولندية، تتغير أشكال الكلمات بناءً على دورها في الجملة، مما يعني أن السؤال وإجابته القانونية قد يتشاركان المعنى نفسه ولكنهما قد يبدوان مختلفين تماماً من الناحية الظاهرية.

وضع الباحثون هدفاً لحل هذه المشكلة المحددة للقانون البولندي عبر اختبار ثلاث استراتيجيات مختلفة لمساعدة الحواسيب في العثور على المادة القانونية الصحيحة. وقد بنوا اختبارهم على أسئلة حقيقية من امتحانات دخول المتدربين القانونيين لعامي 2024 و2025 في بولندا. هذه أسئلة عالية المخاطر حيث تكون الإجابة الصحيحة هي مادة قانونية واحدة. أنشأ الفريق نظاماً لا يكتفي بقراءة النص الخام للقوانين فحسب، بل يلحق أيضاً "بديلاً" (surrogate) بكل مادة. تخيل هذا البديل كأنه مجموعة من الملاحظات المفيدة التي كتبها مساعد ذكي لكل مادة قانونية قبل بدء عملية البحث. تتضمن هذه الملاحظات ملخصاً، وقائمة بالمواضيع، ومجموعة من الأسئلة الافتراضية التي يمكن للمادة أن تجيب عليها. وعندما يطرح المستخدم سؤالاً، يمكن للحاسوب أن يطابق السؤال مع هذه الملاحظات المكتوبة مسبقاً، والتي غالباً ما تسد الفجوة بين كيفية طرح الشخص للسؤال وبين كيفية صياغة القانون.

اختبرت الدراسة ثلاثة مناهج متميزة لاستخدام هذه الملاحظات. المنهج الأول، الذي يسم الله الباحثون ASCR-H، يعمل مثل محرر دقيق؛ فهو يستخدم الملاحظات أولاً لتضييق نطاق البحث إلى القوانين الأكثر واعدة، ثم يستخدم طريقة بحث كثيفة لإيجاد احتمالات أخرى، وأخيراً يستخدم نموذج لغة قوياً لإعادة ترتيب المرشحين الأوائل. هذه الطريقة بطيئة ومكلفة لأنها تطلب من الحاسوب التفكير بعمق في القائمة عدة مرات. أما المنهج الثاني، DTF، فهو أسرع وأرخص بكثير؛ إذ يتخطى مرحلة التفكير العميق وإعادة الترتيب، وبدلاً من ذلك، يدمج النتائج من ثلاث طرق بحث مختلفة — إحداها تنظر في الملاحظات، وأخرى تنظر في النص الخام، وثالثة تنظر في هيكلية القانون — ويدمجها في قائمة واحدة باستخدام قاعدة رياضية ثابتة. والمنهج الثالث هو حل وسط، حيث يتخلى عن خطوة إعادة الترتيب لكنه يحتفظ بعملية التصفية الأولية.

كشفت النتائج عن مقايضة واضحة بين السرعة والدقة في أعلى القائمة. كان منهج "المحرر الدقيق" (ASCR-H) الأكثر نجاحاً في وضع المادة الصحيحة في المرتبة الأولى، حيث نجح بنسبة 72.3%، متفوقاً بشكل ملحوظ على جميع الطرق الأخرى التي لم تكن تعرف الإجابة مسبقاً. أما المنهج السريع (DTF)، فقد وضع المادة الصحيحة في الصدارة بنسبة 51.9% فقط، بفارق يزيد عن عشرين نقطة. ومع ذلك، تتغير القصة إذا نظرت إلى أسفل القائمة؛ فبينما كان "المحرر الدقيق" أفضل في المقدمة، إلا أن المنهج السريع استدرك الفارق بسرعة. وبحلول الوقت الذي تصل فيه إلى أول عشرين نتيجة، يصبح المنهجان متماثلين إحصائياً، بل ويبدأ المنهج السريع في الأداء بشكل أفضل قليلاً في المستويات الأعمق. وهذا يشير إلى أنه إذا كان الإنسان مستعداً لتصفح قائمة أطول، فإن النظام الأسرع والأرخص سيكون فعالاً بنفس القدر.

كما اكتشف الباحثون ما لم ينجح. فقد اختبروا العديد من الحيل الشائعة المستخدمة في أنظمة البحث الأخرى، مثل إعادة كتابة سؤال المستخدم لجعله أكثر وضوحاً، أو استخدام تقنية تسمى "التغذية الراجعة لصلة شبه حقيقية" (pseudo-relevance feedback)، والتي تحاول تحسين البحث من خلال التظاهر بأن النتائج الأولى صحيحة واستخدامها لتنقيح الاستعلام. لم تنجح أي من هذه الحيل؛ بل إن بعضها جعل النتائج أسوأ. كما وجدوا أن مجرد استخدام قاموس لتجريد الكلمات من نهاياتها — وهو حل شائع للغات ذات القواعد المعقدة — لم يقدم أي فائدة لأن أسئلة الامتحان كانت مكتوبة بالفعل بلغة قريبة جداً من لغة القوانين نفسها.

ولعل النتيجة الأكثر إثارة للدهشة هي أن جعل المادة الصحيحة في رأس القائمة لم يؤدِ بالضرورة إلى تحسين الإجابة النهائية. فقد اختبر الباحثون ما إذا كان برنامج حاسوبي، يعمل كقاضٍ، يمكنه اختيار الإجابة الصحيحة من متعدد بناءً على المواد المسترجعة. ووجدوا أن الحاسوب كان بارعاً بالفعل في الإجابة على هذه الأسئلة من معرفته الداخلية، لدرجة أنه لم يكن يهم كثيراً ما إذا كانت المادة الصحيحة مصنفة في المرتبة الأولى أو الخامسة. لقد وصل النظام إلى حالة التشبع؛ فهو يعرف الإجابة دون الحاجة إلى النص. وهذا يعني أنه بالنسبة لهذا النوع من الامتحانات، فإن الجهد الهائل المطلوب للوصول إلى الترتيب المثالي في المقدمة قد لا يستحق التكلفة، لأن النتيجة النهائية ستكون هي نفسها. وتخلص الدراسة إلى أن الأداة المثلى للبحث القانوني تعتمد كلياً على الهدف: إذا كنت بحاجة إلى أفضل فرصة لرؤية القانون الصحيح فوراً، فإن المنهج المكلف والدقيق هو الأفضل. ولكن إذا كنت بحاجة إلى تغطية نطاق واسع من الاحتمالات بسرعة وبتكلفة منخفضة، فإن المنهج السريع والبسيط لا يقل كفاءة، بشرط أن تكون مستعداً للبحث بعمق أكبر في النتائج.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →