DeonticBench: A Benchmark for Reasoning over Rules
تقدم هذه الورقة DeonticBench، وهو معيار شامل يتكون من 6,232 مهمة عبر مجالات قانونية وسياساتية أمريكية متنوعة لتقييم وتحسين قدرة النماذج اللغوية الكبيرة على أداء الاستدلال الوجوبي المعقد والمحدد سياقياً من خلال سير عمل يعتمد على كل من اللغة الطبيعية ولغة البرمجة الرمزية Prolog.
المؤلفون الأصليون: Guangyao Dou, Luis Brena, Akhil Deo, William Jurayj, Jingyu Zhang, Nils Holzenberger, Benjamin Van Durme
المؤلفون الأصليون: Guangyao Dou, Luis Brena, Akhil Deo, William Jurayj, Jingyu Zhang, Nils Holzenberger, Benjamin Van Durme
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
1. بيان المشكلة
تواجه النماذج اللغوية الكبيرة (LLMs) صعوبة في الاستدلال الوجوبي (Deontic Reasoning) — وهي عملية الاستدلال حول الالتزامات، والأذونات، والمحظورات في ظل قواعد صريحة ومحددة السياق. وتعد هذه القدرة بالغة الأهمية في المجالات عالية المخاطر مثل الأنظمة القانونية، والإدارة الضريبية، وإنفاذ السياسات.
- القصور الحالي: تركز المعايير المرجعية الحالية غالبًا على الاستدلال الرياضي قصير السياق أو ألغاز المنطق الاصطناعية. وهي تفشل في استيعاب تعقيد الاستدلال على القواعد في العالم الحقيقي طويل السياق، حيث يجب على النماذج تفسير القوانين، واستخراج وقائع القضايا، وتطبيق معايير متعددة العوامل قانونيًا.
- الفجوة: هناك نقص في المعايير التي تقيم كلاً من النهجات غير الرمزية (الاستدلال المباشر باللغة الطبيعية) والرمزية (الترجمة إلى كود قابل للتنفيذ) في بيئات عالية المخاطر ومستندة إلى نصوص تشريعية. علاوة على ذلك، غالبًا ما تقوم النماذج الحالية بـ "الهلوسة" في القواعد أو تفشل في تنفيذ القيود المنطقية المعقدة بأمانة.
2. المنهجية: DEONTICBENCH
يقدم المؤلفون DEONTICBENCH، وهو معيار مرجعي شامل يتكون من 6,232 مهمة عبر أربعة مجالات متميزة من العالم الحقيقي:
- SARA (الضرائب الفيدرالية الأمريكية): مقتبس من عمل سابق، ويتميز بحسابات الالتزامات الضريبية الرقمية وفحوصات الاستلزام الثنائية بناءً على قانون الإيرادات الداخلية.
- الطيران (سياسات الأمتعة): مستمد من RuleArena، ويركز على حسابات الرسوم الرقمية بناءً على سياسات الناقلين المعقدة (الوزن، الأبعاد، درجة المقصورة).
- الإسكان (قانون الولايات المتحدة): يعتمد على مهام استرجاع قانونية تتضمن قوانين الإسكان الخاصة بالولايات وأسئلة ثنائية (نعم/لا).
- USCIS-AAO (إدارة الهجرة): مجموعة بيانات تم إنشاؤها حديثًا تضم 242 حالة استئناف هجرة ثنائية (مقبولة مقابل مرفوضة) مستمدة من سجلات مكتب الاستئناف الإداري.
الميزات الرئيسية للمعيار المرجعي:
- التقييم مزدوج الوضع: يمكن حل المهام عبر:
- الاستدلال المباشر: يخرج النموذج الإجابة مباشرة باللغة الطبيعية.
- سير العمل المدعوم بالمحلل الرمزي (Solver-Assisted): يقوم النموذج بترجمة النصوص التشريعية ووقائع القضايا إلى كود Prolog، والذي يتم تنفيذه بعد ذلك بواسطة محلل SWI-Prolog خارجي لتوليد الإجابة. وهذا يوفر تتبعًا برمجيًا قابلًا للتدقيق.
- المجموعات الفرعية الصعبة: لتجنب التشبع والتركيز على صعوبات الاستدلال الحقيقية، قام المؤلفون بتنقية مجموعات فرعية "صعبة" لكل مجال. وهي حالات تفشل فيها النماذج الرائدة باستمرار، مما يتطلب برامج Prolog أطول وتأسيسًا أكثر تعقيدًا للقواعد.
- القطع المرجعية: يطلق المؤلفون برامج Prolog مرجعية لجميع الحالات، مما يسمح بالتدريب والتحليل لمدى دقة تتبع البرنامج.
تفاصيل بناء مجموعة البيانات:
- بناء USCIS-AAO: يتضمن استخراج السرديات "الحقيقية فقط" من القرارات القانونية المعقدة لمنع تسرب البيانات (لضمان عدم رؤية النموذج للنتيجة في المطالبة/Prompt). تم ذلك عبر استخراج بواسطة LLM متبوعًا بالتحقق البشري.
- خط أنابيب توليد Prolog: يستخدم المؤلفون نهج "التوليد عند الطلب" حيث تنشئ النماذج وحدات تشريعية وبرامج أسئلة لكل حالة، بدلاً من الاعتماد على مكتبة عالمية مسبقة التجميع، وذلك لمحاكاة التحديثات التنظيمية في العالم الحقيقي بشكل أفضل.
3. الإعداد التجريبي
- النماذج التي تم تقييمها: ثمانية نماذج لغوية كبيرة عامة ورائدة (بما في ذلك GPT-4.1، GPT-5.1، GPT-5.2، O3، Claude Sonnet 4.5، Gemini 2.5 Flash، Kimi K2، Qwen3-235B) وثلاثة نماذج برمجة متخصصة.
- استراتيجيات التلقين (Prompting):
- المباشر: لا يوجد توليد كود.
- الصفر من الأمثلة (Zero-Shot): توليد Prolog بدون أمثلة.
- القليل من الأمثلة (Few-Shot): توليد Prolog مع أمثلة داخل السياق.
- تجارب التدريب: قام المؤلفون بضبط نموذج Qwen2.5-32B-Instruct باستخدام:
- التعلم الخاضع للإشراف (SFT).
- تحسين التفضيل المباشر (DPO).
- التعلم المعزز (تحديدًا Dr. GRPO، وهو متغير من تحسين السياسة النسبي للمجموعات مع دالة مكافأة مدركة للمحمولات/Predicates).
4. النتائج الرئيسية
- الأداء العام: حتى أقوى النماذج الرائدة تؤدي بشكل ضعيف في المجموعات الفرعية "الصعبة".
- أفضل أداء في SARA Numeric (الصعب) كان 44.4% فقط (O3).
- أفضل أداء في Housing (الصعب) كان 46.6% (F1-macro).
- يختلف الأداء بشكل كبير حسب المجال واستراتيجية التلقين؛ ولا يهيمن نموذج واحد على جميع الإعدادات.
- الرمزي مقابل غير الرمدي:
- المقايضة: يؤدي التوليد الرمزي (Prolog) إلى معدلات امتناع أعلى (فشل النماذج في إنتاج كود قابل للتنفيذ) ولكنه يوفر القابلية للتفسير. التلقين المباشر يقلل من حالات الامتناع ولكنه يزيد من الإجابات المهلوسة (المنطق الخاطئ).
- تحليل الخطأ: الأخطاء تعتمد على المجال:
- المجالات القانونية (Housing, USCIS): يهيمن عليها اختيار القاعدة الخاطئة (تطبيق قوانين غير صحيحة).
- المهام المهيكلة (SARA): يهيمن عليها أخطاء استخراج الكيانات/الحقائق (سوء تفسير حالة التقديم أو التبعيات).
- المهام الكمية: يهيمن عليها أخطاء الدقة العددية.
- تأثير التدريب:
- يحسن SFT و RL الأداء في مهام التصنيف الثنائي (مثل USCIS، SARA Binary) ولكنهما يقدمان مكاسب محدودة في الاستدلال الرقمي (SARA Numeric).
- تفشل طرق التعلم المعزز الحالية (DPO, GRPO) في حل هذه المهام بشكل موثوق من البداية إلى النهاية. تظل النماذج حساسة للغاية لاستراتيجيات التلقين حتى بعد التدريب.
- نماذج البرمجة: أظهرت نماذج البرمجة المتخصصة (مثل GPT-5.2-Codex) أداءً قويًا في مجالات محددة (Airline) ولكنها ظلت غير مستقرة وحساسة للتلقين، وغالبًا ما تفشل في توليد Prolog قابل للتنفيذ لمجموعات قواعد معقدة.
5. المساهمات الرئيسية
- معيار DEONTICBENCH: أكبر مجموعة بيانات حتى الآن (6,232 مهمة) للاستدلال القائم على القواعد القابل للتنفيذ في مجالات حقيقية عالية المخاطر (الضرائب، الهجرة، الإسكان، الطيران).
- تقييم شامل: تحليل منهجي لأنماط الفشل عبر النماذج الرائدة، مما يكشف أن زيادة جهد الاستدلال (مثل نماذج "التفكير") لا تؤدي بالضرورة إلى تحسين الأداء في المهام المستندة إلى النصوص التشريعية.
- رؤى التدريب: استقصاء لعمليات SFT و RL لتوليد البرامج الرمزية، مع تسليط الضوء على أنه بينما يحسن التدريب جودة الكود، إلا أن الطرق الحالية غير كافية للاستدلال الموثوق والقابل للتنفيذ من البداية إلى النهاية.
- الموارد المفتوحة: إطلاق جميع برامج Prolog المرجعية ومجموعة بيانات USCIS-AAO لتسهيل الأبحاث المستقبلية في الاستدلال العصبي الرمزي (Neuro-symbolic reasoning).
6. الأهمية
- السلامة والموثوقية: تؤكد الورقة أن النماذج اللغوية الكبيرة غير موثوقة حاليًا للتطبيقات القانونية والسياسية عالية المخاطر حيث يكون الالتزام بالقواعد الصريحة أمرًا إلزاميًا. يمكن أن تؤدي الهلوسة في تطبيق القواعد إلى ضرر مالي أو قانوني كبير.
- المستقبل العصبي الرمزي: تشير النتائج إلى أنه بينما تعد ترجمة اللغة الطبيعية إلى كود رمزي (Prolog) مسارًا واعدًا لقابلية التفسير، فإن خطوة "الترجمة" تظل عقبة رئيسية. يجب أن يركز العمل المستقبلي على تحسين تأسيس القواعد (استرجاع النص التشريعي الصحيح) والتنفيذ الأمين بدلاً من مجرد تحسين قدرات الاستدلال العامة.
- معيار قياسي: يضع DEONTICBENCH معيارًا جديدًا لتقييم النماذج اللغوية الكبيرة في البيئات طويلة السياق والمقيدة بالقواعد، متجاوزًا الألغاز المنطقية الاصطناعية نحو التعقيد التنظيمي في العالم الحقيقي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.
تصلك أفضل أبحاث NLP كل أسبوع.
يحظى بثقة باحثين في ستانفورد وكامبريدج والأكاديمية الفرنسية للعلوم.
تفقّد بريدك لتأكيد الاشتراك.
حدث خطأ ما. تعيد المحاولة؟
لا رسائل مزعجة، ويمكنك إلغاء الاشتراك متى شئت.