Confidently Wrong: Exception Chain Collapse in Frontier LLM Rule Evaluation
تحدد هذه الورقة فشلاً صامتاً يُعرف بـ "انهيار سلسلة الاستثناءات" في النماذج اللغوية الكبيرة الرائدة أثناء تقييم القواعد المتداخلة، وتقترح وحدة "Aethis" للأهلية، وهي بنية عصبية-رمزية تستبدل الاستدلال غير الموثوق للنماذج بالتنفيذ الحتمي القائم على حل مشكلات القابلية للإرضاء (SMT) لضمان امتثال قابل للتدقيق ومقاوم للانحراف.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
ملخص تقني: الخطأ الواثق: انهيار سلسلة الاستثناءات في تقييم القواعد لنماذج LLM الرائدة
1. بيان المشكلة
تحدد الورقة نمط فشل محددًا ومنهجيًا في نماذج اللغات الكبيرة (LLMs) الرائدة يُسمى "انهيار سلسلة الاستثناءات" (exception chain collapse). يحدث هذا أثناء مهام تقييم الأهلية التي تتضمن قواعد شرطية متداخلة من النوع: "أ هو مطلوب ما لم ينطبق ب، ما لم يقم ج بإلغاء ب."
بينما تؤدي نماذج LLM الرائدة بشكل جيد في مهام المنطق متعدد المسارات البسيطة (مثل التفرع بـ "أو" البسيط)، فإن أداءها يتدهور بشكل كبير عند مطالبتها بتقييم سلاسل استثناء متعددة المستويات (تحديدًا بعمق ثلاثة مستويات). توثق الورقة نمطين متميزين من الفشل:
- الارتكاز على الإعفاء (Exemption Anchoring): يعامل النموذج الإعفاءات كعناصر ثانوية للمسار الأساسي. إذا فشل المسار الأساسي، فإن النموذج "يرتكز" على هذا الفشل ويفشل في تقييم مسارات الإعفاء البديلة الصالحة بشكل مستقل.
- انهيار سلسلة الاستثناءات (Exception Chain Collapse): يفشل النموذج في صياغة منطق الـ "ما لم" (UNLESS) متعدد المستويات بشكل صحيح، وغالبًا ما يخلط بين مسارات الإعفاء المستقلة (على سبيل المثال، معاملة إعفاء "المحارب القديم" كونه تابعًا لإعفاء "العمر").
عدم الاستقرار الجوهري: أحد النتائج الحاسمة هو أن دقة النماذج الرائدة في هذه المهام هي "حد امتثال متحرك". بين مارس وأبريل 2026، أغلقت خلايا فشل معينة في الاختبارات المرجعية بصمت تحت نفس الاسم المستعار للنموذج (مثل GPT-5.4 وClaude Opus 4.6) دون أي تغيير في الإصدار. وهذا يجعل ادعاءات الدقة وقت الاختبار غير موثوقة لسير العمل المنظم الذي تتطلب فيه الاتساق.
2. المنهجية
يقترح المؤلفون ويقيمون وحدة Aethis للأهلية (Aethis Eligibility Module)، وهي بنية عصبية-رمزية (neuro-symbolic) مصممة لفصل تأليف القواعد عن تنفيذ القواعد.
البنية
- المرحلة الأولى: التأليف الآلي للقواعد (LLM): يقرأ نموذج LLM المصادر القانونية الموثوقة (التشريعات، التوجيهات السياسية) ويولد قواعد كأكواد مهيكلة في لغة مجال محدد (DSL) مقيدة. تتضمن هذه المرحلة سلسلة إثبات (provenance chain) حيث ترتبط كل قاعدة مُولدة باستشهادات مصدر محددة (معرف المستند، مسار القسم، الاقتباس المباشر).
- المرحلة الثانية: وحدة الأهلية (محرك حتمي): يتم تجميع لغة الـ DSL المولدة إلى قيود "إرضاء النظريات المحددة" (SMT). ثم يقوم حلّال SMT بتقييم هذه القيود مقابل بيانات مقدم الطلب المهيكلة.
- الآلية الرئيسية: يعامل المحرك كل مسار أهلية كفرع بوليني (boolean branch) مستقل تمامًا يتم دمجه عبر التشتت (OR). يقوم بتقييم هذه الفروع بشكل حتمي، وبشكل مستقل عن انحراف النموذج، أو جهد الاستدلال، أو تنسيق المطالبة (prompt).
تصميم الاختبار المرجعي
أنشأ المؤلفون اختبارًا مرجعيًا يتكون من 225 سيناريو عبر أربعة مجالات:
- الحياة في المملكة المتحدة: تشريعات الهجرة البريطانية الحقيقية (قانون الجنسية البريطانية لعام 1981).
- إتقان اللغة الإنجليزية: توجيهات الهجرة البريطانية الحقيقية.
- شهادة المركبات الفضائية: قانون اصطناعي تم نمذجته على الهيكل التشريعي للمملكة المتحدة مع سلاسل استثناء بعمق ثلاثة مستويات.
- تأمين الإنشاءات: صياغة سياسة اصطناعية تمت نمذجتها على بنود DE3/DE5 في سوق لندن مع سلاسل استثناء بعمق خمسة مستويات.
تم تقييم هذا الاختبار المرجعي مقابل ثمانية نماذج LLM (أربعة رائدة، وأربعة من فئة الإنتاج) من Anthropic وOpenAI، مقارنةً بوحدة الأهلية الحتمية.
3. المساهمات الرئيسية
1. تصنيف أنماط الفشل
تحدد الورقة رسميًا "انهيار سلسلة الاستثناءات" و"الارتكاز على الإعفاء" كأخطاء منهجية في تقييم سلاسل الاستثناء المتداخلة. وتظهر هذه الفشل كالتالي:
- تركيبية (Compositional): تنشأ من عمق المنطق (ثلاثة مستويات) وليس من نقص المعرفة القانونية.
la - صامدة أمام هندسة المطالبات (Robust to Prompting): إن تحسين المطالبات (مثل "فكر خطوة بخطوة"، "قيم الإعفاءات بشكل مستقل") يفشل في حل المشكلة؛ بل إنه يستبدل السلبيات الكاذبة (false negatives) بالإيجابيات الكاذبة (false positives)، مما يقلل صافي الدقة.
- غير مستقرة: نقاط الفشل المحددة تتغير بصمت عبر تحديثات النماذج، مما يجعل النماذج الرائدة غير موثوقة للقرارات عالية المخاطر والتي تتطلب التدقيق.
2. وحدة Aethis للأهلية
تقدم الورقة نظامًا عصبيًا-رمزيًا ينقل عدم اليقين من حد الاستدلال (حيث يكون صامتًا ومستمرًا في نماذج LLM) إلى حد المواصفات (حيث يكون متعمدًا وقابلًا للتدقيق).
- الضمان: توفر طبقة التنفيذ دلالات (semantics) محددة رياضيًا. إذا تم صياغة حزمة القواعد بشكل صحيح، فإن التنفيذ سيكون متسقًا بنسبة 100% مع المواصفات، بغض النظر عن إصدار النموذج أو التكوين.
- القابلية للتدقيق: يتضمن كل قرار سلسلة إثبات تربط النتيجة مباشرة بالبند التشريعي المحدد والمسار المنطقي الذي تم اتخاذه.
3. الأدلة التجريبية
- نتائج الاختبار المرجعي: حققت وحدة الأهلية دقة بنسبة 100% عبر جميع السيناريوهات الـ 225.
- أداء نماذج LLM: أظهرت النماذج الرائدة تدهورًا ملحوظًا في مهام سلسلة الاستثناء. على سبيل المثال، في لقطة مارس 2026، سجل Claude Opus 4.6 نسبة 89.7% في قسم المركبات الفضائية (61/68)، مع وجود 7 سيناريوهات محددة فشلت 0/3 مرات عبر عمليات تشغيل مستقلة.
- التوسيع العدائي (Adversarial Extension): في توسيع عدائي نسخة v3.8 (20 سيناريو جديد لتأمين الإنشاءات)، سجل المحرك الحتمي 20/20. وبينما وصلت بعض النماذج الرائدة إلى 100% في المجموعة الأصلية، إلا أنها فشلت في الحالات العدائية الأكثر عمقًا (على سبيل المثال، فشل Claude Opus 4.7 في 2/20، وفشل GPT-5.4 الافتراضي في 1/20).
- التحقق الخارجي: في 949 حالة محجوزة من تسع مهام من LegalBench، كانت وحدة الأهلية أكثر دقة بكثير من ثلاثة نماذج رائدة (بمجموع McNemar's )، مع أكبر الفوارق (+41 نقطة مئوية) في مهام تطبيق القواعد متعددة الجوانب.
4. الأهمية والادعاءات
الورقة لا تدعي أن نماذج LLM غير موثوقة بشكل عام أو أنها لا تستطيع استخدامها في الاستدلال القانوني. بدلاً من ذلك، تقدم ادعاءً متواضعًا ومحددًا:
- نقل عدم اليقين: المساهمة الأساسية هي معمارية. من خلال استخدام نماذج LLM لـ التأليف (حيث تعد طلاقتها ميزة) ومحلات SMT لـ التنفيذ (حيث تتطلب الحتمية)، يجعل النظام عدم اليقين قابلًا للإدارة. يتم نقل عدم اليقين إلى خطوة صياغة القواعد (المستوى 2)، والتي يمكن إدارتها عبر التحقق القائم على الاختبار ومراجعة خبراء المجال، بدلاً من بقائه في خطوة الاستدلال (المستوى 3)، حيث يكون صامتًا وغير قابل للملاحظة.
- القابلية للدفاع التنظيمي: بالنسبة للمجالات عالية المخاطر (الهجرة، التأمين، شهادات السلامة) حيث تمنع السلبيات الكاذبة الحقوق وتكون القابلية للتفسير إلزامية، توفر طبقة التنفيذ الحتمية خاصية لا تستطيع نماذج LLM الرائدة توفيرها: الثبات (Invariance). حزمة القواعد المجمعة تعطي نفس النتيجة اليوم كما ستعطي بعد ستة أشهر، بغض النظر عن التغييرات الصامتة في أوزان النموذج الأساسي.
- القيود: يذكر المؤلفون صراحةً أن النظام يضمن التنفيذ الصحيح للمواصفات، وليس صحة المواصفات نفسها. تعتمد جودة حزمة القواعد على قدرة LLM على صياغة النص المصدر (المستوى 2)، وهو أمر يتم التخفيف منه ولكن لا يتم القضاء عليه عبر التحقق القائم على الاختبار. يتطلب النظام حاليًا مدخلات مهيكلة ولا يتعامل مع استخراج المستندات غير المهيكلة.
باختصار، تجادل الورقة بأنه بالنسبة لتقييم سلاسل الاستثناء المتداخلة في سير العمل المنظم، فإن التنفيذ الرسمي الحتمي هو شرط ضروري للثقة، وأن البنى العصبية-الرمزية توفر مسارًا قابلاً للتطبيق لتحقيق ذلك دون التضحية بفائدة نماذج LLM في استخراج القواعد.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.