Reason Popper-ly: Patching In-Context Reasoning with Inductive Logic Programming
تقدم الورقة البحثية إطار العمل "Reason Popper-ly"، وهو إطار عمل عصبي رمزي يعزز تسلسل الأفكار (Chain-of-Thought) في النماذج اللغوية الكبيرة باستخدام البرمجة المنطقية الاستقرائية لتعلم قواعد العلاقات، والتحقق من الخطوات الوسيطة، وتصحيح الأخطاء المنطقية تلقائياً، مما يؤدي إلى تحسين الدقة بشكل كبير في مهام الاستدلال متعدد الخطوات.
تخيل أنك تحاول تعليم روبوت ذكي جداً وكثير الكلام كيفية حل لغز ما. أنت لا تطلب منه الإجابة فحسب، بل تطلب منه عرض خطوات عمله، خطوة بخطوة، تماماً مثل محقق يدون الأدلة في دفتر ملاحظاته. هذه الطريقة، التي تسمى "سلسلة الأفكار" (Chain-of-Thought)، ساعدت النماذج اللغوية الضخمة على أن تصبح أفضل بكثير في حل الألغاز التي تتطلب تفكيراً متسلسلاً. ومع ذلك، هناك عقبة: مجرد كتابة الروبوت لقصة طويلة وواثقة لا يعني أن كل جملة في تلك القصة صحيحة بالفعل. أحياناً، يخطئ الروبوت في المنطق في منتصف القصة، حتى لو خمن الإجابة الصحيحة في النهاية. الأمر يشبه طالباً يكتب مقالاً جميلاً ولكنه يضيف بالخطأ اثنين زائد اثنين ليصبح الناتج خمسة في المنتصف، ثم يصحح خطأه سحرياً عند الوصول إلى النهاية. يشعر العلماء بالقلق لأنه إذا لم نتمكن من الوثوق بالخطوات، فلا يمكننا الوثوق باستنتاج الروبوت في المواقف الجادة. السؤال الكبير هو: كيف نصلح أخطاء الروبوت أثناء تفكيره، دون التخلص من دفتر ملاحظاته بالكامل والبدء من جديد؟
إليك "Reason Popper-ly"، وهي طريقة جديدة تعمل كمحرر شديد الانتباه لعملية تفكير الروبوت. بدلاً من ترك الروبوت يكتب قصته كاملة ويأمل في الأفضل، أو استبدال الروبوت بالكامل بآلة حاسبة جامدة، يستخدم هذا النهج مزيجاً ذكياً من التعلم والتحقق. أولاً، يدرس النظام آلاف الأمثلة حول كيفية عمل العلاقات (مثل كيف يجتمع "الأب" و"الأخت" لتكوين "العمة") لبناء كتاب قواعد صغير ومثالي. ثم، عندما يحاول الروبوت حل لغز جديد، يعمل كتاب القواعد هذا كحكم في الوقت الفعلي. بينما يكتب الروبوت كل جملة، يتحقق الحكم مما إذا كان المنطق صامداً أمام كتاب القواعد. إذا ارتكب الروبوت خطأً — كأن يدعي أن "الأخ" و"الأم" ينتجان "ابن عم" بدلاً من "أخت" — فإن النظام لا يحذف الصفحة بأكملها. بدلاً من ذلك، يقوم بوخز الروبوت بلطف، قائلاً: "مهلاً، هذه الخطوة خاطئة؛ إليك المنطق الصحيح"، ويطلب منه إعادة كتابة هذا الجزء فقط وبقية القصة من تلك النقطة.
اختبر الباحثون هذه الفكرة على اختبار معياري يسمى CLUTRR، وهو عبارة عن لغز شجرة عائلة ضخم حيث يتعين عليك معرفة كيفية ارتباط شخصين ببعضهما من خلال ربط النقاط عبر عدة أجيال. جربوا هذا على خمسة نماذج لغوية مختلفة، تتراوح من أجهزة الكمبيوتر المحلية الصغيرة إلى أكثر النماذج "الرائدة" (frontier models) قوة المتاحة اليوم. كانت النتائج واعدة للغاية. بالنسبة للنماذج الأصغر، عززت طريقة "الترقيع" هذه دقة النموذج بمقدار هائل — يصل إلى 48 نقطة مئوية في الألغاز الأصعب والأطول. وحتى النماذج الرائدة فائقة الذكاء، والتي كانت جيدة بالفعل، تحسنت بشكل ملحوظ بمقدار يصل إلى 15 نقطة في السلاسل الأطول. تشير الدراسة إلى أنه كلما زادت الألغاز طولاً وتعقيداً، يبدأ عقل الروبوت في التعثر أكثر، مما يجعل وجود هذا "الحاجز الوقائي" الرمزي (symbolic guardrail) لالتقاط وتصحيح أخطاء منطقية محددة يحدث فرقاً كبيراً.
ما يجعل هذا النهج مميزاً هو كيفية تعامله مع الأخطاء. فالنظام لا يكتفي بالقول "خطأ" أو "صواب"؛ بل يشخص لماذا أخطأ الروبوت. يمكنه تحديد ما إذا كان الروبوت قد استخدم المكونات الصحيحة ولكن الوصفة الخاطئة، أو إذا كان قد نسي عكس علاقة (مثل الخلط بين "الأم" و"الابنة")، أو إذا كان قد اختلق حقيقة لم تكن موجودة في القصة. ومن المثير للاهتمام أن الدراسة وجدت أنه بالنسبة لأكبر النماذج وأكثرها ذكاءً، لم يكن الخطأ الأكثر شيوعاً هو الوقوع في خطأ منطقي، بل كان الخلط بين اتجاه العلاقات. ومن خلال إصلاح هذه الأخطاء الصغيرة والمحددة وترك الروبوت يستمر من النقطة المصححة، يحافظ النظام على إبداع الروبوت وترسيخه مع ضمان بقاء المنطق سليماً. وهذا يشير إلى أننا لسنا بحاجة لاستبدال الذكاء الاصطناعي بالرياضيات الجامدة لجعله موثوقاً؛ نحن فقط بحاجة إلى طريقة ذكية وخفيفة الوزن لمراجعة واجباته المدرسية أثناء العمل.
ملخص تقني: Reason Popper-ly
بيان المشكلة
أصبح التلقين بسلسلة الأفكار (CoT) طريقة قياسية لاستخراج الاستدلال متعدد الخطوات من النماذج اللغوية الكبيرة (LLMs). ومع ذلك، فإن الخطوات الوسيطة التي تولدها هذه النماذج ليست مضمونة من الناحية المنطقية. تشير الأبحاث السابقة إلى أن تفسيرات (CoT) يمكن أن تكون معقولة ظاهرياً ولكنها غير وفية لعملية اتخاذ القرار الفعلية للنموذج، كما تتدهور جودة الاستدلال بشكل كبير مع زيادة العمق التركيبي.
تحاول المنهجيات العصبية-الرمزية (neurosymbolic) الحالية سد هذه الفجوة، لكنها تواجه أربعة تحديات رئيسية:
اكتساب القواعد: تعتمد الطرق الحالية غالباً على تحديد القواعد يدوياً أو إعادة التدريب باستخدام أهداف معلوماتية منطقية، بدلاً من تعلم قواعد التحقق مباشرة من مسارات النموذج المولدة للاستخدام في وقت التشغيل.
عنق زجاجة التأصيل (Grounding): يؤدي ترجمة مسارات (CoT) ذات اللغة الطبيعية إلى محمولات رمزية مهيكلة إلى أخطاء في الاستخراج تتراكم مع أخطاء الاستدلال، مما يحد من المسارات الرمزية في نطاقات ضيقة.
تحديد الخطأ (Error Attribution): معظم أدوات التحقق تختزل الاستدلال في قرار ثنائي (قبول/رفض) للمسار الكامل، وتفشل في تحديد مواقع فشل الخطوات المحددة أو تصنيف أنواعها (مثل: قاعدة خاطئة مقابل فقدان الانعكاس).
التصحيح المستهدف: غالباً ما تقوم طرق التحسين الحالية بالتخلص من السياق بالكامل لإعادة التوليد من البفر، مما يؤدي لفقدان العمل الوسيط الصحيح. وبالمقابل، فإن استبدال الخطوات البسيطة يقطع تماسك الخطوات اللاحقة.
المنهجية: Reason Popper-ly
يقترح المؤلفون إطار عمل Reason Popper-ly، وهو إطار عمل عصبي-رمزي يستخدم البرمجة المنطقية الاستقرائية (ILP) لتعلم قواعد تركيب العلاقات من مسارات الاستدلال وتوظيفها كمدقق عبر الإنترنت لتصحيح مستوى الخطوة. يعمل الإطار في مرحلتين:
1. المرحلة غير المتصلة (Offline): تعلم قواعد التركيب
يبني النظام جدول تركيب رمزياً مجمداً (R) باستخدام نظام ILP المسمى Popper.
جمع المسارات: تولد النماذج اللغوية (LLMs) مسارات (CoT) على مجموعة تدريب (قصص القرابة CLUTRR). يتم تقسيم المسارات حسب الصحة النهائية (إشراف إيجابي مقابل سلبي).
استخراج التركيب: بالنسبة للخطوات المستنتجة التي تستشهد بخطوتين سابقتين، يستخرج النظام ثلاثية (r1,r2,r3) تمثل الادعاء بأن العلاقة r1 مع r2 تنتج r3. يتضمن ذلك تطبيع الاتجاه لمحاذاة العلاقات مع سلسلة الاستدلال.
استقراء القواعد: يتعلم نظام Popper فضاء فرضية مقيد بـ حقائق أساسية من شكل compose(r1, r2, r3). تشكل الحقائق الناتجة جدول تركيب جزئي يربط أزواج العلاقات الصالحة بنتيجتها المركبة. يعمل هذا الجدول كمدقق رمزي.
2. المرحلة المتصلة (Online): التحقق، التشخيص، والترقيع
في وقت الاستدلال، يولد النموذج اللغوي مسار استدلال كاملاً، والذي تتم معالجته لاحقاً:
التحقق: يتم تحليل كل خطوة مستنتجة إلى ثلاثية تركيب ويتم فحصها مقابل الجدول المتعلم R. تُعلم الخطوة كخرق إذا كان الزوج (r1,r2) موجوداً في الجدول ولكن النتيجة المتوقعة r3 لا تطابق R(r1,r2).
التشخيص: تُصنف الانتهاكات إلى أربعة أنواع من الأخطاء:
قاعدة خاطئة (Wrong Rule): مقدمات صحيحة، وتركيب غير صحيح.
فقدان الانعكاس (Missing Inv): الفشل في عكس علاقة المقدمة قبل التركيب.
عكس الاتجاه (Direction Rev): التنبؤ بمعكوس العلاقة المستهدفة.
هلوسة (Hallucinated): الاستشهاد بمقدمة غير مدعومة بالقصة.
الترقيع (Patch): يتم إعادة كتابة الخطوات غير الصالحة باستخدام التركيب الصحيح من R مع الحفاظ على الكيانات والسياق. إذا تم ترقيع خطوة ما، يتم التخلص من جميع الخطوات اللاحقة المستنتجة منها. ثم يقوم النموذج بإعادة توليد الجزء المتبقي فقط بشرط المقدمة المصححة. تتكرر هذه العملية حتى لا يتبقى أي انتهاكات قابلة للتحقق.
المساهمات الرئيسية
الإصلاح على مستوى الخطوة القائم على ILP: يقترح المؤلفون مسار عمل يتعلم قواعد رمزية من المسارات ويستخدمها كحاجز حماية عبر الإنترنت فوق (CoT)، بدلاً من استبدال استدلال النموذج بمحلل مستقل.
تصنيف دقيق للأخطاء: يقدم المنهج تصنيفاً تشخيصياً لإخفاقات التركيب (ما وراء الصحة الثنائية)، مما يسمح بالتدخل المستهدف ويوفر رؤية حول نقاط الضعف المحددة في الاستدلال (مثل تطبيع الاتجاه مقابل تطبيق القاعدة).
التحقق التجريبي: تم تقييم الإطار على معيار CLUTRR عبر خمسة نماذج لغوية (تتراوح من 3B إلى النماذج الرائدة) وأعماق استدلال من 2 إلى 10 قفزات.
النتائج
أظهر التقييم على CLUTRR أن Reason Popper-ly يحسن باستمرار الدقة النهائية مقارنة بـ (CoT) القياسي والمسارات الرمزية الخارجية الكاملة:
التحسن مقارنة بـ (Endogenous CoT): يحقق المنهج مكاسب كبيرة عبر جميع النماذج. بالنسبة للنماذج الصغيرة في السلاسل الطويلة (8-10 قفزات)، كانت التحسينات في الدقة كبيرة (على سبيل المثال، تحسن Qwen-3.5:4B من 19.09% إلى 61.93%؛ وGemma-4:E4B من 14.39% إلى 62.74%). كما استفادت النماذج الرائدة أيضاً، حيث تحسن GPT-5.4 من 59.91% إلى 75.09% في السلاسل الطويلة.
المقارنة مع المسارات الخارجية: بينما تؤدي المسارات الرمزية الخارجية الكاملة (حيث يستخرج النموذج الحقائق فقط ويتولى المحلل عملية الاستدلال) أداءً جيداً في السلاسل القصيرة، إلا أن أداءها يتدهور مع زيادة طول السلسلة بسبب تراكم أخطاء التأصيل وبناء الرسم البياني. يتفوق Reason Popper-ly على هذه المسارات في السلاسل الطويلة من خلال الحفاظ على تأصيل النموذج الناجح مع تصحيح إخفاقات الاستدلال القابلة للتحقق فقط.
تحليل الخطأ: يكشف تصنيف الخطأ عن ملفات تعريف متميزة للفشل. ترتكب النماذج الأصغر أخطاء "القاعدة الخاطئة" بشكل متكرر، بينما تفشل النماذج الرائدة بشكل أساسي بسبب "فقدان الانعكاس" (تطبيع الاتجاه)، مما يشير إلى أن التوسع يقلل من أخطاء التركيب الأساسية ولكنه لا يقلل من أخطاء التعامل الهيكلي. أخطاء الهلوسة نادرة (0-2%).
الأهمية والادعاءات
يزعم البحث أن Reason Popper-ly يقدم حلاً وسطاً عملياً بين (CoT) غير المقيد والتفويض الرمزي الكامل. تكمن أهميته الأساسية في إثبات أن:
حواجز حماية رمزية خفيفة الوزن: دعم الاستدلال الرمزي ليس بالضرورة أن يستبدل استدلال النموذج بالكامل ليكون مفيداً. يمكن للإصلاح الانتقائي على مستوى الخطوة أن يخفف بفعالية من تدهور جودة الاستدلال في السلاسل التركيبية العميقة.
الحفاظ على الاستدلال الصحيح: من خلال التدخل فقط عند الخطوات التي تنتهك القواعد وإعادة توليد التابع، يحافظ المنهج على العمل الوسيط الصحيح للنموذج، مما يعالج "عنق زجاجة التأصيل" المتأصل في المنهجيات الخارجية الكاملة.
الفائدة التشخيصية: يوفر التحقق على مستوى الخطوة تصنيفاً تشخيصياً دقيقاً للأخطاء يقدم رؤى تشخيصية تتجاوز دقة الإجابة النهائية، ويكشف عن نقاط ضعف استدلالية نوعية مختلفة عبر أحجام النماذج.
يشير المؤلفون إلى وجود قيود تتعلق بتخصص المجال (يركز حالياً على استدلال القرابة حيث يكون التأصيل قابلاً للتتبع) والافتراض بأن تعديل الخطوات الوسيطة يوجه الإجابة النهائية بشكل سببي، رغم أن النتائج التجريبية تشير إلى أن هذا الافتراض صامد في السياق الذي تم تقييمه.