Beyond Factual Knowledge: Benchmarking and Learning Step-Level Procedural Rule Reasoning in Large Language Models
تقدم هذه الورقة البحثية RuleWorld، وهو معيار واسع النطاق لتقييم الاستدلال الإجرائي على مستوى الخطوات، وتقترح DynaRule، وهو إطار عمل شامل (end-to-end) يحسن بشكل كبير أداء النماذج اللغوية الكبيرة في مهام الاستدلال المعقدة متعددة الخطوات من خلال الحقن الديناميكي وإعادة الانتباه إلى القواعد داخل ذاكرة التخزين المؤقت (KV cache).
المؤلفون الأصليون:Bohan Yu, Pengfei Cao, Chen Han, Chenxi Zhou, Zhiheng Zhang, Zhiyang Xie, Wenhao Teng, Xiangwen Liao, Jun Zhao, Kang Liu
تُعد النماذج اللغوية الكبيرة هي المحركات التي تقف وراء جيل جديد من الذكاء الاصطناعي، وهي قادرة على كتابة القصص، وحل المسائل الرياضية، وترجمة اللغات بطلاقة مذهلة. وهي تعمل من خلال امتصاص كميات هائلة من النصوص، وتعلم الأنماط الإحصائية لكيفية ترابط الكلمات معاً لتكوين المعنى. لسنوات، اختبر الباحثون هذه النماذج في قدرتها على استرجاع الحقائق، مثل معرفة أن باريس هي عاصمة فرنسا. ولكن هناك نوع آخر من المعرفة هو لا يقل أهمية بالنسبة للتفكير في العالم الحقيقي: المعرفة الإجرائية. لا يتعلق هذا الأمر بمعرفة "ما" هو صحيح، بل بمعرفة "كيفية" التصرف أو التفكير بناءً على مجموعة من التعليمات. تخيل محامياً يجب عليه تطبيق مجموعة محددة ومعقدة من القوانين على قضية جديدة، أو طبيباً يتبع بروتوكولاً مفصلاً لتشخيص حالة نادرة. في هذه الحالات، لا تكون الإجابة مخزنة في الذاكرة؛ بل يجب العثور عليها، واختيارها، وتطبيقها خطوة بخطوة من كتاب قواعد خارجي ضخم. والسؤال الذي يواجه المجال هو ما إذا كانت هذه النماذج القوية قادرة حقاً على تعلم القيام بذلك، أم أنها ببساطة تتظاهر بفهم القواعد بينما تعتمد على تخميناتها الداخلية.
وللإجابة على ذلك، أنشأ فريق من الباحثين ساحة اختبار ضخمة تسمى RuleWorld. فبدلاً من إعطاء النماذج عدداً قليلاً من القواعد لحل لغز واحد، بنوا مكتبة تحتوي على ما يقرب من خمسة ملايين قاعدة مجردة. هذه القواعد غريبة ومنفصلة عن الحياة اليومية عن عمد، مثل "إذا دخل مخلوق إلى غابة، فإنه يشتعل ناراً"، لضمان عدم قدرة النماذج على استخدام معرفتها الداخلية. كُتبت هذه القواعد بطريقتين: كبيانات منطقية رسمية وكجمل باللغة الإنجليزية العادية. ثم صمم الباحثون ثلاثة أنواع من التحديات لاختبار النماذج. كان النوع الأول بسيطاً: العثور على قاعدة واحدة للإجابة على سؤال. والثاني أكثر تعقيداً: الإجابة على عدة أسئلة في وقت واحد، يتطلب كل منها قواعد مختلفة. أما الثالث فكان الأصعب: حل سلسلة من المشكلات حيث تصبح إجابة الخطوة الأولى هي نقطة البداية للخطوة التالية، مما يتطلب من النموذج تتبع تقدمه عبر تسلسل طويل من الخطوات المنطقية.
وعندما اختبروا النماذج الحالية على هذا المعيار الجديد، كانت النتائج صارخة. حتى النماذج الأكثر تقدماً واجهت صعوبة عندما زاد عدد القواعد المتاحة. فعندما أُجبرت على الاختيار من بين آلاف القواعد، غالباً ما كانت تلتقط القواعد الخاطية أو تضيع في منتصف سلسلة متعددة الخطوات. كما أن الطرق القياسية التي تحاول مساعدة النماذج عبر البحث عن النص ذي الصلة قبل الإجابة ثبت ضعفها؛ إذ كانت تجد القاعدة الصحيحة للخطوة الأولى لكنها تفشل في تحديث بحثها للخطوة الثانية، مما يؤدي إلى سلسلة من الأخطاء. كانت النماذج تحاول جوهرياً استيعاب كتاب القواعد بأكمله في رؤوسها في آن واحد، وهي مهمة أرهقت قدرتها على التركيز على ما يهم في كل لحظة محددة.
ولحل هذه المشكلة، طور الباحثون نظاماً جديداً يسمى DynaRule. فبدلاً من معاملة القواعد كقائمة ثابتة تُقرأ مرة واحدة، يعلم DynaRule النموذج أن يعامل القواعد كمورد ديناميكي يمكنه الوصول إليه وتحديثه أثناء التفكير. يعمل النظام من خلال دمج القواعد مباشرة في بنية الذاكرة الداخلية للنموذج، وهي عملية تسمة النموذج بالوصول إليها دون إبطاء السرعة. والأهم من ذلك، يتم تدريب النموذج على التعرف على الوقت الذي يحتاج فيه إلى تغيير مساره. فهو يتعلم إصدار إشارة داخلية خاصة، وهي أمر "بحث" ذهني، كلما انتهى من خطوة استنتاجية واحتاج إلى العثة القاعدة التالية. وعندما تنطلق هذه الإشارة، يقوم النموذج فوراً بإعادة تقييم مكتبة القواعد بأكملها، مستبعداً القواعد التي استخدمها سابقاً ومركزاً انتباهه على المجموعة الجديدة من القواعد المطلوبة للخطوة الحالية. وهذا يحول عملية العثور على القاعدة من بحث لمرة واحدة إلى عملية مستمرة وقابلة للتعلم تتطور مع سلسلة الاستنتاج.
كانت نتائج هذا النهج كبيرة. ففي معيار RuleWorld، تفوق DynaRule باستمرار على جميع الأساليب الأخرى، بما في ذلك تلك التي تستخدم أدوات بحث خارجية قوية. وعند مواجهة مجموعة تضم عشرة آلاف قاعدة، حافظ النظام الجديد على مستوى عالٍ من الدقة، حيث حدد القاعدة الصحيحة بنسبة تزيد عن خمسة وثمانين بالمائة في المحاولة الأولى، بينما شهدت الأساليب الأخرى انهياراً في أدائها. وفي المهام التي تتطلب خطوات متعددة، رفع DynaRule متوسط الدقة بنحو عشرين نقطة مقارنة بأفضل البدائل الموجودة. لقد أثبت النظام أنه من خلال تعليم النموذج كيفية إدارة انتباهه بنشاط تجاه مجموعة كبيرة من التعليمات، يمكنه التنقل بموثوقية في المشاهد المنطقية المعقدة. ووجد الباحثون أن النموذج لم يقم بمجرد حفظ القواعد؛ بل تعلم طريقة عامة لتحديد مواقعها وتطبيقها، حتى عند اختباره على قواعد لم يسبق له رؤيتها من قبل. وهذا يشير إلى أن الفجوة بين معرفة النموذج الداخلية الواسعة وقدرته على اتباع التعليمات الخارجية يمكن جسرها، بشرما إذا أُعطي النموذج وسيلة لتحديث تركيزه ديناميكياً مع تطور المهمة.
ملخص تقني: ما وراء المعرفة الواقعية – تقييم وتعلم الاستدلال الإجرائي على مستوى الخطوة في النماذج اللغوية الكبيرة
1. بيان المشكلة
بينما تتفوق النماذج اللغوية الكبيرة (LLMs) في فهم النصوص وتوليدها، إلا أنها تواجه صعوبة في تحديد وتطبيق القواعد الإجرائية المقدمة خارجياً بشكل موثوق وعلى نطاق واسع. تركز التقييمات الحالية لقدرات المعرفة في النماذج اللغبية الكبيرة بشكل أساسي على المعرفة الواقعية، متجاهلةً في كثير من الأحيان المعرفة الإجرائية (كيفية التصرف أو الاستدلال). علاوة على ذلك، فإن الاختبارات المرجعية الحالية لقدرات الاستدلال بالقواعد تقدم القواعد ذات الصلة كمسلمات خاصة بكل حالة، مما يحول القواعد القابلة لإعادة الاستخدام إلى مجرد تلميحات لكل سؤال. هذا التصميم يحجب القدرة على معرفة ما إذا كان النموذج يستطيع:
تحديد القواعد الصحيحة القابلة لإعادة الاستخدام من مستودع قواعد مشترك وكبير لاستعلام معين.
تطبيق هذه القواعد بموثوقية عبر سلاسل استدلال متعددة الخطوات حيث تتغير القواعد المستهدفة ديناميكياً.
تواجه الطرق الحالية تحديين رئيسيين:
هشاشة الاسترجاع والاستخدام: غالباً ما تكون القواعد المحقونة مجردة للغاية ولا تتطابق بشكل جيد مع الصيغة السطحية للأسئلة، مما يجعل الاسترجاع والتطبيق غير مستقرين على نطاق واسع.
عدم الاستقرار على مستوى الخطوة: في عمليات التجميع المتوازي والاستدلال متعدد القفزات، تتغير القواعد المطل ت عبر الخطوات. تعاني النهج الحالية، مثل التوليد المعزز بالاسترجاع (RAG) أو طرق الحقن الداخلي، من عدم التطابق الدلالي أو عدم استقرار اختيار القواعد أثناء الاستدلال متعدد الخطوات.
2. المنهجية
2.1 المعيار المرجعي RuleWorld
لمعالجة نقص التقييم الصارم، قدم المؤلفون RuleWorld، وهو معيار مرجعي واسع النطاق مصمم لقياس قدرة النماذج اللغبية الكبيرة على استخدام القواعد.
الحجم والطبيعة: يتكون من 4.94 مليون قاعدة إجرائية مقدمة خارجياً، وهي قواعد مجردة، غير قائمة على المنطق العام، ومستقلة عن الكيانات. هذا يمنع النماذج من الاعتماد على المعرفة الداخلية.
الهيكل: يتم تنظيم القواعد في أربعة أنواع رئيسية (السمات، البيئات، الأفعال، الحالات) وسبعة أنواع فرعية، وهي متاحة بكل من منطق الدرجة الأولى (FOL) واللغة الطبيعية (NL). القواعد متسقة عالمياً وخالية من التعارض، مما يسمح لاستنتاجات قاعدة واحدة بأن تعمل كمسلمات لقواعد أخرى.
أنواع المهام: يحدد المعيار ثلاثة أنواع من الأسئلة والأجوبة لالتقاط أنماط متميزة من استخدام القواعد:
سؤال وجواب بقاعدة واحدة: تطبيق قاعدة واحدة بالضبط (50 ألف حالة).
سؤال وجواب متعدد القواعد بالتوازي: حل عدة أسئلة فرعية مستقلة ضمن حالة واحدة، وتجميع الإجابات (3.25 مليون حالة، بحد أقصى 8 قواعد ذهبية).
سؤال وجواب متعدد القفزات: استدلال تسلسلي تصبح فيه الاستنتاجات الوسيطة مسلّمات للخطوات اللاحقة (77.7 ألف حالة، بحد أقصى 4 قفزات).
النطاق الإجمالي: يتضمن المعيار 3.37 مليون حالة من الأسئلة والأجوبة عبر 11 مهمة فرعية.
2.2 إطار عمل DynaRule
يقترح المؤلفون DynaRule، وهو إطار عمل متكامل يقوم بحقن القواعد في ذاكرة التخزين المؤقت لـ KV (KV cache) الخاصة بالنموذج ويحول الاسترجاع إلى عملية قابلة للتعلم وخطوة بخوة.
حقن القواعد عبر ذاكرة التخزين المؤقت لـ KV: يتم تشفير القواعد الخارجية باستخدام مشفر جمل مدرب مسبقاً وإسقاطها في مساحة تضمين النموذج اللغبي عبر محولات أحادية الطبقة. يتم إدراج تمثيلات هذه القواعد (أزواج المفتاح والقيمة) مباشرة في ذاكرة التخزين المؤقت لـ KV جنباً إلى جنب مع الرموز السياقية، مما يوسع آلية الانتباه لتشمل مجموعة القواعد.
تحديد طبقة الثقة: حدد المؤلفون "طبقة ثقة" محددة داخل المحول (Transformer) حيث يتم تقليل اعتلاج الانتباه (attention entropy) فوق القواعد المحقونة. تُظهر هذه الطبقة توزيع انتباه أكثر حدة، مما يشير إلى التركيز الأكثر حسماً على القواعد ذات الصلة.
تدريب الانتباه المتراكم على مستوى الخطوة:
تم تقديم رمز خاص <search> لتوجيه الانتباه إلى القواعد المطلوبة في كل خطوة استدلال محددة.
يتضمن التدريب خسارة انتباه متراكمة على مستوى الخطوة. بالنسبة للخطوة الأولى، يكون الاسترجاع مشروطاً بالسؤال. بالنسبة للخطوات اللاحقة (t≥2)، يتم إدراج رمز <search> قبل الإجابة، ويعملت الحالة المخفية لهذا الرمز كاستعلام لإعادة الانتباه إلى مجموعة القواعد.
تبني دالة الهدف للتدريب مجمع مرشح مشترك من أفضل K من القواعد (مدعوماً بالقواعد الذهبية من جميع الخطوات) وتطبق خسارة الاعتلاج المتقاطع (cross-entropy loss) لتشجيع الانتباه العالي على القواعد الصحيحة للخطوة الحالية مع معاملة قواعد الخطوات الأخرى كسلبيات صعبة (hard negatives).
عملية الاستدلال: أثناء الاستدلال، يقوم النموذج بعملية استرجاع القواعد وتحديثها بالكامل داخل مساحته الداخلية. عندما يخرج فك التشفيد رمز <search>، يعيد النموذج حساب الانتباه على مجموعة القواعد عند طبقة الثقة، مستبدلاً مدخلات القواعد القديمة في ذاكرة التخزين المؤقت لـ KV بأخرى مختارة حديثاً. هذا يتيح إعادة الانتباه الديناميكي وتحديث القواعد لدعم استدلال مستقر متعدد الخطوات.
3. المساهمات الرئيسية
المعيار المرجعي RuleWorld: معيار مرجعي واسع النطاق يحتوي على ملايين القواعد الإجرائية المجردة في منطق الدرجة الأولى واللغة الطبيعية، ويغطي أربعة أنواع، وسبعة أنواع فرعية، وإحدى عشرة مهمة فرعية من الأسئلة والأجوبة. إنه يجمع بشكل فريد بين مجمع قواعد مشترك كبير وتقييم محكوم للاستدلال بقاعدة واحدة، وقواعد متعددة بالتوازي، واستدلال متعدد القفزات.
إطار عمل DynaRule: طريقة متكاملة لدمج القواعد تقوم بحقن القواعد الخارجية في ذاكرة التخزين المؤقت لـ KV. يستخدم آلية انتباه قابلة للتعلم مدفوعة برمز <search> لاختيار وتحديث القواعد ديناميكياً، مما يحول الاسترجاع إلى عملية داخلية قابلة للاشتقاق.
4. النتائج التجريبية
أُجريت التجارب على RuleWorld باستخدام نموذج Qwen2.5-7B-Instruct كنموذج أساسي، مع المقارنة ضد خطوط أساس قوية تشمل Prompting، وRAG (Dense, BM25, Hybrid)، وKBLaM، وSR-KI.
أداء الاستدلال بالقواعد:
تواجه النماذج اللغبية الحالية (بما في ذلك DeepSeek V3.2 وGPT-5.5) تحديات كبيرة تحت مجمعات القواعد الكبيرة (على سبيل المثال، 10 آلاف قاعدة)، حيث تنخفض الدقة بشكل حاد.
يتفوق DynaRule باستمرار على جميع خطوط الأساس. حيث يحسن متوسط دقة الأسئلة والأجوبة بما يصل إلى 19 نقطة فوق أقوى خطوط الأساس.
في مهام فرعية محددة، تصل المكاسب إلى 48 نقطة.
تحت 10 آلاف قاعدة، يحقق DynaRule أكثر من 85% في Recall@1 وأكثر من 90% في Recall@10، متفوقاً على أقوى خط أساس بأكثر من 60 نقطة.
أداء الاسترجاع:
يُظهر DynaRule قدرة فائقة على تحديد القواعد، متفوقاً على أقوى خط أساس بما يصل إلى 61.98 نقطة (في منطق الدرجة الأولى) و 53.42 نقطة (في اللغة الطبيعية) في Recall@1.
على عكس طرق RAG التكرارية (IRCoT, ReAct) التي تفشل في سد الفجوة مع تعدد خطوات الاسترجاع، فإن استرجاع DynaRule الداخلي على مستوى الخطوة يوائم تحديد القواعد مع عملية فك التشفيد.
الكفاءة:
يتوسع DynaRule بكفاءة. حقن ذاكرة التخचान المؤقت لـ KV يتوسع بمقدار O((M+N)N)، وهو أرخص بكثير من حقن المطالبات التربيعي لسياقات القواعد الطويلة.
يقلل من زمن الوصول لأول توكن (TTFT) وإجمالي وقت الاستدلال مع الحفاظ على إنتاجية عالية للتوكنات.
التعميم:
عند اختباره على مستودع قواعد غير مرئي (قواعد لم يسبق رؤيتها)، يحافظ DynaRule على أداء جوهري (50.20% تطابق تام عند 10 آلاف قاعدة)، مما يشير إلى أن النموذج يتعلم محاذاة قابلة للنقل بدلاً من حفظ قواعد تدريب محددة.
الدراسة الاستبعادية (Ablation):
يؤدي إزالة القواعد الصحيحة من المجموعة المحقونة إلى انهيار الدقة إلى ما يقرب من الصفر، مما يؤكد اعتماد النموذج على القواعد المحقونة بدلاً من المعرفة الداخلية.
5. الأهمية والادعاءات
يزعم البحث أن DynaRule يعالج الفجوة الحرجة بين المعرفة البارامترية والتأسيس الصريح للقواعد. من خلال توحيد استرجاع القواعد وتحديثها والاستدلال بها بالكامل داخل المساحة الداخلية للنموذج، يُمكّن إطار العمل النماذج اللغبية من:
تحديد القواعد الإجرائية ذات الصلة في كل خطوة استدلال.
استبدال القواعد القديمة ديناميكياً لدعم استدلال مستقر متعدد الخطوات.
تحقيق استدلال إجرائي موثوق حتى عند مواجهة مجمعات قواعد كبيرة ومجردة حيث تفشل طرق الاسترجاع التقليدية.
يسلط العمل الضوء على أن النماذج اللغبية الحالية تعاني في الاستدلال بالقواعد الإجرائية على مستوى الخطوة، ويوضح أن التكامل الديناميكي على مستوى الخطوة هو مسار قابل للتطبيق نحو قدرات استدلال أكثر قوة وموثوقية. يشير المؤلفون إلى القيود المتعلقة بالنطاق الحالي (FOL/NL فقط) وفقدان المعلومات المتأصل في تمثيلات القواعد القائمة على التضمين (embedding) مع توسع مجمعات القواعد إلى الملايين، مما يقترح عملاً مستقبلياً في الفهرسة الهرمية وتمثيلات القواعد الأكثر ثراءً.