FregeLogic at SemEval 2026 Task 11: A Hybrid Neuro-Symbolic Architecture for Content-Robust Syllogistic Validity Prediction
تقدم الورقة البحثية FregeLogic، وهو نظام هجين عصبي-رمزي لمهمة SemEval-2026 Task 11 يجمع بين مجموعة من النماذج اللغوية الكبيرة ومحلل Z3 SMT لحل أخطاء التحيز المحتوي في التنبؤ بصحة القياس المنطقي، محققاً دقة بنسبة 94.3% ومقللاً بشكل كبير من مقياس تأثير المحتوى من خلال التحقق الرسمي المستهدف في الحالات المتنازع عليها.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك قاضٍ في محكمة منطقية. مهمتك هي تحديد ما إذا كانت حجة معينة (قياس منطقي) صحيحة منطقياً.
هنا يكمن الجزء الصعب: البشر (والنماذج الذكية التي نبنيها) سيئون جداً في هذا الأمر عندما تبدو الحجة "مقنعة" في الحياة الواقعية.
- الفخ: إذا قالت حجة ما: "كل القطط لها شوارب. حيواني الأليف له شوارب. إذن، حيواني الأليف هو قط." يبدو هذا منطقياً، لكنه غير صحيح منطقياً.
- الفخ 2: إذا قالت حجة ما: "كل وحيد القرن أرجواني. حيواني الأليف أرجواني. إذن، حيواني الأليف هو وحيد قرن." قد يبدو هذا سخيفاً، لكن البنية المنطقية هي نفسها تماماً.
غالباً ما ترتبك نماذج الذكاء الاصطناعي هنا؛ فهي تقع في فخ "تأثير المحتوى" (Content Effect)، حيث تسمح لمعرفتها بالواقع بالتدخل في مهاراتها المنطقية.
يقدم هذا البحث نظام FregeLogic، وهو نظام ذكي مصمم للتغلب على هذا الفخ. إليك كيف يعمل، باستخدام تشبيه بسيط.
فريق المحققين الخمسة (مجموعة النماذج اللغوية الكبيرة - LLM Ensemble)
أولاً، يستأجر النظام خمسة محققين مختلفين من الذكاء الاصطناعي (نماذج لغوية كبيرة).
- جميعهم أذكياء، لكن لديهم شخصيات وطرق تفكير مختلفة.
- يُطلب منهم التصويت على ما إذا كانت الحجة "صحيحة" أم "غير صحيحة".
- عادةً ما يتفقون جميعاً. إذا قال 4 أو 5 منهم "صحيحة"، فإن النظام يقبلها.
إنذار "الخلاف"
هذا هو الجزء العبقري: النظام يراقب التصويتات المتقاربة.
- إذا كان التصويت 5-0 أو 4-1، فإن المحققين واثقون، والنظام يثق بهم.
- ولكن إذا كان التصويت 3-2، فإن النظام يطلق جرس الإنذار.
لماذا؟ أدرك المؤلفون أنه عندما يختلف المحققون، فهذا يعني عادةً أن الحجة مخادعة. المحتوى "المقنع" قد أربك بعض المحققين، بينما تمسك آخرون بالمنطق. هذا الانقسام (3-2) هو إشارة إلى أن الذكاء الاصطناعي يعاني من "تأثير المحتوى".
أستاذ الرياضيات الصارم (محلل Z3)
عندما يختلف المحققون (في حالة الـ 3-2)، يستدعي النظام أستاذ رياضيات صارماً (محلل منطق رسمي يسمى Z3).
- المحققون بارعون في فهم اللغة، لكن القصص تشتت انتباههم.
- الأستاذ لا يهتم بالقصة على الإطلاق. هو يقوم بتجريد الحجة من الكلمات المتعلقة بـ "القطط" أو "وحيد القرن" أو "الزجاج". هو ينظر فقط إلى الهيكل العظمي للحجة.
- المحقق: "مهلاً، وحيد القرن ليس حقيقياً! هذا غير صحيح!"
- الأستاذ: "لا يهمني ما إذا كان وحيد القرن موجوداً أم لا. هل العملية الحسابية صحيحة؟ نعم. إذن هي صحيحة."
يعمل الأستاذ كـ مرجح للنتيجة. إذا كان المحققون في حالة نزاع، فإن الأستاذ هو من يصدر القرار النهائي بناءً على الرياضيات البحتة.
النتائج: لماذا نجح الأمر؟
قام الفريق باختبار هذا على 960 لغزاً منطقياً.
- فريق المحققين الصافي: حقق نسبة 93.4% تقريباً، لكنهم كانوا لا يزالون عرضة للخداع بسهولة بواسطة القصص "المقنعة".
- الفريق الهجين (FregeLogic): حقق 94.3% تقريباً.
- والأهم من ذلك، كانوا أقل انحيازاً بكثير. فقد توقفوا عن الوقوع في فخ القصص "السخيفة" بنسبة 16% أكثر من المحققين وحدهم.
السر الكامن: "المترجم المهيكل"
كانت هناك مشكلة واحدة كبيرة: الأستاذ (Z3) هو روبوت يتحدث "الرياضيات" فقط، بينما يتحدث المحققون "الإنجليزية". لكي يفهم الأستاذ الحجة، كان على المحققين ترجمة الجملة الإنجليزية إلى كود JSON صارم.
- الطريقة القديمة: حاول المحققون كتابة الكود كنص حر، فارتكبوا أخطاء بنسبة 22%، ولم يستطع الأستاذ قراءته.
- الطريقة الجديدة: أجبر النظام المحققين على استخدام نموذج مهيكل (مثل ملء استمارة صارمة). أدى ذلك إلى تقليل أخطاء الترجمة إلى ما يقرب من الصفر.
الخلاصة
FregeLogic يشبه فريقاً يعرف متى يثق بحدسه (المحققون) ومتى يستعين بكتاب قواعد صارم (أستاذ الرياضيات).
من خلال استخدام كتاب القواعد الصارم فقط عندما يكون الفريق في حالة ارتباك، تمكنوا من حل أصعب الألغاز المنطقية دون التشتت بالقصة. إنه مثال مثالي لدمج الحدس الشبيه بالبشر مع الدقة الرياضية الصارمة للحصول على أفضل ما في العالمين.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.