SciClaimSeekers at CheckThat! 2026: Retrieving Scientific Sources for Social Media Claims with LLM Reranking
يعالج نظام SciClaimSeekers المعروض في هذه الورقة تحدي التحقق من الادعاءات العلمية على وسائل التواصل الاجتماعي من خلال توظيف مسار استرجاع هجين يجمع بين BM25 وMultilingual E5 مع تقنية دمج الرتب المتبادلة (Reciprocal Rank Fusion)، متبوعاً بإعادة ترتيب باستخدام نموذج Qwen2.5-14B-Instruct، والذي حقق معدل رتب متوسط (MRR@5) بنسبة 64.39% على مجموعة اختبار المهمة الأولى لـ CLEF-2026 CheckThat!، وأثبت أن مثل هذه المسارات المصممة بعناية يمكن أن تضاهي النهج القائمة على الضبط الدقيق.
المؤلفون الأصليون:Mohotarema Rashid, Nansu Baniya, Anirban Saha Anik, Xiaoying Song, Lingzi Hong
تخيل الإنترنت كمكتبة ضخمة وفوضوية حيث يمكن لأي شخص أن يصرخ بـ "حقيقة" من فوق برج عالٍ. أحياناً تكون هذه الصرخات حقيقية، لكنها غالباً ما تكون مجرد شائعات أو سوء فهم للعلوم الحقيقية. المشكلة تكمن في أنه عندما يشارك الناس هذه الأفكار العلمية على وسائل التواصل الاجتماعي، فإنهم نادراً ما يحضرون معهم الكتاب الأصلي أو تقرير الخبير. الأمر يشبه شخصاً يقول: "قرأت أن تناول البروكلي يمنحك قوة خارقة"، لكنه يرفض إخبارك في أي كتاب قرأت ذلك. هذا يجعل من الصعب التحقق مما إذا كانت القصة حقيقية أم مجرد أسطورة مختلقة. يحتاج العلماء ومدققو الحقائق إلى وسيلة للعثور على "الرمز المصدر" لهذه الادعاءات — أي الأوراق البحثية الفعلية المختبئة في مكتبة الكتابات الأكاديمية الضخمة. هذا هو تحدي "استرجاع المصدر": أخذ منشور غير منظم وغير رسمي من وسائل التواصل الاجتماعي والعثور على الورقة العلمية الرسمية المحددة التي كان يحاول التحدث عنها.
الورقة التي ستطالعها الآن، بعنوان "SciClaimSeekers at CheckThat! 2026"، تصف نظاماً ذكياً جديداً تم بناؤه لحل هذا اللغز تحديداً. لقد أنشأ الباحثون فريق تحقيق رقمي يُدعى SciClaimSeekers. فكر في هذا النظام كعملية مكونة من ثلاث خطوات للعثور على الكتاب الصحيح في مكتبة تضم 10,000 ورقة علمية. أولاً، يستخدم النظام "محركي بحث" مختلفين في نفس الوقت: أحدهما يبحث عن تطابق الكلمات بدقة (مثل العثور على كتاب لأن عنوانه يحتوي على كلمة "بروكلي") والآخر يفهم "المعنى" للجملة (مثل العثور على كتاب لأنه يتحدث عن "القوة الخارقة" حتى لو لم تكن كلمة "بروكلي" موجودة فيه). ثانياً، يقوم بدمج القوائم من كلا محركي البحث لإنشاء قائمة واحدة أقصر من المرشحين الأكثر احتمالاً. وأخيراً، وهو الأهم، يستخدم "دماغ ذكاء اصطناعي" قوياً لقراءة منشور وسائل التواصل الاجتماعي والمرشحين الأوائل واحداً تلو الآخر، متسائلاً: "هل هذه هي الورقة التي يتحدث عنها هذا المنشور؟" ويعطيها درجة تقييم.
وجد الفريق أن خطوة "دماغ الذكاء الاصطناعي" هذه كانت السحر الحقيقي. فبينما ساعدت الخطوتان الأوليان في تضييق النطاق، أدت خطوة إعادة الترتيب بواسطة الذكاء الاصطناعي إلى رفع معدل نجاح النظام بشكل كبير. وفي مجموعة اختبار من منشورات وسائل التواصل الاجتماعي، حدد نظامهم الورقة العلمية الصحيحة ضمن أفضل خمسة تخمينات بنسبة 64.39% من الوقت. كانت هذه قفزة هائلة — بزيادة قدرها حوالي 13.6 نقطة مئوية عن استخدام محرك بحث بسيط يعتمد على مطابقة الكلمات فقط. تشير النتائج إلى أن استخدام نماذج الذكاء الاصطناعي الضخمة والمدربة مسبقاً في عملية منظمة وخطوة بخوة يعد وسيلة قوية جداً للتحقق من الادعاءات العلمية، حتى دون الحاجة إلى تدريب ذكاء اصطناعي مخصص من الصفر. النظام فعال للغاية لدرجة أنه احتل المركز الحادي عشر من بين 37 فريقاً في مسابقة دولية كبرى، مما يثبت أن هذا المزيج من البحث البسيط والقراءة الذكية للذكاء الاصطناعي يعمل جيداً لربط ضجيج وسائل التواصل الاجتماعي بالحقيقة العلمية.
ملخص تقني: SciClaimSeekers في مسابقة CheckThat! 2026
بيان المشكلة تنتشر الادعاءات العلمية على وسائل التواصل الاجتماعي بشكل أسرع من إمكانية التحقق منها، ومع ذلك نادراً ما تضع منشورات وسائل التواصل الاجتماعي روابط لمصادرها الأكاديمية الأصلية. وهذا يخلق تحدياً كبيراً لأنظمة التحقق من الحقائق الآلية. ويتفاقم هذا الصعوبة بسبب "التحيز التأكيدي"، حيث يفضل المستخدمون المعلومات التي تتوافق مع معتقداتهم المسبقة، بالإضافة إلى عدم التطابق الهيكلي بين خطاب وسائل التواصل الاجتماعي غير الرسمي المليء بالمصطلحات التقنية وبين الأدبيات العلمية الرسمية. علاوة على ذلك، غالباً ما يقوم المحتوى الذي ينشئه المستخدمون بإعادة صياغة النتائج أو الإشارة إليها بشكل فضفاض دون استشهادات معيارية، مما يجعل تحديد المصادر العلمية الأصلية أمراً صعباً. تعالج مهمة CheckThat! 2026 (المهمة 1) تحديداً استرجاع المصادر العلمية للادعاءات الموجودة على وسائل التواصل الاجتماعي، مما يتطلب من الأنظمة ربط منشور على وسائل التواصل الاجتماعي بالمنشور العلمي الصحيح من بين مجموعة ثابتة تضم 10,000 ورقة بحثية.
المنهجية يقترح المؤلفون نظام SciClaimSeekers، وهو عبارة عن خط إنتاج (pipeline) مكون من ثلاث مراحل "استرجاع ثم إعادة ترتيب" مصمم لسد الفجوة بين منشورات وسائل التواصل الاجتماعي الضوضائية والملخصات العلمية الرسمية. يعمل النظام كما يلي:
الاسترجاع في المرحلة الأولى (هجين): يعمل مسترجعان متكاملان بالتوازي على مجموعة بيانات مفهرسة مكونة من 10,000 ورقة (ممثلة بالعناوين والملخصات المدمجة):
الاسترجاع المتفرق (Sparse Retrieval): يستخدم BM25 (Okapi) لالتقاط الإشارات المعجمية، مثل الكيانات المسماة والقيم الرقمية. يتم معالجة المدخلات مسبقاً لإزالة الضوضاء (الروابط، الإشارات، علامات الترقيم) وتنميطها.
الاسترجاع الكثيف (Dense Retrieval): يستخدم نموذج multilingual-e5-large-instruct (المبني على XLM-RoBERTa). يستخدم هذا النموذج بادئات تعليمات (instruction prefixes) للتمييز بين الاستعلامات والمستندات، حيث يعامل منشور وسائل التواصل الاجتماعي كاستعلام لاسترجاع الورقة العلمية المقابلة. ويستخدم عملية "التجميع المتوسط" (mean pooling) فوق الحالات الخفية النهائية وL2 normalization لمطابقة تشابه جيب التمام عبر فهرس FAISS.
الدمج (Fusion): يعيد كلا المسترجعين أفضل 100 مرشح. يتم دمج هذه القوائم باستخدام دمج الرتب المتبادل (RRF) مع ثابت تنعيم k=60، لإنتاج مجموعة موحدة تضم أفضل 50 مرشحاً.
إعادة الترتيب في المرحلة الثانية (LLM): يتم إعادة ترتيب أفضل 50 مرشحاً مدمجين باستخدام Qwen2.5-14B-Instruct، وهو نموذج لغوي كبير مفتوح المصدر.
النهج: يُستخدم النموذج كـ مشفر تقاطعي نقطي (pointwise cross-encoder) بدون تدريب مسبق (zero-shot). وخلافاً للنهج القائم على القوائم (listwise)، يتم تقييم كل زوج (منشور وسائل التواصل الاجتماعي، الورقة المرشحة) بشكل مستقل.
صياغة الأوامر (Prompting): يوجه النظام النموذج للعمل كمحدد للمصدر العلمي، حيث يخرج درجة صلة رقمية صحيحة بين 0 و10 بناءً على احتمالية أن يشير المنشور إلى الورقة المحددة.
المخرجات: يتم ترتيب المرشحين حسب درجة الـ LLM (مع كسر التعادل باستخدام درجة RRF الخاصة بالمرحلة الثانية)، ويتم إرجاع أفضل 5 نتائج كأفضل توقع.
المساهمات الرئيسية
أداء خط الإنتاج الهجين: قدم المؤلفون خط إنتاج هجين "استرجاع ثم إعادة ترتيب" حقق المركز الحادي عشر من بين 37 فريقاً مشاركاً في مجموعة الاختبار الإنجليزية لمسابقة CheckThat! 2026 المهمة 1. حقق النظام MRR@5 بنسبة 64.39% على مجموعة الاختبار الرسمية.
هيمنة النماذج اللغوية الكبيرة (LLM) في إعادة الترتيب: تعزل الدراسة مساهمة كل مرحلة، حيث حددت أن المشفر التقاطعي للنماذج اللغوية الكبيرة هو المحرك الرئيسي للأداء. وفرت إعادة الترتيب باستخدام Qwen2.5-14B حوالي +10 نقاط في MRR@5 سواء تم تطبيقها على مرشحي BM25 وحدهم أو على المرشحين المدمجين هجينياً. وهذا يمثل حوالي ثلاثة أرباع التحسن الإجمالي البالغ +13.67 نقطة مقارنة بأساس BM25.
التعميم: أظهر النظام قدرة قوية على التعميم، مع فجوة ضئيلة جداً بلغت 0.03 نقطة مئوية بين درجة مجموعة التطوير (64.36%) ودرجة مجموعة الاختبار (64.39%)، مما يشير إلى أن قرارات الضبط تنتقل بسلاسة إلى البيانات الجديدة.
النتائج والتحليل يكشف التقييم، القائم على متوسط الرتبة العكسية (MRR@5)، والضربة الأولى (Hit@1)، والضربة الخامسة (Hit@5)، ما يلي:
النماذج المرجعية (Baselines): حقق BM25 وحده حوالي 50% في MRR@5. وحسن مسترجع E5 الكثيف هذا بنحو نقطتين، وأضاف دمج RRF الهجين حوالي 1.5 نقطة أخرى.
مقارنة إعادة الترتيب: أظهر المشفر التقاطعي التقليدي (bge-reranker-v2-m3) مكاسب طفيفة في مجموعة التطوير ولكنه عانى من فرط التخصيص (overfitting)، حيث كان أداؤه أسوأ من الأساس الهجين في مجموعة الاختبار. في المقابل، حقق إعادة الترتيب باستخدام النموذج اللغوي التوليدي (Qwen2.5-14B) مكاسب كبيرة ومتسقة.
الكفاءة مقابل الأداء: بينما يمثل إعادة الترتيب باستخدام LLM عنق الزجاجة الحسابي (يستغرق حوالي 11 ساعة لمجموعة الاختبار على وحدتي معالجة رسومية A40)، يشير المؤلفون إلى أن خط الإنتاج معياري (modular) ويعمل من البداية إلى النهاية على عقدة واحدة، مما يجعله عملياً للنشر في حالات الاستخدام غير المتزامنة (offline) أو الحساسة للخصوصية.
الأهمية والادعاءات يزعم البحث أن النماذج الضخمة سابقة التدريب، عند دمجها في خط إنتاج دقيق، يمكن أن تكون منافسة للنهج التي يتم ضبطها بدقة (fine-tuned) لاسترجاع المصادر العلمية. وتحديداً، يرى المؤلفون أن التقييم النقطي (pointwise scoring) باستخدام نموذج لغوي قوي مفتوح الأوزان يعمل كبديل موثوق لإعادة تدريب مشفر تقاطعي مخصص للمهمة. يسلط العمل الضوء على أنه بينما يوفر الاسترجاع الهجين (الذي يجمع بين الإشارات المتفرقة والكثيفة) أساساً ضرورياً للاستدعاء (recall)، فإن القفزة الكبيرة في جودة الترتيب مدفوعة بقدرات الفهم الدلالي للنموذج اللغوي الكبير في مرحلة إعادة الترتيب. يُقدم النظام كحل مفتوح المصدر ومعياري يعالج بفعالية عدم التطابق اللغوي والهيكلي المتأصل في ربط ادعاءات وسائل التواصل الاجتماعي بالأدلة العلمية.