What Does 99% Accuracy Measure? A Reproducible Audit of Shortcut Learning in a Widely Used Fake News Corpus
تُثبت هذه الورقة أن دقة الـ 99% المستشهد بها على نطاق واسع في مجموعة بيانات ISOT/Kaggle للأخبار الزائفة هي وهم ناتج عن تعلم الاختصارات من البيانات الوصفية وتحيزات المصادر بدلاً من الكشف الحقيقي عن الحقيقة، حيث تفشل النماذج في التعميم على سيناريوهات متباينة موضوعياً أو معايير مستقلة مثل LIAR.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في العصر الرقمي، غالباً ما تتجاوز سرعة انتشار القصص الزائفة سرعة انتشار الحقيقة، مما يدفع نحو سباق لبناء برامج حاسوبية يمكنها كشف الأكاذيب في المقالات الإخبارية. وقد أمل العلماء طويلاً أنه من خلال تغذية هذه البرامج بآلاف الأمثلة من الأخبار الحقيقية والمزيفة، ستتعلم الآلات التمييز بينهما، لتصبح في النهاية حراساً موثوقين ضد المعلومات المضللة. وكان الاعتقاد السائد هو أنه إذا استطاع برنامج حاسوبي تحديد الأخبار المزيفة بدقة تقارب الكمال في اختبار ما، فإنه يكون قد تعلم الإشارات الدقيقة للخداع. ومع ذلك، فإن هذه الثقة تستند إلى افتراض هش: وهو أن الحاسوب يقرأ القصة بالفعل ليحكم على صدقها، بدلاً من مجرد ملاحظة نمط في كيفية نشر القصة.
يتحدى تحقيق حديث هذا الافتراض من خلال فحص مجموعة مستخدمة على نطاق واسع من المقالات الإخبارية، والتي كانت بمثابة أرض خصبة لتدريب عدد لا يحصى من أنظمة الكشف. لقد عامل الباحثون طريقة الاختبار القياسية ليس كمقياس للذكاء، بل كمسطرة لقياس ما يبحث عنه الحاسوب في الواقع. واكتشفوا أن الدرجات العالية التي سجلتها هذه الأنظمة لا تعكس القدرة على التحقق من الحقائق. بدلاً من ذلك، تستغل البرامج طريقاً مختصراً مخفياً: فهي تتعلم التعرف على الأسلوب الخاص والناشر للمقال بدلاً من محتوى المقال نفسه. ويكشف البحث أن المعيار المستخدم للحكم على هذه الأنظمة معيب بشكل جوهري، إذ يكافئ الآلات على رصد هوية الناشر بدلاً من حقيقة الادعاء.
بدأ الباحثون بتحليل مجموعة بيانات ضخمة تحتوي على أكثر من أربعين ألف مقال إخباري، مقسمة بالتساوي بين تلك المصنفة كأخبار حقيقية وتلك المصنفة كمزيفة. كانت هذه المجموعة هي المعيار لتدريب واختبار كاشفات الأخبار المزيفة لسنوات، حيث سجلت معظم الأنظمة معدلات دقة تزيد عن ثمانية وتسعين بالمائة. ولفهم المعنى الحقيقي لهذه الأرقام، جرد الفريق النموذج من التعقيد المعتاد واستخدم طريقة بسيطة وشفافة لتدقيق البيانات. لقد عاملوا النموذج الحاسوبي كأداة استقصاء، حيث قاموا بإزالة أجزاء مختلفة من المعلومات بشكل منهجي لمعرفة أي القطع كانت تقود النجاح فعلياً.
كان الاكتشاف الأول والأكثر إثارة للدهشة هو أن الحاسوب لم يكن بحاجة لقراءة المقالات الإخبارية على الإطلاق للحصول على درجة مثالية. فقد تضمنت مجموعة البيانات حقلاً يسمى "الموضوع"، يدرج موضوع المقال، مثل "السياسة" أو "أخبار العالم". ووجد الباحثون أن المقالات الحقيقية كانت موسومة حصرياً بمجموعة واحدة من المواضيع، بينما كانت المقالات المزيفة موسومة بمجموعة مختلفة تماماً. لم يكن هناك أي تداخل. وعندما بنوا نموذجاً ينظر فقط إلى وسوم الموضوع هذه ويتجاهل النص بالكامل، حقق درجة مثالية. أثبت هذا أن المعيار كان معيباً جزئياً؛ فقد كانت الوسوم مرتبطة ارتباطاً وثيقاً بالبيانات الوصفية (metadata) لدرجة أن الآلة استطاعت حل المشكلة دون أن تفهم كلمة واحدة من الخبر.
وحتى بعد إزالة هذه الاختصارات الواضحة، ظلت النتائج مرتفعة بشكل مريب. قام الباحثون بعد ذلك بإزالة أدلة أخرى دقيقة، مثل أسماء وكالات الأنباء التي ظهرت في جميع المقالات الحقيقية تقريباً ولم تظهر في معظم المقالات المزيفة، كما حذفوا النسخ المكررة من المقالات التي ظهرت بالخطأ في كل من مجموعتي التدريب والاختبار. قللت هذه التغييرات من درجة الحاسوب، ولكن بنسبة ضئيلة جداً، حيث انخفضت من مستوى يقارب الكمال إلى مستوى لا يزال مرتفعاً جداً. أشار هذا إلى أن الحاسوب لم يكن يعتمد فقط على خدعة أو اثنتين واضضحتين، بل تعلم نمطاً أوسع وأكثر انتشاراً.
وكشف المزيد من الاستقصاء أن هذا النمط لم يكن يتعلق بالحقائق في القصة، بل بأسلوب الكتابة. فقد جاءت المقالات الحقيقية من وكالات أنباء مهنية واتبعت تنسيقاً رسمياً صارماً، بينما جاءت المقالات المزيفة من مواقع إلكترونية متنوعة واستخدمت اصطلاحات مختلفة، مثل عبارات محددة حول الفيديوهات أو الصور. تعلم الحاسوب التمييز بين هذين "الصوتين" بدلاً من صدق الادعاءات. ولاختبار ذلك، حاول الباحثون حذف الكلمات الأكثر شيوعاً التي استخدمها الحاسوب لاتخاذ قراراته. وحتى بعد إزالة أكثر ألف كلمة أهمية، لم تتغير قدرة الحاسوب على التمييز إلا بشكل طفيف جداً. كانت الإشارة موزعة عبر أسلوب الكتابة بأكمله، مما جعل من المستحيل إصلاح الأمر بمجرد إزالة بعض الكلمات السيئة.
الاختبار الحقيقي لما إذا كان الحاسوب قد تعلم شيئاً مفيداً جاء عندما غير الباحثون قواعد اللعبة. فقد طلبوا من الحاسوب تصنيف مقالات إخبارية من مجموعة مواضيع ومصادر مختلفة تماماً، لم يسبق له رؤيتها من قبل. وفي هذه البيئة الجديدة، انهارت أداء الحاسوب؛ حيث انخفضت الدرجات التي كانت تقارب الكمال إلى مستوى التخمين العشوائي. لم يتعلم الحاسوب تحديد الأخبار المزيفة، بل تعلم تحديد مجموعة معينة من الناشرين. وعندما اختفت هؤلاء الناشرين، ضاع الحاسوب.
كان هذا الفشل أكثر وضوحاً عندما استخدم الباحثون نموذجاً حاسوبياً أكثر تقدماً وقوة مصمماً لفهم اللغة البشرية بعمق. وبينما قدم هذا النموذج المتطور أداءً أفضل قليلاً في الاختبار الأصلي، إلا أنه فشل بشكل أكبر عند مواجهة المواضيع المختلفة الجديدة. لقد أصبح بارعاً جداً في رصد الأسلوب الخاص للناشرين الأصليين لدرجة أنه لم يستطع التكيف عندما تغير ذلك الأسلوب. أظهرت الدراسة أن إضافة المزيد من القدرة الحوسبية لم تساعد الآلة على تعلم الحقيقة، بل ساعدتها فقط على حفظ الطريق المختصر بكفاءة أكبر.
خلص الباحثون إلى أن درجات الدقة العالية التي سجلتها الدراسات السابقة كانت مضللة. فهي لم تكن تقيس القدرة على كشف الأكاذيب، بل القدرة على الفصل بين مجموعة من الناشرين وأخرى. لم تكن النماذج الحاسوبية تصبح أكثر ذكاءً، بل كانت تصبح أفضل في استغلال العيوب الموجودة في بيانات الاختبار. تقدم الدراسة مساراً واضحاً لكل من يعمل في هذا المجال: قبل الوثوق بنظام لكشف الأخبار المزيفة، يجب التأكد مما إذا كان يقرأ البيانات الوصفية أو المصدر، بدلاً من قراءة القصة نفسها. إن الأدوات اللاية لإجراء هذا الفحص بسيطة وغير مكلفة، إذ لا تتطلب سوى بضع دقائق من وقت الحاسوب، ومع ذلك فهي ضرورية لضمان أن التكنولوجيا التي نبنيها تعالج بالفعل المشكلة التي صُممت من أجلها.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.