Misinformation Span Detection in Videos via Audio Transcripts
تتناول هذه الورقة تحدي تحديد معلومات مضللة محددة داخل مقاطع الفيديو من خلال تقديم مجموعتين جديدتين من النصوص الصوتية المشروحة، وإثبات أن النماذج اللغوية الحديثة يمكنها اكتشاف هذه المقاطع المضللة بفعالية بدرجة F1 تبلغ 0.68.
المؤلفون الأصليون: Breno Matos, Rennan C. Lima, Savvas Zannettou, Fabricio Benevenuto, Rodrygo L. T. Santos
المؤلفون الأصليون: Breno Matos, Rennan C. Lima, Savvas Zannettou, Fabricio Benevenuto, Rodrygo L. T. Santos
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إليك ملخص تقني مفصل لورقة البحث بعنوان "كشف نطاق المعلومات المضللة في الفيديوهات عبر النصوص المسموعة".
1. تعريف المشكلة
تتناول الورقة تحدي كشف نطاق المعلومات المضللة (Misinformation Span Detection) في محتوى الفيديو. بينما ركزت الأبحاث السابقة على التصنيف الثنائي (تحديد ما إذا كان الفيديو بأكم له يحتوي على معلومات مضللة)، فإن هذا النهج يفتقر إلى القابلية للتفسير والمنفعة لمدققي الحقائق. فهو لا يحدد متى أو أين تقع الادعاءات الكاذبة داخل الفيديو.
يعرف المؤلفون المهمة بأنها تحديد نطاقات (مقاطع) محددة داخل النص المكتوب للفيديو تحتوي على ادعاءات كاذبة. ويعد هذا أمراً بالغ الأهمية لأن فيديو طويلاً (مثل مقابلة مدتها 55 دقيقة) قد يكون معظمه حقائق، ولكنه قد يحتوي على لحظات قصيرة وحرجة من المعلومات المضللة. إن أتمتة هذا الكشف يمكن أن تساعد مدققي الحقائق في تحديد الطوابع الزمنية الدقيقة للتحقق، وتساعد منصات التواصل الاجتماعي في تطبيق ملصقات السياق أو التحذيرات في اللحظة الدقيقة التي يتم فيها تقديم ادعاء كاذب.
2. المنهجية
يقترح المؤلفون منهجية مكونة من ثلاث خطوات لبناء مجموعات البيانات وتدريب المصنفات لهذه المهمة:
أ. جمع البيانات وبناء مجموعة البيانات
أنشأ الفريق مجموعتين جديدتين من البيانات بناءً على عمل تدقيق الحقائق الذي تقوم به Aos Fatos، وهي وكالة رائدة في تدقيق الحقائق في البرازيل:
- مجموعة بيانات BOL4Y: تحتوي على 538 فيديو تظهر فيها شخصية الرئيس البرازيلي السابق جواير بولسونارو. وتتضمن 2,355 ادعاءً كاذباً موثقاً تغطي فترة ولايته التي استمرت 4 سنوات.
- مجموعة بيانات EI22: تحتوي على 77 فيديو تتعلق بادعاءات التزوير الانتخابي التي أطلقها الناخبون خلال الانتخابات الرئاسية البرازيلية لعام 2022، مع 78 ادعاءً كاذباً موثقاً.
خط معالجة البيانات:
- النسخ النصي (Transcription): تم تحويل الصوت من الفيديوهات إلى نص باستخدام نموذج OpenAI Whisper. بالنسبة لبعض المصادر، تم الحصول على النصوص مباشرة من خدمة Escriba التابعة لـ Aos Fatos.
- التقطيع (Segmentation): تم تقسيم النصوص إلى نوافذ (عادة ما تصل مقاطع Whisper إلى 30 ثانية).
- توليد التضمينات (Embedding Generation): تم تحويل المقاطع والادعاءات الأصلية الكاذبة إلى متجهات كثيفة (dense vector embeddings) باستخدام BERTimbau (وهو نموذج BERT مدرب مسبقاً على اللغة البرتغالية البرازيلية).
- مطابقة المقاطع: قام النظام بحساب تشابه جيب التمام (cosine similarity) بين تضمينات الادعاءات وتضمينات المقاطع. وتم تحديد المقاطع ذات التشابه العالي (عتبة ≥ 0.7) كمرشحة.
- التوثيق اليدوي: قام مدققون بشريون بالتحقق من المقاطع المرشحة، وتحديد النطاق الدقيق الذي يحتوي على الادعاء. كما تعاملوا مع الحالات التي تمتد فيها الادعاءات عبر مقاطع متعددة عن طريق دمجها.
- أخذ العينات السلبية (Negative Sampling): تم التعامل مع جميع المقاطع غير الموثقة كعينات سلبية (غير مضللة).
ب. نماذج التصنيف
درب المؤلفون وقيموا نموذجين من نماذج اللغة المتطورة المدربة مسبقاً على اللغة البرتغالية البرازيلية:
- BERTimbau: وهو نموذج يعتمد على المشفر فقط (encoder-only).
- PTT5: وهو نموذج يعتمد على بنية (encoder-decoder) بناءً على هندسة T5.
تم ضبط كلا النموذجين بدقة (fine-tuning) باستخدام رأس تصنيف (softmax) للتنبؤ بما إذا كان مقطع نصي معين يحتوي على ادعاء كاذب (الفئة 1) أم لا (الفئة 0).
ج. الإعداد التجريبي
- التعامل مع عدم توازن الفئات: نظراً للعدد الهائل من العينات السلبية (على سبيل المثال، 336 ألف عينة سلبية مقابل 2.3 ألف عينة إيجابية في BOL4Y)، استخدم المؤلفون استراتيجيات أخذ العينات الناقصة (undersampling) مع نسب مختلفة من الإيجابي إلى السلبي (1:1، 1:10، 1:25، 1:50، 1:75، 1:100).
- تنوع مجموعات البيانات: اختبروا نسخة "الأصلية" (الادعاءات المستخرجة من النصوص الخام) ونسخة "المحررة" (الادعاءات التي صقلها الصحفيون) لتقييم تأثير ضجيج النسخ النصي.
- التحليل الزمني: أجروا تجارب "التقدم للأمام" (Walk-Forward) و"التوسع" (Expand) لاختبار ما إذا كانت النماذج المدربة على بيانات سابقة يمكنها التنبؤ بمعلومات مضللة مستقبلية، مما يحاكي النشر في العالم الحقيقي.
- التقييم عبر مجموعات البيانات: تم اختبار النماذج المدربة على BOL4Y على مجموعة EI22 لتقييم القدرة على التعميم عبر المتحدثين والمواضيع المختلفة.
3. المساهمات الرئيسية
- أول نهج لكشف النطاق: يعد هذا أول عمل يصيغ ويعالج كشف المعلومات المضللة كمسألة كشف نطاق (span detection) في الفيديوهات، متجاوزاً التصنيف الثنائي على مستوى الفيديو.
- مجموعات بيانات مبتكرة: إصدار BOL4Y و EI22، اللذين يحتويان على أكثر من 2,400 ادعاء كاذب موثق مع طوابع زمنية دقيقة للفيديو، ونصوص، ووسائط أصلية. وهي أول مجموعات بيانات من نوعها.
- وضع خط الأساس (Baseline): وضع المؤلفون أول معايير مرجعية لهذه المهمة، مما أثبت أن الكشف الآلي أمر ممكن.
- العلم المفتوح: يتم إصدار جميع مجموعات البيانات (النصوص، الصوت، الفيديو)، والتعليمات البرمجية، وبيانات كشط HTML علناً عبر Zenodo وHuggingFace وGitHub، التزاماً بمبادئ FAIR.
4. النتائج
- أداء التصنيف:
- النموذج الأفضل أداءً في المجموعة الأصلية كان BERTimbau مع نسبة أخذ عينات ناقصة 1:75، حيث حقق درجة Macro F1 بلغت 0.68.
- ومن المثير للاهتمام أن التدريب على مجموعة البيانات الكاملة (بدون أخذ عينات ناقصة) أدى إلى أداء ضعيف (F1 ~0.56)، مما يشير إلى أن عدم التوازن الشديد في الفئات يعيق التعلم وأن أخذ العينات الناقص عملية حاسمة.
- أظهرت المجموعة المحررة (الادعاءات الأكثر نقاءً والتي صقلها الصحفيون) أداءً محسناً، حيث وصل BERTimbau إلى F1 قدره 0.81، مما يسلط الضوء على تحدي الضجيج في النسخ النصي الآلي.
- التحليل الزمني:
- أظهرت النماذج القدرة على التعميم إلى الأشهر المستقبلية، رغم أن الأداء تقلب بناءً على الأحداث السياسية (مثل انخفاض الأداء خلال فترة الانتخابات لعام 2022).
- أظهر PTT5 أداءً أكثر اتساقاً عبر الإعدادات الزمنية مقارنة بـ BERTimbau.
- الأداء عبر مجموعات البيانات:
- نجحت النماذج المدربة على BOL4Y في التعميم على مجموعة EI22، محققة Macro F1 قدره 0.71 (مع نسبة 1:10 لأخذ العينات الناقصة). وهذا يثبت أن النهج يعمل عبر مختلف المتحدثين والمواضيع.
5. الأهمية والتأثير
- المنفعة العملية: تسمح القدرة على تحديد نطاقات المعلومات المضللة بـ التدخلات السياقية. يمكن للمنصات وضع ملصقات تحذيرية أو تدقيقات للحقائق بالضبط عند نطق ادعاء كاذب، بد rًا من وسم الفيديو بأكمله.
- الامتثال التنظيمي: يدعم هذا العمل الامتثال للوائح مثل قانون الخدمات الرقمية (DSA)، الذي يتطلب من المنصات امتلاك آليات قوية للإشراف على المحتوى والشفافية.
- الأساس البحثي: من خلال إصدار مجموعات بيانات عالية الجودة وموثقة، يُمكّن المؤلفون المجتمع البحثي من استكشاف الاستراتيجيات متعددة الوسائط، ونماذج اللغة الكبيرة (LLMs)، ونماذج الرؤية واللغة لهذا النوع من المشكلات.
- كفاءة مدققي الحقائق: يمكن لهذه الأداة أن تقلل بشكل كبير من الوقت الذي يقضيه مدققو الحقائق في مراجعة الفيديوهات الطويلة من خلال توجيههم إلى المقاطع المحددة التي تتطلب التحقق.
في الختام، تنجح الورقة في إثبات أن كشف نطاق المعلومات المضللة في النصوص المسموعة للفيديوهات هو مهمة ممكنة باستخدام نماذج اللغة الحديثة، بشرما تم استخدام معالجة مناسبة للبيانات (أخذ العينات الناقصة) ونصوص عالية الجودة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.
تصلك أفضل أبحاث NLP كل أسبوع.
يحظى بثقة باحثين في ستانفورد وكامبريدج والأكاديمية الفرنسية للعلوم.
تفقّد بريدك لتأكيد الاشتراك.
حدث خطأ ما. تعيد المحاولة؟
لا رسائل مزعجة، ويمكنك إلغاء الاشتراك متى شئت.