← أحدث الأبحاث
💻 computer science

Leave No Stone Unturned: Uncovering Holistic Audio-Visual Intrinsic Coherence for Deepfake Detection

تقدم هذه الورقة البحثية HAVIC، وهو كاشف للتزييف العميق يستفيد من التماسك الجوهري السمعي البصري الشامل المتعلم من مقاطع الفيديو الأصلية لتحقيق تعميم وأداء فائقين على مجموعة بيانات جديدة عالية الدقة (HiFi-AVDF)، متفوقاً بشكل كبير على الأساليب الحالية الرائدة في سيناريوهات عبر مجموعات البيانات.

المؤلفون الأصليون: Jielun Peng, Yabin Wang, Yaqi Li, Long Kong, Xiaopeng Hong

نُشر 2026-03-26
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jielun Peng, Yabin Wang, Yaqi Li, Long Kong, Xiaopeng Hong

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك محقق تحاول كشف فيديو مزيف. في الماضي، كانت أدوات كشف التزييف العميق (Deepfake) مثل المحققين الذين يبحثون عن دليل واحد فقط: إما الصورة (البصريات) أو الصوت (السمعيات). كانوا يبحثون عن عيوب صغيرة ومحددة تركها المزورون القدامى غير المهرة—مثل حافة ضبابية على الوجه أو صدى غريب في الصوت.

لكن اليوم، يستخدم المزورون ذكاءً اصطناعيًا فائق التقدم (مثل تلك التي تصنع الأفلام أو تولد الفيديوهات من النصوص). إنهم بارعون جدًا لدرجة أنهم لا يتركون تلك العيوب القديمة والواضحة—إنهم مثل السحرة المهرة الذين يجعلون الصورة والصوت يبدوان مثاليين بشكل فردي، ولكن قد يكونان غير متزامنين قليلاً أو يبدوان "خاطئين" فقط عند وضعهما معًا.

تقدم هذه الورقة البحثية محققًا جديدًا يدعى HAVIC (التماسك الجوهري الشامل بين الصوت والصورة). بدلًا من البحث عن عيوب محددة، يبحث HAVIC عن التناغم الطبيعي.

إليك كيف يعمل، مقسمًا إلى مفاهيم بسيطة:

١. محقق "التناغم الطبيعي"

فكر في محادثة بشرية حقيقية مثل أوركسترا متقنة التنسيق.

  • البصريات: تتحرك شفاه المغني تمامًا عند غناء النغمة.
  • الصوت: يبدو الصوت وكأنه صادر من فم الشخص، وليس من مكبر صوت في الزاوية.
  • السياق: إذا كان المغني يتحدث عن شاطئ، فإن الخلفية تبدو كأنها شاطئ.

كانت الأدوات القديمة مثل فني يتحقق مما إذا كانت آلة موسيقية واحدة خارج النغمة. أما HAVIC فهو مثل قائد الأوركسترا الذي يستمع إلى الأوركسترا بأكملها. إنه يسأل: "هل يتطابق الصوت مع الحركة؟ هل تتطابق الحركة مع المشهد؟ هل يبدو الشيء بأكمله كأنه لحظة حقيقية وحية؟"

٢. المستويات الثلاثة لـ "الشعور بالواقعية"

يقول المؤلفون إن HAVIC يتحقق من "التماسك" (التناغم) على ثلاثة مستويات، مثل التحقق من لوحة للتأكد من أصالتها:

  • المستوى الأول: فحص الوسيط الواحد (الملمس)
    • التشبيه: النظر إلى لوحة لمعرفة ما إذا كانت ضربات الفرشاة تبدو كطلاء حقيقي أم أن ملمسها غريب.
    • ما يفعله HAVIC: يتحقق مما إذا كان الفيديو وحده يبدو طبيعيًا (لا تو-جد تشوهات غريبة في الوجه) وما إذا كان الصوت وحده يبدو طبيعيًا (لا توجد تشوهات روبوتية).
  • المستوى الثاني: الفحص الدقيق (تزامن الشفاه)
    • التشبيه: مشاهدة عرض دمى. إذا فتحت الدمية فمها لكلمة "مرحبًا"، ولكن الصوت خرج متأخرًا بجزء من الثانية، ستعرف أنه مزيف.
    • ما يفعله HAVIC: يتحقق من التوقيت الدقيق، بجزء من الملي ثانية، بين الصوت (مثل صوت حرف "ب" أو "م") والشكل الدقيق للشفاه.
  • المستوى الثالث: الفحص الشامل (القصة)
    • التشبيه: تخيل فيديو لشخص يصرخ رعبًا، لكن الصوت عبارة عن أغنية تهويدة مبهجة. القصة لا تتطابق.
    • ما يفعله HAVIC: يتحقق من الصورة الكبيرة. إذا قال الصوت "أنا على الشاطئ"، ولكن الفيديو يظهر جبلًا ثلجيًا، فإن HAVIC يعرف أن هناك خطأ ما، حتى لو بدا الوجه والصوت مثاليين.

٣. كيف تعلم HAVIC ليكون محققًا

لا يمكنك تعليم المحقق كشف التزييف بمجرد إظهار فيديوهات مزيفة له، لأن المزورين يغيرون حيلهم باستمرار. بدلاً من ذلك، تم تدريب HAVIC على آلاف الفيديوهات الحقيقية والأصلية.

  • التدريب: تخيل أنك تعرض على طالب ملايين الفيديوهات الحقيقية وتقول له: "تعلم كيف يبدو 'الواقع' حقًا". لقد تعلم HAVIC "قوانين الفيزياء" لكيفية تفاعل الصوت والرؤية بشكل طبيعي.
  • الاختبار: عندما يرى فيديو جديدًا، فإنه يقارنه مقابل تلك "القوانين الفيزيائية". إذا كسر الفيديو قواعد التناغم الطبيعي (حتى لو بشكل طفيف)، فإنه يصنفه كمزيف.

٤. "الامتحان" الجديد (مجموعة البيانات)

أدرك المؤلفون أن الاختبارات القديمة للتزييف العميق كانت سهلة للغاية. كانت مثل إعطاء عبقري في الرياضيات اختبارًا يحتوي فقط على مسائل الجمع. يمكن للمزورين الجدد اجتياز ذلك بسهولة.

لذا، أنشأ الفريق امتحانًا جديدًا وشديد الصعوبة يسمى HiFi-AVDF.

  • ما هو؟ مجموعة من الفيديوهات المصنوعة بواسطة أكثر أدوات الذكاء الاصطناعي التجارية تقدمًا في العالم (مثل Sora وKling وVeo).
  • لماذا هو مميز؟ هذه الفيديوهات واقعية جدًا لدرجة أن البشر يجدون صعوبة في التمييز بينها وبين الواقع. إنه الاختبار النهائي لأي أداة كشف.

٥. النتائج

عندما وضعوا HAVIC تحت الاختبار:

  • الأدوات القديمة: تعثرت. ارتبكت أمام التزييفات الجديدة عالية الجودة.
  • HAVIC: اجتاز الاختبار بتفوق. لقد كشف التزييفات التي فاتتها الأدوات الأخرى بفارق كبير (محسنًا الكشف بنسبة تقارب 10% في أصعب الاختبارات).

الخلاصة

تجادل هذه الورقة البحثية بأنه لكي نتمكن من كشف الجيل القادم من تزييف الذكاء الاصطناعي، لا يمكننا مجرد البحث عن "العيوب". يجب أن نفهم كيف يعمل العالم بشكل طبيعي.

HAVIC هو محقق لا يبحث فقط عن القطع المكسورة؛ بل يستمع إلى لحن الواقع. إذا كان اللحن بعيدًا عن النغمة الصحيحة ولو قليلًا، فإنه يعرف أنه مزيف. هذا يجعل من الصعب جدًا على الجهات السيئة خداعه، بغض النظر عن مدى تقدم أدوات الذكاء الاصطناعي الخاصة بهم.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →