SAVe: Self-Supervised Audio-visual Deepfake Detection Exploiting Visual Artifacts and Audio-visual Misalignment
تقترح الورقة البحثية إطار عمل SAVe، وهو إطار عمل للتعلم العميق ذاتي الإشراف للكشف عن التزييف العميق السمعي البصري، والذي يتدرب حصرياً على مقاطع الفيديو الأصلية من خلال توليد تلاعبات وهمية آنية لتعلم العيوب البصرية ونمذجة التزامن بين حركة الشفاه والكلام للكشف عن عدم المحاذاة عبر الوسائط، مما يحقق تعميماً قوياً عبر مجموعات البيانات.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك محقق يحاول كشف فيديو مزيف لمشهور. في الماضي، كان المحققون (نماذج الذكاء الاصطناعي) يتم تدريبهم عبر النظر إلى آلاف الأمثلة من التزييف المعروف. تعلموا كيفية رصد "لطخات" أو "أخطاء تقنية" محددة تتركها الأدوات المستخدمة في صنع تلك التزييفات.
لكن هذه هي المشكلة: بمجرد أن يقوم الأشرار بتطوير أدواتهم لصنع تزييفات أكثر سلاسة ونقاءً، يصاب المحققون القدامى بالارتباك. لقد اعتمدوا أكثر من اللازم على "الأسلوب" الخاص بالتزييفات السابقة، وليس على الحقيقة الجوهرية لما يجعل الشيء حقيقياً.
SAVe هو نوع جديد من المحققين يغير قواعد اللعبة. فبدلاً من دراسة التزييف، هو يدرس الفيديوهات الحقيقية فقط. إنه يعلم نفسه كيف يكتشف التزييف من خلال تعلم كيف يبدو "الواقع"، ثم يستنتج أن أي شيء لا يتوافق مع هذا النمط هو أمر مريب.
إليك كيف يعمل SAVe، مقسماً إلى تشبيهات بسيطة:
1. خدعة "الدمج الذاتي" (لعبة آلة التصوير)
تخيل أن لديك صورة مثالية وعالية الجودة لوجهك. لتعليم المحقق كيف يبدو "التزييف" دون استخدام تزييف فعلي، يأخذ SAVe صورتك الحقيقية ويصنع "تزييفاً مستعاراً" في مكانه.
يقوم بذلك عن طريق أخذ نسختين مختلفتين قليلاً من نفس الصورة (ربما إحداهما أكثر سطوعاً، أو واحدة مزاحة قليلاً) ودمجهما معاً في مناطق محددة.
- دمج الوجه (FaceBlend): يدمج الوجه بالكامل. إذا لم يتطابق الإضاءة أو ملمس الجلد تماماً، فإنه يخلق "درزة" أو "فاصلاً" يشبه أعمال الفوتوشوب السيئة.
- دمج الشفاه (LipBlend): يركز فقط على الفم. يقوم بتمويه الشفاه قليلاً ليرى ما إذا كان بإمكان الذكاء الاصطناعي رصد الغرابة حول الأسنان واللسان.
- دمج الجزء السفلي من الوجه (LowerFaceBlend): يراقب منطقة الفك والذقن لرصد أي تشوه.
الدرس المستفاد: يتعلم الذكاء الاصطناعي رصد هذه "الدروز" أو "اللطخات" من خلال محاولة التمييز بين الصورة الحقيقية والصورة المدمجة ذاتياً. وبمجرد أن يتقن ذلك، يمكنه رصد نفس أنواع الدروز الموجودة في التزييفات العميقة (Deepfakes) التي يصنعها المجرمون.
2. محقق "تزامن الشفاه" (اختبار الدبلجة)
أحياناً، يبدو الفيديو مثالياً من الناحية البصرية، لكن الصوت غير متوافق. تخيل مشاهدة فيلم حيث تتحرك شفاه الممثل، لكن الصوت صادر من شخص آخر، أو أن الصوت متأخر قليلاً.
يمتلك SAVe أذناً وعيناً خاصة تعملان معاً. فهو يستمع إلى الكلام ويراقب حركات الشفاه في وقت واحد.
- التشبيه: فكر في آلة "الكاريوكي" التي تكون غير متزامنة قليلاً. إذا فتح المغني فمه لنطق كلمة "Hello" ولكن الصوت خرج بعد ثانية من الآن، ستعرف أن هناك خطباً ما.
- القوة: هذا أمر بالغ الأهمية لأن بعض التزييفات العميقة تغير الوجه مع الاحتفاظ بالصوت الحقيقي، أو تغير الصوت مع الاحتفاظ بالوجه الحقيقي. يتحقق SAVe مما إذا كانت الفم والصوت يمسكان بأيدي بعضهما في توقيت مثالي. إذا تعثرت العلاقة بينهما، فالأمر مزيف.
3. العقل "ذو الرؤوس الأربعة"
لا يعتمد SAVe على دليل واحد فقط. لديه أربعة "محققين" يعملون معاً، ويقومون بالتصويت على الإجابة النهائية:
- محقق الوجه: يفحص الوجه بالكامل بحثاً عن أنسجة غريبة.
- محقق الشفاه: يفحص منطقة الفم بحثاً عن أخطاء تقنية عالية التردد.
- محقق الفك: يفحص الجزء السفلي من الوجه بحثاً عن أي تشوه.
- محقق التزامن: يتحقق مما إذا كان الصوت يتطابق مع حركة الشفاه.
عندما يتفق الجميع، يكون النظام واثقاً جداً. وإذا قال أحدهم "مزيف" بينما قال الآخرون "حقيقي"، فإن النظام يزن الأدلة بعناً. وهذا يجعل من الصعب جداً على أي تزييف عميق جديد وغير مرئي خداعه.
لماذا يعد هذا أمراً كبيراً؟
- لا توجد "ورقة غش": الذكاء الاصطناعي التقليدي يحتاج إلى ورقة غش (فيديوهات مزيفة مصنفة) ليتعلم. أما SAVe فيتعلم من خلال اللعب بالفيديوهات الحقيقية فقط. هذا يعني أنه يمكنه اكتشاف أنواع جديدة من التزييف لم تُخترع بعد، لأنه يفهم مبادئ الواقع، وليس مجرد الأخطاء المحددة للتزييفات القديمة.
- مشكلة "الضغط": عندما تُرسل الفيديوهات عبر الإنترنت، يتم ضغطها (تصغير حجمها)، مما يخفي الأدلة الصغيرة التي تبحث عنها أدوات الكشف عادةً. SAVe بارع بشكل مفاجئ في اكتشاف التزييف حتى في هذه الفيديوهات منخفضة الجودة والمضغوطة، لأنه يبحث عن عدم اتساق أعمق (مثل عدم التزامن بين الصوت والشفاه) الذي يصمد أمام عملية الضغط.
باخت ملخص
SAVe يشبه طباخاً ماهراً لم يتذوق أبداً طبقاً "مزيفاً". بدلاً من ذلك، درس المكونات الحقيقية بدقة شديدة لدرجة أنه إذا قدمت له طبقاً مصنوعاً من لحم مزيف، يمكنه فوراً معرفة أنه ليس حقيقياً لأن الملمس، والرائحة، وطريقة تفاعل المكونات لا تتطابق مع "الوصفة الحقيقية" التي يعرفها جيداً.
إنه طريقة أذكى وأكثر مرونة لمحاربة التزييف العميق، لا تعتمد على معرفة حيل العدو المحددة مسبقاً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.