← أحدث الأبحاث
💻 computer science

UniSkip-Mamba: A Frequency-Aware State Space Model for Audio-Visual Temporal Forgery Localization

تقترح هذه الورقة نموذج UniSkip-Mamba، وهو نموذج حالة فضاء (State Space Model) مدرك للتردد يعزز تحديد تزييف المحتوى السمعي البصري الزمني من خلال التركيز انتقائياً على الأنماط التمييزية ذات التردد المنخفض إلى المتوسط مع تصفية الضوضاء عالية التردد، مما يحقق دقة هي الأفضل في فئتها وسرعة استنتاج أكبر بكثير.

المؤلفون الأصليون: Cangjin Yu, Quan Zhang, Dan Jiang, Ke Zhang

نُشر 2026-07-28
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Cangjin Yu, Quan Zhang, Dan Jiang, Ke Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك محقق تحاول حل لغز في غرفة صاخبة ومزدحمة. الغرفة مليئة بأشخاص يتحدثون، وموسيقى تعزف، وأضواء تومض. في عالم الوسائط الرقمية، هذه "الغرفة" هي مقطع فيديو، و"الأشخاص" هم البكسلات والموجات الصوتية التي تشكل القصة. لفترة طويلة، أصبحت الحواسيب جيدة جداً في اكتشاف ما إذا كان الفيديو مزيفاً (ما يعرف بـ "التزييف العميق" أو Deepfake)، لكنها غالباً ما تعاني من مهمة محددة وصعبة: وهي تحديد متى يبدأ الجزء المزيف ومتى ينتهي بالضبط. الأمر يشبه معرفة أن الأغنية هي نسخة مقلدة ولكن دون القدرة على الإشارة إلى الثانية الدقيقة التي تغير فيها صوت المغني. هذا المجال، المسمى "تحديد التزييف الزمني السمعي البصري"، أمر بالغ الأهمية لأنه في الحياة الواقعية - كما هو الحال في قاعة المحكمة أو لسلامة وسائل التواصل الاجتماعي - نحتاج إلى معرفة الحدود الدقيقة للكذبة، وليس فقط معرفة وجود كذبة.

لفهم كيفية قيام الحواسيب بذلك، فكر في الفيديو كأنه أغنية معقدة. تماماً مثل الموسيقى، للفيديو "ترددات" مختلفة. بعض الأجزاء بطيئة، عميقة وثابتة (ترددات منخفضة)، مثل طبلة الباص أو محادثة هادئة. وأجزاء أخرى سريعة، حادة ومضطربة (ترددات عالية)، مثل خشخشة الأسطوانات أو هزة كاميرا مفاجئة ومتقطعة. تحاول نماذج الكمبيوتر التقليدية الاستماع إلى كل صوت في الأغنية، من أعمق نغمات الباص إلى أعلى صرخة. لكن المشكلة هنا هي أنه في العالم الرقمي، تلك الأصوات السريعة وعالية الحدة غالباً ما تكون مجرد ضجيج استاتيكي أو أخطاء ناتجة عن ضغط الملفات، وليست هي الأدلة الفعلية التي تكشف التزييف. إذا حاول محقق حل قضية من خلال التركيز على الضجيج الخلفي، فقد يتشتت انتباهه ويفوت الأدلة الحقيقية.

هنا يأتي دور دراسة جديدة بلمسة ذكية. لقد قام الباحثون، تشانغ جين يو، وكوان تشانغ، ودان جيانغ، وكيه تشانغ، ببناء نوع جديد من المحققين الرقميين يسمى UniSkip-Mamba. بدلاً من الاستماع إلى كل صوت في الفيديو، أدركوا أن أدلة "الجريمة" في الفيديوهات المزيفة تختبئ غالبط في الترددات المنخفضة والمتوسطة البطيئة والثابتة. أما الأشياء السريعة والمضطربة ذات التردد العالي؟ فهي في الغالب مجرد ضجيج يربك الكمبيوتر. لذا، صمموا نظامهم لـ "يتخطى" الأجزاء الصاخبة، تماماً مثل "دي جي" يعرف كيف يتجاهل الخشخشة في الأسطوانة ويركز على الإيقاع.

الاكتشاف الرئيسي للورقة البحثية هو أنه من خلال تجاهل الضجيج عالي التردد بشكل متعمد، يصبح الكمبيوتر في الواقع أفضل في أداء مهمته. لقد اختبروا ذلك على مجموعتين ضخمتين من الفيديوهات المزيفة، LAV-DF و AV-Deepfake1M. وكانت النتائج مبهرة: لم يكتفِ أسلوبهم الجديد، UniSkip-Mamba، بالعثور على التزييف فحسب، بل حدد أيضاً أوقات البداية والنهاية بدقة أعلى بكثير من الطرق الرائدة السابقة. في إحدى مجموعات البيانات، حسنوا دقة النتائج بنسبة تقارب 10%، وفي الأخرى بنسبة تزيد عن 14%. والأكثر إثارة للدهشة، أنه من خلال تخطي الضجيج، أصبح النظام أسرع بـ 6 مرات في اتخاذ القرارات.

يجادل الباحثون ضد الطريقة القديمة، حيث تحاول الحواسيب معالجة كل إطار وموجة صوتية بالتفصيل. إنهم يظهرون أن هذا النهج "الكثيف" هو في الواقع نقطة ضعف لأنه يجعل الكمبيوتر حساساً للغاية للأخطاء الصغيرة التي لا معنى لها. إن طريقة "المسح بالتخطي" (Skip-Scanning) الخاصة بهم تعمل بمثابة مرشح ذكي. فهي تجمع إطارات الفيديو معاً وتفحصها بطريقة تعمل طبيعياً على عزل الضجيج عالي التردد مع الحفاظ على الأنماط الهامة منخفضة التردد التي تكشف التزييف. كما وجدوا أن دمج الصوت والفيديو بطريقة مرنة ومحددة - بدلاً من مجرد وضعهما جنباً إلى جنب بشكل جامد - يساعد الكمبيوتر في كشف حالات عدم التطابق بين حركة الشفاه والصوت ولو بنسبة ضئيلة جداً.

باختصار، تشير هذه الورقة البحثية إلى أنه في بعض الأحيان، لكي ترى الحقيقة بوضوح، عليك أن تتوقف عن النظر إلى كل شيء. من خلال بناء نظام يعرف بالضبط أي الترددات تهم وأيها مجرد ضجيج، ابتكر الباحثون أداة ليست فقط أسرع وأكثر دقة، بل أيضاً أكثر صموداً أمام المشكلات الواقعية مثل الفيديوهات الضبابية أو المضغوطة. إنه تذكير بأنه في عصر الذكاء الاصطناعي، قد تكون أفضل طريقة للعثور على الكذبة هي تجاهل الضجيج والاستماع إلى الإيقاع.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →