Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning
تقدم هذه الورقة Skyra، وهو نموذج لغوي كبير متعدد الوسائط متخصص يكتشف ويفسر مقاطع الفيديو المُنشأة بواسطة الذكاء الاصطناعي من خلال تحديد الآثار البصرية التي يمكن للإنسان إدراكها، مدعوماً بمجموعة بيانات ViF-CoT-4K الجديدة، واستراتيجية تدريب ثنائية المرحلة، وتقييم ViF-Bench الشامل.
المؤلفون الأصليون:Yifei Li, Wenzhao Zheng, Yanran Zhang, Runze Sun, Yu Zheng, Lei Chen, Jie Zhou, Jiwen Lu
تخيل أن الإنترنت فجأة غرق بمقاطع فيديو تبدو حقيقية للغاية، لدرجة أنك لا تستطيع التمييز بين ما إذا كانت قد صُوِّرت بكاميرا أم أنها من نسج خيال الكمبيوتر. هذه هي المشكلة التي صُممت Skyra لحلها.
فكر في Skyra ليس كمجرد كاشف بسيط للإجابة بـ "نعم أو لا"، بل كـ محقق فيديوهات خارق القدرات، لا يكتفي فقط بالتخمين بأن الفيديو مزيف، بل يشير بالفعل بإصبعه إلى "الخلل" المحدد الذي كشفه، ويشرح لماذا يُعد هذا الخلل خطأً.
إليك كيف يتم تفصيل الورقة البحثية، باستخدام بعض التشبيهات من الحياة اليومية:
1. المشكلة: "الوادي غير المريح" أصبح أكثر سلاسة
لقد أصبحت مولدات الفيديو بالذكاء الاصطناعي (مثل Sora وKling وWan) بارعة للغاية. يمكنها صنع فيديوهات تبدو مثالية للوهلة الأولى.
الطريقة القديمة: كانت الكواشف السابقة تشبه حراس الأمن الذين يمتلكون قائمة مراجعة؛ حيث يبحثون عن "بكسلات سيئة" أو "إضاءة غريبة". ولكن مع تطور الذكاء الاصطناعي، اختفت تلك البكسلات السيئة، وبدأ الحراس يشعرون بالارتباك، فغالباً ما يصنفون الفيديوهات الحقيقية على أنها "مزيفة!" والمزيفة على أنها "حقيقية!".
مشكلة النماذج اللغوية الكبيرة متعددة الوسائط (MLLM): حتى أذكى نماذج الدردشة العامة (التي تُعتبر "عباقرة" عالم الذكاء الاصطناعي) فشلت في هذا الاختبار. فعند سؤالها عن تمييز فيديو مزيف، كانت تكتب مقالات طويلة وواثقة تقول فيها: "الإضاءة تبدو رائعة، والشخص يبتسم، لذا فهذا الفيديو حقيقي!". لقد فاتتها الأخطاء الدقيقة التي تكسر قوانين الفيزياء لأنها لم تكن مدربة على البحث عنها.
2. الحل: Skyra، "الناقد الفني الجنائي"
Skyra هو نموذج ذكاء اصطناعي متخصص مصمم للقيام بشيء واحد فقط: إيجاد "الآثار الاصطناعية" (Artifacts).
ما هو الأثر الاصطناعي؟ تخيل أنك تنظر إلى لوحة فنية؛ إذا رسم الفنان يداً بستة أصابع، أو إذا تحول كوب قهوة فجأة إلى طائر في منتصف الهواء، فهذا هو "الأثر الاصطناعي". إنه خطأ يكسر قوانين الفيزياء أو المنطق السليم.
كيف تعمل Skyra: بدلاً من مجرد قول "مزيف"، تعمل Skyra مثل محقق يحمل عدسة مكبرة. إنها تشاهد الفيديو إطاراً تلو الآخر وتقول:
"عند الثانية 1.5، ذاب المحرك المعدني الخاص بالبارتندر مثل الزبدة. هذا مستحيل! هذا تشوه في الشكل (Shape Distortion). وأيضاً، عند الثانية 3.0، ظهر كوب من العدم. هذا ظهور غير طبيعي لجسم (Abnormal Object Appearance)."
3. التدريب: تعليم المحقق عبر "ملف قضايا مكون من 4,000 فيديو"
لا يمكنك تعليم محقق كيفية كشف التزييف بمجرد الطلب منه أن يخمن؛ بل تحتاج إلى قضايا حقيقية.
مجموعة البيانات (ViF-CoT-4K): قام الباحثون ببناء مكتبة ضخمة تضم 4,000 فيديو. والأهم من ذلك، أنهم لم يكتفوا بتصنيفها كـ "مزيفة" فحسب، بل جعلوا خبراء بشريين يشاهدونها ويكتبون تقارير مفصلة حول بالضبط ما هو الخطأ، وصولاً إلى الثانية المحددة والمكان الدقيق على الشاشة.
"سلسلة الأفكار" (Chain of Thought - CoT): لقد علموا الذكاء الاصطناعي كيف "يفكر بصوت عالٍ". فبدلاً من القفز إلى استنتاج، يُجبر الذكاء الاصطناعي على قول: "أنا أرى هذا، ثم أرى ذاك، ولذلك هذا الفيديو مزيف". وهذا يحاكي الطريقة التي يستنتج بها الخبير البشري.
4. التدريب على خطوتين: "البداية الباردة" و"التعزيز"
تصف الورقة عملية تدريب ذكية تتكون من خطوتين:
الخطوة 1: البداية الباردة (SFT): قاموا أولاً بتعليم الذكاء الاصطناعي الأساسيات باستخدام التقارير المكتوبة بشرياً. الأمر يشبه إعطاء محقق جديد كتاباً مدرسياً عن "الأخطاء الشائعة في الفيديوهات المزيفة" ليعرف ما الذي يجب أن يبحث عنه.
الخطوة 2: التعلم التعزيزي (RL): هذه هي مرحلة "الممارسة". يتم اختبار الذكاء الاصطناعي، وإذا فاته دليل أو أخطأ في الاستنتاج، يتلقى "عقوبة". وإذا وجد خطأً دقيقاً يكسر قوانين الفيزياء قد يغفل عنه البشر، فإنه يحصل على "مكافأة". هذا يدفع الذكنا الاصطناعي ليصبح محققاً ماهراً يستطيع رصد أدق وأخفى الأخطاء.
5. النتائج: التفوق على المنافسين
اختبر الباحثون Skyra مقابل "ViF-Bench"، وهي مجموعة اختبار صارمة تحتوي على فيديوهات من أكثر من 10 من أكثر مولدات الفيديو المتقدمة في العالم.
النتيجة: لم تفز Skyra فحسب، بل هيمنت تماماً. فبينما عانت الكواشف الأخرى (وحتى نماذج الذكاء الاصطناعي العامة الأكثر ذكاءً) وغالباً ما كان أداؤها لا يتعدى التخمين العشوائي، حققت Skyra دقة عالية جداً.
"السبب": توضح الورقة أن نجاح Skyra يعود إلى تركيزها على الانتهاكات الجوهرية (الأشياء التي تكسر الفيزياء، مثل شخص يمشي عبر جدار أو جسم يتغير لونه لحظياً) بدلاً من الأمور السطحية مثل "هل يبدو هذا الفيديو مشوشاً؟".
الملخص
باختاً، Skyra هو محقق ذكاء اصطناعي متخصص، تم تدريبه على مكتبة ضخمة من "أخطاء الذكاء الاصطناعي" الموثقة بشرياً. هي لا تخمن فقط ما إذا كان الفيديو مزيفاً، بل تشاهد الفيديو، وترصد اللحظة المحددة التي تكسر فيها الفيزياء (مثل ملعقة تذوب أو شخص يختفي)، وتكتب تقريراً يشرح بالضبط لماذا تعلم أن هذا الفيديو هو عملية تزييف. لقد صُممت لتكون "صادقة الحقائق" في عالم لم يعد فيه التصديق يعتمد على ما تراه العين.
ملخص تقني: Skyra – كشف الفيديو المولد بواسطة الذكاء الاصطناعي عبر الاستدلال بالآثار المرئية المرتكزة
بيان المشكلة أدى التقدم السريع في النماذج التوليدية القائمة على الانتشار (diffusion-based) والنمذجة متعددة الوسائط إلى تمكين إنشاء فيديوهات اصطناعية واقعية للغاية، مما يشكل مخاطر جسيمة على السلامة الاجتماعية من خلال المعلومات المضللة والتزييف العميق (deepfakes). وبينما ركزت طرق الكشف الحالية بشكل كبير على التصنيف الثنائي باستخدام الميزات المكانية والزمانية، إلا أنها تعاني من قصورين حرجين: الافتقار إلى القابلية للتفسير (عمليات اتخاذ قرار غامضة)، وعدم القدرة على رصد الآثار (artifacts) التي يمكن للبشر إدراكها. ويكشف التحليل التجريبي في الورقة أن حتى النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) المتطورة تؤدي أداءً يقارب العشوائية في هذه المهمة، حيث تفشل غالباً في تحديد الآثار التوليدية الدقيقة أو تفسير تدهور الفيديو الطبيعي (مثل ضبابية الحركة أو الضغط) على أنه تزييف. علاوة على ذلك، تميل أدوات الكشف القائمة على MLLM إلى الاعتماد على إشارات سطحية مثل الجودة البصرية أو الإضاءة بدلاً من التناقضات الجوهرية التي تنتهك قوانين الفيزياء والتي يستخدمها البشر لتحديد المحتوى الاصطناعي.
المنهجية يقترح المؤلفون Skyra، وهو نموذج لغوي كبير متخصص متعدد الوسائط مصمم لكشف الفيديوهات المولدة بالذكاء الاصطناعي من خلال تحديد والاستدلال على الآثار المرئية المرتكزة. وتعتمد المنهجية على ثلاثة مكونات أساسية:
مجموعة بيانات ViF-CoT-4K: لمعالجة نقص التوصيفات البشرية دقيقة التفاصيل، قام المؤلفون ببناء أول مجموعة بيانات واسعة النطاق لآثار الفيديو المولدة بالذكاء الاصطناعي. تتضمن هذه المجموعة:
جمع البيانات: فيديوهات حقيقية من مصادر مثل Panda-70M وKinetics-400، وفيديوهات اصطناعية مولدة بأكثر من عشرة نماذج متطورة (مثل Sora-2، وWan2.2، وKling، وHunyuanVideo).
تصنيف هرمي: تصنيف ثلاثي الطبقات للآثار يميز بين التزييف منخفض المستوى (مثل شذوذ الأنسجة، ومشاكل اللون/الإضاءة) وانتهاك القوانين (مثل عدم اتساق الكائنات، والحركة غير الطبيعية، وانتهاكات السببية).
عملية التوصيف: قام موصفون محترفون بإجراء مقارنات جنباً إلى جنب بين الفيديوهات الحقيقية والمزيفة لتحديد الآثار، مع توفير التوطين الزماني-المكاني (الطوابع الزمنية وصناديق الإحاطة) والتفسيرات النصية. وقد تم تحويل هذه البيانات إلى بيانات "سلسلة الأفكار" (Chain-of-Thought - CoT) باستخدام استراتيجية هندسة الأوامر التي تتضمن التقييم الذاتي والتعلم في السياق.
استراتيجية تدريب ثنائية المرحلة:
المرحلة الأولى: الضبط الدقيق الخاضع للإشراف (SFT) / تهيئة البداية الباردة: يتم ضبط النموذج الأساسي (Qwen2.5-VL-7B) على مجموعة ViF-CoT-4K باستخدام تنسيق مخرجات مهيكل يتطلب من النموذج إخراج كتلة <thinking> (عملية الاستدلال) وكتلة <answer> (الحكم). بالنسبة للفيديوهات المزيفة، يجب على النموذج وسم الآثار صراحةً بالنوع والوقت والموقع؛ أما بالنسبة للفيديوهات الحقيقية، فيجب عليه فحص المناطق المشتبه بها وتبرئتها بشكل منهجي. تمنح هذه المرحلة النموذج قدرات أساسية في الكشف والتفسير.
المرحلة الثانية: التعلم المعزز (RL): لتعزيز قدرة النموذج على اكتشاف الآثار المميزة وتحسين التعميم، استخدم المؤلفون "تحسين السياسة النسبي للمجموعات" (GRPO). تم تصميم دالة مكافأة مخصصة تتكون من عنصرين:
مكافأة الدقة غير المتماثلة: تعاقب النتائج الإيجابية الكاذبة (التنبؤ بأن الفيديو "مزيف" وهو في الأصل حقيقي) بشكل أكثر صرامة من النتائج السلبية الكاذبة لمنع الانحياز نحو فئة "المزيف".
مكافأة الفحص: تشجع النموذج على الالتزام بالتنسيق المطلوب والاستكشاف النشط للإشارات البصرية، بدلاً من الاعتماد على الأنماط السطحية.
معيار تقييم ViF-Bench: معيار تقييم شامل يتكون من 3,000 عينة عالية الجودة مولدة بأكثر من عشرة مولدات فيديو حديثة، متوافقة دلالياً وتنسيقياً مع نظيراتها الحقيقية للحد من "تعلم الاختصارات" (shortcut learning).
المساهمات الرئيسية
نموذج Skyra: نموذج لغوي كبير متخصص متعدد الوسائط يحقق أداءً رائداً في كل من دقة الكشف والقابلية للتفسير من خلال الاستفاء بالآثار المرتكزة.
مجموعة بيانات ViF-CoT-4K: أول مجموعة بيانات واسعة النطاق تتميز بآثار زمانية-مكانية دقيقة وموصوفة بشرياً مع تصنيف هرمي، مما يسمح بالتدريب الخاضع للإشراف للكشف القابل للتفسير.
معيار ViF-Bench: معيار صارم مصمم لتقييم قوة الكشف عبر مختلف المولدات المتطورة، ويتميز بأزواج (حقيقي-مزيف) ذات دلالات متوافقة.
إطار التدريب: خط معالجة مبتكر ثنائي المرحلة يجمع بين SFT واستراتيجية تعلم معزز مصممة بعناقة (بما في ذلك المكافآت غير المتماثلة) لتحسين قدرات إدراك الآثار والاستدلال.
النتائج التجريبية أظهرت التجارب المكثفة على ViF-Bench ومعيار GenVideo الخارجي تفوق Skyra:
أداء الكشف: حقق Skyra-RL دقة بنسبة 91.02% ودرجة F1 بلغت 90.27% على ViF-Bench، متفوقاً على ثاني أفضل طريقة (DeMamba) بمقدار +17.27% في درجة F1، ومتجاوزاً أدوات الكشف الأخرى القائمة على MLLM بفارق كبير (على سبيل المثال، +32% في F1 عن BusterX++).
التعميم: يظهر Skyra قدرة قوية على التعميم عبر المجالات. عند تكييفه مع معيار GenVideo (خارج النطاق)، حقق زيادة في الدقة قدرها +19.22% مقارنة بنسخته التي اعتمدت على SFT فقط، مما يشير إلى أن التعلم المعزز يساعد النموذج على تعلم إشارات الآثار الجوهرية بدلاً من الأنماط الخاصة بالمولدات.
المتانة: يحافظ النموذج على أداء عالٍ تحت تأثير مختلف أنواع تدهور الفيديو، بما في ذلك الضغط، وضوضاء غاوس، والتحولات اللونية، حيث تفشل المصنفات الثنائية ونماذج MLLM الأخرى غالباً.
جودة التفسير: تظهر دراسات الحالة أن Skyra يمكنه تحديد الآثار الدقيقة التي يدركها البشر (مثل تشوه الشكل، أو المظهر غير الطبيعي للأجسام) وتقديم تفسيرات متماسكة ومرتكزة مع توطين زماني-مكاني دقيق، بينما تقدم نماذج MMLM الأساسية غالباً أوصافاً عامة أو تغفل الآثار تماماً.
الأهمية والادعاءات تزعم الورقة أن Skyra يمثل تحولاً من التصنيف الثنائي الغامض إلى الكشف المرتكز على الآثار والقابل للتفسير. ومن خلال محاكاة التفكير البشري — البحث النشط عن التناقضات الفيزيائية والمنطقية — لا يقدم النموذج مجرد حكم، بل يقدم تفسيراً "مرتكزاً" يمكنه مساعدة عمليات التحقق البشرية. ويرى المؤلفون أن مجموعتهم المعيارية ومعيارهم يقدمان بيئة اختبار معيارية للنهوض بمجال كشف المحتوى المولد بالذكاء الاصطناعي القابل للتفسير. كما يقر المؤلفون بوجود حدود، مشيرين إلى أن أداء النموذج مرتبط بالمولدات المغطاة في مجموعتهم، وأنه لا يقيم النية أو الضرر المجتمعي للفيديو. ويؤكدون أن Skyra مصمم لدعم التحقق البشري (human-in-the-loop) وليس لاستبداله، مما يسلط الضل على الحاجة إلى تقدير دقيق لليقين في التطبيقات ذات الأهمية المتعلقة بالسلامة.