VOID: Video Object and Interaction Deletion
تقدم الورقة البحثية VOID، وهو إطار عمل لإزالة الكائنات من الفيديو يستفيد من نموذج رؤية-لغة لتحديد وتوجيه نموذج انتشار فيديو في توليد نتائج مضادة للواقع وواقعية فيزيائياً للتفاعلات المعقدة بين الكائنات، معالجةً بذلك أوجه القصور في الأساليب الحالية في التعامل مع الديناميكيات السببية مثل الاصطدامات.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تشاهد فيلماً، وقررت أن تقوم بتعديل مشهد ما. تشير بإصبعك إلى شخصية وتقول: "احذفهم".
في عالم أدوات تحرير الفيديو القديمة، كان هذا يشبه استخدام ممحاة رقمية. إذا مسحت شخصاً يقف أمام مجموعة من قطع الدومينو المتساقطة، فستقوم الأداة ببساطة بملء الفراغ الناتج بالخلفية. ولكن تكمن المشكلة هنا: قطع الدومينو ستظل تسقط. لم تكن الأداة تفهم أن الشخص كان يمسك قطع الدومو ويمنعها من السقوط؛ لقد رأت فقط "ثقباً" يحتاج إلى ملء.
هنا يأتي دور VOID، وهو نموذج ذكاء اصطناعي جديد لا يعمل كممحاة، بل يعمل كـ عالم فيزياء يسافر عبر الزمن.
المشكلة الجوهرية: "تأثير الدومينو"
يوضح البحث أن الفيديوهات ليست مجرد صور تتحرك، بل هي سلسلة من السبب والنتيجة.
- الذكاء الاصطناعي القديم: "أرى شخصاً. سأقوم بالرسم فوقه باستخدام الحائط الموجود خلفه." (النتيجة: يختفي الشخص، لكن الكرة التي كان يمسكها تظل تطفو في الهواء، متحديةً الجاذبية).
- VOID: "أرى شخصاً. إذا أزلتُه، فإن الكرة التي كان يمسكها ستسقط. قطع الدومينو التي كان يحجبها ستسقط. الظل الذي كان يلقيه سيختفي." (النتيجة: مشهد واقعي حيث تظل الفيزياء منطقية).
كيف يعمل VOID: الخدعة السحرية المكونة من ثلاث خطوات
بنى المؤلفون VOID باستخدام ثلاث حيل ذكية، والتي يمكننا تخيلها كفريق من المتخصصين يعملون معاً:
1. "معسكر التدريب على ماذا لو؟" (بناء البيانات)
لتعليم VOID كيف يفكر، لم يكتفِ الباحثون بعرض فيديوهات حقيقية عليه، بل بنوا مختبراً للمحاكاة الافتراضية (باستخدام أداة تسمى Kubric).
- التشبيه: تخيل لعبة فيديو حيث يمكنك إيقاف الزمن، وحذف شخصية، ومشاهدة محرك الفيزياء وهو يعيد حساب العالم بأكه لفي لحظة.
- النتيجة: أنشأوا آلاف السيناريوهات من نوع "ماذا لو؟". أظهروا للذكاء الاصطناعي: "هذا فيديو لكرات تصطدم بحائط. الآن، إليك نفس الفيديو، ولكن الحائط غير موجود، والكرة تطير عبر الهواء". هذا علم الذكاء الاصطناعي أن إزالة جسم ما يغير مستقبل المشهد.
2. "القناع الفائق" (الـ Quadmask)
عادةً، عندما تقوم بتعديل فيديو، ترسم دائرة سوداء بسيطة حول الشيء الذي تريد حذفه.
- الطريقة القديمة: "احذف الدائرة السوداء".
- طريقة VOID: يستخدم VOID ما يسمى بـ Quadmask، وهو بمثابة خريطة ملونة للذكاء الاصطناعي.
- الأسود: الجسم المراد حذفه.
- الرمادي الداكن: الجسم ومنطقة التلامس مع الأشياء الأخرى (التداخل).
- الرمادي الفاتح: منطقة "تأثير الارتداد" (Ripple Effect). وهي المنطقة التي ستتغير بسبب غياب الجسم (على سبيل المثال، المساحة التي ستسقط فيها الكرة).
- الأبيض: كل شيء يبقى كما هو تماماً دون تغيير.
- التشبيه: بدلاً من مجرد قول "امسح هذا" للذكاء الاصطناعي، أنت تعطيه مخططاً يقول: "امسح هذا، وأصلح أيضاً الفوضى التي ستحدث بجانبه".
3. "المساعد الذكي" (الـ VLM)
هذا هو السر الحقيقي. يستخدم الذكاء الاصطناعي نموذج رؤية ولغة (VLM) — وهو أساساً ذكاء اصطناعي بارع جداً في فهم الصور واللغة، مثل أمين مكتبة ذكي قرأ كل كتب الفيزياء.
- العملية: عندما تنقر على جسم لحذفه، ينظر الـ VLM إلى المشهد ويسأل: "ماذا سيحدث إذا اختفى هذا الجسم؟"
- المخرج: قد يقول: "إذا أزلت اليد التي تمسك بالبالون، فإن البالون سيطير للأعلى". ثم يرسم خريطة "الرمادي الفاتح" ليتبعها الذكاء الاصطناعي. إنه يحول نقرة بسيطة إلى خطة معقدة.
عملية التحرير ذات المرحلتين
لا يقوم VOID بتوليد الفيديو في خطوة واحدة، بل يقوم بذلك عبر مرحلتين لضمان المثالية:
- المرحلة الأولى (المسودة الأولية): يقوم بتوليد المشهد الجديد بناءً على خطة الفيزياء. تتحرك الأجسام بشكل صحيح، لكنها قد تبدو مهتزة أو ممتدة (مثل شخصيات الصلصال المتحركة).
- المرحلة الثانية (التلميع): ينظر إلى الأجزاء المهتزة ويستخدم "الضجيج الملتوي بالتدفق" (طريقة متطورة لقول "تنعيم الحركة") للتأكد من أن الأجسام تبدو صلبة ومتماسكة، تماماً كما في الواقع.
لماذا هذا الأمر مهم؟
يظهر البحث أن VOID يمكنه التعامل مع أشياء تفشل فيها النماذج الأخرى:
- الخلاط: إذا أزلت الشخص الذي يشغل الخلاط، فإن الطعام بداخله يتوقف عن الدوران.
- البالون: إذا أزلت الشخص الذي يمسك بالبالون، فإن البالون يطير للأعلى (رغم أن VOID لم يتم تدريبه خصيصاً على بالونات طائرة!).
- الدومينو: إذا أزلت قطعة الدومينو الوسطى، فإن القطع التي تليها لن تسقط أبداً.
الخلاصة
VOID يشبه منح محرر الفيديو عقلاً. فبدلاً من مجرد الرسم فوق ثقب، فإنه يفهم قصة المشهد. هو يعرف أنه إذا أزلت دعامة السقف، فسوف ينهار السقف. وإذا أزلت المكابح، فستسرع السيارة.
إنه يسد الفجوة بين "صنع صورة جميلة" و"محاكاة الواقع"، مثبتاً أنه لكي يعمل تحرير الفيديو حقاً، يحتاج الذكاء الاصطناعي إلى فهم قوانين الفيزياء، وليس فقط قوانين البكسلات.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.