← أحدث الأبحاث
💻 computer science

From Ideal to Real: Stable Video Object Removal under Imperfect Conditions

تقدم الورقة البحثية إطار عمل "إزالة الكائنات من الفيديو المستقر" (SVOR)، وهو إطار عمل قوي يحقق إزالة لكائنات الفيديو خالية من الوميض وبأداء هو الأفضل في فئته تحت ظروف العيوب الواقعية، وذلك عبر توظيف استراتيجية "اتحاد القناع" (Mask Union) لضمان المسح المستقر، ورأس "تجزئة مدرك لإزالة الضجيج" (Denoising-Aware Segmentation) لتحديد المواقع بدقة، ونهج "تدريب منهجي ذي مرحلتين" (Curriculum Two-Stage training) للتعامل مع الظلال، والحركة المفاجئة، والأقنعة المعيبة.

المؤلفون الأصليون: Jiagao Hu, Yuxuan Chen, Fuhao Li, Zepeng Wang, Fei Wang, Daiguo Zhou, Jian Luan

نُشر 2026-03-11
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jiagao Hu, Yuxuan Chen, Fuhao Li, Zepeng Wang, Fei Wang, Daiguo Zhou, Jian Luan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك فيديو منزليًا لنزهة عائلية. فجأة، يسير شخص غريب في منتصف الكادر تمامًا، مما يحجب رؤية أطفالك وهم يلعبون. تريد تعديل الفيديو لجعله يبدو وكأن الغريب لم يكن موجودًا أبدًا.

يُسمى هذا إزالة الأجسام من الفيديو (Video Object Removal). ورغم أن الأمر يبدو بسيطًا، إلا أنه يمثل كابوسًا للحواسيب في العالم الحقيقي.

المشكلة: لماذا تفشل الأدوات الحالية؟

فكر في أدوات تعديل الفيديو بالذكاء الاصطناعي الحالية كفنان صارم للغاية يتبع القواعد بحذافيرها. هو يعمل بشكل مثالي إذا أعطيته مخططًا مرسومًا يدويًا بدقة للشخص المراد إزالته. لكن في العالم الحقيقي، تكون الأمور فوضوية:

  1. مشكلة "المخطط الضبابي": إذا تحرك الشخص بسرعة، يصبح المخطط (القناع/الماسك) ضبابيًا أو يقفز حول المكان. هنا يرتبك الفنان ويترك أجزاءً من الشخص خلفه، أو يجعل الخلفية تومض مثل مصباح مكسور.
  2. مشكلة "الظل": إذا أزلت شخصًا، يجب عليك أيضًا إزالة ظله. الأدوات القديمة غالبًا ما تمسح الشخص ولكن تترك وراءها ظلًا شبحيًا عائمًا.
  3. مشكلة "الصفحات المفقودة": أحيانًا، يكون المخطط مفقودًا لبضع ثوانٍ. هنا يصاب الفنان بالذعر ويتوقف عن الرسم، تاركًا فجوة في الفيديو.

تقدم هذه الورقة البحثية نظام SVOR (الإزالة المستقرة للأجسام من الفيديو)، وهو نظام جديد مصمم ليكون "فنانًا محترفًا" يمكنه التعامل مع هذه الأخطاء الفوضوية في العالم الحقيقي دون أن يتأثر.


الحل: ثلاث قوى خارقة لـ SVOR

بنى المؤلفون نظام SVOR باستخدام ثلاث حيل ذكية للتعامل مع العيوب:

1. MUSE: "شبكة الأمان" للحركة السريعة

التشبية: تخيل أنك تحاول الإمساك بكرة بيسبول سريعة باستخدام شبكة. إذا نظرت إلى الكرة لثانية واحدة فقط، فقد تفقدها إذا كانت تتحرك بسرعة كبيرة.
كيف يعمل: عندما تتسارع حركة الفيديو (حركة مفاجئة)، تنظر الأدوات القياسية إلى إطار واحد في كل مرة وتفقد تتبع الجسم. يستخدم SVOR استراتيجية تسمى MUSE (اتحاد الأقنعة للإزالة المستقرة). بدلًا من النظر إلى إطار واحد فقط، ينظر إلى "نافذة" زمنية صغيرة ويجمع (يوحد) جميع المواقع التي شغلها الجسم في تلك النافذة.

  • النتيجة: حتى لو تحرك الجسم بسرعة فائقة أو اختفى لثانية واحدة، فإن "شبكة الأمان" تمسك بكل بقعة لمسها، مما يضمن عدم ترك أي شيء خلفه.

2. DA-Seg: "نظام تحديد المواقع الداخلي (GPS)"

التشبية: تخيل أنك تقوم بطلاء جدار، لكن النموذج (الدليل لمكان الطلاء) ممزق وبه قطع مفقودة. الرسام العادي سيتوقف. أما الرسام المحترف، فيمتلك "نظام تحديد مواقع داخلي" يتذكر كيف يجب أن يبدو الجدار بناءً على الطلاء الذي يمزجه حاليًا.
كيف يعمل: عندما يقدم المستخدم قناعًا سيئًا أو مكسورًا أو ناقصًا، لا يعتمد SVOR فقط على دليل المستخدم الفوضوي. بل لديه "عقل مساعد" داخلي صغير (DA-Seg) يراقب الفيديو ويخمن أين يجب أن يكون الجسم، حتى لو كان القناع مكسورًا. إنه يعمل مثل نظام الـ GPS الذي يبقي الرسام على المسار الصحيح، مما يضمن بقاء عملية الإزالة مستقرة حتى عندما تكون التعليمات خاطئة.

3. التدريب المنهجي على مرحلتين: "تعلم المشي، ثم الجري"

التشبية: لن تعلم طفلًا قيادة سيارة سباق على مضمار ممطر في يومه الأول. ستبدأ به في موقف سيارات في يوم مشمس لتعلم الأساسيات.
كيف يعمل:

  • المرحلة الأولى (موقف السيارات): يتم تدريب الذكاء الاصطناعي على آلاف الفيديوهات التي لا يوجد بها أشخاص (مجرد مناظر طبيعية). يتعلم كيفية ملء المساحات الفارغة بشكل طبيعي، مثل بحيرة هادئة أو شارع مزدحم، دون أن يرى شخصًا ليقوم بإزالته أبدًا. هذا يعلمه كيف يبدو "الخلف الحقيقي".
  • المرحلة الثانية (مضمار السباق): الآن، يُعرض على الذكاء الاصطناعي فيديوهات تحتوي على أشخاص وظلال، ولكن مع تعليمات "مكسورة عمدًا" (أقنعة سيئة). ولأن الذكاء الاصطناعي يعرف بالفعل كيفية رسم خلفية مثالية من المرحلة الأولى، يمكنه التركيز تمامًا على تعلم كيفية إزالة الشخص وظله دون إفساد المناظر الطبيعية.

النتيجة: من "المثالي" إلى "الواقعي"

قبل هذه الورقة البحثية، كانت محررات الفيديو تعمل بشكل رائع في الظروف "المثالية" (أقنعة مثالية، حركة بطيئة، لا توجد ظلال). لكنها فشلت في الظروف "الواقعية".

SVOR يغير قواعد اللعبة:

  • لا مزيد من الأشباح: إنه يزيل الأشخاص وظلالهم بدقة تامة.
  • لا مزيد من الوميض: الحركة السريعة لا تسبب اهتزازًا في الفيديو.
  • لا مزيد من "الخطأ": حتى لو كان المخطط مفقودًا أو مكسورًا، لا يزال الفيديو يبدو نظيفًا.

باختصار، SVOR هو الفرق بين روبوت يمكنه فقط رسم دائرة مثالية على جدار أبيض، وبين فنان ماهر يمكنه رسم دائرة مثالية على ورقة مجعدة وممطرة ومتحركة. إنه ينقل تحرير الفيديو من المختبر إلى العالم الحقيقي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →