← أحدث الأبحاث
💻 computer science

Object-WIPER : Training-Free Object and Associated Effect Removal in Videos

تقدم الورقة البحثية Object-WIPER، وهو إطار عمل لا يتطلب تدريباً يستفيد من نماذج المحولات لانتشار النصوص إلى الفيديو (text-to-video diffusion transformers) المُدربة مسبقاً لإزالة الأجسام الديناميكية والتأثيرات البصرية المرتبطة بها من مقاطع الفيديو مع ضمان ملء الفراغات بشكل متسق دلالياً ومتماسك زمنياً.

المؤلفون الأصليون: Saksham Singh Kushwaha, Sayan Nag, Yapeng Tian, Kuldeep Kulkarni

نُشر 2026-02-24
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Saksham Singh Kushwaha, Sayan Nag, Yapeng Tian, Kuldeep Kulkarni

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تشاهد فيديو منزليًا لنزهة عائلية. فجأة، تلاحظ ميكروفون "بوم" (العمود الطويل ذو الغطاء الوبري) يتدلى في كادر التصوير، أو ربما يمتد ظل أحد أفراد طاقم العمل عبر العائلة السعيدة. تريد تعديل الفيديو لجعله يبدو وكأن النزهة كانت خاصة تمامًا ولم يقطعها أحد.

هذه هي المشكلة التي يحلها Object-WIPER. إنه بمثابة "ممحاة سحرية" للفيديو لا تكتفي فقط بحذف الشخص أو الشيء غير المرغوب فيه؛ بل تحذف أيضًا ظلاله، وانعكاساته، والتموجات الغريبة التي يسببها، وكل ذلك دون الحاجة إلى إعادة تدريبه على بيانات جديدة.

إليك كيف يعمل، مقسمًا إلى مفاهيم وتشبيهات بسيطة:

1. المشكلة: تأثير "الشبح"

معظم أدوات تحرير الفيديو اليوم تشبه الرسام الأخرق. إذا طلبت منها طلاء شخص ما، فقد تقوم بملء جسد الشخص بالعشب الموجود في الخلفية. لكنها غالبًا ما تنسى طلاء ظل الشخص أو انعكاسه في بركة ماء.

النتيجة؟ ينتهي بك الأمر بظل عائم أو انعكاس للاشيء، مما يجعله يبدو كشبح يطارد الفيديو الخاص بك. الأدوات السابقة للذكاء الاصطناعي إما كانت تتطلب كميات هائلة من بيانات التدريب (مثل طالب يدرس لسنوات) أو أنها ببساطة لم تكن قادرة على إيجاد هذه "الأشباح" (الظلال/الانعكاسات) لإزالتها.

2. الحل: Object-WIPER (المحقق الذكي)

Object-WIPER هو أداة "لا تحتاج إلى تدريب" (training-free). فكر فيه كمحقق يعرف بالفعل كيف يعمل العالم لأنه درس مكتبة ضخمة من الأفلام والفيديوهات قبل أن يبدأ عمله. هو لا يحتاج للذهة إلى المدرسة مرة أخرى؛ بل يستخدم معرفته الحالية لحل القضية.

يعمل في ثلاث خطوات رئيسية:

الخطوة أ: إيجاد الأجزاء "المخفية" (عدسة المحقق المكبرة)

تعطي الذكاء الاصطناعي "قناعًا" (mask) -وهو عبارة عن تحديد تقريبي- للجسم الذي تريد إزالته، مثل بطة. وتخبره أيضًا: "أزل البطة وانعكاسها".

بدلاً من مجرد النظر إلى البطة، يستخدم الذكاء الاصطناه آلية "انتباه" (attention) خاصة. تخيل أن الذكاء الاصطناعي يقرأ نصًا (الطلب النصي) أثناء النظر إلى الفيديو. إنه يسأل الفيديو: "مهلاً، أي بكسلات تتحدث عن 'البطة' و'الانعكاس'؟"

  • الانتباه المتقاطع (Cross-Attention): يجد البكسلات التي تطابق كلمة "بطة".
  • الانتباه الذاتي (Self-Attention): ثم ينظر إلى تلك البكسلات ويسأل: "من هم أصدقاؤكم؟" فيدرك أن البكسلات التي تمثل "الانعكاس" تتسكع مع بكسلات "البطة".
  • النتيجة: ينشئ قناعًا مثاليًا وموسعًا يشمل البطة وانعكاسها معًا، مما يملأ الفجوات التي قد يغفل عنها البشر.

الخطوة ب: "الرجوع والضبط" (المسافر عبر الزمن)

بمجرد أن يعرف بالضبط ما يجب إزالته، يقوم بخدعة سحرية تسمى القلب (Inversion).

  • تخيل أن الفيديو عب_ارة عن أحجية معقدة. يقوم الذكاء الاصطناعي بـ "إعادة الفيديو" إلى حالة من الضجيج الساكن الصرف (مثل تشويش التلفاز)، لكنه يحفظ بعناية الأجزاء التي تمثل الخلفية (العشب، السماء).
  • بعد ذلك، يأخذ جزء "البطة" من الأحجية ويرميه، مستبدلاً إياه بضجيج ساكن عشوائي جديد.
  • الحركة الحاسمة: عندما يبدأ في إعادة بناء الفيديو (Denoising)، فإنه يجبر منطقة "البطة" الجديدة على النظر إلى قطع "الخلفية" المحفوظة لاستلهام الشكل. إنه يخبر البكسلات الجديدة: "لا تنظروا إلى البطة القديمة؛ انظروا إلى العشب خلفها وانسخوا ذلك."

الخطوة ج: "الطلاء الذكي" (مرمم الآثار)

بينما يعيد الذكاء الاصطناعي بناء الفيديو من الضجيج، فإنه يستخدم تقنية تسمى تدرج الانتباه (Attention Scaling).

  • فكر في هذا كزر التحكم في مستوى الصوت. خلال المراحل الأولى من إعادة البناء، يقوم بخفض "صوت" منطقة "البطة" حتى لا يعيد البطة بالخطأ. ويقوم برفع "صوت" منطقة "الخلفية" حتى يتدفق العشب والسماء بشكل طبيعي في المساحة الفارغة.
  • وبحلول الوقت الذي ينتهي فيه الفيديو، تكون البطة وانعكاسها قد اختفيا، وحل محلهما خلفية واقعية وسلسة.

3. المقياس الجديد: TokSim

يشير البحث أيضًا إلى مشكلة مضحكة في كيفية تقييم هذه الأدوات. عادةً ما نستخدم مقاييس مثل "PSNR" (الذي يقيس مدى قرب البكسلات من الأصل).

  • الخلل: إذا قام الذكاء الاصطناعي بمجرد نسخ الفيديو الأصلي ولم يزل البطة على الإطلاق، ستكون الدرجة مثالية! الأمر يشبه طالبًا ينسخ إجابات الاختبار ويحصل على درجة امتياز، رغم أنه لم يحل المشكلة.
  • الإصلاح: ابتكر المؤلفون مقياسًا جديدًا يسمى TokSim. بدلاً من مجرد عد البكسلات، فإنه يتحقق من:
    1. هل بدت الخلفية متسقة بمرور الوقت؟ (لا توجد أشباح وامضة).
    2. هل تبدو الخلفية الجديدة وكأنها تنتمي إلى المكان؟
    3. هل اختفت البطة حقًا؟
      إذا كانت البطة لا تزال موجودة، تنهار الدرجة. وإذا اختفت البطة وبدا العشب حقيقيًا، ترتفع الدرجة.

لماذا هذا مهم؟

  • لا حاجة للتدريب: لست بحاجة إلى حاسوب خارق لتدريب هذا النموذج. إنه يعمل مباشرة بمجرد استخدامه.
  • جاهز للعالم الحقيقي: إنه يتعامل مع الأشياء الصعبة مثل الأجسام الشفافة (الزجاج)، والمرايا، والظلال المتحركة، وهي أمور فشلت فيها الأدوات السابقة.
  • نتائج نظيفة: هو لا يكتفي بقص الجسم فحسب؛ بل يداوي الجرح بحيث يبدو الفيديو وكأن الجسم لم يكن موجودًا أبدًا.

باختًا، Object-WIPER يشبه محرر أفلام ماهر يمكنه النظر إلى مشهد فوضوي، وتحديد ليس فقط الممثل ولكن أيضًا ظله وانعكاسه، ثم "الطلاء فوق" الفوضى بأكملر بسلاسة باستخدام الخلفية، مما يجعل المشهد يبدو وكأنه كان مثاليًا دائمًا. وهو يفعل كل ذلك دون الحاجة للعودة إلى مدرسة السينما.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →