GenEraser: Generalizable Video Object Removal via Balanced Text-Mask Guidance and Decoupled Locator-Preserver
يُعد GenEraser إطار عمل مبتكر يحقق إزالة عامة وعالية الدقة للأجسام والتأثيرات في مقاطع الفيديو في سيناريوهات العالم المفتوح عبر الاستفيد من خليط خبراء متعدد الشروط مع توجيه نصي ثنائي الأجزاء، وآلية دمج (CFG) عميقة قابلة للتعلم لموازنة الشروط التكيفية، وبنية منفصلة بين المحدد والمحافظ على التفاصيل لحل المقايضة بين التعميم الدلالي والحفاظ على مستوى البكسل.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تقوم بتحرير فيديو منزلي، وتريد إزالة شخص دخل إلى الكادر، ولكن عندما تقوم ببساطة بـ "قصّه"، تتبقى لك آثار غريبة: ظله لا يزال على الأرض، أو انعكاسه لا يزال في المرآة، أو دخان السيجارة التي كان يحملها لا يزال يطفو في الهواء. يبدو الأمر مزيفًا وغير متناسق.
GenEraser هو أداة ذكاء اصطناعي جديدة مصممة لحل هذه المشكلة. فكر فيه كأنه "ممحاة سحرية رقمية" لا تكتفي فقط بقص الجسم، بل تنظف أيضًا كل الآثار الجانبية الفوضوية التي تركها وراءه، مما يجعل المشهد يبدو وكأن الجسم لم يكن موجودًا أبدًا.
إليك كيف يشرح البحث "قدراته الخارقة" الثلاث الرئيسية باستخدام تشبيهات بسيطة:
1. "المترجم ثنائي اللغة" (التوجيه النصي ثنائي الأجزاء - Bipartite Text Guidance)
معظم محرري الفيديو القدامى ينظرون فقط إلى قناع (وهو تحديد أصفر مرسوم حول الجسم المراد إزالته). هم يفترضون أنه إذا أزلنا الجسم، فكل شيء آخر سيختفي أيضًا. لكن الذكاء الاصطناعي غالبًا ما يصاب بالارتباك. فإذا مسحت سيارة، قد ينسى الذكاء الاصطناعي مسح دخان الإطارات أو الظل الذي خلفته السيارة.
يستخدم GenEraser نهج المترجم. فبدلاً من مجرد إظهار صورة لما يجب قصه للذكاء الاصطناعي، فإنه يعطيه وصفًا من جزأين:
- الجزء أ (نص أحمر): "أزل السيارة."
- الجزء ب (نص أصفر): "أزل أيضًا الدخان، والظل، والانعكاس."
من خلال قراءة هذا الوصف، يفهم الذكاء الاصطناعي قصة المشهد. فهو يدرك أن الدخان والظلال هي "آثار سببية" — أشياء تحدث بسبب وجود السيارة. يساعد هذا الذكاء الاصطناعي في العثء على وإزالة الأشياء الصعبة مثل حزم الضوء، أو التموجات في الماء، أو الانعكاسات في المرآة التي قد يغفل عنها التحديد البسيط.
2. "الخلاط الذكي" (دمج CFG العميق القابل للتعلم - Learnable Deep CFG Fusion)
تخيل أنك تطبخ حساءً. أحيانًا تحتاج إلى المزيد من الملح (التوجيه النصي) لضبط النكهة، وأحيانًا تحتاج إلى المزيد من الماء (توجيه القناع) لملء القدر. إذا أضفت كمية ثابتة من الملح في كل مرة، فقد يكون طعم الحساء سيئًا في بعض الوصفات.
تستخدم أدوات الذكاء الاصطناعي القديمة وصفة ثابتة (ضبط يدوي) لتقرر مقدار الاستماع إلى الوصف النصي مقابل التحديد البصري. يستخدم GenEraser خلاطًا ذكيًا. فهو ينظر إلى مشهد الفيديو المحدد ويضبط التوازن تلقائيًا في الوقت الفعلي.
- إذا كان المشهد مليئًا بدخان معقد، فإنه يرفع "مستوى صوت النص" ليفهم كيف يبدو الدخان.
- إذا كان المشంలో جسمًا بسيطًا على جدار سادة، فإنه يرفع "مستوى صوت القناع" ليكون دقيقًا في الحواف.
هذا "الخلاط الذكي" يتعلم من تلقاء نفسه كيفية موازنة هاتين التعليمتين لكل فيديو، بحيث لا تضطر أنت لتخمين الإعدادات.
3. "فريق العمل الثنائي" (المحدد والمحافظ المنفصلين - Decoupled Locator and Preserver)
يشير البحث إلى مشكلة شائعة: محاولة القيام بوظيفتين مختلفتين تمامًا بشخص واحد غالبًا ما يؤدي إلى الفشل.
- الوظيفة أ: العثور على الجسم وإزالته (تتطلب الجرأة والشمولية).
- الوظيفة ب: الحفاظ على الخلفية لتبدو مثالية (تتطلب الحذر والدقة).
إذا قمت بتدريب نموذج ذكاء اصطناعي واحد للقيام بكلتا الوظيفتين، فغالبًا ما يرتبك. فقد يزيل الجسم جيدًا ولكنه يفسد الخلفية، أو يحافظ على مثالية الخلفية ولكنه يترك أثرًا شبحيًا للجسم.
يحل GenEraser هذه المشكلة من خلال توظيف عاملين متخصصين:
- المحدد (The Locator): تم تدريب هذا العامل على أنواع مختلفة من الفيديوهات (اصطناعية وحقيقية). وظيفته الوحيدة هي أن يكون "صيادًا". يتعلم كيفية رصد الأجسام وآثارها الغريبة (مثل الظلال) في أي بيئة وإزالتها. وهو بارع في التعميم (التعامل مع المواقف الجديدة والغريبة).
- المحافظ (The Preserver): تم تدريب هذا العامل على بيانات "مثالية" حيث تكون الخلفية دقيقة للغاية. وظيفته الوحيدة هي أن يكون "مرممًا". يضمن أن الأجزاء من الفيديو التي لا يتم مسحها تبدو تمامًا مثل الأصل. وهو بارع في الدقة.
من خلال فصل هذه المهام، يعمل الفريق بشكل أفضل معًا. يقوم "المحدد" بالعثور على الفوضى، ويقوم "المحافظ" بإصلاح الخلفية، مما ينتج عنه فيديو نظيف وواقعي.
النتيجة
اختبر البحث GenEraser مقابل أفضل الأساليب الأخرى ووجد أنه الأفضل. لقد نجح في إزالة أشياء صعبة مثل:
- الدخان من إطارات السيارة.
- الفقاعات من دولفين.
- الضوء المنبعث من مصباح.
- الانعكاسات في المرآة.
- الظلال التي يلقيها الأشخاص أو الأجسام.
باختصار، GenEraser هو أداة تحرير فيديو تفهم فيزياء المشهد (الضوء، الظلال، الدخان) من خلال قراءة الوصف، وتوازن إعداداتها تلقائيًا، وتستخدم فريق عمل متخصص لضمان أن يبدو الفيديو النهائي طبيعيًا ونظيفًا.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.