YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal
يُعد YOSE إطار عمل فعال للضبط الدقيق لنموذج DiT المخصص لإزالة الكائنات من الفيديو، حيث يعمل على تسريع الاستدلال عبر الاختيار التكيفي للرموز الأساسية بواسطة الفهرسة المتغيرة الطول بنظام الدفعات (Batch Variable-length Indexing) ومحاكاة المناطق غير المحجوبة باستخدام محاكي عملية الانتشار (Diffusion Process Simulator)، محققاً تسريعاً يصل إلى 2.5 ضعف مع الحفاظ على الجودة البصرية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مقطع فيديو لشارع مزدحم، وتريد إزالة شخص محدد يسير عبر الإطار. في الماضي، كانت نماذج الذكاء الاصطناعي التي تحاول القيام بذلك تشبه فريقاً من الرسامين، فبدلاً من مجرد الرسم فوق الشخص، قرروا إعادة رسم الشارع بأكل، والسماء، وكل سيارة في الخلفية في كل مرة يجرون فيها تغييراً. كان هذا بطيئاً ومبذراً للغاية لأن 90% من الفيديو لم يكن يحتاج إلى أي تعديل.
تقدم هذه الورقة البحثية YOSE (أنت تختار فقط الرموز الأساسية)، وهي طريقة جديدة تعمل كمحرر ذكي وجراح. فبدلاً من إعادة رسم اللوحة بأكملة، يقوم YOSE بطلاء الأماكن المحددة التي تحتاج إلى إصلاح فقط، مع التأكد من أن الطلاء الجديد يمتزج تماماً مع الأجزاء التي لم تُمس.
إليك كيف يعمل YOSE، مقسماً إلى مفاهيم بسيطة:
1. المشكلة: نهج "اللوحة الكاملة"
أدوات الفيديو الحالية بالذكاء الاصطناعي (المعتمدة على ما يسمى "DiT") جيدة جداً في إزالة الأشياء، لكنها بطيئة. حتى لو كنت تريد إزالة طائر صغير من فيديو، يقوم الكمبيوتر بمعالجة كل بكسل في الفيديو بأكره. إنه مثل استخدام مطرقة ثقيلة لكسر حبة جوز. تشير الورقة إلى أن أفضل الأدوات الموجودة حالياً تعمل بسرعة 10 إطارات في الثانية (FPS) تقريباً، وهو أمر بطيء جداً للاستخدام في الوقت الفعلي.
2. الحل: أداتان ذكيتان
يضيف YOSE "أداتين" خاصتين إلى الذكاء الاصطناعي الحالي لجعله أسرع دون إفساد الجودة.
الأداة (أ): "القاص الذكي" (الفهرسة المتغيرة الطول للدفعة - Batch Variable-length Indexing)
- التشبيه: تخيل أن لديك كومة من 100 ورقة واجب منزلي، ولكن 5 منها فقط تحتوي على أخطاء. المعلم العادي يصحح الـ 100 ورقة واحدة تلو الأخرى. أما YOSE فهو يشبه المعلم الذي يقص فوراً الأوراق الخمس التي بها أخطاء، ويصحح تلك فقط، ثم يعيدها إلى الكومة.
- كيف يعمل: ينظر الذكاء الاصطناعي إلى "القناع" (المنطقة التي تريد تغييرها). يستخدم تقنية تسمى BVI لاختيار نقاط البيانات (الرموز/Tokens) الموجودة داخل ذلك القناع فعلياً. إنه يتجاهل بقية الفيديو أثناء العمليات الثقيلة. وهذا يسمح للكمبيوتر بالعمل على عدد متغير من العناصر اعتماداً على حجم الشيء المراد إزالته، بدلاً من عدد ثابت وضخم.
الأداة (ب): "هامس الأشباح" (محاكي عملية الانتشار - Diffusion Process Simulator)
- التشبيه: إذا قمت بطلاء البقعة الصغيرة التي كان يتواجد فيها الشخص فقط، فقد يبدو الطلاء الجديد كأنه ملصق لا يتناسب مع الإضاءة أو ملمس الشارع من حوله. أنت بحاجة لمعرفة كيف يبدو بقية الشارع لدمج الطلاء الجديد بسلاسة.
- المشكلة: إذا قمت بقص الأجزاء "السيئة" لتوف توفير الوقت، فإن الذكاء الاصطناعي ينسى كيف تبدو الأجزاء "الجيدة". إنه يفقد السياق.
- الحل: يستخدم YOSE وحدة تسمى DiffSim. هي لا تعالج الأجزاء "الجيدة" من الفيديو فعلياً (لأن ذلك سيكون بطيئاً). بدلاً من ذلك، تقوم بإنشاء محاكاة أو "شبح" لما تفعله تلك الأجزاء الجيدة. إنها تهمس للذكاء الاصطناعي: "مهلاً، السماء هنا زرقاء، والسيارة هناك تتحرك لليسار"، ليعرف الذكاء الاصطناعي كيفية دمج البقعة الجديدة بسلاسة. الأمر يشبه امتلاك خريطة للمدينة بأكملها بينما تسير في حي واحد فقط.
3. "الالتحام السلس" (استراتيجية الدمج - Fusion Strategy)
حتى مع وجود "هامس الأشباح"، قد يكون هناك خط مرئي طفيف حيث يلتقي الفيديو الجديد بالفيديو القديم. يستخدم YOSE خدعة أخيرة: حيث يقوم بتداخل الحواف قليلاً ويعدل إحصائيات السطوع واللون (المتوسط والتباين) لجعل الانتقال غير مرئي. إنه يشبه تنعيم حواف قص صورة لتبدو مندمجة في الخلفية.
النتائج: سريعة ونظيفة
تدعي الورقة البحثية أنه باستخدام هذه الحيل:
- السرعة: YOSE أسرع بـ 2.5 مرة من أفضل الطرق السابقة. إذا كانت الطريقة القديمة تستغرق 10 ثوانٍ، فإن YOSE يستغرق حوالي 4 ثوانٍ.
- القابلية للتوسع: تعتمد السرعة على حجم الشيء الذي تزيله. إذا كنت تزيل نقطة صغيرة، فسيكون سريعاً جداً. وإذا كنت تزيل مبنى ضخماً، فسيصبح أبطأ، لكنه لن يصبح أبداً أبطأ من الطريقة القديمة.
- الجودة: تظل جودة الفيديو جيدة تماماً مثل طرق المعالجة الكاملة البطيئة. في الواقع، ولأنه لا يعبث بالخلفية عن طريق الخطأ (لأنه يتجاهلها)، فإن الخلفية غالباً ما تبدو أكثر استقراراً.
الملخص
YOSE هو "محرر ذكي" يدرك أنك لست بحاجة لإعادة محاكاة الكون بأكمله لإزالة جسم واحد. إنه يقص العمل الذي لا يحتاج للقيام به، ويستخدم محاكاة ذكية لتذكر سياق الأجزاء التي تجاهلها، ثم يدمج كل شيء معاً ببراعة تجعل من المستحيل ملاحظة الفرق. إنه يحول عملية ثقيلة وبطيئة إلى عملية جراحية سريعة ودقيقة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.