← أحدث الأبحاث
💻 computer science

Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval

تقترح هذه الورقة شبكة "إزالة الضجيج ثم الاسترجاع" (DRNet)، وهي نموذج جديد يحسن استرجاع لحظات الفيديو من خلال توظيف وحدة إزالة ضجيج مشروطة بالنص لتصفية مقاطع الفيديو غير ذات الصلة، ووحدة تغذية راجعة لإعادة بناء النص للإشراف المساعد، مما يحقق أداءً هو الأفضل في فئته على مجموعات البيانات المرجعية.

المؤلفون الأصليون: Weijia Liu, Jiuxin Cao, Bo Miao, Zhiheng Fu, Xuelin Zhu, Jiawei Ge, Bo Liu, Mehwish Nasim, Ajmal Mian

نُشر 2026-08-07
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Weijia Liu, Jiuxin Cao, Bo Miao, Zhiheng Fu, Xuelin Zhu, Jiawei Ge, Bo Liu, Mehwish Nasim, Ajmal Mian

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول العثور على مشهد محدد في فيديو منزلي ضخم وغير محرر لعطلة عائلية. لديك دليل نصي، مثل "اللحظة التي يقفز فيها الكلب إلى المسبح". في عالم علوم الحاسوب، تسمى هذه المهمة "استرجاع لحظات الفيديو" (Video Moment Retrieval). وهي فرع من فروع الذكاء الاصطناعي حيث تتعلم الحواسيب فهم كل من الصور واللغة لتحديد متى يحدث حدث ما بالضبط في فيديو طويل. التحدي يكمن في أن معظم الفيديوهات مليئة بـ "الضجيج" — ساعات من المناظر الطبيعية، أو أشخاص يسيرون حول، أو ثرثرة غير ذات صلة بكل ما تبحث عنه. إذا حاول الحاسوب تحليل كل ثانية من الفيديو بالتساوي، فسيصاب بالارتباك بسبب الأشياء غير ذات الصلة، تماماً مثل محاولة العثور على إبرة محددة في كومة قش بينما تهب الرياح وتُحرك الكومة بأكملها. لقد حاول الباحثون بناء "محركات بحث" أفضل للفيديو، لكن العديد من الطرق الموجودة تتشتت بالنفايات الموجودة في الفيديو، مما يؤدي إلى نتائج غير دقيقة.

تقدم هذه الورقة استراتيجية جديدة ذكية تسمى "إزالة الضجيج ثم الاسترجاع" (Denoise-then-Retrieve). بدلاً من محاولة العثور على الإبرة بينما لا تزال كومة القش فوضوية، يقترح المؤلفون عملية من خطوتين: أولاً، تنظيف كومة القش عبر التخلص من النفايات، ثم البحث عن الإبرة. لقد بنوا نظاماً يسمى DRNet (شبكة إزالة الضنب ثم الاسترجاع) يعمل كمرشح ذكي. قبل أن يحاول الحاسوب حتى الإجابة على السؤال، فإنه يستخدم الاستعلام النصي لمسح الفيديو وإنشاء "قناع للضجيج" (noise mask). فكر في هذا القناع كزوج من النظارات الشمسية السحرية التي تقوم فوراً بتعتيم الأجزاء المملة أو غير ذات الصلة من الفيديو (مثل السماء أو شخص يمر بجانبك) وتسلط الضوء فقط على المقاطع التي تطابق الوصف بالفعل (مثل الكلب وهو يقفز).

تجادل الورقة ضد الطريقة القديمة التي كانت تفعلها، حيث تعامل الحواسيب كل مقطع في الفيديو على أنه بنفس الأهمية. يوضح المؤلفون أنه في معظم الفيديوهات، تشغل "اللحظة المستهدفة" الفعلية أقل من 30% من الوقت، بينما تشكل المقاطع "المزعجة" غالبية الوقت. ومن خلال إجبار الحاسوب على تجاهل الضجيج أولاً، يمكن للنظام تركيز قدراته الذهنية على الأجزاء ذات الصلة. وللتأكد من أن عملية التصفية هذه تعمل بشكل صحيح، يحتوي النظام أيضاً على ميزة "التحقق الذاتي". فهو يحاول إعادة كتابة الدليل النصي الأصلي باستخدام مقاطع الفيديو المنظفة فقط. إذا لم يتطابق الدليل المعاد كتابته مع الدليل الأصلي، فإن النظام يعرف أنه قد استبعد شيئاً مهماً أو احتفظ بالكثير من النفايات، ومن ثم يعدل نفسه.

النتائج واعدة للغاية. فعند اختبار هذه الطريقة الجديدة على مجموعتي بيانات شائعتين للفيديو، وهما Charades-STA و QVHighlights، تفوقت هذه الطريقة الجديدة على أفضل التقنيات الموجودة في كل مقياس. على سبيل المثال، في مجموعة بيانات Charades-STA، حسنت الطريقة الجديدة دقة العثور على اللحظة الصحيحة بمقدار 4.36 نقطة مئوية مقارنة بأقرب منافس لها. كما وجد المؤلفون أن فكرة "التنظيف أولاً، ثم البحث" ليست جيدة لنظامهم الخاص فحسب؛ بل يمكنهم أيضاً دمجها في نماذج بحث فيديو أخرى موجودة وجعل تلك النماذج تعمل بشكل أفضل أيضاً. باختاًصار، تشير الورقة إلى أن السر في العثات على اللحظة المناسبة في الفيديو ليس مجرد النظر بجهد أكبر إلى كل شيء، بل في تعلم تجاهل الأشياء التي لا تهم.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →