← أحدث الأبحاث
💻 computer science

See More, Store Less: Memory-Efficient Resolution for Video Moment Retrieval

تقترح الورقة البحثية إطار عمل SMORE، وهو إطار عمل فعال من حيث استهلاك الذاكرة لاسترجاع لحظات الفيديو، والذي يستخدم التسميات التوضيحية الموجهة بالاستعلام، وتعديل الأهمية، وضغط الإطارات التكيفي لتحقيق أداء رائد في عدة معايير قياسية مع التغلب على قيود الذاكرة الناتجة عن المعالجة الكثيفة للإطارات.

المؤلفون الأصليون: Mingyu Jeon, Sungjin Han, Jinkwon Hwang, Minchol Kwon, Jonghee Kim, Junyeong Kim

نُشر 2026-01-15
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Mingyu Jeon, Sungjin Han, Jinkwon Hwang, Minchol Kwon, Jonghee Kim, Junyeong Kim

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك فيلماً مدته ساعتان، ولكن ليس لديك سوى مفكرة صغيرة لكتابة ما يحدث فيه. أنت بحاجة للعثور على مشهد معين بناءً على وصف مثل: "اللحظة التي يطارد فيها الجرو الكرة الحمراء".

المشكلة:
تحاول معظم أنظمة الذكاء الاصطنا القانونية حل هذه المشكلة بإحدى طريقتين، وكلتاهما تشوبهما عيوب:

  1. نهج "اللقطات المتفرقة": يقومون بالتقاط بعض الصور العشوائية للفيلم كل بضع ثوانٍ. إذا ركض الجرو عبر الشاشة بين تلك اللقطات، فسيفتقده الذكاء الاصطناعي تماماً. الأمر يشبه محاولة قراءة كتاب من خلال النظر فقط إلى الصفحة 1، والصفحة 50، والصفحة 100.
  2. نهج "الوصف الكامل": يحاولون كتابة ملخص مفصل لكل ثانية من الفيلم. هذا يلتقط كل شيء، ولكن هذا يملأ مفكرتك (الذاكرة) بسرعة كبيرة لدرجة أن الكمبيوتر قد يتوقف عن العمل قبل أن ينتهي.

الحل: SMORE (رؤية المزيد، وتخزين أقل)
يقترح المؤلفون إطار عمل جديداً يسمى SMORE. فكر في SMORE كمساعد ذكي للغاية وموفر للذاكرة، يعرف بالضبط ما تبحث عنه حتى قبل أن يبدأ في قراءة السيناريو.

إليك كيف يعمل SMORE، باستخدام ثلاث حيل بسيطة:

1. "قلم التحديد المخصص" (التعليقات الموجهة بالاستعلام)

بدلاً من كتابة ملاحظات عامة مثل "كلب يمشي"، يستمع SMORE إلى سؤالك المحدد أولاً.

  • الطريقة القديمة: يكتب الذكاء الاصطناعي: "كلب يمشي". (وصف عام، قد لا يساعدك في العثور على المشهد المحدد).
  • طريقة SMORE: إذا سألت: "أين الجرو الذي يطارد الكرة؟"، سيبحث الذكاء الاصطناعي في الفيديو ويكتب: "جرو يطارد كرة".
  • التشبيه: تخيل أميناً للمكتبة، بدلاً من فهرسة كل كتاب حسب لونه، يقرأ طلبك ("أحتاج كتاباً عن الفضاء") ثم يكتب ملاحظة خاصة على الكتب ذات الصلة تقول: "هذا الكتاب عن الفضاء!". هذا يضمن أن الملاحظات تطابق تماماً ما تبحث عنه.

2. "مقبض التحكم في الصوت" (أهمية الاستعلام)

ليست كل الملاحظات متساوية في الأهمية. بعض المشاهد هي مجرد ضوضاء خلفية؛ بينما البعض الآخر هو الحدث الرئيسي.

  • كيف يعمل: يمنح SMORE "مقبض تحكم في الصوت" لكل ملاحظة يكتبها. إذا كانت الملاحظة تطابق بحثك تماماً، فإنه يرفع مستوى الصوت (أهمية عالية). أما إذا كانت الملاحظة عن شيء غير ذي صلة (مثل قطة نائمة في الخلفية بينما سألت عن جرو)، فإنه يخفض مستوى الصوت.
  • التشبيه: يشبه الأمر منسق الأغاني (DJ) الذي يمزج قائمة تشغيل. عندما تأتي الأغنية التي تريد سماعها، يرفع الـ DJ مستوى الصوت. وعندما تعمل أغنية لا تهمك، يقوم بخفض صوتها تدريجياً حتى لا تشتت الانتباه. هذا يساعد الذكاء الاصطناعي على التركيز فقط على الأجزاء "العالية" (المهمة) من الفيديو.

3. "الضاغط الذكي" (الضغط البصري المهيكل)

غالباً ما تحتوي الفيديوهات على العديد من الإطارات التي تبدو متطابقة تقريباً (مثلاً: سيارة تسير على طريق مستقيم لمدة 10 ثوانٍ). تخزين كل إطار على حدة هو هدر للمساحة.

  • كيف يعمل: ينظر SMORE إلى الإطارات المتتالية. إذا كان إطاران متشابهين تقريباً، فإنه لا يتخلص من أحدهما (مما يؤدي لفقدان المعلومات)، بل يقوم بدلاً من ذلك بـ "ضغط" الإطارين معاً رياضياً في ملخص واحد مدمج يحتفظ بأهم التفاصيل.
  • التشبيه: تخيل أن لديك كومة من 100 صورة لغروب الشمس حيث لا تتحرك الشمس إلا قليلاً. بدلاً من الاحتفاظ بكل الـ 100 صورة، تأخذ أفضل 5 صور وتدمجها في "صورة فائقة" واحدة عالية الجودة تلتقط الحركة بأكملها دون الحاجة إلى 100 ملف منفصل.

النتائج

اختبر الباحثون هذا النظام على ثلاث قواعد بيانات فيديو رئيسية (QVHighlights، وCharades-STA، وActivityNet-Captions).

  • الأداء: تفوق SMORE على أفضل النماذج الحالية (مثل Chrono وLLaVA-MR) في العثين على لحظات الفيديو الصحيحة.
  • الكفاءة: حقق ذلك باستخدام ذاكرة أقل. فبينما احتاجت النماذج الرائدة الأخرى إلى شريحة كمبيوتر ضخمة ومكلفة (80 جيجابايت من الذاكرة) للعمل، استطاع SMORE تحقيق نتائج أفضل باستخدام شريحة أصغر وأكثر شيوعاً (48 جيجابايت من الذاكرة).

باختصار:
SMORE يشبه المحقق الذي لا يكتفي بقراءة ملف القضية بأكه كاملاً بشكل أعمى. بدلًا من ذلك، يقرأ الدليل المحدد الذي أعطيته له، ويحدد الصفحات ذات الصلة، ويخفض مستوى الضجيج، ويلخص الأجزاء المملة لكي يتمكن من حل اللغز بشكل أسرع وبأوراق أقل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →