← أحدث الأبحاث
🤖 AI

Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding

يُعد SAVEMem إطار عمل ثنائي المرحلة وخالٍ من التدريب، يعمل على تعزيز فهم الفيديو المتدفق عبر الإنترنت من خلال دمج البروز الدلالي في توليد الذاكرة واستخدام الاسترجاع المتكيف مع الاستعلام، مما يحسن الأداء بشكل كبير في اختبارات مثل OVO-Bench مع تقليل ذروة استخدام ذاكرة وحدة معالجة الرسومات.

المؤلفون الأصليون: Hang Wu, Sherin Mary Mathews, Yujun Cai, Ming-Hsuan Yang, Yiwei Wang

نُشر 2026-05-11
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Hang Wu, Sherin Mary Mathews, Yujun Cai, Ming-Hsuan Yang, Yiwei Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول مشاهدة بث إخباري مباشر ولا نهائي على تلفازك، ولكن ليس لديك سوى دفتر ملاحظات صغير للغاية لتدوين أهم التفاصيل. في كل ثانية، تتدفق لقطات جديدة، وفجأة يصرخ أحد المشاهدين بسؤال مثل: "ماذا حدث قبل خمس دقائق؟" أو "ماذا يرتدي المذيع الآن؟"

إذا حاولت تدوين كل شيء في دفتر ملاحظاتك، فسيمتلئ فوراً، وسيتعين عليك التخلص من الملاحظات القديمة لإفساح المجال للملاحظات الجديدة. وإذا تخلصت فقط من الملاحظات الأقدم، فقد تفوتك الإجابة على سؤال حول الماضي. وإذا احتفظت فقط بأحدث الملاحظات، فلن تتمكن من الإجابة على الأسئلة المتعلقة بالتاريخ.

هذه هي المشكلة ذاتها التي يحلها SAVEMem للذكاء الاصطناعي الذي يشاهد مقاطع الفيديو المتدفقة (Streaming Videos). إليك كيف يعمل، مقسماً إلى مفاهيم بسيطة:

المشكلة: "الفيديو اللانهائي" مقابل "الدماغ الصغير"

نماذج الذاء الاصطناعي الحالية بارعة في مشاهدة الأفلام القصيرة، لكنها تعاني مع مقاطع الفيديو المباشرة واللانهائية.

  • القيد: لا يمكن للذكاء الاصطناعي رؤية المستقبل (يرى فقط ما حدث حتى الآن).
  • حد الذاكرة: لا يمكنه تذكر كل إطار (Frame) للأبد لأن "دماغه" (ذاكرة وحدة معالجة الرسومات GPU) صغير جداً.
  • السؤال غير المتوقع: قد يسأل المستخدم عن الآن أو عن شيء حدث قبل ساعة. يحتاج الذكاء الاصطناعي إلى اتخاذ قرار بشأن ما الذي يحتفظ به وما الذي ينساه قبل أن يعرف ماهية السؤال حتى.

الحل: SAVEMem (أمين المكتبة الذكي)

ابتكر المؤلفون نظاماً يسمى SAVEMem يعمل كأمين مكتبة فائق الذكاء للفيديو. لا يحتاج النظام إلى إعادة تدريب (فهو يعمل "جاهزاً للاستخدام" مع نماذج الذكاء الاصطناعي الموجودة). وهو يستخدم عملية مكونة من مرحلتين لإدارة الذاكرة.

المرحلة الأولى: نظام الأرشفة "الدلالي" (ما الذي يجب الاحتفاظ به؟)

بدلاً من مجرد الاحتفاظ بأحدث الصور أو الصور التي تبدو متشابهة (مثل الاحتفاظ بصورتين لسماء زرقاء لأنهما تبدوان متشابهتين)، يسأل SAVEMem سؤالاً مختلفاً: "هل هذه الصورة مثيرة للاهتمام أو مهمة حقاً؟"

  • السلاح السري: قبل بدء الفيديو، يجهز النظام قائمة صغيرة من "الأسئلة الوهمية" (Pseudo-question bank) لتكون جاهزة للانطلاق. هذه أسئلة عامة مثل "هل يوجد شخص؟" "هل هناك شيء يتحرك؟" أو "ما هو المشهد؟".
  • العملية: أثناء تشغيل الفيديو، يفحص النظام كل إطار مقابل هذه الأسئلة الوهمية.
    • إذا كان الإطار يجيب على أحد هذه الأسئلة بشكل جيد (على سبيل المثال، إطار يظهر شخصاً يطبخ)، فإنه يحصل على "درجة أهمية" عالية.
    • إذا كان الإطار مجرد ضوضاء خلفية مملة، فإنه يحصل على درجة منخفضة.
  • الأرفف الثلاثة: ينظم النظام الذاكرة في ثلاثة مستويات:
    1. المدى القصير: يحتفظ بآخر ثوانٍ معدودة بتفاصيل دقيقة (مثل إجراء محادثة).
    2. المدى المتوسط: يحتفظ باللحظات "المثيرة للاهتمام" من الماضي القريب.
    3. المدى الطويل: يحتفظ بملخص متباعد وعالي المستوى للماضي البعيد.
  • النتيجة: حتى لو استمر الفيديو لساعات، يحتفظ الذكاء الاصطناعي فقط بـ "أبرز اللحظات" المهمة دلالياً، وليس فقط تلك التي تبدو متشابهة.

المرحلة الثانية: "البحث الذكي" (كيف تجيب؟)

عندما يطرح المستخدم أخيراً سؤالاً حقيقياً (على سبيل වශයෙන්: "ماذا فعل الشخص قبل تحضير اللحم؟")، فإن النظام لا يخمن فحسب، بل يكيف استراتيجية البحث الخاصة به بناءً على السؤال.

  • "بوابة الحداثة" (Recency Gate): يتحقق النظام أولاً: "هل هذا السؤال عن الآن؟"
    • نعم؟ ينظر فقط إلى رف المدى القصير. يتجاهل بقية التاريخ لتوفير الوقت والطاقة.
    • لا؟ (مثلاً: "ماذا حدث قبل 10 دقائق؟") يفتح رفوف المدى المتوسط والمدى الطويل.
  • "التفاعل المتأخر" (Late Interaction): بمجرد معرفة الرفوف التي يجب فحصها، يقارن النظام سؤال المستخدم المحدد مقابل إطارات "اللقطات البارزة" التي حفظها في المرحلة الأولى. يختار الإطارات المحددة التي تطابق السؤال بأفضل شكل لإنشاء الإجابة.

لماذا يعد هذا أمراً هاماً؟

اختبر المؤلفون هذا النظام على نموذج ذكاء اصطناعي قياسي (Qwen2.5-VL) دون تعليمه أي شيء جديد. وكانت النتائج مبهرة:

  • إجابات أذكى: حسن النظام قدرة الذكاء الاصطناعي على الإجابة على الأسئلة المتعلقة بالفيديو المتدفق بفارق كبير (سجل 62.69 بدلاً من 52.27 في اختبار رئيسي).
  • حمل أخف: استخدم 48% أقل من ذاكرة الكمبيوتر من النموذج القياسي عند مشاهدة فيديوهات طويلة. الأمر يشبه الحصول على إجابة أفضل باستخدام حقيبة ظهر أصغر.
  • لا حاجة للتدريب: لا تحتاج لقضاء أسابيع في تعليم الذكاء الاصطناعي كيفية القيام بذلك؛ فهو يعمل ببساطة باستخدام الأدوات التي يمتلكها بالفعل.

العيوب (المحددات)

المؤلفون صريحون بشأن ما لا يستطيع النظام فعله بعد:

  • العد صعب: إذا سألت "كم عدد الأشخاص الذين مروا في الساعة الأخيرة؟"، فقد يفتقد النظام بعضهم لأنه اضطر للتخلص من الإطارات "المملة" لتوفير المساحة.
  • الأسئلة العامة: "الأسئلة الوهمية" المستخدمة لتقييم الأهمية هي أسئلة عامة. قد لا تكون مثالية لأنواع الفيديو المتخصصة جداً (مثل اللقطات الطبية المتخصصة) دون تعديلات مستقبلية.

باختصار

SAVEMem هو بمثابة مساعد فيديو لا يحاول حفظ كل ثانية من البث المباشر. بدلاً من ذلك، يقوم بمسح سريع للفيديو، ويحتفظ بـ "أحداث القصة" (اللحظات المهمة)، ويتخلص من الأجزاء المملة. وعندما تسأل سؤالاً، يعرف بالضبط أين يبحث—سواء كان ذلك في الثواني القليلة الماضية أو في لحظة محددة من ساعة مضت—مما يمنحك إجابة أفضل بجهد أقل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →