← أحدث الأبحاث
🤖 AI

video-SALMONN S: Memory-Enhanced Streaming Audio-Visual LLM

تقدم الورقة البحثية نموذج video-SALMONN S، وهو نموذج لغوي كبير صوتي-بصري تدفقي معزز بالذاكرة، يستخدم التدريب في وقت الاختبار لتحويل التمثيلات قصيرة المدى باستمرار إلى ذاكرة طويلة المدى، مما يمكنه من معالجة فيديوهات تزيد مدتها عن 3 ساعات والتفوق بشكل كبير على النماذج الحالية في معايير التعلم طويل الأمد والتعلم العرضي.

المؤلفون الأصليون: Guangzhi Sun, Yixuan Li, Xiaodong Wu, Yudong Yang, Wei Li, Zejun Ma, Chao Zhang

نُشر 2026-02-04
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Guangzhi Sun, Yixuan Li, Xiaodong Wu, Yudong Yang, Wei Li, Zejun Ma, Chao Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت فهم فيلم مدته ثلاث ساعات، لكن لا يمكنك سوى عرضه عليه بمعدل إطار واحد في الثانية (عرض بطيء ومتقطع للغاية) والصورة ضبابية قليلاً (بدقة 360p). كما أن الروبوت يمتلك "دماغاً" صغيراً جداً (ذاكرة) لا يمكنه استيعاب سوى كمية ضئيلة من المعلومات في المرة الواحدة.

تفقد معظم نماذج الذكاء الاصطناعي الحالية (AI) بداية الفيلم بحلول الوقت الذي تصل فيه إلى نهايته. يقدم هذا البحث روبوتاً جديداً يسمى video-SALMONN S يحل هذه المشكلة. إليك كيف يعمل، باستخدام تشبيهات بسيطة:

1. المشكلة: "الدلو المثقوب"

تخيل أنك تحاول ملء دلو بالماء (معلومات الفيديو) بينما يوجد ثقب في أسفل الدلو.

  • نماذج الذكاء الاصطناعي القديمة تشبه الدلاء ذات الثقوب الكبيرة. إذا صببت فيديو مدته 3 ساعات، فسوف يتسرب الماء (المعلومات) قبل أن تصل إلى النهاية. لذا تضطر هذه النماذج إلى التخلص من معظم الفيديو لتوفير مساحة في ذاكرتها، مما يجعلها تنسى التفاصيل المهمة.
  • نماذج البث (Streaming models) (الأفضل حالياً) هي أفضل حالاً، لكنها لا تزال تفقد المعلومات بمر مرور الوقت لأنها تضطر باستمرار إلى حذف البيانات القديمة لإفساح المجال للبيانات الجديدة.

2. الحل: "الدفتر ذاتي التحرير" (TTT)

السر وراء video-SALMONN S هو تقنية تسمى التدريب أثناء الاختبار (Test-Time Training - TTT).

  • التشبيه: تخيل أنك تقرأ كتاباً طويلاً جداً. بدلاً من مجرد القراءة والنسيان، لديك دفتر سحري. في كل مرة تقرأ فيها صفحة جديدة، لا تكتفي بكتابتها فحسب، بل تعيد كتابة دماغك بناءً على ما قرأته للتو. أنت تقوم بتحديث فهمك للقصة أثناء القراءة.
  • كيف يعمل: بينما يعمل الفيديو، يقوم النموذج باستمرار بتعديل إعداداته الداخلية (أوزانه/weights) لتخزين تفاصيل القصة. إنه يحول الذاكرة قصيرة المدى (ما حدث للتو) إلى ذاكرة طويلة المدى (القصة بأكملها) عن طريق تغيير هيكله. الأمر يشبه كون الروبوت "يتعلم" الفيديو في الوقت الفعلي، بدلاً من مجرد مشاهدته.

3. خدعة "التنبؤ طويل المدى"

للتأكد من أن الروبوت لن ينسى بداية الفيلم، أضاف المؤلفون قاعدة خاصة تسمى التنبؤ طويل المدى (Long-Span Prediction).

  • التشبيه: تخيل أنك تلعب لعبة "الهاتف المكسور" مع صديق، لكن اللعبة تستمر لمدة 3 ساعات. عادةً ما تصبح الرسالة مشوهة. هذا النموذج لديه قاعدة: "في كل مرة تمرر فيها رسالة، يجب عليك أيضاً التحقق مما إذا كان لا يزال بإمكانك تذكر ما قيل قبل 30 دقيقة".
  • النتيجة: هذا يجبر الروبوت على إبقاء الأجزاء الأولى من الفيديو واضحة في ذهنه، حتى أثناء معالجته لأحدث الإطارات.

4. "أمين المكتبة الذكي" (قارئ الذاكرة)

حتى مع وجود دفتر سحري، لا يمكنك قراءة كل صفحة من كتاب مدته 3 ساعات عندما يسألك شخص ما سؤالاً محدداً؛ فهذا سيستغرق وقتاً طويلاً جداً.

  • التشبيه: عندما يسأل المستخدم "ماذا يحدث بعد ذلك؟"، يعمل الروبوت مثل أمين مكتبة ذكي. فبدلاً من سحب الأرشيف الكامل لـ 3 ساعات، يقوم بمسح سريع لذاكرته، ليجد الصفحات القليلة المحددة المتعلقة بالسؤال، ويتجاهل الباقي.
  • الفائدة: هذا يجعل الروبوت سريعاً وفعالاً، رغم أنه شاهد ساعات من الفيديو.

5. الاختبار الجديد: "ELViM" (تحدي الذاكرة)

أدرك المؤلفون أن الاختبارات الموجودة كانت سهلة للغاية؛ فهي تسأل فقط عن فيديوهات يشاهدها الروبوت في تلك اللحظة. لذا أنشأوا اختباراً جديداً يسمى ELViM (التعلم العرضي من ذاكرة الفيديو).

  • السيناريو: يشاهد الروبوت فيديو لشخص يخبز كعكة. ثم يشاهد 30 دقيقة من فيديوهات أخرى (مثل وثائقيات الطبيعة). أخيراً، يعود فيديو الخبز للظهور، متوقفاً تماماً قبل أن يكسر الخباز بيضة.
  • السؤال: "ما هي الخطوة التالية؟"
  • الهدف: يجب على الروبوت تذكر خطوة الخبز من قبل 30 دقيقة، وتجاهل وثائقيات الطبيعة التي كانت بينهما، والإجابة بشكل صحيح.
  • النتيجة: حقق video-SALMONN S نجاحاً ساحقاً في هذا الاختبار، حيث تفوق على أفضل النماذج السابقة بنسبة 15%. لقد أثبت أن الروبوت يمكنه حقاً "تذكر" المهارات التي تعلمها قبل ساعات.

ملخص الإنجازات

  • يشاهد فيديوهات طويلة: يمكنه التعامل مع فيديوهات تزيد مدتها عن 3 ساعات بمعدل إطارات منخفض دون نفاد الذاكرة.
  • يتذكر بشكل أفضل: يتفوق على كل من نماذج "البث" (التي تشاهد مباشرة) والنماذج "غير المتصلة" (التي ترى الفيديو بالكامل دفعة واحدة) بفارق كبير (3-7% أفضل في الاختبارات القياسية، و15% أفضل في اختبار الذاكرة).
  • كفء: لا يحتاج إلى حاسوب خارق للقيام بذلك؛ فهو يتناسب ضمن ميزانية ذاكرة قياسية.

باختختصار، video-SALMONN S هو أول ذكاء اصطناٍ يعيد تعريف القدرة على مشاهدة فيلم طويل، والتعلم منه، وتذكر التفاصيل بعد ساعات، كل ذلك مع الحفاظ على حجم ذاكرة صغير ومستقر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →