← أحدث الأبحاث
💻 computer science

LongVU-TTT: Causal Test-Time Training for Visual Resampling in Long Video Understanding

يقدم LongVU-TTT مُعيد عينات سببي للتدريب أثناء وقت الاختبار مع أوزان سريعة تكيُّفية ومُنتقي هجين لضغط تسلسلات الفيديو الطويلة بفعالية مع الحفاظ على الأدلة الزمنية الحرجة، محققاً أداءً هو الأفضل في فئته عبر العديد من معايير فهم الفيديو.

المؤلفون الأصليون: Mahmoud Ahmed, Sameh Abdulah, Olatunji Ruwase, Sam Ade Jacobs, Mathis Bode, Mohamed Elhoseiny

نُشر 2026-08-27
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Mahmoud Ahmed, Sameh Abdulah, Olatunji Ruwase, Sam Ade Jacobs, Mathis Bode, Mohamed Elhoseiny

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إن مشاهدة فيديو طويل مع ذكاء اصطناعي تشبه مطالبة شخص بتذكر كل ثانية من فيلم مدته ساعتان بينما يجيب في الوقت نفسه على سؤال محدد حوله. إن أنظمة الذكاء الاصطناعي الحالية التي تفهم الفيديو مبنية على أساس حيث يقوم مكون يشبه الكاميرا بمسح كل إطار وتمرير وصف له إلى "دماغ لغوي". تكمن المشكلة في أنه كلما زاد طول الفيديو، تضخمت كمية المعلومات لدرجة لا يستطيع معها الدماغ اللغوي استيعابها جميعًا في ذاكرته قصيرة الممد. وللتعامل مع ذلك، حاول المهندسون تلخيص الفيديو عبر اختيار بعض الإطارات التمثيلية أو دمج اللحظات المتشابهة، لكن هذه الأساليب غالبًا ما تجرد الفيديو من التفاصيل الدقيقة اللازمة لفهم كيفية تغير المشهد بمرور الوقت. يظل التحدي الجوهري قائمًا: كيف يمكن للذكاء الاصطناعي معالجة مئات الإطارات من فيديو دون فقدان القصة، مع الاستمرار في احتواء المعلومات ضمن مساحة ذاكرة محدودة؟

لقد طور فريق من الباحثين نهجًا جديدًا يسمى LongVU-TTT لحل هذه العقبة. فبدلاً من إجبار الدماغ اللغوي على القيام بكل العمل الشاق لتتبع الوقت، قاموا بإدراج طبقة معالجة متخصصة بين الكاميرا والدماغ. تعمل هذه الطبقة كمرشح ديناميكي يراقب الفيديو أثناء تشغيله، ويقوم بتحديث فهمه الداخلي لما يحدث باستمرار. وبدلاً من معاملة كل إطار كصورة ثابتة، يتعلم هذا النظام التعرف على متى يتغير المحتوى البصري. وهو يفعل ذلك من خلال تعديل اتصالاته الداخلية في الوقت الفعلي أثناء معالجة التدفق، مما يخلق فعليًا ملخصًا جارياً لتاريخ الفيديو. وعندما يحدث تغيير كبير، مثل دخول شخصية إلى غرفة أو انعطاف سيارة عند زاوية، يقوم النظام بتمييز تلك اللحظة كلحظة مهمة.

وجد الباحثون أن طريقة التعديل المستمر واللحظي هذه تعمل بشكل أفضل من التقنيات السابقة التي اعتمدت على أنماط ثابتة أو متوسط حسابي بسيط. ومن خلال استخدام هيكل يحترم التخطيط ثنائي الأبعاد للصورة — تمامًا كما تدرك أعيننا الأشكال والحواف بدلاً من مجرد قائمة مسطحة من البكسلات — يلتقط النظام التفاصيل المحلية التي تغفل عنها الأساليب الأخرى. والأهم من ذلك، اكتشف الفريق أن هذا الملخص الجاري الداخلي ليس أرشيفًا مثاليًا للماضي؛ بل يعمل كـ "مراقب ماهر" يتذكر التدفق العام للأحداث والتغيرات الأخيرة، لكنه لا يستطيع تذكر كل تفصيل محدد من بداية فيديو طويل. وبسبب ذلك، يجمع النظام بين فهمه الديناميكي وعملية اختيار ذكية؛ فهو يحتفظ بالإطارات التي حدثت فيها أهم التغييرات، ويملأ بقية الذاكرة بعينات موزعة بانتظام لضمان تغطية الخط الزمني.

في اختباراتهم، عالج الباحثون فيديوهات تحتوي على ما يصل إلى 512 إطارًا، وضغطوها إلى 128 إطارًا فقط ليقرأها الدماغ اللغوي. ورغم هذا الاختزال الكبير، حقق النظام أداءً أفضل من النماذج الحالية في خمس معايض مصممة لاختبار فهم الفيديو. وقد أظهر قوة خاصة في المهام التي تتطلب من الذكاء الاصطناعي تتبع التغييرات بمرور الوقت، متفوقًا على الأساليب المتقدمة الأخرى بهوامش ملموسة. كما أوضحت الدراسة قيدًا حيويًا: فبينما تعتبر الحالة الداخلية للنظام ممتازة في تجميع اللحظات ذات الصلة وتسليط الضوء على التحولات، إلا أنها لا يمكن أن تحل محل الحاجة إلى الاحتفاظ بالدليل البصري الفعلي للأحداث البعيدة. وكانت أفضل النتائج هي تلك التي استخدم فيها النظام معرفته الداخلية لتوجيه عملية اختيار الإطارات، مما يضمن الحفاظ على الدليل البصري الأكثر أهمية للإجابة النهائية.

ولجعل هذا العمل ممكنًا على أجهزة الكمبيوتر القياسية، طور الفريق أيضًا طريقة للتعامل مع متطلبات الذاكرة الهائلة للتدريب على الفيديوهات الطويلة. فقد طوروا طريقة تقسم المعالجة إلى أجزاء أصغر يمكن إدارتها، وتنقل البيانات بين الذاكرة الرئيسية للكمبيوتر ومعالجه بطريقة تحافظ على سلاسة عمل النظام دون تباطؤ. سمح هذا لهم بتدريب النموذج على تسلسلات طويلة باستخدام بطاقات رسوميات قياسية متاحة على نطاق واسع، بدلاً من الحاجة إلى مجموعات حوسبة فائقة متخصصة وباهظة الثمن. والنتيجة هي نظام يمكنه فهم الفيديوهات الطويلة بدقة وكفاءة أكبر، مما يثبت أن مفتاح التعامل مع التسلسلات الطويلة لا يكمن فقط في امتلاك ذاكرة أكبر، بل في معرفة اللحظات التي يجب تذكرها بالضبط.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →