← أحدث الأبحاث
💻 computer science

Seeing the Forest and the Trees: Query-Aware Tokenizer for Long-Video Multimodal Language Models

تقدم هذه الورقة QTSplus، وهي وحدة اختيار رموز خفيفة الوزن وواعية بالاستعلام، تقوم بتصفية الرموز المرئية ديناميكيًا بناءً على تعقيد الاستعلام النصي لتقليل التكاليف الحسابية وزمن الاستجابة بشكل كبير في النماذج اللغوية متعددة الوسائط للفيديوهات الطويلة، مع الحفاظ على الأداء أو تعزيزه في مهام الفهم الزمني.

المؤلفون الأصليون: Siyou Li, Huanan Wu, Juexi Shao, Yinghao Ma, Yujian Gan, Yihao Luo, Yuwei Wang, Dong Nie, Lu Wang, Wenqing Wu, Le Zhang, Massimo Poesio, Juntao Yu

نُشر 2026-02-26
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Siyou Li, Huanan Wu, Juexi Shao, Yinghao Ma, Yujian Gan, Yihao Luo, Yuwei Wang, Dong Nie, Lu Wang, Wenqing Wu, Le Zhang, Massimo Poesio, Juntao Yu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان "رؤية الغابة والأشجار" باستخدام لغة بسيطة وتشبيهات إبداعية.

المشكلة الكبرى: مشكلة "مكتبة الإسكندرية"

تخيل أن لديك ذكاءً اصطناعيًا متعدد الوسائط (روبوت فائق الذكاء يمكنه الرؤية والقراءة). تريد أن تسأله سؤالًا حول فيلم مدته 3 ساعات.

في الوقت الحالي، لكي يفهم الذكاء الاصطناعي الفيديو، يتعين عليه تحويل كل إطار (frame) إلى "توكن" (كلمة رقمية تمثل صورة).

  • المشكلة: فيلم مدته 3 ساعات يحتوي على آلاف الإطارات. إذا حاول الذكاء الاصطناعي قراءة كل إطار منها، فالأمر يشبه أن تطلب من أمين مكتبة قراءة كل كتاب في "مكتبة الإسكندرية" فقط ليجد الإجابة على سؤال بسيط واحد: "ما كان لون السيارة في مشهد المطاردة؟"
  • النتيجة: يصاب الذكاء الاصطناعي بالإرهاق؛ حيث تنفد ذاكرته، ويستغرق وقتًا طويلاً في التفكير، وغالبًا ما يفتقد التفصيل المحدد الذي سألته عنه لأنه غارق في الكثير من المعلومات.

الحل: QTSplus (الأمين الذكي)

يقترح المؤلفون أداة جديدة تسمى QTSplus. فكر فيها كـ أمين مكتبة فائق الذكاء ومدرك للسؤال، يقف بين كاميرا الفيديو وعقل الذكاء الاصطناعي.

بدلاً من تسليم المكتبة بأكملها للذكاء الاصطناعي، يقوم QTSplus بالنظر في سؤالك أولاً، ثم يركض إلى الرفوف، ويختار فقط الكتب (إطارات الفيديو) التي تحتاجها، ثم يسلمها له.

إليك كيف يعمل ذلك، خطوة بخطوة:

1. "درجة الارتباط" (حدس أمين المكتبة)

عندما تسأل: "ماذا يفعل الرجل؟"، لا يقوم QTSplus بالتخمين فحسب. بل يستخدم تقنية تسمى الاهتمام المتقاطع (Cross-Attention).

  • التشبيه: تخيل أمين المكتبة وهو يمسك ببطاقة سؤالك. بينما يمر عبر إطارات الفيديو، يعطي كل إطار "درجة ارتباط" بناءً على مدى تطابقه مع سؤالك.
  • إذا أظهر الإطار رجلاً يشرب الجعة، فإنه يحصل على درجة عالية.
  • إذا أظهر الإطار شجرة أو جدارًا فارغًا، فإنه يحصل على درجة منخفضة.

2. "الميزانية التكيفية" (معرفة مقدار ما يجب قراءته)

هذا هو الجزء الذكي. لا يستخدم الذكاء الاصطناعي قاعدة ثابتة مثل "احتفظ بـ 10% من الفيديو". بل يغير استراتيجيته بناءً على السؤال.

  • السيناريو (أ): تسأل: "لخص الفيلم بأكمله."
    • يقول QTSplus: "حسنًا، هذا سؤال عام. أحتاج للاحتفاظ بالكثير من الإطارات لأروي القصة كاملة." (ميزانية عالية).
  • السيناريو (ب): تسأل: "متى تحول الضوء الأحمر إلى أخضر؟"
    • يقول QTSplus: "هذه لحظة محددة. أحتاج فقط للاحتفاظ بالثواني القليلة المحيطة بإشارة المرور. يمكنني التخلص من الباقي." (ميزانية منخفضة).

إنه يحسب "كسر الاحتفاظ" (Retention Fraction) (نسبة مئوية لكيفية تحديد مقدار ما يجب الاحتفاظ به) بناءً على مدى تعقيد سؤالك ومدى انتشار الأدلة المهمة في الفيديو.

3. "المسافر عبر الزمن" (الحفاظ على الترتيب)

بمجرد أن يختار أمين المكتبة أفضل الإطارات، هناك خطر: قد تصبح مبعثرة. إذا عرضت على الذكاء الاصطناعي إطارًا من نهاية الفيلم قبل إطار من بدايته، فسوف يرتبك.

  • الحل: يضيف QTSplus "طابعًا زمنيًا" صغيرًا إلى الإطارات المختارة.
  • التشبيه: الأمر يشبه وضع الصفحات المختارة من كتاب داخل ملف مع ملاحظات لاصقة تقول "الصفحة 1"، "الصفحة 50"، و"الصفحة 100". هذا يضمن أن يفهم الذكاء الاصطناعي تدفق القصة بالترتيب الصحيح، حتى لو تخطى 99% من الصفحات.

النتائج: سريع، خفيف، ودقيق

اختبر الباحثون هذه الأداة على نموذج Qwen2.5-VL (وهو نموذج ذكاء اصطناعي شائع جدًا). وإليك ما حدث:

  • الضغط: قلل من كمية بيانات الفيديو التي يتعين على الذكاء الاصطناعي معالجتها بنسبة 89%. (تخيل تقليص مستند مكون من 100 صفحة إلى 11 صفحة فقط دون فقدان مضمون القصة).
  • السرعة: أصبح الذكاء الاصطناعي أسرع بنسبة 28% في الإجابة على الأسئلة.
  • الدقة: للمفاجأة، لم يصبح أقل ذكاءً. في الواقع، بالنسبة للأسئلة المتعلقة بـ الترتيب (ماذا حدث أولاً؟) و الاتجاه (في أي اتجاه كانت السيارة تسير؟)، أصبح في الواقع أفضل في الإجابة لأنه لم يتشتت باللقطات غير ذات الصلة.

لماذا هذا مهم؟

قبل هذا، كانت مشاهدة الفيديوهات الطويلة باستخدام الذكاء الاصطناعي تشبه محاولة الشرب من خرطوم حريق؛ فإما أن تضطر لتقطيع الفيديو إلى مقاطع صغيرة غير متصلة (مما يؤدي لفقدان الصورة الكبيرة) أو تترك الذكاء الاصطناعي يختنق بسبب كثرة البيانات.

QTSplus يشبه منح الذكاء الاصطناعي نظارات ذكية. فهو يسمح للذكاء الاصطناعي بمشاهدة فيلم مدته 3 ساعات، وتجاهل الأجزاء المملة، والتركيز بدقة على ما سألت عنه، والإجابة بسرعة دون التعرض للصداع. إنه يتيح لنا توسيع نطاق الذكاء الاصطناعي للتعامل مع فيديوهات العالم الحقيقي التي تستغرق ساعات طويلة باستخدام أجهزة الكمبيوتر العادية، وليس فقط الحواسيب العملاقة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →