← أحدث الأبحاث
🤖 AI

AdaptToken: Entropy-based Adaptive Token Selection for MLLM Long Video Understanding

يُعد AdaptToken إطار عمل لا يتطلب تدريبًا، حيث يستفيد من عدم اليقين الذاتي للنماذج اللغوية الكبيرة متعددة الوسائط (MLLM) والانتباه عبر الوسائط لتخصيص ميزانيات الرموز ديناميكيًا عبر مجموعات الفيديو وتمكين التوقف المبكر، مما يحسن بشكل كبير دقة وكفاءة فهم الفيديوهات الطويلة عبر مختلف المعايير وأحجام النماذج.

المؤلفون الأصليون: Haozhe Qi, Kevin Qu, Mahdi Rad, Rui Wang, Alexander Mathis, Marc Pollefeys

نُشر 2026-03-31
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Haozhe Qi, Kevin Qu, Mahdi Rad, Rui Wang, Alexander Mathis, Marc Pollefeys

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك محقق تحاول حل لغز ما، ولكن بدلاً من فيديو قصير مدته 5 دقائق، تم تسليمك شريط مراقبة لمدة 10 ساعات لمدينة مزدحمة.

مهمتك هي الإجابة على سؤال محدد: "ماذا كان يفعل الشخص الذي يرتدي القبعة الحمراء في الساعة 3:00 مساءً؟"

إذا حاولت مشاهدة الشريط المكون من 10 ساعات بالكامل دفعة واحدة، فإن دماغك (أو في هذه الحالة ذاكرة الكمبيوتر) سينفجر. ستشعر بالتعب، وستنسى البداية بحلول الوقت الذي تصل فيه إلى النهاية، ومن المرجح أن تفوتك الإشارة الحاسمة لأنها كانت مدفونة تحت ساعات من اللقطات المملة لحركة المرور والسحب.

هذه هي المشكلة ذاتها التي يحلها AdaptToken لنماذج الذكاء الاصطناعي التي تحاول فهم الفيديوهات الطويلة. إليك كيف يعمل، مقسماً إلى مفاهحات بسيطة:

1. المشكلة: قضية "كومة القش"

نماذج الذكاء الاصطناعي الحالية تشبه المحققين الذين يحاولون قراءة كل كلمة في مكتبة للعثور على جملة واحدة محددة.

  • الحدود: لديهم مدى انتباه قصير (حدود الذاكرة).
  • الهدر: إذا قمت بتغذيتهم بفيديو مدته 10 ساعات، فإنهم يهدرون كميات هائلة من الطاقة في مشاهدة الأجزاء المملة (مثل لقطة ثابتة لجدار) التي لا علاقة لها بسؤالك.
  • الطريقة القديمة: حاولت الطرق السابقة اختيار إطارات "مهمة"، لكنها كانت مثل اختيار صفحات عشوائية من كتاب دون قراءة السياق. غالباً ما كانوا يفقدون الصورة الكبيرة أو يعلقون في التفاصيل المحلية.

2. الحل: "المحقق الذكي" (AdaptToken)

يعمل AdaptToken كاستراتيجية جديدة تعمل مثل محقق فائق الذكاء وواعٍ بذاته. هو لا يقوم فقط بمسح الفيديو؛ بل يسأل نفسه باستمرار: "هل أعرف ما يكفي لحل هذا اللغز بعد؟"

يعمل من خلال ثلاث خطوات ذكية:

الخطوة أ: "فحص الثقة" (الاعتلاج/الإنتروبي)

تخيل أن المحقق ينظر إلى مقطع صغير من الفيديو.

  • إذا كان المقطع يظهر شارعاً مملاً، يقول المحقق: "ليس لدي أدنى فكرة عما يفعله صاحب القبعة الحمراء. أنا غير متأكد للغاية." (اعتلاج مرتفع - High Entropy).
  • إذا كان المقطع يظهر صاحب القبعة الحمراء وهو يسرق حقيبة، يقول المحقق: "آها! أرى ذلك بوضوح! أنا متأكد جداً." (اعتلاج منخفض - Low Entropy).

يستخدم AdaptToken هذا الشعور بـ اليقين كإشارة. فهو يعامل "اليقين العالي" كإشارة ضوء خضراء تقول: "هذا الجزء من الفيديو هو ذهب! احتفظ بمزيد من التفاصيل من هنا." ويعامل "عدم اليقين" كإشارة ضوء حمراء تقول: "هذا مجرد ضجيج. تخلص من معظمه."

الخطوة ب: "مدير الميزانية"

يمتلك الذكاء الاصطناعي "ميزانية توكن" محدودة (حد على مقدار المعلومات التي يمكنه معالجتها).

  • الطريقة القديمة: إعطاء كل جزء من الفيديو حصة متساوية من الميزانية.
  • طريقة AdaptToken: ينظر إلى نتائج "فحص الثقة". إذا جعلت المجموعة (أ) من الفيديو الذكاء الاصطناعي متأكداً جداً، فإنه يعطي المجموعة (أ) 90% من الميزانية. وإذا جعلت المجموعة (ب) الذكاء الاصطناعي مرتبكاً، فإنه يعطي المجموعة (ب) 10% فقط.
  • النتيجة: يركز الذكاء الاصطناعي طاقته فقط على أجزاء الفيديو التي تساعد فعلياً في الإجابة على السؤال.

الخطوة ج: "الخروج المبكر" (AdaptToken-Lite)

هذا هو الجزء الأروع.
تخيل أن المحقق يشاهد الفيديو. بعد مشاهدة 20 دقيقة فقط، وجد صاحب القبعة الحمراء وهو يسرق الحقيبة. إنه متأكد بنسبة 100%.

  • الذكاء الاصطناعي القديم: "يجب أن أشاهد الـ 9 ساعات و40 دقيقة المتبقية لأكون دقيقاً!" (يهدر الوقت).
  • AdaptToken-Lite: "أنا واثق! لقد انتهيت. دعنا نتوقف عن المشاهدة ونعطي الإجابة."

إنه يتوقف عن معالجة بقية الفيديو تماماً، مما يقلص الوقت إلى النصف دون فقدان الدقة.

3. لماذا يعد هذا أمراً هاماً؟

  • إنه "خالٍ من التدريب": لا تحتاج لتعليم الذكاء الاصطناعي مهارة جديدة. هو فقط يستخدم "شعوره الداخلي" (عدم اليقين) لاتخاذ قرارات أذكى.
  • إنه قابل للتوسع: يعمل على فيديوهات يصل طولها إلى 10,000 إطار (ساعات من اللقطات)، وهو أمر كان مستحيلاً سابقاً لهذه النماذج.
  • إنه سريع: من خلال تخطي الأجزاء المملة والتوقف مبكراً، فإنه يحل المشكلات أسرع بمرتين.

ملخص التشبيه

فكر في مشاهدة فيديو طويل مثل قراءة رواية غموض مكونة من 1000 صفحة للعثين على دليل محدد.

  • الطريقة القديمة: تقرأ كل صفحة، كلمة بكلمة، على أمل ألا تفوتك الإشارة. تصبح مرهقاً ومتعباً.
  • AdaptToken: تقوم بتصفح الصفحات. عندما تصل إلى فصل يبدو "مألوفاً" ومنطقياً، تقرأه بتمعن. وعندما تصل إلى فصل يبدو مربكاً أو غير ذي صلة، تتخطاه. وفي اللحظة التي تجد فيها الدليل، تغلق الكتاب وتصرخ: "لقد حللت اللغز!"

يحول AdaptToken الذكاء الاصطناعي من قارئ بطيء ومرهق إلى محقق سريع وبديهي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →