← أحدث الأبحاث
💻 computer science

FLoC: Facility Location-Based Efficient Visual Token Compression for Long Video Understanding

يُعد FLoC إطار عمل لا يتطلب تدريباً ومستقلاً عن النماذج، حيث يستفيد من دالة تحديد الموقع (facility location function) وخوارزمية جشعة كسولة (lazy greedy algorithm) لاختيار مجموعة فرعية مدمجة ومتنوعة من الرموز المرئية (visual tokens) لفهم الفيديو الطويل بكفاءة، مما يقلل التكاليف الحسابية بشكل كبير مع الحفاظ على أداء يقارب المثالية عبر مختلف المعايكات.

المؤلفون الأصليون: Janghoon Cho, Jungsoo Lee, Munawar Hayat, Kyuwoong Hwang, Fatih Porikli, Sungha Choi

نُشر 2026-03-06
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Janghoon Cho, Jungsoo Lee, Munawar Hayat, Kyuwoong Hwang, Fatih Porikli, Sungha Choi

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول شرح فيلم مدته ثلاث ساعات لصديق، ولكن ليس لديك سوى دقيقة واحدة فقط للقيام بذلك.

إذا حاولت وصف كل إطار (frame) في الفيلم، فسينتهي وقتك قبل أن تصل حتى إلى الحبكة الدرامية. وإذا اخترت لحظات عشوائية، فقد تفوتك ملامح وجه الشرير أو دليل حاسم. وإذا اكتفيت بتلخيص "الأجزاء المملة"، فستفقد الإثارة.

هذه هي المشكلة التي تواجهها الحواسيب تماماً عند محاولة فهم الفيديوهات الطويلة (مثل لقطات كاميرات المراقبة، أو المحاضرات، أو فيديوهات العائلة).

المشكلة: بيانات كثيرة، وقدرة استيعابية محدودة

نماذج الذكاء الاصطناعي الحديثة (التي تُسمى النماذج متعددة الوسائط الضخمة - Large Multimodal Models) تشبه المحققين الأذكياء جداً. يمكنها النظر إلى فيديو والإجابة على أسئلة مثل: "ماذا يرتدي الشخص؟" أو "ماذا حدث في المنتصف؟".

ومع ذلك، لكي "يرى" الذكاء الاصطناعي فيديو ما، فإنه يقوم بتفكيكه إلى ملايين القطع الصغيرة التي تسمى الرموز البصرية (visual tokens).

  • المشكلة: الفيديو الطويل يولد عدداً هائلاً من هذه الرموز، مما يؤدي إلى إرهاق "عقل" الذكاء الاصطناعي (ذاكرته). الأمر يشبه محاولة قراءة كتاب مكون من 10,000 صفحة في جلسة واحدة؛ سيصاب الذكاء الاصطناعي بالإرهاه، أو ينسى الأشياء، أو ببساطة يتوقف عن العمل (يحدث له انهيار).
  • الحل الحالي: تحاول معظم الطرق حل هذه المشكلة إما عن طريق:
    1. تخطي الصفحات: حذف إطارات بشكل عشوائي (مثل تخطي كل صفحة عاشرة). المخاطرة: قد تفوتك نقطة التحول في القصة.
    2. تجميع الصفحات المتشابهة: تجميع المشاهد المتشابهة معاً. المخاطرة: إذا حدث حدث نادر ومهم (مثل سقوط مفتاح على الأرض)، فقد يتم دمجه مع "الخلفية المملة" ويتم حذفه.

الحل: FLoC (المكتبي الذكي)

يقترح المؤلفون طريقة جديدة تسمى FLoC (الضغط الفعال للرموز البصرية القائم على تحديد الموقع المرفقي - Facility Location-based Efficient Visual Token Compression).

تخيل الفيديو كأنه مكتبة ضخمة تحتوي على آلاف الكتب (الرموز). الذكاء الاصطناعي لديه مساحة لقراءة 10 كتب فقط (الميزانية المتاحة). كيف تختار الـ 10 كتب التي تحكي القصة بأكملها؟

1. مفهوم "تحديد الموقع المرفقي" (Facility Location)

تخيل أنك تفتتح سلسلة من مقاهي القهوة في مدينة جديدة. لديك ميزانية لافتتاح 5 مقاهٍ فقط.

  • الهدف: تريد وضعها بحيث يكون كل ساكن في المدينة قريباً من مقهى، ولكنك لا تريد وضع مقهيين بجانب بعضهما مباشرة (هدر للمال).
  • الاستراتيجية: أنت لا تختار أماكن عشوائية. بل تختار أماكن تغطي أكبر مساحة ممكنة مع ضمان التنوع. ستختار مقهى في الشمال، وآخر في الجنوب، وآخر في وسط المدينة المزدحم، وآخر في الضواحي الهادئة، وهكذا.

تقوم FLoC بفعل ذلك مع الرموز البصرية للفيديو:

  • تنظر إلى جميع "اللحظات" البصرية في الفيديو.
  • تختار مجموعة صغيرة من اللحظات التي تمثل الفيديو بأكمله (مثل المقاهي التي تغطي المدينة).
  • والأهم من ذلك، أنها تضمن عدم اختيار 5 لقطات لنفس الحائط الممل. بل ستختار الحائط، والشخص الذي يمر بجانبه، والسيارة التي تمر، واللحظة النادرة التي ينبح فيها الكلب. إنها توازن بين التمثيل (تغطية القصة الرئيسية) والتنوع (التقاط التفاصيل النادرة).

2. خدعة "الجشع الكسول" (The Lazy Greedy Trick) (دفعة السرعة)

عادةً، عملية إيجاد المواقع الخمسة المثالية لمقاهي القهوة هي كابوس رياضي يستغرق وقتاً طويلاً جداً للحساب.

  • الطريقة القديمة: فحص كل التشكيلات الممكنة لـ 5 مقاهٍ. (يستغرق ساعات).
  • طريقة FLoC (الجشع الكسول): تستخدم اختصاراً ذكياً. تختار أفضل مكان أولاً. ثم، بدلاً من إعادة حساب كل شيء للمكان الثاني، تستخدم تقديراً "كسولاً" لترى ما إذا كان المكان التالي الأفضل لا يزال جيداً بما يكفي. إذا كان كذلك، تختاره. وإذا لم يكن، تنتقل لما بعده.
  • النتيجة: تجد اختياراً قريباً من المثالية في جزء من الثانية. الأمر يشبه أمين مكتبة يمكنه مسح رف بسرعة واختيار الكتب العشرة الأكثر أهمية دون الحاجة لقراءة المكتبة بأكملها أولاً.

لماذا يهم هذا في الحياة الواقعية؟

بما أن FLoC لا تتطلب تدريباً (لا تحتاج لأن تُعلّم كيفية القيام بذلك) وهي جاهزة للاستخدام المباشر (تعمل مع أي ذكاء اصطناعي موجود)، فهي تعتبر تحولاً جذرياً في:

  • كاميرات المراقبة: بدلاً من تخزين تيرابايت من اللقطات، يمكن للذكاء الاصطناعي ضغط أيام من التصوير فوراً إلى "ملخص لأبرز الأحداث" المهمة، مما يوفر مساحات تخزين هائلة.
  • النظارات الذكية: إذا كنت ترتدي نظارات تسجل يومك، فإن FLoC تسمح للذكاء الاصطناعي الموجود على هاتفك بفهم ما رأيته دون استنزاف البطارية أو الحاجة إلى حاسوب خارق في السحابة.
  • الروبوتات: يمكن لروبوت يتنقل في مستودع معالجة ساعات من الفيديو في الوقت الفعلي للعث_ور على عنصر معين، بدلاً من التعثر في محاولة معالجة كل بكسل.

الخلا-صة

FLoC هي بمثابة محرر بارع. فبدلاً من قص الفيلم عشوائياً أو الاكتفاء بالاحتفاظ بالمشاهد "المتوسطة"، فهي تختار بذكاء الإطارات المحددة التي تحكي القصة بأكملها، مما يضمن عدم فقدان أي تفصيل مهم، وتفعل ذلك بسرعة فائقة. إنها تسمح للذكاء الاصطناعي أخيراً بـ "مشاهدة" الفيديوهات الطويلة دون أن يصاب بصداع.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →