← أحدث الأبحاث
💻 computer science

OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models

يُعد OmniSelect إطار عمل لتقليم الرموز (token pruning) يتكيف مع الأنماط المختلفة ولا يتطلب تدريباً، حيث يقوم ديناميكياً باختيار وتطبيق استراتيجيات ضغط بناءً على الصلة بين الأنماط المتعددة لتقليل تسلسلات الرموز متعددة الوسائط بكفاءة في نماذج OmniLLMs مع الحفاظ على الأداء.

المؤلفون الأصليون: Morunliu Yang, Ruotao Xu, Le Li, Yue Wang, Jianxin Zhang, Juntao Li, Yihang Lou, Siwei Feng, Peifeng Li

نُشر 2026-05-19
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Morunliu Yang, Ruotao Xu, Le Li, Yue Wang, Jianxin Zhang, Juntao Li, Yihang Lou, Siwei Feng, Peifeng Li

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحث OmniSelect، مترجم إلى لغة بسيطة مع استخدام تشبيهات إبداعية.

المشكلة الكبيرة: ازدحام مروري بسبب "كثرة المعلومات"

تخيل أن لديك مساعداً آلياً فائق الذكاء (وهو Omni-LLM) يمكنه مشاهدة الفيديوهات والاستماع إلى الصوت في نفس الوقت. لفهم الفيديو، لا يكتفي هذا الروبوت برؤية "سيارة" فحسب؛ بل يقوم بتفكيك الفيديو إلى آلاف القطع الرقمية الصغيرة التي تسمى الرموز (tokens). وهو يفعل الشيء نفسه بالنسبة للصوت.

إذا قمت بتغذية الروبوت بفيديو طويل مع صوت، فسيشعر بالإرهاق. الأمر يشبه محاولة قراءة كتاب مكون من 1000 صفحة أثناء الاستماع إلى "بودكاست" مدته 10 ساعات في آن واحد. سيعلق الروبوت في "ازدحام مروري" من البيانات، مما يستهلك كل ذاكرته ويستغرق وقتاً طويلاً للإجابة على سؤال بسيط مثل: "ما كان لون الشاحنة؟"

لحل هذه المشكلة، يحاول الباحثون عادةً التخلص من بعض قطع الأحجية (الرموز) لجعل المهمة أسرع. لكن المشكلة هي أن: معظم الطرق الحالية تشبه عامل النظافة الأخرق. فهي تتخلص من القطع بشكل عشوائي أو تستخدم قاعدة "مقاس واحد يناسب الجميع". قد يتخلصون من أهم إطار في حادث سيارة لمجرد أنه حدث في نفس وقت وجود صوت ممل، أو قد يحتفظون بغرفة فارقة وصامتة لمجرد أن الموسيقى الخلفية كانت صاخبة.

الحل: OmniSelect (المحرر الذكي)

يقترح المؤلفون طريقة جديدة تسمى OmniSelect. فكر في OmniSelect ليس كعامل نظافة، بل كـ محرر أفلام ذكي ومتكيف يعرف بالضبط ما الذي يريد المشاهد معرفته قبل أن يبدأ في عملية القص.

إن OmniSelect "لا يحتاج إلى تدريب" (training-free)، مما يعني أنه لا يحتاج للعودة إلى المدرسة لتعلم كيفية القيام بذلك؛ بل يستخدم مجموعة ذكية من القواعد لمعرفة ما يجب الاحتفاظ به وما يجب حذفه أثناء العمل.

كيف يعمل: العملية المكونة من ثلاث خطوات

1. "فحص الصلة" (من هو النجم؟)

قبل قص أي شيء، يطرح OmniSelect سؤالاً بسيطاً: "بالنسبة لهذا السؤال تحديداً، هل الإجابة مخبأة في الفيديو أم في الصوت؟"

يستخدم أداة خفيفة (تسمى AudioCLIP) لمسح السؤال والفيديو والصوت.

  • السيناريو أ: تسأل: "كيف حال الطقس؟" ترى الأداة أن الفيديو هو النجم. يقرر OmniSelect أن يكون مرتكزاً على الفيديو (Video-Centric). فهو يحتفظ بالإطارات المرئية ويحذف الصوت.
  • السيناريو ب: تسأل: "ما هي الأغنية التي تعمل الآن؟" ترى الأداة أن الصوت هو النجم. يصبح OmniSelect مرتكزاً على الصوت (Audio-Centric). فهو يحتفظ بالصوت ويحذف الفيديو.
  • السيناريو ج: تطلب: "صف المشهد بأكمله." كلاهما مهم. يختار OmniSelect التقليم الموحد (Uniform Pruning)، حيث يحذف كليهما بالتساوي.

تشبيه: تخيل أنك تجهز حقيبة سفر لرحلة. إذا كنت ذاهباً إلى الشاطئ، فستحزم ملابس السباحة والنظارات الشمسية (مرتكز على الفيديو). إذا كنت ذاهباً إلى حفلة موسيقية، فستحزم التذاكر وسدادات الأذن (مرتكز على الصوت). يحدد OmniSelect الوجهة قبل أن تبدأ في حزم الحقائب، حتى لا تضيع مساحة في أشياء غير ضرورية.

2. "الميزانية الديناميكية" (تخصيص المساحة)

بمجرد أن يعرف أي "نجم" (الفيديو أو الصوت) هو الأكثر أهمية، فإنه لا يقطع بشكل عشوائي، بل ينشئ ميزانية ديناميكية.

إذا كان الفيديو هو النجم، فإنه يقول: "حسناً، لدينا ميزانية ضيقة. سنحتفظ بـ 90% من إطارات الفيديو ولكن بـ 30% فقط من الصوت." وإذا كان الصوت هو النجم، فإنه يعكس السيناريو. إنه يضمن أن الأجزاء الأكثر إفادة في الفيديو أو الصوت تحصل على أكبر قدر من "المساحة" في ذاكرة الروبوت.

3. "القص الدقيق" (استراتيجية Bottom-K)

داخل كل جزء زمني (مثل مقطع مدته 5 ثوانٍ)، يتعين على OmniSelect تحديد قطع الأحجية المحددة التي يجب التخلص منها.

  • الطريقة القديمة (Top-K): تحتفظ بعض الطرق بالأجزاء "الأعلى صوتاً" أو "الأكثر نشاطاً". هذا يشبه الاحتفاظ بأكثر البكسلات ألواناً في صورة ما، حتى لو كانت مجرد ضجيج.
  • طريقة OmniSelect (Bottom-K): هذا هو التحول الذكي في الورقة البحثية. بدلاً من الاحتفاظ بالقطع "الأعلى صوتاً"، يحتفظ بالقطع الأقل تشابهاً مع بعضها البعض.
    • تشبيه: تخيل غرفة مليئة بالناس يتحدثون. إذا كان الجميع يقولون الشيء نفسه تماماً، فأنت تحتاج فقط للاستماع إلى شخص واحد. يحدد OmniSelect "الأصداء" (الرموز المكررة) ويُسكتها، محتفظاً فقط بالأصوات الفريدة التي تضيف معلومات جديدة. هذا يضمن أن الروبوت يرى الصورة الكاملة، وليس فقط الجزء الأكثر صخباً.

النتائج: سريع، رشيق، وذكي

اختبرت الورقة البحثية نظامها على حجمين مختلفين من الروبوتات (3 مليار و7 مليار بارامتر) باستخدام اختبارات فيديو وصوت من العالم الحقيقي.

  • السرعة: جعل OmniSelect الروبوت أسرع بمقدار 1.19 إلى 1.33 مرة. الأمر يشبه الترقية من دراجة هوائية إلى سكوتر.
  • الذاكرة: وفر حوالي 2.6 إلى 2.8 جيجابايت من الذاكرة. هذا يشبه إخلاء خزانة كاملة من الأشياء غير الضرورية لكي يتمكن الروبوت من استيعاب أشياء أكثر أهمية.
  • الدقة: رغم التخلص من 70% من البيانات، إلا أن الروبوت لا يزال يجيب على 94% إلى 99% من الأسئلة بشكل صحيح مقارنة بقراءة الفيديو بالكامل. وفي بعض الحالات، من خلال إزالة "الضجيج" (البيانات المكررة)، أصبح الروبوت في الواقع أفضل في الإجابة على الأسئلة مما كان عليه عندما كان لديه كل البيانات.

الملخص

OmniSelect هو نظام ذكي يتوقف عن معاملة جميع بيانات الفيديو والصوت على أنها متساوية. بدلاً من ذلك، يعمل كالمحقق:

  1. يكتشف ما إذا كانت الإجابة تكمن في العينين (الفيديو) أم في الأذنين (الصوت).
  2. يخصص ميزانية الذاكرة الخاصة به بناءً على ذلك.
  3. يقص الأجزاء المملة والمكررة بصرامة مع الاحتفاظ بالتفاصيل الفريدة والمهمة.

النتيجة هي ذكاء اصطناعي فائق الكفاءة يمكنه فهم الفيديوهات الطويلة والأصوات المعقدة دون أن يتعثر، وكل ذلك دون الحاجة إلى إعادة تدريبه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →