IDPruner: Harmonizing Importance and Diversity in Visual Token Pruning for MLLMs
يُعد IDPruner إطار عمل مبتكر لتقليم الرموز المرئية للنماذج اللغوية الكبيرة متعددة الوسائط، حيث يستفيد من خوارزمية "الارتباط الأقصى للمعلومات ذات الصلة" (Maximal Marginal Relevance) لتحقيق توازن أمثل وفق منحنى باريتو بين أهمية الرموز وتنوعها دون الحاجة إلى خرائط الانتباه، مما يتيح تقليماً فعالاً بلمحة واحدة مع الحفاظ على أداء يضاهي أحدث المعاياي عبر مختلف البنيات والمهام.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك صورة فوتوغرافية ضخمة وعالية الدقة لشارع مدينة مزدحم. تريد عرض هذه الصورة على مساعد ذكاء اصطناعي ذكي للغاية حتى يتمكن من الإجابة على أسئلة مثل: "ماذا يفعل الشخص الذي يرتدي المعطف الأحمر؟" أو "هل هناك كلب في الجوار؟"
المشكلة هي أن الكمبيوتر لا يرى هذه الصورة كصورة، بل كآلاف من قطع الأحجية الصغيرة (التي تسمى "tokens"). معالجة كل هذه القطع تستغرق وقتاً وطاقة هائلين، تماماً مثل محاولة قراءة كل كلمة في كتاب مكون من 500 صفحة لمجرد العثور على جملة واحدة محددة.
تقليم الرموز البصرية (Visual Token Pruning) هو فن التخلص من قطع الأحجية غير الضرورية قبل أن يقرأها الذكاء الاصطناعي، والاحتفاظ فقط بالقطع الأكثر أهمية. ولكن الجزء الصعب هو: كيف تقرر ما الذي يجب الاحتفاظ به؟
الطريقتان القديمتان (ولماذا فشلتا)
قبل هذا البحث، جرب الباحثون استراتيجيتين رئيسيتين، وكلتاهما كانت تعاني من عيوب:
"صائد الضجيج" (القائم على الأهمية):
- كيف يعمل: يبحث عن الأجزاء "الأعلى صوتاً" أو الأكثر وضوحاً في الصورة. إذا كانت هناك سيارة حمراء زاهية، فهو يحتفظ بها. إذا كان هناك وجه شخص، فهو يحتفظ به.
- العيب: يصبح مهووساً بالموضوع الرئيسي لدرجة أنه يتجاهل الخلفية. إذا كان السؤال "ما نوع الأشجار الموجودة في الخلفية؟"، فإن هذا الذكاء الاصطناعي سيفشل لأنه حذف الأشجار للتركيز على السيارة. الأمر يشبه قراءة عنوان إخباري مع تجاهل المقال بأكيمله.
"مخطط التشتت" (القائم على التنوع):
- كيف يعمل: يحاول اختيار قطع مختلفة تماماً عن بعضها البعض لضمان تغطية الصورة بأكملها. إنه ينثر اختياراته مثل حبات السكر فوق قطعة دونات.
- العيب: قد يحتفظ بقطعة من السماء، وقطعة من الرصيف، وقطعة من سحابة عشوائية، لكنه قد يفتقد الموضوع المهم الفعلي (مثل السيارة الحمراء) لأن تلك السيارة تبدو متشابهة جداً مع أجزاء أخرى من الصورة. الأمر يشبه أخذ عينة من كل شيء ولكن مع تفويت النكهة الأساسية.
الحل الجديد: IDPruner (المنسق الذكي)
أدرك مؤلفو هذا البحث، IDPrally (IDPruner)، أن أفضل نهج ليس اختيار أحدهما، بل إيجاد التوازن المثالي. لقد استخدموا حيلة رياضية ذكية تسمى الارتباط الهامشي الأقصى (Maximal Marginal Relevance - MMR).
إليك تشبيه بسيط لشرح كيفية عمل IDPruner:
تخيل أنك منسق (Curator) لمتحف، ولديك مجموعة ضخمة تضم 1,000 لوحة، ولكن يمكنك فقط تعليق 10 منها على الحائط.
- "صائد الضجيج" القديم سيعلق فقط الـ 10 لوحات الأكثر شهرة. ولكن إذا كانت جميعها لوحات طبيعية، فسيفتقر متحفك إلى التنوع.
- "مخطط التشتت" القديم سيختار 10 لوحات مختلفة تماماً عن بعضها (بورتريه، منظر طبيعي، طبيعة صامتة، لوحة تجريدية). ولكن إذا كانت الـ 10 لوحات الأكثر شهرة كلها لوحات طبيعية، فقد تفوتك أفضل الأعمال الفنية تماماً.
استراتيجية IDPruner:
إنه يستخدم قاعدة من خطوتين لكل لوحة يفكر فيها:
- هل هي مشهورة؟ (الأهمية: هل لها قيمة عالية؟)
- هل هي فريدة؟ (التنوع: هل تشبه كثيراً اللوحات التي اخترتها بالفعل؟)
إنه يحسب درجة: "الشهرة ناقص التكرار".
- إذا كانت اللوحة مشهورة جداً ولكنها تشبه تماماً لوحة اخترتها بالفعل، فإن عقوبة "التكرار" تخفض درجتها. لذا تتجاوزها.
- إذا كانت اللوحة أقل شهرة قليلاً ولكنها تقدم منظوراً جديداً تماماً، فإن درجتها ترتفع. لذا تختارها.
بهذه الطوية، ستكون لوحاتك العشر النهائية مزيجاً من الموضوعات الأكثر أهمية ونطاق متنوع من المشاهد. ستحصل على أفضل ما في العالمين.
لماذا هذا مهم (الأجزاء "السحرية")
يسلط البحث الضوء على ثلاثة أشياء رائعة حول IDPruner:
- إنه عملية "ضربة واحدة": تحاول بعض الطرق الأخرى تقليم الصورة ببطء، خطوة بخطوة، وهذا أمر بطيء. أما IDPruner فيتخذ جميع قراراته دفعة واحدة وبسرعة كبيرة. إنه مثل الطاهي الذي يقطع جميع الخضروات دفعة واحدة بدلاً من تقطيعها واحدة تلو الأخرى.
- إنه يتوافق مع التقنيات السريعة: تستخدم الحواسيب الحديثة أداة خاصة لتعزيز السرعة تسمى FlashAttention. العديد من طرق التقليم تكسر هذه الأداة. تم تصميم IDPruner ليعمل بشكل مثالي معها، مما يعني أنه سريع وفعال في آن واحد.
- إنه يعمل في كل مكان: اختبر المؤلفون هذا النموذج على العديد من نماذج الذكاء الاصطنا المختلفة (مثل Qwen و LLaVA) وعلى مهام متنوعة (قراءة الرسوم البيانية، رصد الأشياء، فهم الفيديوهات). في معظم الحالات، حافظ IDPrencer على ذكاء النموذج حتى عندما تخلصوا من 75% إلى 90% من بيانات الصورة.
الخلاصة
IDPruner هو بمثابة محرر فائق الذكاء للبيانات المرئية. بدلاً من قطع الأجزاء "المملة" بعشوائية أو الاحتفاظ بالأجزاء "المختلفة" فقط، فإنه يستخدم معادلة متوازنة لضمان أن يرى الذكاء الاصطناعي الشخصيات الرئيسية للقصة مع استيعاب المحيط أيضاً.
النتيجة؟ نماذج ذكاء اصطناعي أسرع بكثير وأقل تكلفة في التشغيل، ولكنها تظل بنفس ذكاء النسخ الثقيلة والبطيئة. إنه الفرق بين حمل حقيبة ظهر ثقيلة مليئة بالصخور وبين حمل حقيبة تحتوي فقط على الأدوات الأساسية التي تحتاجها للرحلة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.