ApET: Approximation-Error Guided Token Compression for Efficient VLMs
تُعد ApET إطار عمل فعال لضغط الرموز (tokens) وخالٍ من آلية الانتباه لنماذج الرؤية واللغة، حيث يستفيد من أخطاء التقريب الناتجة عن إعادة البناء الخطي لتحديد الرموز البصرية الزائدة واستبعادها، مما يحقق وفراً كبيراً في الحوسبة مع الحفاظ على الأداء أو حتى تحسينه وضمان التوافق مع FlashAttention.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مساعداً آلياً فائق الذكاء (نموذج لغوي بصري) يمكنه النظر إلى الصور ومقاطع الفيديو والإجابة على الأسئلة المتعلقة بها. للقيء بهذا، يقوم الروبوت بتفكيك كل صورة إلى آلاف القطع الصغيرة التي تشبه قطع الأحجية وتسمى "الرموز" (Tokens).
المشكلة؟ بعض هذه القطع حيوية للغاية (مثل وجه شخص أو علامة توقف)، لكن الكثير منها ليس سوى ضجيج خلفية ممل (مثل بقعة من السماء الزرقاء أو جدار ضبابي). ولأن الروبوت يحاول معالجة كل قطعة بمفردها، فإنه يصاب بالإرهاق، ويعمل ببطء، ويستهلك الكثير من الطاقة.
الطريقة القديمة: "مسابقة الشعبية"
في السابق، حاول الباحثون تسريع العملية عبر سؤال الروبوت: "ما هي القطع التي تنظر إليها أكثر من غيرها؟" استخدموا آلية تسمى "الانتباه" (Attention).
فكر في هذا الأمر كمعلم في فصل دراسي لا ينتبه إلا للطلاب الجالسين في الصف الخلفي لأنهم أكثر صخباً، أو الطلاب الذين يرفعون أيديهم كثيراً.
- العيب: هذا يخلق انحيازاً. قد يتجاهل الروبوت تفصيلاً صغيراً ولكن مهماً (مثل طائر صغير في شجرة) لمجرد أنه في جزء "هادئ" من الصورة، بينما يصب تركيزه على مساحة واسعة وفارغة من السماء لمجرد أنها في مكان "صاخب".
- الخلل التقني: أيضاً، شرائح الكمبيوتر الحديثة (مثل FlashAttention) مصممة لتعمل بسرعة فائقة من خلال تجاهل هذه "أصوات الشعبية". لذا، لم تستطع الطرق القديمة استخدام أسرع الشرائح، مما جعلها بطيئة في الواقع العملي.
الطريقة الجديدة: ApET (اختبار إعادة البناء)
قرر مؤلفو هذه الورقة البحثية، ApET، التوقف عن سؤال الروبوت عما "يحبه" والبدء في سؤاله عما "يحتاجه". لقد استخدموا خدعة ذكية تعتمد على إعادة البناء (Reconstruction).
تخيل أن لديك أحجية (بازل)، لكنك تريد رمي القطع التي ليست ضرورية لإعادة بناء الصورة.
- الإعداد: تختار مجموعة صغيرة وعشوائية من القطع (تسمى "الرموز الأساسية" - Basis Tokens).
- الاختبار: تحاول إعادة بناء الصورة بأكملها باستخدام تلك القطع القليلة فقط.
- النتيجة:
- إذا حاولت إعادة بناء قطعة من السماء باستخدام بضع قطع من السماء فقط، فستبدو مثالية. "الخطأ" سيكون ضئيلاً جداً. الاستنتاج: هذه القطعة لم تكن مهمة كثيراً؛ يمكننا رميها.
- إذا حاولت إعادة بناء عين قطة باستخدام قطع من السماء فقط، فستبدو النتيجة سيئة للغاية. "الخطأ" سيكون ضخماً! الاستنتاج: هذه القطعة فريدة وحيوية! احتفظ بها.
تقوم ApET ببساطة بالاحتفاظ بالقطع التي يصعب إعادة بناؤها (خطأ عالٍ) وترمي القطع التي يسهل تخمينها (خطأ منخفض).
لماذا يعد هذا تغييراً جذرياً؟
- لا يوجد انحياز: لا يهتم بمكان وجود القطعة في الصورة (أعلى، أسفل، يسلاً، يميناً). هو يهتم فقط بما إذا كانت القطعة فريدة ومعلوماتية. الأمر يشبه تقييم الطالب بناءً على درجاته الفعلية في الاختبار، وليس بناءً على مدى صوته في الفصل.
- سريع للغاية: لأنه لا يحتاج لسؤال الروبوت "إلى ماذا تنظر؟"، فإنه يعمل بشكل مثالي مع أسرع شرائح الكمبيوتر (FlashAttention). إنه يشبه الانتقال من سيارة ذات ناقل حركة يدوي إلى سيارة كهربائية عالية السرعة.
- نتائج أفضل: للمفاجأة، من خلال رمي القطع "المملة"، يصبح الروبوت في الواقع أكثر ذكاءً. الأمر يشبه قيام الطاهي بإزالة الخضروات المائية من الحساء لتبرز نكهة اللحم. في اختبارات الفيديو، حققت ApET في الواقع أداءً أفضل من النموذج الأصلي غير المختصر!
الخلاصة
ApET هو مرشح ذكي ينظف الضجيج البصري قبل أن يصل إلى دماغ الروبوت. يستخدم خدعة رياضية بسيطة (التحقق من مدى صعوبة تخمين قطعة مفقودة) لتقرير ما يجب الاحتفاظ به. هذا يجعل الذكاء الاصطناعي أسرع، وأرخص في التشغيل، وأكثر دقة بشكل مفاجئ، خاصة في مقاطع الفيديو الطويلة حيث يمكن للطرق القديمة أن ترتبك وتتعب.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.