OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning
يُعد OccamToken إطار عمل متكيف مع الميزانية ولا يتطلب تدريباً، يعمل على تحسين كفاءة استنتاج النماذج البصرية اللغوية عبر استبدال ترتيب الرموز المطلق الهش باختبار أدلة نسبي مرتكز على السجلات، مما يتيح ضغطاً فائقاً للرموز (على سبيل المثال، تقليل 2,880 رمزاً إلى حوالي 40 رمزاً) مع الحفاظ على أكثر من 93% من الدقة الأصلية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إليك شرح لورقة بحث OccamToken، مقسمة إلى مفاهيم بسية مع تشبيهات من الحياة اليومية.
المشكلة الكبرى: الكثير من الضجيج في المطبخ
تخيل أنك طاهٍ (الذكاء الاصطناي) تحاول طهي وجبة بناءً على طلب زبون (السؤال النصي) وكومة ضخمة من المكونات (الصورة).
في أنظمة الذكاء الاصطناعي الحديثة، عندما تعرض صورة، يقوم الكمبيوتر بتفكيكها إلى آلاف القطع الصغيرة التي تسمى "الرموز" (Tokens). إذا كان لديك صورة عالية الدقة، فهذا يشبه امتلاك كومة من 2,880 مكوناً. يجب على الطاهي النظر في كل واحدة منها قبل البدء في الطهي. هذا يستغرق وقتاً وجهداً هائلين (قوة حوسبية)، حتى لو كانت معظم تلك المكونات مجرد ضجيج خلفية مثل ذرة غبار على الطاولة أو بقعة سماء ضبابية.
الطريقة القديمة: قاعدة "أفضل 10"
في السابق، ولتوفير الوقت، حاول الناس التخلص من المكونات "الأقل أهمية". استخدموا قاعدة مثل: "احتفظ بأكثر 100 مكون مثير للاهتمام وارمِ الباقي".
تجادل الورقة البحثية بأن هذه القاعدة معطلة لسببين:
- تأثير "الطفل الصارخ": أحياناً، يمكن لمكون ممل (مثل جدار فارغ) أن يحصل بالخطأ على "درجة أهمية" عالية جداً بسبب طريقة حساب الكمبيوتر للأمور. هذا الضجيج العالي يغطي على المكونات الهادئة والمهمة (مثل تفصيل صغير في صورة)، مما يجعل الكمبيوتر يعتقد أن الأشياء المملة هي في الواقع الأكثر أهمية.
- مشكلة "مقاس واحد يناسب الجميع": القاعدة الثابتة (مثل "احتفظ بـ 100") لا تعمل مع كل صورة.
- إذا سألت: "هل هناك قطة؟" في صورة لغابة، فأنت تحتاج فقط للتحقق من بضعة أماكن. الاحتفاظ بـ 100 مكان سيكون هدراً.
- إذا سألت: "ما هو ملمس القماش؟" في صورة لسترة، فقد تحتاج للنظر في أماكن أكثر بك many. الاحتفاظ بـ 100 فقط قد يعني أنك ستفقد الإجابة.
الحل الجديد: OccamToken
ابتكر المؤلفون طريقة جديدة تسمى OccamToken. بدلاً من السؤال: "أيها هي الـ 100 الأفضل؟"، هم يسألون: "هل هذا المكون أكثر فائدة من 'وعاء المرجع' الخاص بنا؟"
إليك كيف يعمل الأمر، خطوة بخوة:
1. "وعاء المرجع" (رمز السجل - Register Token)
تخيل أن لديك وعاءً خاصاً على الطاولة يحتوي على عينة عامة ومتوسطة من "كل شيء في المطبخ". هو لا يعرف عن قطط محددة أو سترات محددة؛ هو فقط يحمل "جو الخلفية" للغرفة.
- لماذا يساعد: في النظام القديم، كان "الطفل الصارخ" (الضجيج الممل) يسرق كل الانتباه. لكن في هذا النظام الجديد، يقوم "وعاء المرجع" بامتصاص ذلك الضجيج. إنه يعمل كإسفنجة للإشارات العالية عديمة الفائدة.
- النتيجة: الآن، يمكن للكمبيوتر رؤية أي المكونات مميزة حقاً، لأن الضجيج قد تم كتمه.
2. المرحلة الأولى: "تنظيف الصورة" (تقليم التكرار - Redundancy Pruning)
قبل أن يقرأ الطاهي طلب الزبون، يقوم طاقم المطبخ بعمل مسح سريع.
- يقارنون كل مكون بـ "وعاء المرجع".
- إذا بدا المكون تماماً مثل الخلفية العامة في الوعاء، يتم التخلص منه.
- تشبيه: إذا كانت الصورة لشارع مزدحم، يقوم الطاقم برمي الـ 2,000 رمز التي تمثل فقط "السماء" أو "الرصيف الضبابي" لأن وعاء المرجع يعرف بالفعل ما تبدو عليه تلك الأشياء. إنهم يحتفظون بالمكونات التي تبدو مختلفة عن الوعاء (السيارات، الناس).
- الفائدة: هذا يحدث تلقائياً لكل صورة. الصورة البسيطة يتم تنظيفها بشكل كبير؛ والصورة المعقدة يتم تنظيفها بشكل أقل.
3. المرحلة الثانية: فحص "طلب الزبون" (تقليم الصلة - Relevance Pruning)
الآن يقرأ الطاهي السؤال المحدد: "هل الرجل الواقف على اليسار واقف؟"
- ينظر الطاهي إلى المكونات المتبقية.
- يقارنونهم بـ "وعاء المرجع" مرة أخرى، ولكن هذه المرة يسألون: "هل هذا المكون يساعد في الإجابة على السؤال المحدد بشكل أفضل من الخلفية العامة؟"
- تشبيه: إذا كان السؤال عن رجل، يحتفظ الطاهي بالمكونات التي تظهر الرجل والأرض التي يقف عليها. إذا كان السؤال عن قطة في الزاوية، يحتفظ الطاهي بتلك المكونات ويرمي المكونات الخاصة بالرجل.
- الفائدة: عدد المكونات التي يتم الاحتفاظ بها يتغير بناءً على السؤال. سؤال بسيط قد يحتاج 10 رموز فقط؛ سؤال صعب قد يحتاج 50.
النتائج: عمل أقل، نفس المذاق
اختبرت الورقة البحثية هذا على عدة نماذج ذكاء اصطناعي (مثل LLaVA و Qwen).
- الادعاء: تمكنوا من رمي 98.6% من المكونات (الانتقال من 2,880 رمزاً إلى حوالي 40 رمزاً) ومع ذلك حصلوا على الإجابة الصحيحة بنسبة 93% من المرات.
- التشبيه: الأمر يشبه إدراك أنك لست بحاجة لتذوق كل حبة أرز في القدر لتعرف ما إذا كان مالحاً. أنت فقط بحاجة لتذوق الملاعق الصحيحة.
- لا حاجة لإعادة التدريب: الجزء الأفضل هو أنهم لم يضطروا لإعادة تعليم الطاهي كيفية الطبخ. لقد قاموا فقط بتغيير القواعد لكيفية اختيار الطاهي للمكونات. إنه يعمل "جاهزاً للاستخدام" (out of the box).
الملخص
OccamToken هو مرشح ذكي يمنع الذكاء الاصطناعي من إضاعة الوقت في النظر إلى ضجيج الخلفية الممل. بدلاً من استخدام قاعدة صارمة مثل "احتفظ بأفضل 100"، فإنه يستخدم "وعاء مرجع" لمعرفة ما هو جديد ومفيد حقاً للسؤال المطروح. هذا يجعل الذكاء الاصطناعي أسرع وأرخص في التشغيل دون جعله "أقل ذكاءً".
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.