← أحدث الأبحاث
🤖 AI

CATP: Cross-Attention Token Pruning for Accuracy Preserved Multimodal Model Inference

تقدم الورقة البحثية CATP، وهي طريقة مبتكرة لتقليم الرموز (token pruning) تستفيد من آليات الانتباه المتقاطع واستراتيجية تصويت منقحة لتعزيز الدقة بشكل كبير مع الحفاظ على الكفاءة الحسابية في النماذج متعددة الوسائط الضخمة.

المؤلفون الأصليون: Ruqi Liao, Chuqing Zhao, Jin Li, Weiqi Feng, Yi Lyu, Bingxian Chen, Haochen Yang

نُشر 2026-02-16
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ruqi Liao, Chuqing Zhao, Jin Li, Weiqi Feng, Yi Lyu, Bingxian Chen, Haochen Yang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك أمين مكتبة فائق الذكاء ولكنه مرهق من العمل (نموذج BLIP-2)، تحاول الإجابة على أسئلة حول مكتبة ضخمة من الكتب والصور.

في كل مرة يطرح فيها شخص ما سؤالاً، يتعين على أمين المكتبة النظر في كل صفحة من كل كتاب وفي كل بكسل من كل صورة للعثور على الإجابة. يستغرق هذا وقتاً طويلاً ويجعل أمين المكتبة منهكاً (تكلفة حوسبية عالية).

المشكلة هي أن معظم تلك الصفحات والبكسلات ليست سوى ضجيج خلفية ممل (مثل لون السماء في صورة قطة، أو نوع الخط في صفحة نصية). هذه الأشياء لا تساعد فعلياً في الإجابة على السؤال.

الطريقة القديمة: "القطع العشوائي" (Brute Force)

حاولت الطرق السابقة تسريع العملية عن طريق التخلص عشوائياً من نصف الصفحات أو الاحتفاظ فقط بالصفحات التي تحتوي على أكبر وأبرز الكلمات.

  • طريقة الـ L2-norm: كانت تشبه الاحتفاظ فقط بالصفحات ذات الخط الأكبر.
  • طريقة الـ Self-attention: كانت تشبه الاحتفاظ فقط بالصفحات التي نظر إليها أمين المكتبة كثيراً داخل النص نفسه.

النتيجة: أصبح أمين المكتبة أسرع، لكنه بدأ يعطي إجابات سيئة للغاية. لقد تخلصوا من صورة القطة الحاسمة لأن الخط كان صغيراً، أو احتفظوا بصفحة مملة لمجرد أنها تحتوي على كلمة كبيرة. انخفضت الدقة بشكل حاد.

الطريقة الجديدة: CATP (الخاطبة الذكية)

قدم المؤلفون CATP (تقليم الرموز عبر الانتباه المتبادل - Cross-Attention Token Pruning). فكر في CATP كـ خاطبة ذكية تعرف بالضبط أي أجزاء من الصورة ذات صلة بالسؤال المطروح.

إليك كيف تعمل CATP، باستخدام تشبيه بسيط:

1. نظام التصويت (لجنة الحكام)

بدلاً من مجرد التخمين بشأن الأجزاء المهمة من الصورة، تقوم CATP بإنشاء لجنة من الحكام (طبقات الانتباه المتبادل - Cross-Attention Layers).

  • تخيل أن السؤال هو قائمة من "رموز الاستعلام" (الأشياء المحددة التي تسأل عنها).
  • وتخيل أن الصورة هي قائمة من "رموز الصورة" (قطع صغيرة من أحجية الصورة).

في الأيام الخوالي، كان الحكام يصرخون فقط "هذه القطعة مهمة!" بناءً على مدى علو صوتها.
لقد غيرت CATP القواعد: كل قطعة من الصورة تحصل على فرصة للتصويت لكل قطعة من السؤال.

  • إذا كانت قطعة من الصورة (مثل "كرة حمراء") ذات صلة وثيقة بجزء من السؤال ("أين الكرة؟")، فإن قطعة الصورة هذه تعطي صوتاً عالياً لجزء السؤال.
  • إذا لم يكن لقطعة من الصورة (مثل "سماء زرقاء") علاقة بالسؤال، فإنها تعطي صوتاً منخفضاً.

2. لوحة النتائج

تقوم CATP بجمع كل الأصوات.

  • أجزاء السؤال التي تحصل على الكثير من الأصوات من الصورة هي "كبار الشخصيات" (VIPs). وهي التي تبقى.
  • أجزاء السؤال التي تحصل على أصوات قليلة هي "الأجزاء المملة". ويتم استبعادها (تقليمها).

يضمن هذا أن أمين المكتبة يحتفظ فقط بأجزاء السؤال المرتبطة بالصورة فعلياً، مستبعداً ما سواها.

3. الترقية "الموزونة"

وجد البحث أيضاً أن قطع الصور ليست متساوية في الأهمية؛ فبعض قطع الصور أكثر "تأثيراً" من غيرها.

  • CATP القياسي: كل قطعة صورة تحصل على صوت واحد.
  • CATP الموزون: إذا كانت قطعة الصورة مهمة جداً بالفعل (لديها درجة "انتباه ذاتي" عالية)، فإن صوتها يُحتسب أكثر. الأمر يشبه إعطاء حكم رفيع المستوى "صوتاً خارقاً". هذا يجعل عملية التقليم أكثر ذكاءً.

لماذا يعد هذا أمراً كبيراً؟

اختبر الباحثون هذه الطريقة في مهمة الإجابة على الأسئلة البصرية (النظر إلى صورة والإجابة على سؤال).

  • الطرق القديمة: عندما قاموا بقطع 75% من البيانات لتوفير الوقت، انخفضت الدقة إلى لا شيء تقريباً (من 1% إلى 9%). كان الأمر يشبه مطالبة أمين مكتبة بقراءة صفحة واحدة فقط من كتاب مكون من 100 صفحة وتوقع معرفته للقصة بأكملها.
  • CATP: حتى عندما تم قطع 75% من البيانات، ظلت الدقة مرتفعة بشكل مدهش (حوالي 30% إلى 44%).

الخلاصة:
CATP تشبه إعطاء أمين المكتبة قلم تحديد (Highlighter) يقوم فقط بتحديد الجمل في الكتاب التي تجيب فعلياً على السؤال. هذا يسمح لأمين المكتبة بتجاهل 80% من الكتاب، وإنجاز المهمة أسرع بـ 8 مرات، ومع ذلك يقدم إجابة صحيحة.

يدعي البحث أن هذه الطريقة أكثر دقة بما يصل إلى 12 مرة من طرق "القطع" السابقة، مما يحل المشكلة الكبيرة المتمثلة في كيفية جعل الذكاء الاصطناعي أسرع دون جعله أقل ذكاءً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →