← أحدث الأبحاث
💻 computer science

HAWK: Head Importance-Aware Visual Token Pruning in Multimodal Models

تُعد HAWK طريقةً لتقليم الرموز المرئية دون الحاجة إلى تدريب لنماذج اللغات الكبيرة متعددة الوسائط، حيث تستفيد من الوعي بأهمية الرأس والانتباه الموجه بالنص لتقليل زمن الاستجابة واستهلاك الذاكرة بشكل كبير مع الحفاظ على دقة تضاهى أعلى المستويات من خلال الاحتفاظ انتقائياً بالرموز المرئية ذات الصلة بالمهمة.

المؤلفون الأصليون: Qihui Zhu, Tao Zhang, Yuchen Wang, Zijian Wen, Mengjie Zhang, Shuangwu Chen, Xiaobin Tan, Jian Yang, Yang Liu, Zhenhua Dong, Xianzhi Yu, Yinfei Pan

نُشر 2026-04-10
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Qihui Zhu, Tao Zhang, Yuchen Wang, Zijian Wen, Mengjie Zhang, Shuangwu Chen, Xiaobin Tan, Jian Yang, Yang Liu, Zhenhua Dong, Xianzhi Yu, Yinfei Pan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول شرح مشهد معقد من فيلم لصديق لك. لديك نص (السيناريو) وملف فيديو بدقة 4K (الصورة).

المشكلة: كثرة البيانات
نماذج اللغات الكبيرة متعددة الوسائط (MLLMs) تشبه المساعدين الأذكياء للغاية الذين يمكنهم "مشاهدة" الفيديوهات و"قراءة" النصوص في نفس الوقت. ومع ذلك، عندما تنظر هذه النماذج إلى صورة، فهي لا ترى مجرد صورة؛ بل تقوم بتفكيكها إلى مئات القطع الصغيرة التي تشبه قطع الأحجية (البازل) وتسمى الرموز البصرية (visual tokens).

إذا كانت لديك صورة عالية الدقة أو فيديو طويل، سينتهي الأمر بالذكاء الاصطناعي مع آلاف من قطع الأحجية هذه. الأمر يشبه محاولة حل أحجية مكونة من 10,000 قطعة بينما يسألك صديقك أسئلة في نفس الوقت. سيشعر الذكاء الاصطناعي بالإرهاق، ويستغرق وقتاً طويلاً في التفكير، ويستهلك كمية هائلة من ذاكرة الكمبيوتر (RAM). وهذا يجعله بطيئاً ومكلفاً للتشغيل، خاصة في التطبيقات التي تتطلب استجابة فورية.

الحل القديم: نهج "المتوسط"
لحل هذه المشكلة، حاول الباحثون استخدام تقليم الرموز (token pruning) — وهو ببساطة التخلص من قطع الأحجية التي تبدو غير مهمة حتى يضطر الذكاء الاصطنانا لتركيز جهده على القطع الأكثر أهمية فقط.

كانت الطرق السابقة تعمل مثل "محرر كسول" يفترض أن كل جزء من دماغ الذكاء الاصطناعي يعمل بنفس الطريقة تماماً. كانوا ينظرون إلى قطع الأحجية ويقولون: "لنحتفظ بالقطع الأكثر تشابهاً مع بعضها البعض" أو "لنحتفظ بالقطع التي نظر إليها الذكاء الاصطناعي أكثر، مع معاملة كل 'عيونه' بالتساوي".

الاكتشاف: الذكاء الاصطناعي لديه "عيون" متخصصة
اكتشف مؤلفو هذه الورقة البحثية، HAWK، شيئاً مذهلاً: الذكاء الاصطناعي لا يمتلك "عيوناً" متطابقة. بل لديه العديد من رؤوس الانتباه (attention heads) (فكر فيها كأجهزة استشعار أو عدسات متخصصة).

  • قد تكون "عين" واحدة بارعة في رصد النصوص في الصورة.
  • وعين أخرى قد تكون ممتازة في التعرف على الوجوه.
  • وثالثة قد تكون مركزة على المناظر الطبيعية في الخلفية.

إذا عاملت كل هذه العيون بنفس الطريقة، فقد تتخلص بالخطأ من قطعة الأحجية التي كانت "عين" (مستشعر النص) تراقبها، بينما تحتفظ بقطعة كانت "عين" (مستشعر الخلفية) تحدق فيها (والتي قد تكون غير ذات صلة بسؤالك).

حل HAWK: المحرر الذكي
يعمل HAWK كـ محرر ذكي ومتخصص. فبدلاً من معاملة دماغ الذكاء الاصطناعي ككتلة واحدة، هو يفهم أن أجزاء مختلفة من الدماغ أكثر أهمية لمهام معينة.

إليك كيف يعمل HAWK، باستخدام تشبيه بسيط:

  1. خريطة "الرأس" (الأهمية الثابتة): قبل أن ينظر الذك de الذكاء الاصطناعي إلى صورة محددة، يقوم HAWK بدراسة لمرة واحدة لتحديد أي "العيون" هي الأكثر أهمية. الأمر يشبه معرفة أنك لوظيفة معينة، تحتاج إلى "نظارات القراءة" أكثر من "نظارات الرؤية الليلية". يقوم HAWK بإنشاء خريطة للأهمية لكل عين.
  2. دليل "السؤال" (الانتباه الديناميكي): عندما تطرح سؤالاً على الذكاء الاصطناعي (مثلاً: "أين طاولة النزهة؟")، ينظر HAWK إلى سؤالك ويسأل: "أي من عيون الذكاء الاصطناعي هي الأنسب للإجابة على هذا السؤال تحديداً؟"
  3. القص الذكي: يدمج HAWK هاتين المعلومتين معاً. يقول: "حسناً، 'عين قراءة النص' مهمة جداً، والسؤال يتعلق بالطاولة. لنحتفظ بقطع الأحجية التي تنظر إليها 'عين قراءة النص'، ونرمي الباقي".

لماذا يعد هذا أمراً مهماً؟

  • لا يتطلب تدريباً: لا تحتاج لإعادة تعليم الذكاء الاصطناعي كيفية القيام بذلك. الأمر يشبه إعطاء نظارات جديدة لخبير موجود بالفعل؛ يمكنه استخدامها فوراً.
  • زيادة هائلة في السرعة: من خلال التخلص من ما يصل إلى 80% من قطع الأحجية غير المفيدة، ينهي الذكاء الاصطناعي مهمته بشكل أسرع بكثير.
  • دقة أفضل: لأنه يحتفظ بـ القطع الصحيحة (تلك التي تهتم بها العيون المتخصصة)، فإنه لا يصاب بالارتباك. في الاختبارات، حتى بعد التخلص من 80% من البيانات، ظل الذكاء الاصطناعي يجيب بشكل صحيح بنسبة 96% مقارما عندما كان يرى كل شيء.

باختاًصر
فكر في HAWK كـ مساعد شخصي لذكاء اصطناعي فائق الذكاء. بدلاً من إلقاء مكتبة كاملة من الكتب على مكتب الذكاء الاصطناعي وقول "اقرأ هذا"، يقوم HAWK بمسح سريع للكتب، ويدرك أي الفصول ذات الصلة بسؤالك المحدد، ثم يسلم الذكاء الاصطناعي تلك الصفحات القليلة ذات الصلة فقط. بهذه الطريقة، يقرأ الذكاء الاصطناعي بشكل أسرع، ويستهلك طاقة أقل، ولا يزال يفهم القصة بشكل مثالي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →