← أحدث الأبحاث
💻 computer science

Capturing Token Tendencies for Training-Free Token Pruning in Multimodal Large Language Models

تقترح هذه الورقة البحثية "التقليم المدرك للاتجاه" (Trend-aware Pruning)، وهو إطار عمل خالٍ من التدريب للنماذج اللغوية الكبيرة متعددة الوسائط يعمل على تحسين الكفاءة من خلال نمذجة التطور الديناميكي لأهمية الرموز عبر الطبقات لمنع الفقدان المبكر للمؤشرات البصرية الحرجة، محققاً تقليلاً في الرموز بنسبة تزيد عن 77.8% مع الحفاظ على أداء تنافسي.

المؤلفون الأصليون: Jie Ma, Zhike Qiu, Jie Gao, Jiayi Ji, Qian Chen, Xiaoshuai Sun, Rongrong Ji

نُشر 2026-07-31
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jie Ma, Zhike Qiu, Jie Gao, Jiayi Ji, Qian Chen, Xiaoshuai Sun, Rongrong Ji

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت فائق الذكاء كيف يفهم العالم من خلال عرض صور عليه وطرح الأسئلة. يسمى هذا المجال "نماذج اللغات الكبيرة متعددة الوسائط" (MLLMs). فكر في هذه النماذج كأنها محققون بارعون يمكنهم قراءة النص والنظر إلى الصور في نفس الوقت. لكي "يرى" الروبوت صورة ما، يقوم بتفكيكها إلى آلاف القطع الصغيرة التي تشبه أحجية الصور المقطوعة وتسمى "الرموز" (tokens). كل رمز هو عبيد صغير من الصورة، مثل قطعة من سماء زرقاء أو عجلة سيارة. تكمن المشكلة في أنه عندما تعرض على الروبوت صورة عالية الدقة، فإنه يشعر بالارتباك بسبب كثرة القطع. يحاول الانتباه لكل قطعة منها، مما يجعل الروبوت بطيئاً، ومكلفاً في التشغيل، وأحياناً مشوشاً بسبب كل هذا الضجيج.

لحل هذه المشكلة، حاول العلماء حيلة بسيطة: مجرد التخلص من القطع التي تبدو غير مهمة في البداية تماماً. الأمر يشبه حارس أمن في ملهى ليلي ينظر إلى الحشد ويطرد فوراً أي شخص لا يرتدي قميصاً بلون محدد. ولكن هنا تكمن العقبة: أحياناً يكون الشخص الأكثر إثارة للاهتمام في الغرفة مرتدياً قميصاً مملاً في البداية، لكنه يبدأ لاحقاً في الرقص ويصبح روح الحفلة بعد بضع دقائق. إذا طرد الحارس هذا الشخص مبكراً جداً، فقد تفسد الحفلة. تسأل هذه الورقة البحثية سؤالاً كبيراً: هل من الآمن اتخاذ قرار نهائي بشأن ما يجب الاحتفاظ به بناءً على نظرة خاطفة لثانية واحدة فقط، أم أننا بحاجة لمراقبة كيف تتغير الأشياء بمرور الوقت؟

يقول الباحثون وراء هذه الورقة، جيما ما وفريقه، إن طريقة "حارس الأمن" القديمة جامدة للغاية. هم يقترحون طريقة جديدة للتفكير تسمى "التقليم القائم على الاتجاه" (Trend-aware Pruning). فبدلاً من مجرد النظر إلى لقطة ثابتة للرموز التي تبدو مهمة الآن، تعمل طريقتهم كـ "مراقب صبور" يراقب الرموز بمرور الوقت ليرى "نزعاتها". لقد أدركوا أن بعض الرموز تشبه الزهور التي تتأخر في التفتح؛ قد تبدو هادئة وغير مهمة في الطبقات الأولى من عقل الروبوت، ولكن مع معالجة الروبوت للصورة بشكل أعمق، تصبح هذه الرموز فجأة حاسمة لفهم المشهد.

بنى الفريق نظاماً يتتبع "زخم" هذه الرموز. تخيل نهراً حيث توجد بعض الصخور التي تقبع ساكنة، بينما تنجرف أخرى ببطء نحو المنتصف. الطرق القديمة ستتجاهل الصخور المنجرفة لأنها ليست في المركز بعد. أما الطريقة الجديدة، فتلاحظ هذا الانجراف. فهي تراقب الرموز التي تظهر "اتجاهاً صاعداً" — أي أن أهميتها في ارتفاع حتى لو لم تكن ذات أولوية قصوى بعد. إذا بدأ أحد الرموز يبدو أكثر إثارة للاهتمام مع تعمق الروبوت في المعالجة، فإن النظام "ينقذه"، ويعيده إلى المحادثة قبل فوات الأوان. كما أنهم يراقبون الرموز التي "تتذبذب" (تصعد وتهبط) أو التي لديها "اتجاه هبوطي" (تتلاشى)، ويعاملون كل مجموعة بشكل مختلف بدلاً من التخلص منها جميعاً.

عندما اختبروا هذه الفكرة على "أدمغة" روبوتية شهيرة مثل LLaVA و Qwen، كانت النتائج مبهرة. لم تساعد الطريقة الجديدة الروبوت على توفير الوقت فحسب، بل ساعدته أيضاً على الأداء بشكل أفضل. في تجاربهم، تمكنوا من تقليل عدد الرموز البصرية بأكثر من 77.8%، تاركين الطبقة النهائية تعالج حوالي 23 رمزاً فقط. ورغم التخلص من هذا القدر الهائل من البيانات، حافظ الروبوت على 98.89% من أدائه الأصلي عند تقليل الرموز إلى النصف، وحافظ حتى على أداء قوي بنسبة 96.03% عند تقليل الرموز بنسبة تقارب 78%. وهذا أمر كبير لأن الطرق الأخرى التي تختار فقط الرموز "الأعلى" في البداية غالباً ما تفقد التفاصيل المهمة عندما تصبح عدوانية بهذا الشكل.

يشير المؤلفون إلى أن هذا النهج ينجح لأنه يحترم حقيقة أن فهم الصورة هو رحلة، وليس لحظة واحدة. ومن خلال السماح للروبوت بتغيير رأيه و"إعادة تنشيط" الرموز التي تم التغاضي عنها في البداية، فإنهم يمنعون فقدان الأدلة الحاسمة. وجدوا أن هذا النهج الديناميكي فعال بشكل خاص في المهام الصعبة مثل قراءة النصوص في الصور (OCR) أو رصد التفاصيل الصغيرة، حيث تفشل الطرق الثابتة غالباً. وبينما يعترفون بأن نظامهم يعتمد على نافذة مراقبة ثابتة ويمكن تحسينه للتعامل مع تسلسلات أطول، إلا أن عملهم يظهر أن مراقبة الاتجاه (Trend) في الانتباه هي وسيلة قوية لجعل هذه الروبوتات الذكية أسرع وأكثر حدة دون الحاجة إلى إعادة تدريبها من الصفر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →