← أحدث الأبحاث
💻 computer science

SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models

يُعد SepPrune إطار عمل خالٍ من التدريب، وقابل للتشغيل المباشر، يقلل بكفاءة التكاليف الحسابية في النماذج اللغوية الكبيرة متعددة الوسائط عبر استخدام رموز فاصل الوسائط كاستعلامات موحدة لتقليم 80.2% من الرموز البصرية مع الاحتفاظ بـ 96.3% من الدقة الأصلية.

المؤلفون الأصليون: Yuchen Wang, Qihui Zhu, Yang Liu, Xiaoyan Sun, Siying Wu

نُشر 2026-07-29
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yuchen Wang, Qihui Zhu, Yang Liu, Xiaoyan Sun, Siying Wu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت فائق الذكاء كيف يرى ويتحدث في آن واحد. هذا هو عالم النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs)، وهي نجوم الذكاء الاصطناعي التي يمكنها النظر إلى صورة لغروب الشمس وكتابة قصيدة عنها، أو تحليل مخطط معقد والإجابة على أسئلة حوله. وللقيام بذلك، لا يكتفي الروبوت بـ "النظر" إلى الصورة فحسب؛ بل يقوم بتفكيك الصورة إلى آلاف قطع الأحجية الرقمية الصغيرة المسماة "رموز الرؤية" (vision tokens). فكر في هذه الرموز كأنها بكسلات فردية، لكنها أذكى بكما؛ فهي تحمل كافة تفاصيل الصورة.

ومع ذلك، هناك عقبة. فعندما تغذي الروبوت بصورة عالية الدقة أو فيديو طويل، فإنه يولد عدداً هائلاً من هذه الرموز مما يجعل الروبوت يشعر بالارتباك. الأمر يشبه محاولة قراءة مكتبة من الكتب دفعة واحدة؛ حيث تصبح العملية بطيئة، ومكلفة، وغير فعالة. لقد حاول العلماء إصلاح ذلك عبر محاولة تخمين الأهمية من خلال مراقبة كيفية انتباه الروبوت للكلمات، بينما يحاول آخرون العثور على القطع المكررة. لكن هذه الأساليب غالباً ما تتعثر في تعقيداتها الخاصة، مما يبطئ الروبوت أكثر بدلاً من تسريعه. يبقى السؤال الكبير: كيف يمكننا إزالة الفوضى دون فقدان الصورة؟

هنا يبرز SepPrune، وهو أسلوب جديد يعمل كمحرر ذكي لهذه النماذج من الذكاء الاصطناعي. لاحظ الباحثون وراء هذا العمل شيئاً رائعاً أثناء مراقبتهم لكيفية تفكير هذه النماذج؛ فقد وجدوا أنه في المراحل الأولى من المعالجة، يولي النموذج قدراً هائلاً من الانتباه لرموز "الفصل" (separator tokens) الخاصة — وهي علامات صغيرة تقع بين بيانات الصورة وبيانات النص، وتعمل كجسر بين العالمين. وقد تبين أن هذه الفواصل هي المفتاح لفهم الصورة.

بدلاً من محاولة حساب أهمية كل رمز رؤية من خلال مقارنتها ببعضها البعض (وهو أمر بطيء وفوضوي)، يستخدم SepPrune رمز الفصل كـ "استعلام رئيسي" (master query). تخيل رمز الفصل كأنه مرشد سياحي يقف عند مدخل متحف؛ فبدلاً من سؤال كل لوحة بمفردها: "هل أنتِ مهمة؟"، ينظر المرشد إلى الغرفة بأكملها ويشير قائلاً: "أنتِ، وأنتِ، وأنتِ هي التحف الفنية؛ أما البقية فيمكنهم الانتظار". ومن خلال استخدام رمز الفصل لتسجيل درجات رموز الرؤية بسرعة، يستطيع SepPrane تحديد القطع الأكثر إفادة من الصورة فوراً والتخلص من الباقي.

النتائج مبهرة. فعند اختباره على نماذج قوية مثل Qwen2.5-VL-7B، تمكن SepPrune من التخلص من أكثر من 80% من رموز الرؤية مع الحفاظ على 96.3% من دقة النموذج الأصلية. وحتى عندما تم دفع عملية التقليم إلى حد أقصى بلغ 90.2% من الاختزال، حافظ النموذج على 87.2% من أدائه. ويمثل هذا قفزة كبيرة مقارنة بالأسالهم الأخرى، التي غالباً ما تكافح للحفاظ على دقة عالية كهذه عند إجراء عمليات قص عميقة. علاوة على ذلك، ولأن هذه الطريقة لا تتطلب حسابات معقدة بين كل رمز والآخر، فهي أسرع بكثير وتعمل بسلاسة مع تقنيات تسريع الأداء الموجودة حالياً.

لقد أثبت الباحثون أيضاً أن خياراتهم المحددة لها أهمية كبرى. فقد أظهروا أن استخدام رمز الفصل كـ "مرشد" يعمل بشكل أفضل من استخدام أجزاء أخرى من النص، وأن تجاهل "موقع" الرموز (أين تقع في الصورة) أثناء عملية الاختيار يمنع النموذج من الاحتفاظ بالقسم السفلي من الصورة عن طريق الخطأ. باختصار، يشير SepPrune إلى أنه من خلال الاستماع إلى الجسر الواصل بين الصورة والنص، يمكننا جعل خبراء الرؤية من الذكاء الاصطناعي أسرع وأكثر كفاءة دون جعلهم يفقدون التفاصيل التي تهم حقاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →