Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders
تتحدى هذه الورقة البحثية الافتراض القائل بأن دمج مشفرات رؤية متعددة يحسن بطبيعته النماذج اللغوية الكبيرة متعددة الوسائط، وذلك من خلال إثبات أن التكرار المنتشر في المشفرات غالباً ما يسمح بتحقيق مكاسب في الأداء والكفاءة عند إزالة مشفرات محددة، عبر استخدام أسلوب الحجب المنهجي ومقاييس جديدة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تقوم بتعيين فريق من المحققين لحل لغز معقد. قررت أنه لكي تكون متأكداً تماماً، لا ينبغي أن توظف محققاً واحداً فحسب، بل يجب أن توظف خمسة. لقد فكرت في أنه إذا فات أحد المحققين دليلاً ما، فسوف يلاحظه آخر. لذا وظفت متخصصاً في بصمات الأصابع، ومتخصصاً في آثار الأقدام، ومتخصصاً في تحليل الصوت، ومتخصصاً في علم النفس، وعاملاً شاملاً.
أنت تدفع رواتب الخمسة جميعاً، وتمنحهم مكتباً ضخماً للعمل فيه، وتتوقع حل القضية بشكل أسرع وأفضل مما لو كان لديك شخص واحد فقط.
هذه الورقة البحثية تتحدث عن فريق من الباحثين الذين دخلوا ذلك المكتب، ونظروا إلى المحققين الخمسة، وقالوا: "مهلاً لحظة. نحن نحتاج حقاً لاثنين منكم فقط. الثلاثة الآخرون إما واقفون دون عمل، أو والأسوأ من ذلك، يتجادلون مع بعضهم البعض".
إليك تفصيل اكتشافهم، باستخدام تشبيهات بسيطة:
1. المفهوم الخاطئ الكبير: "الأكثر هو الأفضل"
في عالم الذكاء الاصطناعي (وتحديداً النماذج اللغوية الكبيرة متعددة الوسائط، أو MLLMs)، هناك اعتقاد شائع بأنه إذا كنت تريد من الكمبيوتر أن "يرى" و"يفهم" الصور، فيجب عليك تمريرها عبر مشفرات رؤية متعددة (المحققين).
- الفكرة القديمة: يتم تدريب المشفرات المختلفة على أشياء مختلفة. أحدهم جيد في قراءة النصوص (OCR)، وآخر جيد في التعرف على الأشياء، وآخر جيد في فهم "روح" أو "جو" الصورة. كانت النظرية هي أن الجمع بينهم سيخلق عقلاً خارقاً يرى كل شيء بشكل مثالي.
- مراجعة الواقع: وجد الباحثون أن هذا غالباً ما يكون هدراً للمال والطاقة. تماماً مثل توظيف خمسة محققين بينما يقوم واحد منهم بكل العمل، فإن إضافة المزيد من المشفرات غالباً ما يؤدي إلى التكرار (Redundancy). إنهم جميعاً ينظرون إلى نفس الأدلة، أو الأسوأ من ذلك، أنهم يربكون العقل الرئيسي بمعلومات متضاربة.
2. التجربة: "المعاملة الصامتة"
لإثبات ذلك، لعب الباحثون لعبة "المعاملة الصامتة" (والتي يسمونها Masking أو الحجب).
تخيل أن المحققين الخمسة يجلسون حول طاولة. أخبر الباحثون أحد المحققين بأن يتوقف عن الكلام ويجلس صامتاً فقط (حجب المشفر). ثم طلبوا من الفريق حل مشكلة ما.
- النتيجة: في كثير من الحالات، حل الفريق المشكلة بنفس الجودة، أو أحياناً بشكل أفضل، مع غياب محقق واحد!
- الصدمة: في بعض الأحيان، عندما أسكتوا محققاً معيناً، تحسن أداء الفريق بالفعل! اتضح أن ذلك المحقق كان يسبب ضجيجاً ويشتت انتباه الآخرين فقط.
3. الأدوات الجديدة: قياس "الفائدة"
اخترع الباحثون طريقتين جديدتين لقياس مدى فائدة كل محقق:
- معدل الاستخدام الشرطي (CUR): فكر في هذا كـ "درجة قيمة".
- إذا حصل المحقق على درجة 90%، فهذا يعني أنه اللاعب النجم. إذا أزلتَه، سيفشل الفريق.
- إذا حصل على درجة 0%، فهو عديم الفائدة. يمكنك طرده ولن يلاحظ الفريق غيابه.
- إذا حصل على درجة سالبة، فهو في الواقع يضر الفريق. إنه الشخص الذي ينشر الشائعات التي تسبب الارتباك للجميع.
- فجوة المعلومات (IG): تقيس هذه الدرجة "عدم التوازن في الفريق".
- الفجوة الصغيرة تعني أن الجميع يساهمون بالتساوي (فريق متوازن).
- الفجوة الكبيرة تعني أن شخصاً واحداً يقوم بـ 90% من العمل بينما الآخرون نائمون. وجد الباحثون أنه في العديد من نماذج الذكاء الاصطناعي، تكون الفجوة كبيرة جداً. يقوم مشفر واحد بكل العمل الثقيل تقريباً، بينما الآخرون مجرد عبء زائد.
4. النتائج: المتخصص مقابل العام
وجدت الدراسة نوعين متميزين من المهام:
- مهام "المتخصص" (مثل قراءة المخططات أو النصوص):
- التشبيه: تخيل مهمة تتطلب قراءة خط يد صغير جداً.
- النتيجة: محقق واحد محدد فقط هو الجيد في هذا. الآخرون عديمو الفائدة هنا. إذا كان لديك نموذج بـ 5 مشفرات، ولكن واحد فقط يمكنه القراءة، فإن الأربعة الآخرين يشغلون مساحة فحسب.
- المهام "العامة" (مثل "ماذا يوجد في هذه الصورة؟"):
- التشبيه: مهمة مثل "هل يوجد كلب في هذه الصورة؟"
- النتيجة: هنا، جميع المحققين يقولون الشيء نفسه تقريباً. إنهم قابلون للاستبدال. وجود خمسة منهم يشبه وجود خمسة أشخاص يصرخون "إنه كلب!" في نفس الوقت. أنت تحتاج فقط لواحد للحصول على الإجابة.
5. الحل: "الفريق الرشيق"
الجزء الأكثر إثارة في الورقة البحثية هو الحل. أظهر الباحثون أنه يمكنك بناء نموذج ذكاء اصطناعي أصغر، وأرخص، وأسرع عن طريق اختيار أفضل مشفر أو اثنين فقط وطرد البقية.
- الأداء: هذه "الفرق الرشيقة" (النماذج ذات عدد أقل من المشفرات) لا تزال تحصل على 90% إلى 95% من الإجابات الصحيحة مقارنة بالنماذج الضخمة المكونة من 5 مشفرات.
- التكلفة: لأنها أصغر، فهي تتدرب بسرعة أكبر بنسبة 34% وتعمل بسرعة أكبر بنسبة 20% على هاتفك أو حاسوبك.
- الطاقة: إنها تستهلك كهرباء أقل بكثير.
الخلاصة
لفترة طويلة، اعتقد عالم الذكاء الاصطناعي: "إذا أضفنا المزيد من العيون، فسيتمكن الذكاء الاصطناعي من الرؤية بشكل أفضل".
تقول هذه الورقة: "لا. إذا كان لديك الكثير من العيون، فستعيق بعضها البعض. أنت لا تحتاج إلى حشد؛ أنت بحاجة إلى العدد الصحيح والمناسب."
من خلال تحديد أي "العيون" مفيدة حقاً وأيها مجرد فائض، يمكننا بناء ذكاء اصطناعي ذكي بنفس القدر، ولكنه أرخص، وأسرع، وأكثر كفاءة. إنه انتقال من مبدأ "الأكبر هو الأفضل" إلى "الأذكى هو الأفضل".
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.