Rank-Gated and Sparse Low-Rank Adaptation for Efficient Fine-Tuning of Vision--Language Models
تقدم هذه الورقة البحثية تقنية Rank-Gated LoRA (RG-LoRA)، وهي طريقة تخصص أوزان أهمية قابلة للتعلم لمكونات رتبة LoRA لتمكين التقليم بعد التدريب من أجل كفاءة الذاكرة، ولكن التجارب الأولية على Qwen3-VL-8B تُظهر أنه بدون تنظيم التشتت الصريح، تفشل البوابات في تعلم تشتت ذي معنى، مما يؤدي إلى مكاسب ضئيلة في زمن الاستجابة أو ذاكرة الوصول العشوائي (VRAM) رغم التحقق من آلية "التدريب-التقليم-التقييم" المقترحة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تصبح أنظمة الذكاء الاصطناعي الحديثة التي يمكنها رؤية الصور وقراءة النصوص قوية للغاية، لكنها تصبح ضخمة أيضاً. تُبنى نماذج الرؤية واللغة هذه بمليارات المعلمات (parameters)، وهي الإعدادات الداخلية التي تسمح للآلة بالتعلم. ولتعليم هذه العمالقة مهمة جديدة، مثل قراءة مخطط طبي أو فهم رسم توضيحي معقد، كان على الباحثين تقليدياً تعديل كل إعداد من الإعدادات. هذه العملية تشبه محاولة إعادة ترميم ناطحة سحاب عن طريق استبدال كل طوبة؛ فهي تتطلب كميات هائلة من ذاكرة الكمبيوتر والوقت، مما يجعل الأمر مستحيلاً لمعظم الباحثين. ولحل هذه المشكلة، طور العلماء طريقاً مختصراً يسمى "التكيف منخفض الرتبة" (Low-Rank Adaptation). فبدلاً من المساس بالمبنى بأكمله، تضيف هذه الطريقة ملحقاً صغيراً وخفيف الوزن للنموذج، والذي يتعلم المهمة الجديدة مع ترك الهيكل الضخم الأصلي دون تغيير. إنها أداة قياسية لجعل هذه النماذج الكبيرة مفيدة دون استنزاف القدرات الحسابية.
ومع ذلك، حتى هذه الملحقات خفيفة الوزن تحتوي على عدم كفاءة خفية. فعندما ينشئها الباحثون، يجب عليهم تخمين مقدار "السعة" التي يحتاجها الملحق قبل البدء في التدريب. إنهم يختارون حجماً ثابتاً، ويستخدم النموذج كل جزء من هذا الحجم، حتى لو كان جزء بسيط فقط منه هو المطلوب للوظيفة. الأمر يشبه بناء حقيبة سفر بـ عشرين جيباً بينما لا تحتاج إلا لخمسة فقط، ومع ذلك لا تزال مضطراً لحمل وزن العشرين جميعاً. ويتساءل البحث الجديد من "تشينوو شو" في جامعة تكساس في أوستن سؤالاً بسيطاً: ماذا لو استطاع النموذج أن يقرر بنفسه أي أجزاء من الملحق مفيدة وأيها ليست كذلك، ثم يقوم بإزالة الأجزاء غير المفيدة مادياً؟
قدم الباحثون طريقة يسمونها "LoRA ذات البوابة الرتبية" (Rank-Gated LoRA). تخيل الملحق الصغير ككومة من الصفحات الشفافة، حيث تمثل كل صفحة طريقة مختلفة يمكن للنموذج من خلالها التعلم من البيانات. في الطرق القياسية، يُجبر النموذج على استخدام جميع الصفحات في الكومة، بغض النظر عما إذا كانت تساعد أم لا. في هذا النهج الجديد، أضاف الباحثون مفتاحاً صغيراً قابلاً للتعلم لكل صفحة. وخلال عملية التدريب، يتعلم النموذج تحويل مفاتيح الصفحات المفيدة إلى وضع التشغيل "on"، ومفاتيح الصفحات غير المفيدة إلى وضع الإيقاف "off". وبمجرد انتهاء التدريب، يمكن للباحثين قص الصفحات التي تم إيقاف تشغيلها مادياً. والنتيجة هي ملحق أصغر بكثير وأكثر كفاءة، يؤدي نفس الوظيفة ولكنه يشغل مساحة أقل ويتطلب طاقة أقل للتشغيل.
لاختبار مدى نجاح هذه الفكرة، طبق الفريق هذه الطريقة على نموذج لغة ورؤية ضخم يسمى Qwen3-VL-8B-Instruct. قاموا بتدريب النموذج على مزيج من ثلاث مجموعات بيانات تتضمن مخططات، ونصوصاً داخل صور، وأسئلة حول المستندات. وقارنوا طريقتهم الجديدة بالنسخة القياسية ذات الحجم الثابت. وأظهرت النتائج أن الطريقة الجديدة يمكنها التعلم بشكل جيد مثل النسخة القياسية، حيث حققت دقة تبلغ حوالي 81.56 بالمائة في أسئلة الاختبار، وهي نسبة قريبة جداً من 81.95 بالمائة التي حققتها الطريقة القياسية. وهذا أثبت أن النموذج يمكنه التعلم بفعالية حتى أثناء حمله لإمكانية أن يكون أصغر حجماً.
الجزء الأكثر إثارة للاهتمام في التجربة جاء بعد اكتمال التدريب. حيث أخذ الباحثون النموذج المدرب وبدأوا في إزالة الصفحات الأقل أهمية، واحدة تلو الأخرى، لمعرفة مدى صغر حجم الملحق الذي يمكنهم الوصول إليه قبل أن يبدأ النموذج في الفشل. ووجدوا أن النموذج كان متيناً بشكل مدهش. فحتى بعد إزالة ثلاث صفحات من أصل ثماني صفحات أصلية، مما ترك خمس صفحات فقط، تحسن أداء النموذج قليلاً في مجموعة تحقق محددة، ليصل إلى 81.26 بالمائة. وهذا يشير إلى أن الملحق الأص〘الأكبر حجماً كان يحمل وزناً إضافياً لم يكن يساعد النموذج على التفكير. ومن خلال قصه، أدى النموذج عمله بنفس الكفاءة، إن لم يكن أفضل، باستخدام مواد أقل.
رغم هذا النجاح، كان الباحثون حذرين في الإشارة إلى ما لم تثبته تجربتهم. فبينما استطاع النموذج تحمل إزالة بعض أجزائه، إلا أن المفاتيم نفسها لم تتعلم إغلاق نفسها تلقائياً أثناء عملية التدريب. فقد ظلت في وضع مشابه جداً لما بدأت به، مما يعني أن النموذج لم يكتشف بشكل طبيعي الأجزاء غير المفيدة من تلقاء نفسه. كان على الباحثين أن يقرروا يدوياً أي الأجزاء سيتم قصها بعد الانتهام. علاوة على ذلك، ولأن الملحق كان صغيراً بالفعل في الأصل، فإن تقليصه لم يجعل النموذج يعمل بشكل أسرع بشكل ملحوظ أو يستخدم ذاكرة كمبيوتر أقل في الوقت الفعلي. فالعمل الشاق لا يزال يتم بواسطة الهيكل الضخم والجامد للنموذج الأساسي، لذا كانت التوفيرات الناتجة عن الملحق الصغير ضئيلة جداً بحيث لا يمكن قياسها في السرعة الإجمالية.
تخلص الدراسة إلى أن الآلية تعمل: فمن الممكن تدريب نموذج بسعة إضافية ثم استئصال الأجزاء غير المستخدمة جراحياً دون الإضراء بقدرته على فهم الصور والنصوص. ومع ذلك، لكي يصبح هذا تحولاً حقيقياً في الكفاءة، يحتاج العمل المستقبلي إلى تعليم النموذج إغلاق المفاتيح من تلقاء نفسه أثناء التدريب، واختبار الطريقة على ملحقات أكبر بكثير حيث ستكون التوفيرات أكثر أهمية. في الوقت الحالي، يقف هذا البحث كإثبات للمفهوم، موضحاً أن هذه الأدوات الرقمية يمكن تقليمها بعد بنائها، مما يمهد الطريق لذكاء اصطناعي أكثر كفاءة وقدرة على التكيف في المستقبل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.