Once-For-All: A Train-Once and Select-Anytime Framework for Multimodal Instruction Tuning
تقترح الورقة البحثية إطار عمل OFA، وهو إطار عمل لاختيار البيانات يتم تدريبه لمرة واحدة وقابل للنقل، يقوم بتجميع التعليمات متعددة الوسائط في فضاء CLIP مجمد لتحديد العينات الغنية بالمعلومات، مما يتيح ضبط التعليمات بكفاءة عبر مجموعات بيانات ونماذج بمقاييس متنوعة دون الحاجة إلى إعادة الحساب.
المؤلفون الأصليون:Mingkang Dong, Hongyi Cai, Xiwen Lei, Jie Li, Tao Zhang, Muxin Pu
تخيل أنك تحاول تعليم روبوت فائق الذكاء (نموذج لغوي بصري - VLM) كيف يفهم العالم من خلال إطلاعه على الملايين من أزواج الصور والأسئلة. هذا يشبه محاولة تعليم طفل عبر قراءة كل كتاب في مكتبة. المشكلة هي أن معظم تلك الكتب إما مكررة ومملة، أو مكتوبة بلغة مربكة، أو ببساطة خاطئة تماماً. قراءة المكتبة بأكملة تستغرق وقتاً طويلاً، وتكلف ثروة من الكهرباء، ومع ذلك قد لا يتعلم الروبوت الدروس الأكثر أهمية.
تقدم هذه الورقة طريقة جديدة تسمى OFA (مرة واحدة للجميع). فكر في الأمر كأنه أمين مكتبة فائق الكفاءة يمكنه النظر إلى كومة ضخمة من الكتب واختيار أفضل 15% تستحق القراءة فعلياً بشكل فوري، دون الحاجة لقراءة الكومة بأكملة أولاً.
إليك كيف يعمل نظام OFA، مقسماً إلى خطوات بسيطة:
1. المشكلة: "الكثير من الضجيج، والقليل من الإشارات المفيدة"
الأساليب الحالية لاختيار البيانات الجيدة تشبه توظيف خبير مختلف لكل مكتبة جديدة. إذا كنت تريد اختيار كتب لمكتبة علمية، توظف عالماً. إذا كنت تريد اختيار كتب لمكتبة تاريخية، توظف مؤرخاً. إذا قمت بتغيير الروبوت الذي تعلمه، عليك توظيف خبير جديد. هذا الأمر بطيء ومكلف.
2. الحل: أمين المكتبة "لمرة واحدة"
قام المؤلفون ببناء مُحدد عالمي (أمين المكتبة) يحتاج للتدريب مرة واحدة فقط. بمجرد تدريبه، يمكن لهذا الأمين الدخول إلى أي مكتبة (مجموعة بيانات) واختيار أفضل الكتب لأي روبوت (نموذج)، دون الحاجة لإعادة تدريبه أو إعادة توظيفه.
3. كيف يعمل أمين المكتبة (الخدعة السحرية)
يستخدم إطار عمل OFA عملية ذكية مكونة من ثلاث خطوات:
الخطوة 1: التجميع حسب "الجو العام" (Clustering) تخيل أخذ جميع أزواج الصور والأسئلة وفرزها إلى 20 كومة مختلفة بناءً على "جوها العام" أو موضوعها، باستخدام ذكاء اصطنا-ي مُدرب مسبقاً (CLIP) يفهم الصور والنصوص بالفعل. هذا يشبه فرز الكتب إلى أنواع أدبية دون قراءة النص بالكامل.
الخطوة 2: اختبار "الثقة" يقوم النظام بتدريب ذكاء اصطناعي صغير وبسيط (المُحدد) للتعرف على الكومة التي ينتمي إليها الكتاب. ولكن إليك الخدعة: يتوقفون عن تدريب هذا الذكاء الاصطناعي في مرحلة مبكرة جداً.
إذا كان الذكاء الاصطناعي واثقاً جداً بشأن كتاب ما ("أوه، هذا بالتأكيد كتاب عن 'القطط'!")، فهذا الكتاب ممل وشائع. إنه مكرر، لذا يرميه أمين المكتبة.
إذا كان الذكاء الاصطناعي مرتبكاً أو غير متأكد ("ممم، هل هذا كتاب عن 'القطط' أم عن 'الكلاب'؟")، فهذا الكتاب مثير للاهتمام، ومعقد، وذو قيمة. يحتفظ به أمين المكتبة.
التشبيه: فكر في طالب يؤدي اختباراً تجريبياً. إذا أجاب على سؤال سهل فوراً، فهو يعرفه بالفعل. أما إذا عانى مع سؤال ما، فهذا هو السؤال الذي يحتاج لدراسته ليتحسن. يقوم OFA باختيار أسئلة "المعاناة".
الخطوة 3: عملية التسليم "مرة واحدة للجميع" بمجرد تدريب هذا الذكاء الاصطناعي الصغير، يتم تجميده (إغلاقه). يمكنك الآن أخذ هذا الذكاء الاصطناعي المجمد واستخدامه على مكتبة كتب مختلفة تماماً أو روبوت مختلف. لا يحتاج لتعلم أي شيء جديد؛ هو فقط يطبق قاعدة "الارتباك = القيمة".
4. النتائج: بيانات أقل، نتائج أفضل
اختبرت الورقة هذا على مجموعتي بيانات ضخمتين (LLaVA-665K و Vision-Flan-186K).
على مجموعة بيانات التدريب: باستخدام 15% فقط من البيانات (العينات "المربكة")، حقق OFA نسبة 98.3% من أداء التدريب على 100% من البيانات. لقد وفر كميات هائلة من الوقت والمال.
على مجموعة بيانات جديدة غير مرئية: تم تطبيق أمين المكتبة الذي تدرب على مجموعة البيانات الأولى على مجموعة بيانات مختلفة تماماً (Vision-Flan) دون إعادة تدريب. ومن المثير للدهشة أن الروبوت الذي تدرب على هذه الـ 15% الفرعية حقق أداءً أفضل (110.6%) مما لو تم تدريبه على مجموعة البيانات الكاملة! وهذا يثبت أن قاعدة "الارتباك = القيمة" تعمل في كل مكان.
على روبوت مختلف: أخذوا البيانات التي اختارها OFA واستخدموها لتدريب نوع مختلف تماماً من الروبوتات (Qwen2.5-VL-3B). وقد عمل ذلك بشكل مثالي، مما يثبت أن الاختيار ليس مرتبطاً بنموذج محدد.
5. لماذا هذا مهم؟
السرعة: يستغرق اختيار البيانات حوالي 9 ساعات، مقارنة بـ 73+ ساعة للطرق الأخرى.
التكلفة: يوفر كميات هائلة من قدرة الحوسبة (ساعات وحدة معالجة الرسومات - GPU).
قابلية إعادة الاستخدام: أنت تدرب المُحدد مرة واحدة، ويمكنك استخدامه للأبد على بيانات ونماذج جديدة.
باختصار: OFA هو مرشح ذكي يجد الأمثلة "الصعبة والمفيدة" في كومة ضخمة من البيانات. يتعلم هذه الحيلة مرة واحدة، ثم يمكنه تطبيقها على أي بيانات أو روبوت مستقبلي، مما يوفر الوقت والمال والطاقة، بل ويجعل الروبوتات أكثر ذكاءً في الواقع.
ملخص تقني: إطار العمل "المرة الواحدة للكل" (OFA) لضبط التعليمات متعدد الوسائط
1. بيان المشكلة
أصبح ضبط التعليمات متعدد الوسائط (Multimodal Instruction Tuning) هو النموذج المعياري لتكييف نماذج الرؤية واللغة (VLMs) مع المهام النهائية. ومع ذلك، فإن مجموعات بيانات التعليمات واسعة النطاق (مثل LLaVA-665K وVision-Flan) غالبًا ما تكون ضخمة، ومكررة، وتحتوي أحيانًا على عينات ذات تسميات توضيحية غير صحيحة. وبينما توجد طرق لاختيار البيانات لتحسين كفاءة التدريب، تعاني الأساليب الحالية من قصورين حرجين:
التكلفة الحسابية: تتطلب الطرق القائمة على التدرج (Gradient-based) حساب التدرج لكل عينة عبر كامل المجموعة المرشحة، وهو أمر مكلف للغاية.
نقص القابلية لإعادة الاستخدام: الأساليب القائمة على التسجيل (Scoring-based) أو المدفوعة بالتعقيد (Complexity-driven) مرتبطة ارتباطًا وثيقًا بالنموذج المستهدف أو مجموعة البيانات المحددة المستخدمة أثناء توليد الإشارة. وبناءً على ذلك، كلما تغيرت بنية النموذج المستهدف أو مجموعة البيانات المرشحة، يجب إعادة حساب معايير الاختيار من الصفر، وغالبًا بتكلفة تضاهي تكلفة التدريب نفسه.
يخلق هذا عائقًا يجعل اختيار البيانات غير عملي في البيئات الواقعية الديناميكية حيث تتغير مجموعات البيانات والنماذج بشكل متكرر.
2. المنهجية: إطار العمل "المرة الواحدة للكل" (OFA)
يقترح إطار OFA منهجية "تدرب مرة واحدة، اختر في أي وقت" والتي تفصل عملية اختيار البيانات عن نموذج الرؤية واللغة (VLM) المستهدف. الجوهر يكمن في أن المختار (Selector) القابل لإعادة الاستخدام يمكن تدريبه على فضاء تمثيل مجمد لتحديد العينات المعلوماتية بناءً على صعوبتها أو غموضها المتأصل، بشكل مستقل عن النموذج الذي يتم ضبطه بدقة.
يعمل إطار العمل عبر ثلاث مراحل رئيسية:
أ. التمثيل متعدد الوسائط والتجميع (Clustering)
الترميز المجمد (Frozen Encoding): يتم ترميز جميع أزواج (الصورة-التعليمات) باستخدام نموذج CLIP مجمد (ViT-B/32). يتم ترميز الصورة والنص بشكل منفصل ثم دمجهما لتكوين متجه ميزات مشترك متعدد الوسائط، والذي يتم تطبيقه عليه عملية ℓ2-normalization.
التجميع (Clustering): يتم تطبيق خوارزمية K-Means Clustering على هذه الميزات المجمدة لتقسيم البيانات إلى K من المجموعات الدلالية (Semantic Clusters). وهذا يكشف الهيكل الدلالي الكامن لمجموعة البيانات دون إشراك أي نموذج VLM مستهدف.
ب. التسمية التوضيحية الزائفة القائمة على المجموعات وتدريب المختار
بناء المجموعة الجوهرية (Core Set Construction): يتم تشكيل "مجموعة جوهرية" (Dcore) عن طريق اختيار العينات ضمن نصف قطر محدد (γ) من مراكز مجموعاتها. تُخصص لهذه العينات تسميات توضيحية زائفة (Pseudo-labels) تتوافق مع مؤشرات المجموعات الخاصة بها.
المختار خفيف الوزن (Lightweight Selector): يتم تدريب شبكة عصبية خفيفة الوزن (المختار) على Dcore للتنبؤ بالتسميات التوضيحية الزائفة للمجموعات. ومن الأهمية بمكان أن هذا المختار يُدرب لـ بضع حقب تدريبية فقط (على سبيل المثال، 3 حقب) ويتم إيقاف تدريبه مبكرًا عمدًا قبل الوصول إلى مرحلة التقارب (Convergence).
الإشارة: يفترض المؤلفون أن المختار المدرب جزئيًا سيصبح واثقًا بسرعة من العينات "النموذجية" (المكررة/السهلة) ولكنه سيظل غير متأكد من العينات "غير النمطية" (المعلوماتية/الصعبة).
ج. اختيار الثقة المنخفضة
التسجيل (Scoring): يتم تجميد المختار المدرب وتطبيقه على كامل مجموعة البيانات المرشحة. لكل عينة، يخرج المختار درجة ثقة محددة كأقصى احتمال للفئة (F(xi)=maxcpi,c).
التصفية (Filtering): يتم الاحتفاظ بالعينات ذات الثقة المنخفضة (أقل من عتبة لكل مجموعة τk) كعينة فرعية معلوماتية، بينما يتم استبعاد العينات ذات الثقة العالية (المكررة).
القابلية للنقل (Transferability): نظرًا لأن المختار يعتمد فقط على تمثيل CLIP المجمد وليس على تدرجات أو معاملات الـ VLM المستهدف، يمكن تطبيق نفس المختار المجمد على:
مجموعات بيانات غير مرئية: مجموعات البيانات التي لم تكن موجودة أثناء تدريب المختار.
بنيات معمارية غير مرئية: النماذج المستهدفة ذات المقاييس والبنيات المختلفة.
3. المساهمات الرئيسية
إطار عمل OFA: إطار لاختيار البيانات يقوم بتدريب مختار قابل لإعادة الاستخدام مرة واحدة على فضاء تمثيل مجمد، مما يلغي الحاجة لإعادة الحساب عند تغير مجموعات البيانات أو النماذج المستهدفة.
إشارة قابلة للنقل: تحديد انخفاض ثقة المختار على تمثيلات CLIP المجمدة كإشارة قابلة للتعميم لمدى أهمية العينة. هذه الإشارة تعتمد فقط على توزيع البيانات، وليس على النموذج المستهدف.
التحقق التجريبي: إثبات أن مجموعة فرعية مختارة واحدة، مشتقة من مجموعة بيانات واحدة (LLaVA-665K)، تعمل بفعالية على ضبط كل من مجموعة البيانات المصدر ومجموعات بيانات غير مرئية (Vision-Flan-186K) وبنيات مختلفة (Qwen2.5-VL-3B, LLaVA-v1.5-7B) دون الحاجة لإعادة الاختيار.
4. النتائج التجريبية
أُجريت التجارب على LLaVA-665K وVision-Flan-186K، مع ضبط نماذج VLM باستخدام 15% فقط من البيانات مقارنة بالنماذج المرجعية التي تستخدم البيانات الكاملة.
الأداء على مجموعة البيانات المصدر (LLaVA-665K):
حقق OFA نسبة 98.3% من أداء البيانات الكاملة عبر 10 اختبارات معيارية، متفوقًا على أفضل الأساليب الحالية مثل PreSel وCoIDO وXMAS.
والجدير بالذكر أن OFA تفوق على نموذج البيانات الكاملة في اختبارات الهلوسة (POPE: 87.5 مقابل 86.4)، مما يشير إلى أن العينات ذات الثقة المنخفضة المختارة تساهم بفعالية في كبح الهلوسة.
النقل عبر مجموعات البيانات (Vision-Flan-186K):
تم تطبيق مختار تم تدريبه فقط على LLaVA-665K مباشرة على Vision-Flan-186K دون إعادة تدريب.
حقق OFA أداءً نسبيًا قدره 110.6% مقارنة بالتدريب على البيانات الكاملة في Vision-Flan، متفوقًا على جميع الأساليب الأخرى وعلى نموذج البيانات الكاملة نفسه. يشير هذا إلى وجود ضجيج/تكرار كبير في Vision-Flan نجح OFA في تصفيتة.
النقل عبر البنيات المعمارية:
استُخدمت مجموعة فرعية مختارة من LLaVA-665K لضبط Qwen2.5-VL-3B، وهو نموذج ذو بنية مختلفة هيكليًا.
حقق OFA أداءً نسبيًا قدره 102.1%، متفوقًا على كل من الاختيار العشوائي والتدريب على البيانات الكاملة لهذا المعمار.
الكفاءة:
قلل OFA التكلفة الحسابية الإجمالية بشكل كبير. فبينما تطلب الضبط الدقيق الكامل 76.0 ساعة من معالج الرسوميات (GPU-hours)، تطلب OFA (بما في ذلك الاختيار والضبط الدقيق) 20.0 ساعة فقط.
استغرقت عملية الاختيار نفسها 9.0 ساعات فقط، وهي أسرع بكثير من أساليب مثل Self-Filter (73.5 ساعة) وCOINCIDE (55.5 ساعة).
5. الأهمية والادعاءات
يزعم البحث أن OFA يعالج عائقًا عمليًا أساسيًا في ضبط التعليمات متعدد الوسائط: وهو عدم قابلية إشارات اختيار البيانات الحالية لإعادة الاستخدام. من خلال فصل عملية الاختيار عن النموذج المستهدف، يوفر OFA حلاً واحداً وقابلاً لإعادة الاستخدام يكون فعالاً عبر مختلف مجموعات البيانات والبنيات المعمارية للنماذج.
يؤكد المؤلفون أن إشارة "الثقة المنخفضة" المستمدة من مختار تم تدريبه بإنقاص متعمد على ميزات CLIP المجمدة، تتعمم على توزيعات البيانات والمعماريات التي لم تُشاهد أثناء التدريب. هذا النهج "المرة الواحدة للكل" يحول اختيار البيانات من عملية مكلفة لكل مهمة إلى استثمار لمرة واحدة، مما يتيح تدريبًا فعالًا وقويًا لنماذج VLM في البيئات محدودة الموارد أو الديناميكية.