Dr. Seg: Revisiting GRPO Training for Visual Large Language Models through Perception-Oriented Design
يتحدى الدكتور سيج الافتراض القائل بأن تدريب (GRPO) القائم على اللغة ينتقل بسلاسة إلى الإدراك البصري من خلال تقديم إطار عمل جاهز للتشغيل يتضمن آلية "النظر للتأكيد" (Look-to-Confirm) ووحدة "المكافأة ذات الترتيب التوزيعي" (Distribution-Ranked Reward) التي تعزز الأداء بشكل كبير في السيناريوهات البصرية المعقدة دون الحاجة إلى تعديلات هيكلية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تقوم بتعليم طالب عبقري ولكنه جامد نوعًا ما (نموذج لغوي بصري ضخم) كيفية العثور على أشياء محددة في غرفة فوضوية.
لفترة طويلة، حاول الباحثون تعليم هذا الطالب باستخدام نفس الأساليب التي استخدموها لحل المسائل الرياضية. في الرياضيات، عادة ما يكون المسار إلى الإجابة خطًا مستقيمًا: الخطوة (أ) تؤدي إلى الخطوة (ب)، والتي تؤدي إلى الحل. وهذا ما يسمى بالاستنتاج المنطقي (Reasoning).
لكن النظر إلى صورة والعثور على قطة أو سيارة أمر مختلف. إنه الإدراك (Perception). أنت لا تتبع خطًا مستقيمًا فحسب؛ بل تمسح الغرفة، وتنظر إلى ملمس السجادة، وتتحقق من الإضاءة، وتلاحظ شكل الظل، وربما تنظر حتى إلى لون الجدار. هناك طرق عديدة ومختلفة لرصد القطة.
تجادل الورقة البحثية بأن المحاولات السابقة لتعليم الطالب كيف "يرى" قد فشلت لأنها عاملته كمسألة رياضية. أدرك المؤلفون، الدكتور سيج وفريقه، ذلك، وابتكروا طريقة تدريب جديدة تسمى Dr. Seg.
إليك كيف يعمل Dr. Seg، مشروحًا من خلال استعارتين بسيطتين:
1. استراتيجية "النظر للتأكيد" (قائمة مراجعة المحقق)
المشكلة:
في الطريقة القديمة، كان الطالب يخمن الإجابة فورًا. وإذا خمن خطأً، يحصل على كلمة "خطأ!" بسيطة ويمضي قدمًا. لم يتعلموا لماذا أخطأوا أو ما هي الأدلة التي فاتتهم. كانوا متحمسين جدًا للانتهاء.
حل Dr. Seg:
يجبر Dr. Seg الطالب على التصرف كمحقق يجب عليه إظهار عمله قبل اتخاذ قرار نهائي.
- الاستعارة: تخيل محققًا يحل جريمة. بدلًا من مجرد الإشارة إلى مشتبه به، يُجبر المحقق على قول: "أنا أنظر إلى الأحذية الملطخة بالطين، والنافذة المكسورة، والساعة المفقودة".
- كيف يساعد ذلك: من خلال إجبار النموذج على الإشارة صراحةً إلى الأدلة البصرية (مثل "النظر إلى الشكل" أو "النظر إلى الملمس") قبل قول "نعم، هذه هي القطة"، يُجبر النموذج على استكشاف الصورة بأكملها. يتوقف عن التخمين ويبدأ في المسح البصري. هذا يساعده على العثور على أشياء لم يرها من قبل لأنه تعلم كيف ينظر، وليس فقط ما الذي يبحث عنه.
2. "المكافأة المرتبة حسب التوزيع" (المدرب العادل)
المشكلة:
في الطريقة القديمة، كان المعلم يعطي مكافآت مثل "عمل جيد" (نقطة واحدة) أو "عمل سيئ" (صفر نقطة).
- الخلل: تخيل طالبًا يحاول إصابة هدف ما. إذا أخطأ بمقدار 1 مليمتر، يحصل على "0". وإذا أخطأ بمقدار 1 متر، يحصل أيضًا على "0". ليس لدى الطالب أدنى فكرة عن مدى قربه! أيضًا، إذا كان المعلم يقيم "المسافة" (من 0 إلى 100) و"العدد" (من 0 إلى 10) في نفس الوقت، فقد تكون درجة "المسافة" ضخمة جدًا لدرجة أنها تطغى على درجة "العدد". سيتعلم الطالب فقط كيفية إصلاح المسافة ويتجاهل العدد.
حل Dr. Seg:
يستخدم Dr. Seg مدربًا عادلًا يحتفظ بسجل مستمر لأداء الجميع مؤخرًا.
- الاستعارة: بدلًا من إعطاء درجة خام، يقول المدرب: "أنت ضمن أفضل 10% من المحاولات التي قمت بها اليوم".
- كيف يساعد ذلك: يتجاهل هذا النظام الأرقام المربكة (مثل ما إذا كانت الدرجة 0.9 أو 0.1) ويركز على التقدم النسبي. إنه يخبر النموذج: "أنت تؤدي بشكل أفضل مما كنت عليه قبل 5 دقائق"، بغضًا عن المقياس المحدد. هذا يعطي النموذج إشارة سلسة وثابتة للتحسن، بدلًا من مزيج فوضوي من الأرقام الكبيرة والصغيرة التي تسبب الارتباك.
النتيجة: طالب خارق
عندما تجمع بين هذين الأمرين:
- إجبار النموذج على النظر حوله أولاً (النظر للتأكيد).
- إعطاؤه درجة عادلة وثابتة بناءً على تقدمه الخاص (المكافأة المرتبة حسب التوزيع).
يصبح النموذج بارعًا للغاية في العثور على الأشياء. في اختبارات الورقة البحثية، لم يصبح Dr. Seg أفضل في العثود على الأشياء التي رآها من قبل فحسب؛ بل أصبح أفضل بكثير في العثور على الأشياء في مواقف جديدة وغريبة (مثل قطة تختبئ في كومة من الغسيل) حيث فشلت النماذج الأخرى.
باختًا: توقف Dr. Seg عن معاملة الذكاء الاصطناعي كإنسان آلي رياضي وبدأ يعامله كمستكشف فضولي، مانحًا إياه الأدوات الصحيحة للنظر بعناية والتغذية الراجعة الصحيحة للتعلم بثبات.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.