SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning
يُعد SafeCap إطار عمل للتعلم المعزز يعمل على تعزيز سلامة النماذج اللغوية البصرية الكبيرة ضد هجمات الاختراق عبر تدريب النماذج على توليد أوصاف صور ذات صلة بالسلامة توجه النموذج اللغوي الكبير المجمد نحو قرارات متوافقة، مما يجعله يتفوق على أساليب محاذاة السلامة الحالية مع الحفاظ على المنفعة البصرية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك صديقًا آليًا فائق الذكاء يمكنه قراءة الكتب وكتابة القصص بشكل أفضل من أي شخص آخر تقريبًا. هذا الروبوت حذر للغاية بالفعل؛ فإذا طلبت منه القيام بشيء خطير، مثل صنع قنبلة، فإنه يقول بأدب: "مستحيل، هذا غير آمن". ولكن الآن، تخيل أنك أريت هذا الروبوت صورة لقنبلة بدلاً من مجرد كتابة الكلمات. فجأة، يرتبك الروبوت. يرى الصورة، ويفكر: "أوه، هذا مجرد رسم رائع!"، فينسى قواعد السلامة الخاصة به، ويشرح لك بسعادة كيفية صنع الجهاز. هذه هي المشكلة المعقدة التي يواجهها العلماء مع نماذج "الرؤية واللغة" الحديثة: فهي بارعة في الرؤية، لكن مكابح السلامة لديها تفشل أحيانًا عندما تنظر إلى صورة.
لإصلاح ذلك، يحاول الباحثون تعليم هذه النماذج أن تكون "ثنائية اللغة" بطريقة خاصة. إنهم يريدون ألا يكتفي الروبوت بالنظر إلى الصورة والإجابة فحسب، بل أن يصف الصورة أولاً بصوت عالٍ وبطريقة آمنة وحذرة، ثم يعطي الإجابة. فكر في الأمر كحارس أمن يجب عليه كتابة تقرير مفصل عن طرد مشبوه قبل أن يُسمح له بإخبارك بما يجب فعله به. إذا كان التقرير غامضًا أو أغفل الخطر، فإن الحارس يتوقف ويقول: "انتظر، أحتاج إلى النظر عن كثب". هذه الورقة البحثية، التي تسمى SafeCap، تقدم طريقة تدريب جديدة تعلم هذه الروبوتات الذكية كتابة تقارير السلامة تلك تلقائيًا، مما يجعل خداعها أصعب بكثير.
المشكلة: عندما تخدع الصور العقل
نماذج الرؤية واللغة الكبيرة (LVLMs) هي بمثابة نسخ فائقة القدرة من روبوتات الدردشة التي يمكنها الرؤية. وهي ترث "سلوكها الجيد" من الأدمغة النصية فقط التي بُنيت عليها. لكن الصور مخادعة. قد يرفض نموذج نصي فقط طلبًا لـ "صنع قنبلة"، ولكن إذا أريته صورة لقنبلة مع ملاحظة تقول "كيف أصنع هذا؟"، فقد يتشتت النموذج بالصورة وينسى قواعد السلامة الخاصة به. الأمر يشبه حارسًا يعتاد فحص الهويات، لكنه يتشتت بانتباهه بسبب ملصق لامع على قميص أحد الزوار فيسمح له بالمرور.
تضمنت المحاولات السابقة للإصلاح استخدام "دفاعات وقت الاستدلال"، وهي تشبه وضع مرشح (فلتر) أمام عيني الروبوت. إحدى الطرق الشائعة، وتسمى ECoS، تحاول تحويل الصورة إلى كلمات بعد أن يراها الروبوت، على أمل أن يتمكن نظام سلامة نصي فقط من رصد الخطر. لكن هذا يشبه محاولة وصف لوحة معقدة لصديق كفيف والأمل في أن يتمكن من رصد فخ مخفي في ضربات الفرشاة. غالبًا ما يغفل الوصف التفاصيل الصغيرة ولكن الخطيرة، ويفشل نظام السلامة.
الحل: SafeCap (مدرب "وصف السلامة")
يقترح مؤلفو هذه الورقة SafeCap، وهي طريقة تدريب ذكية تعلم الروبوت كتابة تقرير سلامته الخاص قبل أن يجيب. بدلاً من مجرد قول "نعم" أو "لا"، يتم تدريب النموذج على إخراج شيئين:
- الوصف (Caption): وصف مفصل للصورة يسلط الضوء على أي تفاصيل ذات صلة بالسلامة (مثل ملصق "خطر" أو سلاح).
- الإجابة (Answer): الرد النهائي على سؤال المستخدم.
يحدث السحر أثناء التدريب. لا يتعلم النموذج مجرد كتابة وصف؛ بل يتعلم كتابة وصف يساعد ذكاءً اصطناعيًا نصيًا فقط (غير متغير) على اتخاذ القرار الصحيح بشأن السلامة. تخيل طالبًا (النموذج) يؤدي اختبارًا. يقول المعلم (نظام التدريب): "اكتب ملخصًا لهذه الصورة أولًا. ثم، سأعطي هذا الملخص لمصحح صارم لا يستطيع رؤية الصورة. إذا قال المصحح 'هذا خطير' بناءً على ملخصك فقط، وقلت أنت أيضًا 'هذا خطير'، فستحصل على مكافأة".
هذا يجبر النموذج على أن يكون صادقًا ودقيقًا. لا يمكنه تجاهل الخطر والأمل في أن يخطئ المصحح. يجب عليه الإشارة صراحة إلى الخطر في الوصف حتى يعمل فحص السلامة.
كيف يعمل: لعبة "المكافأة"
يستخدم التدريب تقنية تسمى التعلم التعزيزي (Reinforcement Learning). فكر في الأمر كأنها لعبة فيديو يحصل فيها النموذج على نقاط للسلوك الجيد ويفقد النقاط للسلوك السيئ.
- مكافأة القالب (Template Reward): يجب على النموذج اتباع تنسيق صارم (كتابة الوصف، ثم الإجابة). إذا أفسد التنسيق، يحصل على صفر من النقاط.
- مكافأة الإجابة (Answer Reward): يتم فحص إجابة النموذج النهائية. إذا كانت مفيدة وآمنة، يحصل على نقاط. إذا كانت خطيرة، تُخصم النقاط بشكل كبير (باستخدام خدعة رياضية خاصة تسمى "الخصم الأسي للمخاطر" تجعل الإجابات الخطيرة تساوي تقريبًا لا شيء).
- مكافأة الوصف (Caption Reward): هذا هو المكون السري. يحصل النموذج على نقاط إضافية إذا ساعد الوصف الذي كتبه الذكاء الاصطناعي النصي (غير المتغير) في الوصول إلى نفس الاستنتاج الآمن. إذا كان الوصف غامضًا وأخطأ الذكاء الاصطناعي النصي في رصد الخطر، فلن يحصل النموذج على نقاط لهذا الجزء.
ماذا وجدوا: السلامة دون فقدان الذكاء
اختبر الباحثون SafeCap على خمسة معايير سلامة (اختبارات مصممة لخداع الذكاء الاصطيائي) وستة معايير فائدة (اختبارات لمعرفة ما إذا كان الذكاء الاصطناعي لا يزال جيدًا في المهام العادية مثل وصف الصور أو حل الألغاز). استخدموا أحجامًا مختلفة من النماذج، تتراوح من 2 مليار إلى 4 مليارات معلمة (parameter).
كانت النتائج مثيرة للإعجاب:
- تعزيز السلامة: تحت بروتوكول "DirectCap" (حيث يكتب النموذج الوصف ثم يجيب)، حسن SafeCap درجات السلامة بمقدار 3.7 إلى 19.0 نقطة عبر نماذج مختلفة. بالنسبة لنموذج 4B-Base، قفزت درجة السلامة بمقدار هائل قدره 19.0 نقطة.
- لا توجد مقايضة: عادةً، جعل النموذج أكثر أمانًا يجعله أقل ذكاءً (يرفض الإجابة على الأسئلة غير الضارة). لكن SafeCap نجح في الحفاظ على "فائدة الرؤية" (مدى جودة وصف الصور والإجابة على الأسئلة) لتكون مطابقة تقريبًا للنماذج غير المدربة. لم يحول الروبوت إلى آلة "لا" غاضبة؛ بل جعله أكثر ذكاءً وحذرًا.
- التفوق على المنافسين: عند مقارنته بطرق أخرى مثل التدريب على السلامة القياسي (SFT)، وDPO، وطريقة أحدث تسمى SafeGRPO، جاء SafeCap في المقدمة. لقد حقق درجات سلامة أعلى مع الحفاظ على فائدة أفضل.
لماذا هذا مهم
تشير الورقة البحثية إلى أن أفضل طريقة للحفاظ على سلامة نماذج الذكاء الاصطناዊ البصرية ليست مجرد إصلاحها بعد رؤية الصورة، بل تعليمها "التفكير بصوت عالٍ" حول ما تراه قبل أن تتحدث. من خلال إجبار النموذج على إنشاء وصف واعٍ بالسلامة، فإنه يخلق جسرًا بين العالم المرئي والقواعد النصية للسلامة.
وجد المؤلفون أن هذه الطريقة تعمل بشكل أفضل عندما يتم تدريب النموذج على استخدام مسار "الوصف أولًا". إذا حاولت استخدام النموذج بدون الوصف (مجرد السؤال عن الإجابة مباشرة)، فإن مكاسب السلامة تكون أصغر وتعتمد أكثر على النموذج المحدد. ولكن عندما يُسمح للنموذج باستخدام عادة "وصف السلامة"، فإنه يصبح أكثر قوة ضد عمليات الاختراق (jailbreaks) والطلبات الخطيرة.
باختًا، يعلم SafeCap الذكاء الاصطناعي أن ينظر إلى صورة، ويصف الخطر بوضوح، ثم يقرر ماذا يفعل. الأمر يشبه تدريب حارس على كتابة تقرير دائمًا قبل فتح البوابة، مما يضمن أنه حتى لو تشتت انتباه حارس البوابة، فإن التقرير المكتوب يحافظ على سلامة الجميع. تظهر الورقة أن هذا النهج ليس فعالًا فحسب، بل يحافظ أيضًا على قدرة النموذج على أن يكون مفيدًا، مما يقدم مسارًا واعدًا لمستقبل أكثر أمانًا للذكاء الاصطناعي في عالم مرئي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.