← أحدث الأبحاث
💻 computer science

Semantic-aware Adversarial Fine-tuning for CLIP

تقترح هذه الورقة البحثية طريقة الضبط الدقيق العدائي المدرك دلالياً (SAFT)، وهي طريقة تعزز متانة نموذج CLIP ضد الهجمات العدائية في وضع الصفر (zero-shot) من خلال توليد أمثلة عدائية مدركة دلالياً عبر مجموعة من الأوصاف النصية المنقحة بدلاً من الاعتماد على قوالب مفردة مصاغة يدوياً.

المؤلفون الأصليون: Jiacheng Zhang, Jinhao Li, Hanxun Huang, Sarah M. Erfani, Benjamin I. P. Rubinstein, Feng Liu

نُشر 2026-02-16
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jiacheng Zhang, Jinhao Li, Hanxun Huang, Sarah M. Erfani, Benjamin I. P. Rubinstein, Feng Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

الصورة الكبيرة: تعليم الروبوت كيف "يرى" بشكل أفضل

تخيل أن لديك روبوتاً ذكياً جداً يسمى CLIP. هذا الروبوت قرأ ملايين الكتب ونظر إلى ملايين الصور. إنه بارع في مطابقة الصور بالكلمات. إذا أظهرت له صورة كلب وسألته: "هل هذا كلب؟"، سيقول "نعم" بثقة عالية.

ومع ذلك، مثل أي نظام ذكي، لدى CLIP نقطة ضعف. يمكن لـ "مخترق" أن يضيف ذرة ضوضاء صغيرة وغير مرئية إلى الصورة (مثل تغيير لون بكسل واحد) ليخدع الروبوت ويجعله يعتقد أن الكلب هو محمصة خبز. يُسمى هذا المثال الخصمي (Adversarial Example - AE).

لإصلاح ذلك، يقوم العلماء عادةً بتدريب الروبوت عبر إظهار هذه الصور "المخادعة" له وقول: "لا، هذا لا يزال كلباً!". تسمى هذه العملية التدريب الدقيق الخصمي (Adversarial Fine-tuning).

المشكلة: الروبوت حرفي للغاية

اكتشف مؤلفو الورقة البحثية خللاً في الطريقة التي ندرب بها هذا الروبوت عادةً.

الطريقة القديمة (قاموس "الكلمة الواحدة"):
تقليدياً، عندما ندرب الروبوت على مقاومة الحيل، نستخدم فقط عبارة محددة واحدة لوصف الفئة. بالنسبة للكلب، نستخدم فقط العبارة: "صورة لكلب".

  • الخلل: يتعلم الروبوت التعرف على العبارة الدقيقة "صورة لكلب". إذا ابتكر مخترق حيلة تعمل ضد هذه العبارة المحددة، فسيصاب الروبوت بالارتباك. ولكن إذا سألت الروبوت: "هل هذا 'حيوان ذو فراء ينبح'؟"، فقد يظل الروبوت مخدوعاً لأنه لم يتعلم أبداً أن "حيوان ذو فراء ينبح" تعني نفس الشيء الذي تعنيه كلمة "كلب". الأمر يشبه طالباً حفظ نموذج الإجابة لكنه لم يفهم المفهوم نفسه.

الاكتشاف:
وجد المؤلفون أنه إذا استخدمت وصفاً مختلفاً وأكثر ثراءً (مثل "كلب جولدن ريتريفر يلعب بالكرة"، فإن تلك الصور "المخادعة" القديمة تتوقف عن العمل. يدرك الروبوت: "مهلاً، هذا لا يزال كلباً!". وهذا يعني أن طريقة التدريب القديمة كانت ضيقة جداً. لقد تعلم الروبوت محاربة كلمة محددة، وليس الفكرة الفعلية.

الحل: SAFT (نهج "المعلم الذكي")

لإصلاح ذلك، ابتكر المؤلفون طريقة جديدة تسمى SAFT (التدريب الدقيق الخصمي الواعي دلالياً). فكر في SAFT كمعلم خارق يعلم الروبوت باستخدام مكتبة كاملة من الأوصاف بدلاً من مجرد جملة واحدة.

إليك كيف يعمل SAFT في ثلاث خطوات بسيطة:

1. فلتر "الهلوسة" (مدقق الحقائق)

يستخدم SAFT نموذج ذكاء اصطناعي قوياً (نموذج تأسيسي - Foundation Model) لكتابة أوصاف متنوعة لكل فئة.

  • بالنسبة لـ "كلب"، قد يولد: "حيوان أليف مخلص"، "صياد رباعي الأرجل"، "ثدي من نوع ينبح"، وحتى "مخلوق أسطوري مجنح".
  • المشكلة: أحياناً يصبح الذكاء الاصطناعي مبدعاً جداً ويؤلف أشياءً غير حقيقية (هلوسات)، مثل تسمية الكلب "مخلوق مجنح".
  • الحل: يمتلك SAFT مدقق حقائق. فهو يقارن الأوصاف الجديدة بالكلمة الأصلية ("كلب"). إذا كان الوصف غريباً جداً أو خاطئاً واقعياً (مثل المخلوق المجنح)، فإنه يتخلص منه. ويحتفظ فقط بأفضل 5 أوصاف دقيقة ومتنوعة.

2. "الهجوم الجماعي" (اختبار المجموعة)

بدلاً من محاولة خداع الروبوت بعبارة واحدة فقط، يحاول المخترق (عملية التدريب) إرباك الروبوت بـ جميع الأوصاف الخمسة في وقت واحد.

  • يجب على الروبوت النظر إلى صورة مخادعة وإدراك: "هذا كلب، حتى لو أسميته 'حيوان ينبح' أو 'حيوان أليف'".
  • هذا يجبر الروبوت على تعلم المفهوم الجوهري للكلب، وليس مجرد الكلمات المحددة.

3. "التدريب الدقيق" (التمرين)

بعد ذلك، يتم تدريب الروبوت على هذه الصور المخادعة. ولأنه اضطر لمحاربة أوصاف عديدة ومختلفة، فإنه يصبح أقوى بكثير. يتعلم تجاهل الحيل الصغيرة غير المرئية (الضوضاء) والتركيز على المعنى الحقيقي للصورة.

لماذا هذا مهم (النتائج)

اختبر المؤلفون طريقة "المعلم الذكي" هذه على 16 مجموعة بيانات مختلفة (مثل ImageNet و CIFAR وغيرها).

  • النتيجة: الروبوت الذي تم تدريبه باستخدام SAFT كان من الصعب جداً خداعه مقارنة بالروبوتات التي تدربت بالطرق القديمة.
  • التشبيه: تخيل رجل أمن.
    • الحارس القديم: يتحقق فقط من بطاقة هوية محددة مكتوب عليها "جون دو". إذا ارتديت قناعاً أو غيرت اسمك إلى "جوني"، فسيسمح لك بالدخول.
    • حارس SAFT: يتحقق من "جون دو"، و"الرجل صاحب القميص الأزرق"، و"الشخص ذو القبعة الحمراء"، و"الموظف". إذا حاولت التسلل باسم مستعار أو قناع، فسيظل يتعرف عليك لأنه يعرف شكلك، وليس فقط ما يقوله ملصق الاسم الخاص بك.

الملخص باختختصار

  1. المشكلة: الطرق السابقة علمت الذكاء الاصطناعي مقاومة الهجمات باستخدام جملة بسيطة واحدة فقط (مثل "صورة لقطة"). جعل هذا الذكاء الاصطناعي هشاً؛ حيث يمكن خداعه إذا استخدم المهاجم وصفاً مختلفاً.
  2. الحل: تستخدم الطريقة الجديدة (SAFT) "مدقق حقائق" لتوليد قائمة من الأوصاف الغنية والدقيقة لكل كائن (مثل "حيوان أليف فروي"، "صياد من فصيلة السنوريات").
  3. التدريب: يتم تدريب الذكاء الاصطناعي على مقاومة الهجمات ضد كل هذه الأوصاف في آن واحد.
  4. النتيجة: يصبح الذكاء الاصطناعي أكثر ذكاءً وقوة. إنه يفهم جوهر الشيء، مما يجعل من المستحيل تقريباً خداعه بالتشوهات البصرية الصغيرة، بغض النظر عن كيفية وصفك لهذا الشيء.

تقول هذه الورقة البحثية باختصار: "لا تعلم الروبوت تعريفاً واحداً للكلب فحسب. علمه ألف طريقة لوصف الكلب، ولن يتمكن أحد من خداعه أبداً."

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →