← أحدث الأبحاث
💻 computer science

Embedding Shift Dissection on CLIP: Effects of Augmentations on VLM's Representation Learning

تتقصى هذه الدراسة تأثير تسع عمليات تعزيز شائعة للصور على تحولات تضمين نموذج CLIP باستخدام مقاييس تشابه ومسافة متنوعة، كاشفةً أن الضجيج، وتحويلات المنظور، وتغيير المقياس تسبب التغيرات الأكثر حدة، مما يوفر رؤى تأسيسية لتحسين متانة النماذج اللغوية البصرية وقابلية تفسيرها الآلية.

المؤلفون الأصليون: Ashim Dahal, Saydul Akbar Murad, Nick Rahimi

نُشر 2026-03-24
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ashim Dahal, Saydul Akbar Murad, Nick Rahimi

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل نموذج CLIP (النموذج الذكي الذي يمثل قلب هذه الدراسة) كأنه ناقد فني فائق الذكاء حفظ ملايين الصور وأوصافها. هذا الناقد لا "يرى" الصورة فحسب، بل يترجم كل صورة إلى شفرة سرية فريدة (تُسمى "التضمين" أو embedding) تلتقط جوهر ما تدور حوله الصورة.

لقد طرح الباحثون في هذه الورقة سؤالاً بسيطاً ولكنه عميق: "ماذا يحدث لهذه الشفرة السرية إذا عبثنا بالصورة؟"

لقد أخذوا 9 طرق مختلفة لـ "العبث" بالصورة — مثل التغبيش (التمويه)، أو إضافة ضجيج (static noise)، أو قلب الصورة، أو مطّها — وراقبوا كيف تتغير شفرة الذكاء الاصطناعي. أرادوا معرفة: هل سيظل الذكاء الاصطناعي يتعرف على القطة، أم سيعتقد فجأة أنها كلب؟ هل تظل الشفرة كما هي، أم أنها تبتعد وتنزاح عن مسارها؟

إليك تفصيل نتائجهم، باستخدام تشبيهات من الحياة اليومية:

1. التجربة: اختبار "عملية التجميل"

تخيل الصورة الأصلية كأنها بورتريه لشخص ما. طبق الباحثون 9 "عمليات تجميل" مختلفة على هذا البورتريه:

  • عمليات التجميل "الخشنة": إضافة ضجيج عشوائي (static)، أو تغبيش الوجه، أو جعل الألوان غريبة (تلاعب بالألوان/color jitter).
  • عمليات التجميل "الهندسية": مطّ الوجه (elastic)، أو تغيير زاوية المنظور، أو التكبير والتصغير (zoom).
  • عمليات التجميل "البسيطة": قلب الصورة أفقياً أو جعلها أكثر سطوعاً أو قتامة.

ثم سألوا الذكاء الاصطناعي: "ما هي الشفرة السرية لهذه النسخة الجديدة؟" وقارنوا بينها وبين الشفرة الخاصة بالصورة الأصلية.

2. الاكتشاف الكبير: ليست كل عمليات التجميل متساوية

وجدت الدراسة أن الذكاء الاصطناعي حساس جداً لبعض التغييرات، لكنه عنيد جداً تجاه تغييرات أخرى.

  • التغييرات "الصادمة" (تأثير عالٍ):

    • الضجيج (Static): تخيل أنك تأخذ صورة وتغطيها بضجيج التلفاز. كان هذا هو الأكثر ضرراً؛ فقد تسبب في بعثرة شفرة الذكاء الاصطناعي تماماً. لقد ارتبك الذكاء الاصطناعي لدرجة أنه بالكاد استطاع التعرف على الموضوع الأصلي.
    • المنظور والمطّ: إذا أخذت صورة لوجه وشددته مثل قطعة "التوفي"، أو نظرت إليه من زاوية غريبة، فإن شفرة الذكاء الاصطناذي ستتغير بشكل كبير. الأمر يشبه النظر إلى صديق عبر مرآة ملاهي مشوهة؛ حيث يكافح الذكاء الاصطناعي لمطابقة الشكل المشوه مع ذاكرته.
    • التغبيش وفقدان البكسلات: تغبيش الصورة أو قطع أجزاء منها (مثل قطعة من أحجية ناقصة) أدى أيضاً إلى إرباك شفرة الذكاء الاصطناعي.
  • التغييرات "غير الضارة" (تأثير منخفض):

    • القلب والسطوع: إذا قلبت صورة أفقياً أو جعلتها أكثر سطوعاً قليلاً، فإن شفرة الذكاء الاصطناعي لم تتغير تقريباً. الأمر يشبه قول الذكاء الاصطناعي: "أوه، لا تزال هذه هي نفس القطة، لكنها تنظر في المرآة أو ترتدي نظارات شمسية فقط". الذكاء الاصطناعي بارع جداً في تجاهل هذه الحيل البسيطة.

3. كيف قاسوا "الانزياح" (Drift)

لم يعتمد الباحثون على التخمين؛ بل استخدموا مجموعة أدوات من "المساطر" لقياس مدى تحرك الشفرة بدقة:

  • خريطة الانتباه (نظرة الذكاء الاصطناعي): نظروا إلى أين كان الذكاء الاصطناعي ينظر في الصورة.
    • تشبيه: في الصورة الأصلية، كانت "نظرة" الذكاء الاصطناعي مركزة بدقة على وجه الكلب. عندما أضافوا الضجيج، أصبحت النظرة مشتتة ومربكة، تنظر إلى أماكن عشوائية. وعندما غبّشوا الصورة، انتشرت النظرة، وعجزت عن إيجاد نقطة تركيز.
  • مسطرة "المسافة": قاسوا المسافة الرياضية بين الشفرة الأصلية والشفرة الجديدة.
    • تشبيه: إذا كانت الشفرة الأصلية هي "المنزل"، والشفرة الجديدة هي "المنزل + ميل واحد"، فهذا انزياح صغير. أما إذا كانت الشفرة الجديدة هي "المنزل + 100 ميل"، فهذا انزياح هائل. الضجيج دفع الشفرة بعيداً بمقدار 100 ميل؛ بينما القلب لم يحركها سوى بضع بوصات.

4. لماذا يهمنا هذا؟

قد تتساءل: "وما الفائدة؟ لماذا نهتم إذا ارتبك الذكاء الاصطناعي بسبب الضجيج؟"

هذا أمر بالغ الأهمية لـ السلامة والثقة:

  • المتانة (Robustness): إذا استُخدم الذكاء الاصطناعي لقيادة سيارة أو لتشخيص مرض، فيجب أن يكون متيناً. إذا كان القليل من المطر (التغبيش) أو اتساخ الزجاج الأمامي (الضجيج) يجعل المنطق الداخلي للذكاء الاصطناعي ينهار، فهذا أمر خطير. هذه الدراسة تخبرنا بالضبط أي أنواع العبث هي التي "تكسر" عقل الذكاء الاصطناعي.
  • فهم العقل: من خلال رؤية كيفية انزياح الشفرة، نحن نتعلم كيف "يفكر" الذكاء الاصطناعي. اتضح أن الذكاء الاصطناعي تعلم تجاهل التغييرات البسيطة (مثل السطوع) ولكنه يعتمد بشكل كبير على التفاصيل الحادة والأشكال المحددة.

الخلاصة

هذه الورقة البحثية تشبه اختبار الجهد لعقل الذكاء الاصطناعي. إنها تظهر لنا أنه رغم ذكاء هذا النظام، إلا أن لديه نقاط ضعف محددة.

  • نقاط القوة: يتعامل مع عمليات القلب وتغيير السطوع بسهولة.
  • نقاط الضعف: يسهل تشتيته بواسطة الضجيج، أو التغبيش الشديد، أو التشوهات الغريبة.

من خلال فهم نقاط الضعف هذه، يمكن للعلماء بناء أنظمة ذكاء اصطناعي أفضل وأكثر أماناً، لا ترتبك عندما يصبح العالم الحقيقي فوضوياً بعض الشيء.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →