← أحدث الأبحاث
💻 computer science

Do Not Leave a Gap: Hallucination-Free Object Concealment in Vision-Language Models

تقدم هذه الورقة هجوماً لإخفاء الأجسام خالياً من الهلوسة لنماذج الرؤية واللغة، حيث يقوم بإخفاء الأجسام المستهدفة عن طريق إعادة ترميزها لتكون متسقة دلالياً مع الخلفية، مما يتجنب الفجوات التمثيلية التي تسبب عادةً هلوسة النماذج.

المؤلفون الأصليون: Amira Guesmi, Muhammad Shafique

نُشر 2026-03-18
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Amira Guesmi, Muhammad Shafique

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان "لا تترك فجوة" (Do Not Leave a Gap) باستخدام لغة بسيطة وتشبيهات إبداعية.

المشكلة الكبرى: "الخدعة السحرية" التي تسير بشكل خاطئ

تخ تخيل أن لديك روبوتاً ذكياً وفناناً ينظر إلى صورة ويصف ما يراه. إنه يشبه المرشد السياحي للصور.

مؤخراً، وجد باحثون أمنيون طريقة لخداع هذا الروبوت. أرادوا إخفاء جسم معين في صورة (مثل وجه شخص أو لوحة ترخيص) بحيث لا يراه الروبوت. وهذا ما يسمى بـ هجوم إخفاء الأجسام (Object Concealment Attack).

الطريقة القديمة (طريقة "الثقب الأسود"):
حاولت الطرق السابقة إخفاء الجسم عن طريق مسحه أساساً أو وضع ثقب أسود ضخم فوقه في عقل الروبوت.

  • التشبيه: تخيل أنك تروي قصة عن نزهة، وفجأة، قمت بتمزيق الصفحة من دفتر ملاحظاتك حيث كانت صورة الشطيرة.
  • النتيجة: يصاب الروبوت بالارتباك. إنه يرى "فجوة" في القصة. ولأنه ذكي جداً ويريد جعل الأمور منطقية، يحاول ملء الفراغ. قد يقول: "أنا أرى شطيرة، وبطانية، و... أوه، لا بد أن هناك صنبور حريق هنا!" رغم عدم وجوده.
  • المصطلح: يسمى هذا الهلوسة (Hallucination). الروبوت يخترع أشياء ليست موجودة لملء الفراغ الذي صنعته أنت.

الحل الجديد: طريقة "الحرباء"

أدرك مؤلفو هذه الورقة أن المشكلة لم تكن في الجسم المفقود؛ بل كانت في المساحة الفارغة المتروكة خلفه. إذا قمت فقط بحذف الجسم، سيهلع الروبوت ويبتكر أشياء جديدة.

اقترحوا طريقة جديدة تسمى إعادة الترميز المتسقة مع الخلفية (Background-Consistent Re-encoding - BCR).

التشبيه:
بدلاً من تمزيق صفحة من كتاب القصة، تخيل أن لديك رساماً ماهراً. تطلب من الرسام أن يأخذ الشخص الموجود في الصورة ويرسمه بدقة شديدة بحيث يبدو تماماً مثل العشب أو السماء خلفه.

  • الشخص لا يزال موجوداً (فيزيائياً)، لكن في عين الروبوت، أصبح جزءاً من الخلفية.
  • لا توجد "فجوة". القصة تتدفق بسلاسة.
  • ولأن الروبوت لا يرى ثقباً في الصورة، فإنه لا يشعر بالحاجة لابتكار صنبور حريق لملئه. سيقول فقط: "أنا أرى حديقة بها مقعد وبعض الحمام"، ويتوقف عند هذا الحد.

كيف يعمل (السر الخفي)

قام الباحثون ببناء برنامج كمبيوتر يقوم بتعديل بكسلات الصورة بدرجة طفيفة جداً للقيام بخدعة "الرسم" هذه. وهو يقوم بثلاثة أشياء رئيسية:

  1. المطابقة الإحصائية: يجعل الألوان والأنسجة للجسم المخفي تتطابق تماماً مع الخلفية (مثل الحرباء التي تغير لون جلدها).
  2. الدمج الدلالي: يضمن أن "معنى" الجسم المخفي يندمج في "معنى" الخلفية. فهو لا يبدو كعشب فحسب، بل يتصرف كعشب في عقل الروبوت.
  3. لا توجد فجوات: والأهم من ذلك، أنه يحافظ على "بنية" الصورة سليمة. هو لا يحذف أي شيء؛ بل يقوم فقط بتمويهه.

لماذا يهم هذا الأمر

اختبر الباحثون هذه الطريقة على ثلاثة من أذكى نماذج الذكاء الاصطنا ve المتاحة اليوم (LLaVA، وBLIP-2، وInstructBLIP).

  • الطريقة القديمة: نجحت في إخفاء الجسم، لكنها تسببت في جعل الروبوت يهلوس بأجسام جديدة بثلاث مرات أكثر من الطريقة الجديدة.
  • الطريقة الجديدة (BCR): نجحت في إخفاء الجسم، لكن الروبوت ظل هادئاً ولم يخترع أشياء وهمية. لقد حافظ على دقة وصف بقية المشهد (محافظاً على حوالي 86% من الأجسام الأخرى).

الخلاصة

الدرس الرئيسي من هذه الورقة هو قاعدة بسيطة لسلامة الذكاء الاصطناعي: لا تترك فجوة.

عندما تحاول إخفاء شيء ما عن الذكاء الاصطناعي، إذا تركت "فراغاً" أو "قطعة مفقودة"، فإن خيال الذكاء الاصطناعي سينطلق بعيداً لملئه. ولكن إذا قمت بتمويه الجسم بحيث يندمج بسلاسة مع الخلفية، فسيظل الذكاء الاصطناعي واقعياً.

باخت de المختصر: لإيقاف الذكاء الاصطناعي عن اختلاق الأشياء، لا تحذف الحقيقة فحسب؛ بل أخفِها جيداً بحيث تبدو وكأنها جزء من المشهد الطبيعي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →