AFTER: Mitigating the Object Hallucination of LVLM via Adaptive Factual-Guided Activation Editing
تقترح الورقة البحثية إطار عمل AFTER، وهو إطار تعديل تنشيط تكيفي موجه بالحقائق يتكون من توجيه التنشيط المعزز بالحقائق وتحسين الإزاحة المتكيف مع الاستعلام، للحد بفعالية من هلوسات الكائنات في النماذج اللغوية البصرية الكبيرة من خلال توجيه التنشيطات المنحازة صراحةً نحو الدلالات الواقعية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك صديقاً ذكياً جداً، واسع الاطلاع، يحب النظر إلى الصور ووصفها لك. هذا الصديق هو ذكاء اصطناعي (تحديداً نموذج لغوي بصري ضخم - Large Vision-Language Model). إنه بارع في قراءة النصوص، ولكن عندما يتعلق الأمر بالنظر إلى الصور، فإنه أحياناً "يتشتت" بما يعتقد أنه يجب أن يراه، بدلاً مما هو موجود بالفعل.
تقدم هذه الورقة البحثية طريقة جديدة تسمى AFTER لإصلاح هذه المشكلة. إليك التفاصيل باستخدام تشبيهات بسيطة:
المشكلة: "الصديق الواثق بزيادة"
يعاني صديقك الذكي من عادة سيئة تسمى هلوسة الأشياء (Object Hallucation).
- السيناريو: تعرض عليه صورة لرجل يجلس على مقعد ويحمل حقيبة ظهر.
- الخطأ: لأن صديقك قد قرأ ملايين القصص عن "التزلج"، يقفز عقله إلى استنتاجات. يقول: "هذا لوح تزلج!" (رغم أنها حقيبة ظهر) أو "إنه يمسك بقفازين!" (رغم أنه يمسك بواحد فقط).
- السبب: يعاني الصديق من الانحياز اللغوي (Language Bias). فهو يثق في مكتبته الداخلية من القصص النصية أكثر من ثقته في البكسلات الفعلية الموجودة في الصورة. إنه يشبه شخصاً يغمض عينيه ويخمن ما يوجد في الغرفة بناءً على إشاعة، بدلاً من فتح عينيه والنظر.
الحلول القديمة: "تغطية عيني" الصديق
حاولت الطرق السابقة إصلاح ذلك عن طريق إضعاف جودة الصورة.
- التشبيه: تخيل أنك تأخذ الصورة، وتجعلها ضبابية، أو تضيف إليها ضجيجاً (static noise)، ثم تطلب من الصديق وصفها. كانت الفكرة هي: "إذا كانت الصورة غير واضحة، فسيُجبر الصديق على الاعتماد على الصورة بشكل أقل والاعتماد على المنطق بشكل أكبر".
- العيب: هذا يشبه محاولة تعليم شخص القيادة عن طريق وضع عصابة على عينيه على أمل أن يتعلم الرؤية بشكل أفضل. إنه أمر مربك ولا يعلمه فعلياً ما هو حقيقي. إنه يتجاهل حقيقة أن الصديق كان بإمكانه أن يكون محقاً لو امتلك الحقائق الصحيحة فقط.
الحل الجديد: AFTER (دليل "مدقق الحقائق")
يقترح المؤلفون طريقة AFTER (التعديل التكيفي الموجه بالحقائق بصرياً ونصياً). فكر في هذا كمنح صديقك مدقق حقائق فائق الدقة ومدرباً شخصياً.
يعمل نظام AFTER في خطوتين:
الخطوة 1: "مدقق الحقائق" (التوجيه التنشيطي المعزز بالحقائق)
بدلاً من جعل الصورة ضبابية، يأخذ نظام AFTER الحقائق الحقيقية حول الصورة (مثل: "هناك حقيبة ظهر حمراء واحدة"، "الرجل يرتدي خوذة") ويحولها إلى جملة واضحة وصادقة.
- التشبيه: تخيل أن صديقك على وشك التخمين. قبل أن يتحدث، يهمس مدقق الحقائق بالحقيقة في أذنه: "تذكر، الشيء الذي تراه هو حقيبة ظهر، وليس لوح تزلج".
- كيف يعمل: يقوم الذكاء الاصطناعي بمقارنة حالته الذهنية "المهلوسة" (ما يريد قوله) مع الحالة الذهنية "الحقيقية" (ما هي الحقيقة). بعد ذلك، يحسب متجه تصحيح (correction vector) — وهو دفعة ذهنية تدفع عقل الصديق بعيداً عن الكذب ونحو الحقيقة.
الخطوة లో 2: "المدرب الشخصي" (تحسين الإزاحة المتكيف مع الاستعلام)
استخدمت الطرق القديمة نفس التصحيح لكل سؤال. لكن في بعض الأحيان، يحتاج الصديق إلى دفعة مختلفة بناءً على ما تسأله عنه.
- التشبيه: إذا سألت: "ما لون السيارة؟"، يحتاج الصديق إلى دفعة تتعلق بـ اللون. وإذا سألت: "كم عدد الأشخاص هناك؟"، فإنه يحتاج إلى دفعة تتعلق بـ العد.
- كيف يعمل: يمتلك AFTER مساعداً صغيراً وذكياً (مقدّر/estimator) ينظر إلى سؤالك المحدد. يقول: "حسناً، بالنسبة لهذا السؤال تحديداً، التصحيح القياسي ليس كافياً. لنضف دفعة إضافية هنا". هذا يجعل التصحيح دقيقاً ومخصصاً للحظة.
لماذا يعد هذا أمراً هاماً؟
- إنه سريع: على عكس الطرق الأخرى التي تتطلب إعادة تدريب الدماغ بالكامل (وهو ما يستغرق أسابيع وأجهزة كمبيوتر عملاقة)، يقوم AFTER فقط بتعديل الإشارات الداخلية للدماغ في الوقت الفعلي. إنه يشبه إعطاء نقرة سريعة على الكتف بدلاً من إرسال الصديق إلى مدرسة لمدة عام كامل.
- إنه دقيق: في الاختبارات، قلل هذا الأسلوب من الهلوسة بنسبة تصل إلى 16.3%. وهذا تحسن هائل.
- يحافظ على المهارات الجيدة: في بعض الأحيان، عندما تصلح خطأ ما، قد تجعل الذكاء الاصطناعي أقل ذكاءً في أشياء أخرى عن طريق الخطأ. AFTER يصلح الأكاذيب دون أن يجعل الصديق ينسى كيف يكون مفيداً أو مبدعاً.
الملخص
فكر في AFTER كأنه نظام GPS صادق لذكاء اصطناعي يستمر في الضياع في خياله الخاص.
- الطريقة القديمة: "إليك خريطة ضبابية؛ حاول أن تخمن أين أنت". (مربك وغير فعال).
- طريقة AFTER: "إليك خريطة واضحة لمكان تواجدك بالفعل، وإليك دليل خطوة بخطوة مخصص لتعود إلى الطريق الصحيح".
من خلال استخدام الحقائق الفعلية للصورة لتوجيه أفكار الذكاء الاصطناعي الداخلية، يمنع AFTER الذكاء الاصطناعي من تأليف القصص ويساعده على قول الحقيقة عما يراه.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.