SAVAA: Mitigating Hallucinations in LVLMs via Step-wise Adaptive Visual Attention Amplification
يُعد SAVAA إطار عمل خالٍ من التدريب يعمل على التخفيف من الهلوسة في النماذج اللغوية الرؤية الكبيرة من خلال تقديم "إنتروبيا التأسيس البصري" لتقدير مخاطر الهلوسة على مستوى الرمز وتعديل عوامل تضخيم الانتباه البصري بشكل تكيفي أثناء التوليد، مما يتغلب على قيود استراتيجيات التضخيم الثابتة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مساعداً آلياً ذكياً جداً (نموذج لغوي بصري ضخم، أو LVLM) ينظر إلى صورة ويصفها لك. أحياناً، يصبح هذا الروبوت واثقاً بنفسه أكثر من اللازم ويبدأ في اختلاق أشياء من خياله. قد يقول مثلاً: "هناك كلب في الصورة"، رغم عدم وجود كلب. يُسمى هذا "الهلوسة" (Hallucination).
يفعل الروبوت ذلك لأنه يعتمد كثيراً على "ذاكرته" حول كيفية سير الأمور عادةً في العالم (الأولويات اللغوية) ولا يركز بما يكفي على ما يراه فعلياً في الصورة في تلك اللحظة المحددة.
الطريقة القديمة: "مفتاح التحكم" الموحد للجميع
حاول الباحثون مؤخراً إصلاح ذلك عن طريق رفع "مستوى صوت" الانتباه البصري للروبوت. تخيل أن الروبوت لديه مفتاح للتحكم في "مستوى النظر إلى الصورة" ومفتاح آخر لـ "الاستماع إلى أفكاره الخاصة".
استخدمت الطرق السابقة مفتاح تحكم ثابتاً. حيث كانوا يقومون ببساطة برفع "مستوى النظر إلى الصورة" بمقدار ثابت لكل كلمة يكتبها الروبوت.
- المشكلة: هذا يشبه محاولة الاستماع إلى همس خافت وصراخ عالٍ باستخدام نفس إعدادات مستوى الصوت.
- أحياناً يحتاج الروبوت إلى النظر بتركيز أكبر إلى الصورة لمنعه من الكذب، لكن مستوى الصوت الثابت يكون منخفضاً جداً (نقص التضخيم - Under-amplification).
- وفي أحيان أخرى، يكون الروبوت ينظر بالفعل عن كثب، لكن مستوى الصوت مرتفع جداً لدرجة أنه يبدأ في "رؤية" أشياء ليست موجودة لمجرد أنه يحدق بقوة شديدة (تضخيم مفرط - Over-amplification).
تسمي الورقة البحثية هذا "نمط الفشل المزدوج" (Dual Failure Pattern): الإعداد الثابت يكون ضعيفاً أحياناً وقوياً جداً أحياناً أخرى.
الحل الجديد: SAVAA (الطيار الذكي والمتكيف)
يقترح المؤلفون طريقة جديدة تسمى SAVAA (تضخيم الانتباه البصري المتكيف خطوة بختوة). بدلاً من مفتاح تحكم ثابت، يعمل SAVAA مثل طيار ذكي يعدل أدوات التحكم في الوقت الفعلي، كلمة بكلمة.
إليك كيف يعمل، خطوة بخطوة:
1. "رادار المخاطر" (إنتروبيا التأسيس البصري)
قبل أن يكتب الروبوت الكلمة التالية، يتحقق SAVAA من "رادار المخاطر" ليرى ما إذا كان الروبوت على وشك الكذب. يستخدم أداة خاصة تسمى "إنتروبيا التأسيس البصري" (Visual Grounding Entropy - VGE).
- كيف يعمل: يطرح سؤالين:
- هل الروبوت غير متأكد؟ (عدم اليقين العالي = خطر).
- هل ينظر الروبوت إلى الصورة من أجل هذه الكلمة؟ (إذا كان الروبوت واثقاً ولكن الصورة لا تدعم الكلمة، فهذا خطر كبير).
- التشبيه: تخيل أن الروبوت يصف شاطئاً. إذا قال "رمل"، فالصورة تدعم ذلك، لذا فإن الخطر منخفض. إذا قال "ثلج" (والصورة هي بوضوح لشاطئ)، فإن الخطر مرتفع، حتى لو شعر الروبوت بثقة كبيرة تجاه كلمة "ثلج".
2. "مفتاح التحكم الديناميكي"
بناءً على رادار المخاطر، يقوم SAVAA بتعديل "مستوى النظر إلى الصورة" للكلمة التالية:
- خطر مرتفع: إذا كان الروبوت على وشك قول شيء خطر، يقوم SAVAA برفع مستوى الانتباه البسي، مما يجبر الروبوت على النظر بدقة إلى الصورة قبل التحدث.
- خطر منخفض: إذا كان الروبوت في وضع آمن والصورة تدعم الكلمة بوضوح، يقوم SAVAA بخفض المستوى. هذا يمنع الروبوت من أن يصبح "مفرط الحماس" ويبدأ في اختراع تفاصيل جديدة.
3. "زر الكتم" للأفكار القديمة
أحياناً، حتى مع التركيز البصري المثالي، لا يزال الروبوت يعتمد كثيراً على عاداته الداخلية في "سرد القصص". لإصلاح ذلك، يضيف SAVAA ميزة "كبح الانتباه النصي" (Text Attention Suppression).
- التشبيه: تخيل أن الروبوت يحاول وصف صورة، لكنه يستمر في التشتت بسبب راديو يلعب قصة في الخلفية. يقوم SAV__AA** بـ كتم صوت الراديو (المدخلات النصية) بلطف حتى يركز الروبوت تماماً على الصورة. هذا يمنع الروبوت من إكمال الجملة لمجرد أنها "تبدو صحيحة" في سياق قصة، بدلاً من كونها موجودة في الصورة.
لماذا هذا مهم؟
اختبر الباحثون هذا على ثلاثة روبوتات ذكية مختلفة (LLaVA، وQwen، وInternVL) باستخدام اختبارات متنوعة حيث كان على الروبوتات وصف الصور.
- النتيجة: قلل SAVAA بشكل كبير من عدد التفاصيل المختلقة (الهلوسة) مقارنة بطرق "مفتاح التحكم الثابت" القديمة.
- الكفاءة: يقوم بكل هذا دون الحاجة إلى إعادة تدريب الروبوت أو جعله يعمل ببطء. إنه فقط يعدل مفاتيح الانتباه أثناء تفكير الروبوت.
ملخص
فكر في الطريقة القديمة كأنها سائق يضغط على دواسة الوقود بنسبة 50% مهما كانت الظروف، سواء كان يقود على طريق سريع مستقيم أو طريق جبلي متعرج. قد يصطدم (يهلوس) لأنه لم يبطئ عند المنحنى أو لم يسرع بما يكفي عند التل.
أما SAVAA فهو السائق الذي يتحقق باستمرار من الطريق، والسرعة، والظروف، ويعدل دواسة الوقود والمكابح بشكل مثالي لكل منعطف. إنه يضمن أن يصف الروبوت ما يراه بالضبط، لا أكثر ولا أقل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.