Revealing and Enhancing Core Visual Regions: Harnessing Internal Attention Dynamics for Hallucination Mitigation in LVLMs
تقترح الورقة البحثية طريقة PADE، وهي طريقة لا تتطلب تدريباً تعمل على التخفيف من حدة الهلوسة في النماذج اللغوية البصرية الكبيرة من خلال الاستفادة من ديناميكيات الانتباه الإيجابي الداخلية لتحديد وتعزيز المناطق البصرية الجوهرية مع تغيير حجم التدخلات بشكل تكيفي وتعويض رموز النظام لضمان الالتزام بالتعليمات.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مساعداً ذكياً ومطلعاً جداً (نموذج لغوي بصري ضخم، أو LVLM) يمكنه النظر إلى الصور ووصفها. هذا المساعد عبقري، لكن لديه عادة غريبة: أحياناً، يتشتت انتباهه بسبب "الضجيج" الداخلي الخاص به ويبدأ في اختلاق الأمور. قد ينظر إلى صورة تفاحة حمراء ويقول بثقة: "هذه كمثرى خضراء"، أو يصف كلباً يركض نحو الماء بينما هو في الواقع يركض بعيداً عنه.
تقدم هذه الورقة البحثية حيلة ذكية جديدة تسمى PADE (تعزيز ديناميكيات الانتباه الإيجابي) لإصلاح هذه المشكلة دون الحاجة إلى إعادة تدريب المساعد أو استئجار مساعدين إضافيين.
إليك تفصيل كيفية عملها، باستخدام تشبيهات بسيطة:
1. المشكلة: "الشريك المزعج" (بالوعات الانتباه)
عندما ينظر المساعد إلى صورة، فإنه يقسم الصورة إلى قطع صغيرة (رموز/tokens) ويحاول تحديد أي القطع هي الأهم.
- المشكلة: في عقل المساعد، هناك أجزاء معينة تسمى "الشريك المزعج" (وتسمى بالوعات الانتباه - Attention Sinks). هذه الأجزاء عادة ما تكون أجزاء مملة وعامة من الصورة (مثل الخلفية أو بداية الجملة) وهي التي تصرخ بأعلى صوت.
- النتيجة: ولأن "الشركاء المزعجين" صاخبون جداً، يتجاهل المساعد الأشياء المثيرة للاهتمام حقاً (التفاحة، الكلب) ويركز على الضجيج. وهذا ما يجعله يهلوِس (يختلق الأمور) لأنه لا ينظر فعلياً إلى التفاصيل المهمة.
2. الحلول القديمة: "المطارق الثقيلة"
حاول العلماء إصلاح ذلك من قبل، لكن أساليبهم كانت خرقاء:
- طريقة "التحقق المزدوج": جعلوا المساعد ينظر إلى الصورة مرتين (مرة بشكل طبيعي، ومرة مع تغيير الصورة قليلاً) ثم قارنوا بين الإجابات. هذا يشبه أن تطلب من صديق أن يراجع واجب الرياضيات الخاص بك مرتين فقط ليتأكد. هذا يعمل، لكنه بطيء ويضاعف العمل.
- طريقة "استئجار محقق": قاموا باستئجار ذكاء اصطناعي آخر أصغر حجماً ليشير إلى ما يوجد في الصورة. هذا يشبه استئجار حارس أمن لمراقبة منزلك أثناء نومك. هذا يعمل، لكنه مكلف وقد لا يتفق الحارس مع قواعد منزلك.
- طريقة "مقبض الصوت": حاولوا فقط رفع مستوى الصوت للأجزاء التي تبدو مهمة من الصورة. ولكن لأن "الشركاء المزعجين" كانوا صاخبين بالفعل، أدى ذلك إلى جعل الضجيج أعلى، مما جعل الهلوسة تسوء.
3. الحل الجديد: PADE (متتبع بقعة الضوء)
أدرك المؤلفون أنه بينما يظل "الشركاء المزعجون" صاخبين دائماً، فإن الأجزاء المهمة من الصورة (مثل التفاحة) لها سلوك مختلف. فهي لا تكتفي بالبقاء صاخبة فحسب، بل تزداد صخباً كلما تعمق المساعد في التفكير.
تخيل الأمر كأنك محقق في غرفة مزدحمة:
- الانتباه الساكن (الطريقة القديمة): أنت تنظر إلى من يصرخ بأعلى صوت الآن. هذا عادة ما يكون "الشريك المزعج" (ضجيج الخلفية).
- PADE (الطريقة الجديدة): أنت تراقب من الذي يزداد اهتماماً مع استمرار المحادثة. إذا بدأ المساعد في إعطاء اهتمام أكبر للتفاحة مع انتقاله من الطبقة الأولى من التفكير إلى الطبقة الأخيرة، فهذا دليل على أن التفاحة حقيقية ومهمة.
يعمل PADE عبر ثلاث خطوات بسيطة:
- تتبع النمو (ديناميكيات الانتباه الإيجابي): بدلاً من السؤال "من هو الأعلى صوتاً؟"، يسأل PADE: "من الذي يحصل على اهتمام أكبر أثناء تفكيرنا؟". إنه يتجاهل الضجيج الساكن ويركز فقط على الأجزاء من الصورة التي تكتسب أهمية. هذا يكشف عن "الجوهر الحقيقي" للصورة.
- ضبط مستوى الصوت (تدرج MAD): عقل المساعد فوضوي؛ بعض الأجزاء صاخبة جداً، وبعضها هادئ. يستخدم PADE "مقبض صوت" ذكياً (يسمى الانحراف المطلق عن الوسيط - Median Absolute Deviation) لضمان عدم الصراخ بصوت عالٍ جداً أو منخفض جداً. إنه يجد التوازن المثالي لتعزيز الأجزاء المهمة دون إفساد النظام.
- لا تنسَ التعليمات (تعويض رموز النظام): أحياناً، إذا قمت بتعزيز الصورة أكثر من اللازم، فقد ينسى المساعد ما طلبته منه (مثلاً: "صف التفاحة"). يمتلك PADE شبكة أمان: يأخذ جزءاً ضئيلاً من الانتباه من "رموز النظام" (الأجزاء المملة والعامة من النص الذي لا تهم كثيراً) ويعطيها للتفاحة. بهذه الطريقة، يرى المساعد التفاحة بوضوح دون أن ينسى سؤالك.
النتيجة
باستخدام "متتبع بقعة الضوء" هذا، يتوقف المساعد عن اختلاق الأمور.
- يتوقف عن قول إن التفاحة خضراء.
- يتوقف عن القول بوجود كوب في الصورة بينما لا يوجد أحد.
- يفعل كل هذا فوراً (لا حاجة لإعادة التدريب) وبتكلفة زهيدة (لا حاجة لأجهزة كمبيوتر إضافية).
باختاً: يعلم PFE الذكاء الاصطناعي كيف يتجاهل ضجيج الخلفية ويركز على الأجزاء من الصورة التي تصبح أكثر إثارة للاهتمام فعلياً أثناء تفكيره، مما يضمن أنه يقول الحقيقة عما يراه.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.