← أحدث الأبحاث
💻 computer science

Logit Lens Supervision for Patch-Level Explanations in Vision-Language Models

تقدم هذه الورقة "فقدان عدسة اللوجيت" (Logit Lens Loss - LLL)، وهو هدف مساعد خفيف الوزن يعزز القابلية للتفسير على مستوى الرقعة في النماذج الرؤية-اللغوية من خلال محاذاة تضمينات الرموز المرئية مع مفاهيمها النصية المقابلة، مما يؤدي إلى تحسين التأسيس وتقليل الهلوسة دون الحاجة إلى تغييرات هيكلية أو إعادة تدريب مكثفة.

المؤلفون الأصليون: Parsa Esmaeilkhani, Longin Jan Latecki

نُشر 2026-08-12
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Parsa Esmaeilkhani, Longin Jan Latecki

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك صديقاً آلياً فائق الذكاء يمكنه النظر إلى صورة وإخبارك بقصة عنها. هذا الروبوت مبني من جزأين مختلفين تماماً: زوج من "العيون" التي ترى الصورة كمجموعة من المربعات الصغيرة الملونة (الرقع)، و"دماغ" خبير في كتابة القصص باستخدام الكلمات. عندما تسأل الروبوت: "أين القطة؟"، ترسل عيناه إشارة لكل مربع صغير في الصورة إلى دماغه. يقوم الدماغ بعد ذلك بخلط إشارات الصورة هذه مع إشارات الكلمات الخاصة به ليعرف الإجابة.

المشكلة هي أنه بينما تنتقل إشارات الصورة هذه عبر الدماغ، فإنها تضيع قليلاً وسط الزحام. فالدماغ بارع جداً في التحدث لدرجة أنه يبدأ أحياناً في تجاهل التفاصيل المحددة لمربعات الصورة، أو والأسوأ من ذلك، يبدأ في خلط إشارات الصورة مع إشارات الكلمات بشكل متداخل جداً لدرجة أن الروبوت ينسى أي مربع ينتمي فعلياً للقطة. قد يخمن كلمة "قطة" بشكل صحيح، لكنه يفعل ذلك بناءً على الكلمات فقط، وليس لأنه "رأى" القطة في الصورة حقاً. هذا أمر بالغ الأهمية، لأننا إذا أردنا الوثوق بهذه الروبوتات، أو إذا أردنا معرفة "لماذا" يعتقد الروبوت أن هناك قطة في الصورة، فنحن بحاجة إلى القدرة على رؤية الجزء المحدد الذي ينظر إليه بالضبط. إذا لم يستطع الروبوت الإشارة إلى القطة، فقد يكون في حالة "هلوسة"—أي أنه يختلق أشياء ليست موجودة.

تعالج هذه الورقة البحثية هذه المشكلة تحديداً. لاحظ المؤلفان، بارسا إسماعيلي خاني ولونجين جان لاتيكي، أنه في "نماذج الرؤية واللغة" (VLMs) الحديثة، تصبح الصلة بين رقعة صورة محددة والكلمة التي تصفها ضعيفة وضبابية كلما انتقلت البيانات عبر النظام. ولإصلاح ذلك، اخترعا حيلة تدريب جديدة تسمى فقدان عدسة اللوجيت (Logit Lens Loss - LLL).

فكر في دماغ الروبوت كمكتبة ضخمة حيث يمثل كل كتاب كلمة ما. عادةً، يتم تعليم الروبوت فقط اختيار الكتاب الصحيح لقوله تالياً (مثل الإجابة على سؤال). أدرك المؤلفان أنه إذا كان الروبوت ينظر إلى رقعة تحتوي على قطة، فيجب على تلك الرقعة تحديداً أن تهمس بكلمة "قطة" للمكتبة، حتى قبل أن يقرر الروبوت التحدث. لقد وضعا قاعدة جديدة للتدريب: كلما رأى الروبوت رقعة تحتوي على قطة، فإنهما يجبران تلك الرقعة على التنبؤ بقوة بكلمة "قطة" في مفردات المكتبة. وقد أسميا ذلك "فقدان عدسة اللوجيت" لأنه يستخدم أداة تسمى "عدسة اللوجيت" لاستراق النظر داخل دماغ الروبوت ومعرفة الكلمات التي تفكر فيها رقع الصور سراً.

أفضل ما في الأمر؟ لم يضطروا لإعادة بناء الروبوت أو إضافة أي أجزاء جديدة. لقد قاموا فقط بتعديل قواعد التدريب. وعندما اختبروا هذه القاعدة الجديدة على روبوتين مشهورين (LLaVA-v1.5 و Qwen2.5-VL)، كانت النتائج بمثادة تشغيل كشاف ضوئي. قبل ذلك، كانت "خريطة الثقة" الخاصة بالروبوت (وهي خريطة حرارية توضح أين يعتقد أن الشيء موجود) ضبابية ومشتتة، مثل نافذة مغطاة بالضباب. أما بعد استخدام قاعدتهم الجديدة، فقد أصبحت الخريطة حادة ودقيقة، حيث أضاءت بالضبط مكان وجود القطة.

تظهر الورقة البحثية أن هذا الإصلاح البسيط يقوم بعمل جبار. فهو يجعل الروبوتات أفضل بكثير في تحديد الأشياء في الصور (التوطين/Grounding)، ويقلل من المرات التي يختلق فيها أشياء ليست موجودة (الهلوسة)، بل ويساعدها أيضاً في الإشارة إلى الأشياء في صور جديدة لم يسبق له رؤيتها من قبل. ومن المثير للدهشة، أنه لم يجعل الروبوتات أسوأ في الإجابة على الأسئلة أو سرد القصص؛ بل في الواقع، حافظ على مهاراتها اللغوية قوية كما كانت. يشير المؤلفان إلى أنه من خلال إبقاء إشارات الصور مرتبطة بمعناها الأصلي، تصبح الروبوتات أكثر ذكاءً وأكثر صدقاً بشأن ما تراه. إنه يشبه تعليم طالب ليس فقط حفظ الإجابة، بل فهم الخريطة التي ينظر إليها بالفعل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →