LookBack: Where and How to Score LVLM Responses via Visual Reference Usage
تقدم هذه الورقة البحثية "LookBack"، وهي طريقة لا تتطلب تدريباً تعمل على تحسين تقييم استجابات النماذج اللغوية الكبيرة متعددة الوسائط (LVLM) من خلال تعزيز احتمالية الرموز (token likelihood) بدرجة "النظر إلى الخلف" البصرية (visual lookback score) للكشف بشكل أفضل عن الهلوسة واختيار المخرات المرتكزة على المحتوى، مما يعالج أوجه القصور في المقاييس الحالية القائمة على الثقة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تتحدث إلى روبوت فائق الذكاء يمتلك عينين وعقلاً في آن واحد. هذا الروبوت، الذي يُسمى نموذج الرؤية واللغة الكبير (أو LVLM اختصاراً)، يمكنه النظر إلى صورة ثم كتابة قصة أو الإجابة على سؤال حولها. إنه يشبه امتلاك صديق يمكنه رؤية العالم ووصفه بشكل مثالي. لكن هنا تكمن المشكلة: أحياناً يثق هذا الروبوت في صوته أكثر من اللازم. قد يصف مشهداً بقواعد لغوية وانسيابية مثالية تجعل الأمر يبدو حقيقياً تماماً، حتى لو كان يتخيل أشياءً ليست موجودة في الصورة على الإطلاق. يُطلق على هذا اسم "الهلوسة".
ولإصلاح ذلك، يحاول العلماء عادةً اختيار أفضل إجابة من قائمة تضم العديد من التخمينات التي يضعها الروبوت. غالباً ما يستخدمون خدعة بسيطة: يختارون الإجابة التي تبدو الأكثر ثقة أو احتمالية بناءً على الحسابات الداخلية الخاصة بالروبوت نفسه. فكر في الأمر كمعلم يختار المقال الذي يبدو الأكثر طلاقة. ولكن ماذا لو كان الروبوت مجرد متحدث لبق، واثق ولكنه مخطئ؟ هذه هي المشكلة التي تعالجها هذه الورقة البحثية: كيف نعرف ما إذا كان الروبوت ينظر حقاً إلى الصورة، أم أنه مجرد غارق في أحلام اليقظة بينما يبدو ذكياً؟
أدرك الباحثون وراء هذه الدراسة، من جامعة يونسي، أن "مقياس الثقة" المعتاد لدى الروبوت معطل عندما يتعلق الأمر بالصور. فقد وجدوا أنه حتى لو أخذت الصورة بعيداً وسألت الروبوت فقط أن يخمن، فإنه سيظل يعطي نفس درجات الثقة العالية لإجاباته. إنه يشبه طالباً يمكنه تسميع مقال تاريخي ببراعة من ذاكرته، ولكن إذا سألته عن صورة محددة في كتابه المدرسي، فقد يصف بثقة ديناصوراً في فصل دراسي لأنه بارع فقط في تخمين الكلمات، وليس في النظر إلى الأدلة.
ولحل هذه المشكلة، ابتكر الفريق طريقة جديدة تسمى LOOKBACK. تخيل أنك تقيم مقال ذلك الطالب مرة أخرى. بدلاً من مجرد التحقق مما إذا كانت الجمل تتدفق بشكل جيد، تسأل: "هل نظرت حقاً إلى الصورة عندما كتبت هذه الكلمة؟" LOOKBACK هي أداة خاصة تتحقق من كل كلمة يكتبها الروبوت لترى ما إذا كانت "عيون" الروبوت (انتباهه الداخلي) تنظر بالفعل إلى الصورة في تلك اللحظة تحديداً.
إليك كيف يعمل الأمر بطريقة ممتعة:
- فحص الثقة: أولاً، يتحقق LOOKBACK من مدى تأكد الروبوت بشأن كلمة ما، تماماً كما فعلت الطرق القديمة.
- فحص النظر للخلف (Lookback Check): بعد ذلك، يسأل: "هل نظرت إلى الصورة لتقول هذه الكلمة؟" إذا قال الروبوت "باندا" وكانت عيناه الداخليتان تحدقان مباشرة في باندا في الصورة، فإن هذه الكلمة تحصل على دفعة هائلة. أما إذا قال "باندا" ولكنه كان يخمن فقط لأنه يحب كلمة "باندا"، فإنه يحصل على عقوبة.
- الدرجة النهائية: تقوم الأداة بدمج هذين الفحصين. فهي تعطي أعلى درجة للإجابات التي ليست فقط سلسة وواثقة، بل تثبت أيضاً أنها كانت تنظر بالفعل إلى الدليل البصري.
اختبر الفريق هذه الفكرة على أربعة تحديات مختلفة تتعلق بالصور والأسئلة، باستخدام ثلاثة عقول روبوتية ذكية مختلفة. ووجدوا أن LOOKBACK كانت أفضل بكثير في اختيار الإجابة الصحيحة من الطرق القديمة. في الواقع، عندما جعلوا الروبوتات تولد 25 تخميناً مختلفاً واستخدموا LOOKBACK لاختيار الفائز، اختارت الإجابة الصحيحة في كثير من الأحيان أكثر من أي طريقة أخرى جربوها.
الأمر الرائع حقاً هو أن LOOKBACK لا تحتاج إلى تعلم أي شيء جديد أو استخدام أي روبوتات إضافية للمساعدة. إنها تستخدم فقط الإشارات التي يرسلها الروبوت الرئيسي بالفعل أثناء تفكيره. إنه يشبه إعطاء الروبوت مرآة لكي يتمكن من فحص عمله دون الحاجة إلى معلم يقف فوق رأسه. تشير الدراسة إلى أنه من خلال مجرد طلب "النظر للخلف" إلى الصورة أثناء حديث الروبوت، يمكننا منع الروبوت من الكذب بثقة بشأن ما يراه، مما يجعل أصدقاءنا من الذكاء الاصطناعي أكثر موثوقية للمهام في العالم الحقيقي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.