Revisit What You See: Revealing Visual Semantics in Vision Tokens to Guide LVLM Decoding
تقدم الورقة البحثية ReVisiT، وهي طريقة فك تشفير لا تتطلب تدريباً تعمل على التخفيف من الهلوسة في النماذج اللغوية البصرية الكبيرة عبر إسقاط الدلالات البصرية ذات الصلة ديناميكياً من الرموز البصرية في عملية توليد النصوص، محققةً أداءً متفوقاً مع تقليل التكلفة الحسابية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إليك شرح لورقة بحث ReVisiT: "كشف الدلالات البصرية في الرموز البصرية لتوجيه فك تشفير نماذج اللغة البصرية الكبيرة (LVLM)"، باستخدام لغة بسيطة وتشبيهات إبداعية.
المشكلة الكبرى: الفنان "الحالم"
تخيل أنك استأجرت فناناً عبقرياً (نموذج لغة بصري كبير، أو LVLM) ليصف لك صورة تعرضها عليه. تعرض عليه صورة تفاحة حمراء على طاولة.
من الناحية المثالية، ينظر الفنان إلى الصورة ويقول: "هذه تفاحة حمراء".
لكن أحياناً، يتشتت انتباه الفنان بأفكاره الداخلية الخاصة. قد يقول: "هذه تفاحة حمراء... وأيضاً موزة وبيتزا"، رغم أن هذه الأشياء ليست موجودة في الصورة. هذا ما يسمى بـ الهلوسة (Hallucination).
تسأل الورقة البحثية: لماذا يحدث هذا؟
اكتشف الباحثون أن الفنان يرى التفاحة بالفعل بشكل صحيح في "عين عقله" (البيانات البصرية)، ولكن عندما يبدأ في التحدث، يصاب بالارتباك بسبب ضجيج مفرداته الخاصة. هو يعرف الحقيقة، لكنه ينسى قولها لأنه يركز بشدة على الكلمات التي تأتي عادةً مع بعضها البعض (مثل "تفاحة" و"فطيرة")، بدلاً من التركيز على ما هو موجود فعلياً في الصورة.
الاكتشاف: "الملاحظات المخفية"
نظر الفريق عن كثب في كيفية عمل هذه النماذج الذكية. وجدوا أن النموذج يقسم الصورة إلى قطع صغيرة تسمى الرموز البصرية (Vision Tokens). فكر في هذه الرموز كأنها ملاحظات لاصقة صغيرة مثبتة على أجزاء مختلفة من الصورة.
- الملاحظات اللاصقة ذكية: حتى عندما يرتكب الذكاء الاصطناعي خطأً (يهلوس بموزة)، فإن الملاحظات اللاصقة الموجودة على الصورة لا تزال تحتوي على المعلومات الصحيحة حول التفاحة. الحقيقة البصرية موجودة، لكنها مدفونة فقط.
- مشكلة الترجمة: عندما يحاول الذكاء الاصطناعي تحويل هذه الملاحظات اللاصقة إلى كلمات، تصبح العملية فوضوية. إذا سألت الذكاء الاصطناعي: "ما هي الكلمة التي تمثل هذه الملاحظة اللاصقة؟" دون وجود قواعد، فقد يخمن "سماء" أو "أزرق" أو "ملمس". الإجابة تكون غامضة للغاية.
- الفلتر السحري: اكتشف الباحثون أنه إذا وضعت فلتر (مرشح) على السؤال — أي تطلب من الذكاء الاصطناعي أن يختار فقط من قائمة محددة من الكلمات ذات الصلة (مثل "تفاحة"، "فاكهة"، "أحمر") — تصبح الملاحظات اللاصقة واضحة جداً فجأة. يمكن للذكاء الاصطناعي أخيراً أن يقول: "آه! هذه الملاحظة تعني بالتأكيد 'تفاحة'!".
الحل: ReVisiT (الرجوع إلى الرموز البصرية)
بناءً على ذلك، ابتكر المؤلفون طريقة جديدة تسمى ReVisiT. إنها تشبه إعطاء الفنان "ورقة غش" أثناء حديثه، ولكن دون الحاجة لإعادة تدريب الفنان أو استئجار فنان جديد.
إليك كيف تعمل ReVisiT، خطوة بخوة:
- التحقق من السياق: بينما يبدأ الذكاء الاصطناعي في كتابة جملة، تقوم ReVisiT بالنظر فيما يفكر فيه الذكاء الاصطناعي حالياً.
- الفلتر: تقوم بإنشاء قائمة صغيرة من الكلمات ذات الصلة بناءً على ذلك السياق (على سبيل المثال، إذا كانت الجملة عن المطبخ، تتضمن القائمة "كوب"، "ملعقة"، "تفاحة"، ولكن ليس "طائرة").
- المطابقة: تنظر ReVisiT إلى جميع "الملاحظات اللاصقة" (الرموز البصرية) من الصورة وتسأل: "أي من هذه الملاحظات تتطابق بشكل أفضل مع قائمتنا الحالية من الكلمات؟" وتختار أفضل مطابقة واحدة.
- الدفعة (التوجيه): تأخذ تلك الملاحظة الفائزة وتدفع اختيار الكلمة التالية للذكاء الاصطناعي بلطف نحوها. الأمر يشبه الهمس في أذنه: "مهلاً، هل تتذكر تلك الملاحظة؟ إنها تقول 'تفاحة'، وليس 'موزة'".
لماذا هذا الأمر رائع؟
- لا يتطلب تدريباً: لا تحتاج لتعليم الذكاء الاصطناعي أي شيء جديد. أنت فقط تغير طريقة كلامه أثناء حديثه.
- سريع جداً: بما أنها مجرد عملية فحص رياضي سريع و"دفعة" بسيطة، فهي لا تبطئ الذكاء الاصطناعي. في الواقع، هي تقريباً بنفس سرعة الطريقة القياسية للكلام.
- يعمل في كل مكان: اختبروها على العديد من نماذج الذكاء الاصطناعي (من الصغيرة إلى الكبيرة جداً) وعلى مهام متنوعة (وصف الصور، الإجابة على الأسئلة، تحديد الأشياء). لقد قللت باستمرار من "الأحلام" (الهلوسة) وجعلت الأوصاف أكثر دقة.
التشبيه: أمين المكتبة والكتاب
تخيل أن الذكاء الاصطناعي هو طالب يؤدي اختباراً.
- الرموز البصرية (Vision Tokens) هي الكتب المدرسية المفتوحة أمام الطالب على مكتبه. الطالب لديه الإجابات الصحيحة في الكتب.
- الهلوسة تحدث لأن الطالب يحاول تخمين الإجابة من ذاكرته بينما يتجاهل الكتب، أو لأن الكتب مفتوحة على الصفحة الخطأ.
- ReVisiT هو أمين مكتبة يقترب، ينظر إلى السؤال، يشير إلى الصفحة المحددة في الكتاب المدرسي التي تحتوي على الإجابة، ويقول: "اقرأ هذا الجزء". عندها يقرأ الطالب الإجابة الصحيحة من الكتاب بدلاً من التخمين.
الملخص
تثبت الورقة البحثية أن نماذج الذكاء الاصطناعي "ترى" الحقيقة بالفعل داخل بياناتها البصرية، لكنها غالباً ما تفشل في نطقها لأنها تضيع في ارتباطاتها اللفظية. ReVisiT هي أداة بسيطة ومجانية تعمل كجسر، تجبر النموذج على النظر إلى ملاحظاته البصرية واستخدامها لتصحيح كلامه، مما يؤدي إلى تقليل الأكاذيب وزيادة دقة الأوصاف.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.