← أحدث الأبحاث
🤖 AI

Residual Decoding: Mitigating Hallucinations in Large Vision-Language Models via History-Aware Residual Guidance

تقدم هذه الورقة البحثية "التحليل المتبقي" (ResDec)، وهي طريقة مبتكرة لا تتطلب تدريباً، تستفيد من معلومات الرموز التاريخية وآليات الاستدلال الداخلي للحد بفعالية من الهلوسة وتعزيز التأسيس البصري في النماذج اللغوية البصرية الكبيرة دون الحاجة إلى تدريب إضافي.

المؤلفون الأصليون: Xinrong Chen, Xu Chu, Yingmin Qiu, Hengyuan Zhang, Jing Xiong, Shiyu Tang, Shuai Liu, Shaokang Yang, Cheng Yang, Hayden Kwok-Hay So, Ngai Wong

نُشر 2026-03-25
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xinrong Chen, Xu Chu, Yingmin Qiu, Hengyuan Zhang, Jing Xiong, Shiyu Tang, Shuai Liu, Shaokang Yang, Cheng Yang, Hayden Kwok-Hay So, Ngai Wong

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك صديقاً ذكياً ومطلعاً جداً، يحب النظر إلى الصور ووصفها. هذا الصديق هو ذكاء اصطناعي (تحديداً نموذج لغوي بصري ضخم). إنه بارع في التحدث، لكن لديه عادة مضحكة: أحياناً، عندما ينظر إلى صورة، يبدأ في إخبارك بأشياء ليست موجودة في الصورة بالفعل.

على سبيل المثال، إذا عرضت عليه صورة قطة، قد يقول لك: "آه، أرى قطة فروية تجلس على سجادة حمراء بجانب كوب من القهوة". لكن في الصورة، لا توجد سجادة ولا قهوة. لقد افترض الذكاء الاصطناعي وجودهما لأن هذه الأشياء غالباً ما توجد مع القطط في بيانات تدريبه الواسعة. هذا ما يسمى بـ الهلوسة (Hallucination). هو لا يكذب عن قصد؛ بل إن "معرفته المكتوبة في الكتب" طغت على ما تراه "عيناه" فعلياً.

تقدم هذه الورقة البحثية حيلة ذكية جديدة تسمى فك التشفير المتبقي (Residual Decoding - ResDec) لمنع حدوث ذلك. وإليك كيف تعمل، مشروحة ببساطة:

المشكلة: "الخطأ الواثق"

عندما ينظر الذكاء الاصطناعي إلى صورة ويبدأ في وصفها، فإنه لا ينطق بالإجابة فوراً. بل يبني الجملة كلمة بكلمة، تماماً كما يفعل الإنسان أثناء التفكير بصوت عالٍ.

اكتشف الباحثون أنه بينما يبني الذكاء الاصطناعي الجملة، فإنه يصاب بالارتباك:

  1. البداية: في البداية تماماً، يكون الذكاء الاصطناعي فوضوياً بعض الشيء. إنه يفكر: "حسناً، أنا أرى صورة... ماذا أقول أولاً؟".
  2. المنتصف: مع استمراره في العمل، يبدأ في الاستقرار على الفكرة الصحيحة. تبدأ الإجابة "الصحيحة" في التوهج بوضوح في ذهنه.
  3. الفخ: ولكن بعد ذلك، وقبل أن ينطق بالإجابة النهائية مباشرة، يتشتت انتباه الذكاء الاصطناعي بسبب "عاداته اللغوية" (الأولويات النصية). يبدأ في التفكير: "أوه، عادة ما يقول الناس 'سجادة حمراء' عندما يرون قطة!". لذا، فإنه يعزز بالخطأ احتمالية الكلمة الخاطئة ("سجادة") ويقلل من احتمالية الكلمة الصحيحة ("لا شيء").

الأمر يشبه طالباً يؤدي اختباراً. هو يعرف أن الإجابة هي (ب)، ولكن قبل أن يظلل الإجابة مباشرة، يصيبه الذعر ويفكر: "مهلاً، عادة ما يضع المعلم الإجابة كـ (ج)"، فيغير إجابته إلى (ج) ويخطئ.

الحل: "المحقق التاريخي"

أدرك المؤلفون أن الذككاء الاصطناعي كان يعرف الإجابة الصحيحة في مرحلة أبكر من العملية، قبل أن يرتبك بسبب عاداته. كانت الإشارة "الصحيحة" مختبئة في تاريخ الكلمات التي ولدها بالفعل.

يعمل ResDec مثل المحقق التاريخي. إليك التشبيه:

تخيل الذكاء الاصطناعي كمسافر يمشي عبر غابة ضبابية (عملية فك التشفير).

  • الضباب: يمثل الضباب ارتباك الذكاء الاصطناعي الناتج عن عاداته اللغوية.
  • المسار: المسار الصحيح هو الحقيقة حول الصورة.
  • المحقق: ينظر ResDec إلى آثار أقدام المسافر من الخطوات القليلة الماضية.

وجد الباحثون نمطاً في هذه الآثار:

  1. الفوضى: في البدا_ة، تكون آثار الأقدام مبعثرة (الذكاء الاصطناعي يحاول فهم الأمور).
  2. الوادي: بعد ذلك، تصبح آثار الأقدام مستقيمة وثابتة جداً. هذه هي "مرحلة الارتكاز الدلالي". لقد ثبت الذكاء الاصطناعي على الحقيقة.
  3. الانحراف: أخيراً، تبدأ آثار الأقدام في التيه مرة أخرى بينما يحاول الذكاء الاصطناعي جعل الجملة تبدو منمقة (وهنا تحدث الهلوسة).

يقول ResDec: "مهلاً، دعونا نتجاهل آثار الأقدام المتعرجة في النهاية. دعونا ننظر إلى آثار الأقدام المستقيمة والثابتة من منتصف الرحلة حيث كان الذكاء الاصطناعي أكثر ثقة ووضوحاً".

إنه يأخذ تلك الأدلة "الثابتة" من الماضي ويمزجها مع القرار الحالي. الأمر يشبه قولك للطالب: "لا تغير إجابتك إلى (ج) لمجرد أنك متوتر. تذكر، عندما كنت هادئاً قبل دقيقة، كنت متأكداً من أن الإجابة هي (ب). تمسك بـ (ب)".

لماذا هذا أمر رائع؟

  1. لا يتطلب تدريباً إضافياً: عادةً، لإصلاح ذكاء اصطناعي، عليك تعليمه أشياء جديدة، وهو أمر يستغرق أسابيع وملايين الدولارات. ResDec هو حل "جاهز للتشغيل". لا تحتاج لإعادة تدريب الذكاء الاصطناعي؛ أنت فقط تغير طريقة قراءته لعقله أثناء العمل.
  2. سريع جداً: إنه لا يبطئ الذكاء الاصطناعي. هو فقط يستخدم المعلومات التي كان الذكاء الاصطناعي يولدها بالفعل على أي حال. الأمر يشبه التحقق من مرآتك الخلفية أثناء القيادة؛ هذا لا يجعل السيارة أبطأ، بل يساعدك فقط على البقاء في مسارك.
  3. يعمل في كل مكان: اختبروه على العديد من نماذج الذكاء الاصطناعي والعديد من أنواع الصور المختلفة (قطط، سيارات، مسائل رياضية)، وقد نجح باستمرار في منع الذكاء الاصطناعي من اختلاق أشياء غير موجودة.

باخت-القول

فك التشفير المتبقي (Residual Decoding) هو ترقية بسيطة ومجانية لواصفات الصور الذكية. إنه يمنعهم من أحلام اليقظة حول أشياء ليست موجودة من خلال تذكيرهم بما كانوا متأكدين منه قبل لحظة واحدة. إنه يجبر الذكاء الاصطناعي على الوثوق بـ "عيونه" (الصورة) بدلاً من "ذكرياته" (العادات النصية)، مما يؤدي إلى أوصاف حقيقية بالفعل للصورة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →