Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution
تُعد SIRA إطار عمل لفك التشفير التبايني الداخلي لا يتطلب تدريباً، حيث تعمل على الحد من الهلوسة في النماذج اللغوية البصرية الكبيرة عبر توليد مرجع مضاد يهيمن عليه الأولوية اللغوية ضمن نفس المحول من خلال الانتباه المقنع في الطبقات المتأخرة، مما يقلل من الاعتماد على الأدوات الخارجية وعمليات التمرير الأمامي الإضافية مع الحفاظ على التغطية الوصفية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مساعداً ذكياً ومطلعاً جداً (نموذج لغوي بصري ضخم) يحاول وصف صورة عرضتها عليه للتو. أحياناً، يصبح هذا المساعد واثقاً جداً مما "يعتقد" أنه يراه، بدلاً مما هو موجود بالفعل. قد يقول: "أرى دراجة حمراء"، بينما هي في الواقع مجرد شكل ضبابي قد يكون دراجة، أو قد يخترع تفاصيل لأن القراءات التي استوعبها عن الدراجات جعلت عقله يملأ الفراغات. يُسمى هذا الهلوسة (Hallucination).
يقدم البحث حيلة ذكية جديدة تسمى SIRA لإيقاف حدوث ذلك، دون الحاجة إلى إعادة تدريب المساعد أو توظيف شخص ثانٍ لمراجعة العمل.
المشكلة في الحيل القديمة
في السابق، لإيقاف المساعد عن الكذب، حاول الباحثون استخدام طريقة كهذه:
- عرض الصورة الأصلية على المساعد.
- ثم، عرض نسخة ضبابية أو مشوهة من نفس الصورة عليه.
- مقارنة الإجابتين. إذا غير المساعد قصته عندما تكون الصورة ضبابية، فربما كان يتكهن فقط.
العيب: هذا يشبه أن تطلب من شخص وصف لوحة، ثم تطلب منه وصف اللوحة نفسها وهو يرتدي نظارات ضبابية. نسخة "النظارات الضبابية" ليست مقارنة عادلة لأن النظارات نفسها تشوه الصورة. إنها عملية فوضوية، وتستغرق ضعف الوقت (عليك النظر إلى الصورة مرتين منفصلتين)، كما أن التشويه قد يخلق أخطاءً جديدة.
حل SIRA: "البادئة المشتركة" (Shared Prefix)
تتبع SIRA نهجاً مختلفاً. فبدلاً من العبث بالصورة، هي تعبث بـ عملية التفكير الداخلي للمساعد بينما لا يزال في مرحلة التفكير.
فكر في عقل المساعد كخط تجميع في مصنع يتكون من محطات عديدة (طبقات) تعالج الصورة والسؤال.
- البداية المشتركة: يبدأ المساعد بالنظر إلى الصورة والسؤال معاً. يبني فهماً صلباً للمشهد في المحطات الأولى من المصنع. هذه هي "البادئة المشتركة". تضمن SIRA اتفاق النسختين من المساعد على هذا الفهم الأولي.
- مفرق الطرق: بعد تشكل الفهم الأولي، تقوم SIRA بتقسيم العملية إلى مسارين متوازيين يعملان داخل نفس العقل:
- المسار (أ) (الرؤية الكاملة): يستمر المساعد في النظر إلى تفاصيل الصورة أثناء إنهاء جملته.
- المسار (ب) (الرؤية "العمياء"): يستمر المساعد من نفس نقطة البداية تماماً، ولكن في المحطات اللاحقة، يتم تغطية عينيه عن تفاصيل الصورة المحددة. يمكنه فقط الاعتماد على معرفته العامة والجملة التي بدأ بكتابتها بالفعل.
كيف تعالج هذه الطريقة الكذب؟
الآن، تقارن SIRA بين المسارين عند كل خطوة من خطوات كتابة الجملة:
- إذا قال المساعد: "أنا أرى كلباً"، وكان المسار (أ) (الذي يرى الكلب) والمسار (ب) (المغمض العينين) كلاهما يقولان "كلب" بثقة عالية، فإن SIRA تعرف أن هذا غالباً مجرد تخمين بناءً على اللغة الشائعة (ربما الكلاب شائعة في القصص). لذا، تقوم بخفض درجة "كلب" لأن النسخة المغمضة العينين لم تكن بحاجة للصورة لتقول ذلك.
- إذا قال المساعد: "أنا أرى فيلاً أرجوانياً"، وكان المسار (أ) يقول "فيل أرجواني" (لأنه يراه)، بينما المسار (ب) يقول "مستحيل، هذا ليس في القصة" (لأنه لا يراه)، فإن SIRA تعرف أن الصورة هي السبب الوحيد لهذا الادعاء. لذا، تقوم برفع درجة "فيل أرجواني".
لماذا هي أفضل؟
- لا تتطلب خطوات إضافية: لا تحتاج للنظر إلى الصورة مرتين. هي تفعل كل شيء في خطوة واحدة، فقط عبر تقسيم عملية التفكير الداخلي.
- لا توجد تشوهات فوضوية: لا تقوم بتضبيب الصورة. هي فقط "تطفئ" المدخلات البصرية مؤقتاً لنسخة واحدة من عملية التفكير، مما يحافظ على توافق السياق بشكل مثالي.
- لا تتطلب تدريباً: تعمل على النماذج الموجودة فوراً. لست بحاجة لتعليم النموذج أي شيء جديد.
النتيجة
في الاختبارات، نجحت SIRA في منع المساعدين من اختراع أشياء غير موجودة (مثل "موزة" ليست في الصورة) مع السماح لهم بوصف الأشياء الحقيقية بدقة. الأمر يشبه وجود "فحص للواقع" مدمج يحدث فوراً داخل عقل النموذج نفسه، مما يضمن أن ما يقولونه مدعوم فعلياً بما يرونه، وليس فقط بما يتوقعون رؤيته.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.