← أحدث الأبحاث
💻 computer science

MLLMs Hallucinate when Information Distribution Drifts in Synergy Heads

تقترح الورقة البحثية إطار عمل HEAL، وهو إطار عمل مبتكر يحدد ويخفف من حدة الهلوسة في النماذج اللغوية الكبيرة متعددة الوسائط من خلال تحليل انزياحات توزيع المعلومات في رؤوس التآزر وتطبيق المعايرة الديناميكية لتوجيه المخرجات نحو الأدلة الواقعية.

المؤلفون الأصليون: Meng'en Qin, Junye Chen, Jucheng Liu, Youlu Xing, Song Wang, Ruize Han

نُشر 2026-09-10
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Meng'en Qin, Junye Chen, Jucheng Liu, Youlu Xing, Song Wang, Ruize Han

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تُعد النماذج اللغوية الكبيرة متعددة الوسائط فئة جديدة وقوية من الذكاء الاصطناعي المصمم للرؤية والتحدث في آن واحد. وخلافًا للأنظمة التقليدية التي تعالج النصوص أو الصور بشكل منفصل، يمكن لهذه النماذج النظر إلى صورة ووصفها، أو الإجابة عن أسئلة حولها، أو سرد قصة بناءً على ما تراه. وهي تعمل من خلال نسج تيارين متميزين من المعلومات: البيانات المرئية من الصورة والأنماط اللغوية المتعلمة من كميات هائلة من النصوص. ولكي تكون هذه الأنظمة مفيدة حقًا في المجالات عالية الخطورة مثل التصوير الطبي أو القيادة الذاتية، يجب أن تكون موثوقة. ومع ذلك، فهي تعاني بشكل متكرر من مشكلة تُعرف باسم "الهلوسة". وتحدث هذه المشكلة عندما يولد النموذج استجابة تبدو واثقة ومنطقية ولكنها خاطئة واقعيًا بشأن العالم المرئي، مثل الادعاء بأن صورة قطة تحتوي على كلب، أو اختراع تفاصيل ليست موجودة ببساض في الصورة.

لفترة طويلة، اعتقد الباحثون أن هذه الأخطاء تحدث لأن النموذج يولي اهتمامًا كبيرًا لمعرفته الداخلية باللغة ولا يولي اهتمامًا كافيًا للصورة الفعلية. وكانت الفكرة السائدة هي أنه بينما يكتب النموذج إجابته، فإنه يبتعد عن الصورة ويعتمد بشكل مفرط على ما يتوقعه بناءً على الكلمات وحدها. ولإصلاح ذلك، ركزت المحاولات السابقة على إجبار النموذج على النظر بتمعن أكبر إلى الصورة أو عبر إعادة تدريب النظام بأكل. وغالبًا ما كانت هذه الأساليب تتعامل مع النموذج كصندوق أسود، حيث تعدل سلوكه من الخارج دون فهم الآليات الداخلية لسبب حدوث الخطأ في المقام الأول.

قام فريق من الباحثين في جامعة شنتشن للتكنولوجيا المتقدمة الآن بالنظر داخل "محرك" هذه النماذج لإيجاد تفسير مختلف. وهم يقترحون أن الهلوسة لا تنتج عن مجرد نقص في الانتباه للصورة، ولا عن تجاهل النموذج للصورة تمامًا. بدلاً من ذلك، وجدوا أن الخطأ ينشأ عندما يصبح التوازن الداخلي بين المعلومات المرئية واللغوية غير مستقر داخل أجزاء محددة من شبكة المعالجة الخاصة بالنموذج. وقد طور الباحثون طريقة تسمى HEAL، والتي ترمز إلى "فك تشابك ومعايرة المعلومات على مستوى الرأس" (Head-lEvel information disentAnglement and caLibration)، لتحديد وتصحيح هذا الخلل في التوازن في الوقت الفلي.

يكمن جوهر اكتشافهم في كيفية معالجة النموذج للمعلومات. فداخل هذه النماذج الكبيرة، توجد العديد من وحدات المعالجة الصغيرة التي تسمى "رؤوس الانتباه". فكر في هذه الرؤوس كفريق من المتخصصين يعملون معًا لفهم جملة ما؛ فبعض المتخصصين يركزون بحتًا على الكلمات، وآخرون يركزون بحتًا على الصورة، ومجموعة ثالثة تعمل على مزج الاثنين معًا. ووجد الباحثون أن المجموعة المسؤولة عن دمج التيارين — والتي يسمونها "رؤوس التآزر" (synergy heads) — هي المكان الذي يبدأ فيه الخلل. فعندما يعمل النموذج بشكل صحيح، تحافظ رؤوس التآزر هذه على توازن صحي، ممسكة بالمعلومات المرئية واللغوية في توازن مستقر. ومع ذلك، عندما يبدأ النموذج في الهلوسة، يختل هذا التوازن؛ إذ ينحرف توزيع المعلومات داخل رؤوس التآزر هذه بعيدًا عن ذلك التوازن الصحي، مما يتسبب في فقدان النموذج لرسوخه في الدليل المرئي.

ومن الأهمية بمكان أن الباحثين استبعدوا فكرة أن الهلوسة تحدث بسبب وجود عدد قليل جدًا من المتخصصين الذين ينظرون إلى الصورة أو لأن المتخصصين في الصور ضعفاء للغاية. فقد أظهر تحليلهم أن عدد الرؤوس التي تركز على الجانب المرئي يظل ثابتًا سواء كان النموذج يقول الحقيقة أو يكذب. فالمشكلة ليست في نقص الانتباه المرئي، بل في انحراف كيفية تعامل متخصصي الدمج مع مزيج المعلومات. فعندما يولد النموذج وصفًا صحيحًا، تحافظ رؤوس التآزر على نسبة ثابتة بين المدخلات المرئية واللغوية. وعندما يهلوس، يختل هذا النسب، وغالبًا ما يميل بشدة نحو الأنماط اللغوية بينما يضعف الاتصال المرئي، رغم أن الصورة لا تزال موجودة.

ولحل هذه المشكلة، أنشأ الفريق استراتيجية معايرة ديناميكية تعمل كمنظم في الوقت الفعلي. وبدلاً من إعادة تدريب النموذج أو تغيير بنيته، تتدخل طريقة HEAL أثناء عملية التوليد؛ فهي تراقب تدفق المعلومات عبر رؤوس التآزر وتكتشف متى يبدأ التوازن في الانحراف. وعند اكتشاف الانحراف، يقوم النظام بحقن عامل معايرة يدفع المعلومات المرئية واللغوية بلطف نحو التوازن الصحيح مرة أخرى. وهذه العملية مستمرة وتكيفية؛ فهي لا تجبر النموذج على تجاهل اللغة أو التركيز المفرط على الصورة، بل توجه التمثيل الداخلي للنموذج للعودة إلى حالة يتم فيها وزن الدليل المرئي بشكل مناسب مقابل السياق اللغوي.

اختبر الباحثون هذا النهج على عدة نماذج رائدة، بما في ذلك نسخ من LLaVA وQwen. وكانت النتائج متسقة عبر الأنظمة والمهام المختلفة. فمن خلال تطبيق هذه المعايرة الديناميكية، أنتجت النماذج حالات هلوسة أقل بكثير مع الحفاظ على قدرتها على التحدث بطلاقة وإبداع. وفي الاختبارات المصممة لقياس عدد المرات التي يخترع فيها النماذج أشياء غير موجودة في الصورة، قللت الطريقة الجديدة الأخطاء بشكل أكثر فعالية من التقنيات السابقة التي حاولت ببساطة تعزيز الانتباه المرئي. وتشير الدراسة إلى أن مفتاح الموثوقية في هذه الأنظمة ليس فقط جعلها تنظر بتمعن أكبر إلى الصورة، بل ضمان بقاء المزيج الداخلي بين الرؤية والكلام مستقرًا.

يقدم هذا العمل منظورًا جديدًا لكيفية فهم الذكاء الاصطناعي للعالم. فهو يوضح أن الموثوقية لا تتعلق فقط بامتلاك المزيد من البيانات أو الأجهزة القوية، بل بالحفاظ على توازن داخلي دقيق بين أنواع مختلفة من المعلومات. ومن خلال تحديد النقطة المحددة التي ينكسر فيها هذا التوازن وتوفير طريقة بسيطة لاستعادته، فتح الباحثون مسارًا نحو أنظمة متعددة الوسائط أكثر موثوقية. وتعتبر هذه الطريقة خفيفة الوزن ولا تتطلب الموارد الحسابية الهائلة اللازمة لإعادة التدريب، مما يجعلها أداة عملية لتحسين دقة الذكاء الاصطناي الذي يرى ويتحدث. وتشير النتائج إلى أن التحسينات المستقبلية في موثوقية الذكاء الاصطناي قد تأتي من ضبط هذه العلاقات الداخلية بدلاً من بناء نماذج أكبر وأكثر تعقيدًا من الصفر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →