SchröMind: Mitigating Hallucinations in Multimodal Large Language Models via Solving the Schrödinger Bridge Problem
يُعد SchrödMind إطار عمل مبتكر يقلل من الهلوسة في النماذج اللغوية الكبيرة متعددة الوسائط من خلال استخدام مسألة جسر شرودنجر لإنشاء رسم خرائط منخفض التكلفة على مستوى الرمز (token) بين التنشيطات الهلوسية والتنشيطات الحقيقية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
المشكلة: "الكاذب الواثق" في الآلة
تخيل أنك تعرض صورة لحديقة على صديق ذكي جدًا، لكنه مشتت الذهن قليلًا. تسأله: "هل يوجد فيل أزرق في هذه الحديقة؟"
قد يجيب صديقك، الذي قرأ آلاف الكتب عن الحيوانات لكنه لا ينظر بتمعن إلى الصورة، بثقة: "نعم، هناك فيل أزرق مهيب بالقرب من النافورة!"
ما يسميه العلماء بـ "الهلوسة" (Hallucination). تعاني النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) — وهي الأدمغة الاصطناعية التي يمكنها "رؤية" الصور و"التحدث" عنها — من هذه المشكلة. لديها الكثير من "الثقافة العامة" (المعرفة اللغوية) لدرجة أنها تجعل خيالها يطغى أحيانًا على ما تراه فعليًا في الصورة. هي لا "ترى" الخطأ بالضرورة، بل تتبع مسارًا من الأفكار يقودها بعيدًا عن الحقيقة.
الحل: Schr¨oMind (نظام "الـ GPS للوصول إلى الحقيقة")
ابتكر الباحثون نظامًا جديدًا يسمى Schr¨oMind. لفهم كيفية عمله، دعونا نستخدم تشبيهين.
1. تشبيه "الانحراف" (عجلة القيادة)
فكر في عملية التفكير لدى الذكاء الاصطناعي كسيارة تسير على طريق سريع.
- مسار الحقيقة: طريق مستقيم وممهد جيدًا.
- مسار الهلوسة: طريق يبدأ بالانحراف نحو خندق طيني لأن السائق غارق في أحلام اليقظة.
تحاول الإصلاحات الحالية للذكاء الاصطناعي "جذب" عجلة القيادة بقوة نحو اليسار للعودة إلى الطريق. المشكلة؟ إذا جذبت العجلة بقوة شديدة، فقد تقلب السيارة (وهذا يحدث عندما يبدأ الذكاء الاصطناعي في قول كلام غير مفهوم أو يفقد قدرته على الطلاقة).
يعمل Schr¨oMind كنظام قيادة ذاتية عالي التقنية. بدلًا من الجذب المفاجئ، يقوم بحساب المنحنى الأكثر سلاسة ودقة للعودة بالسيارة إلى الأسفلت. إنه يجد "أقصر وأكثر المسارات كفاءة" من الخندق الطيني للعودة إلى الطريق السريع دون أن يشعر الركاب (المستخدمون) بأي هزة.
2. تشبيه "جسر شرودنجر" (الجسر السحري)
الاسم مستمد من مفهوم رياضي معقد يسمى "مشكلة جسر شرودنجر" (Schr¨odinger Bridge Problem).
تخيل أن لديك جزيرتين: جزيرة الهلوسة (حيث يختلق الذكاء الاصطناعي الأمور) وجزيرة الحقيقة (حيث يكون الذكاء الاصطناعي دقيقًا). تريد نقل حشد من الناس من جزيرة الهلوسة إلى جزيرة الحقيقة.
- الطرق القديمة: تحاول دفع الجميع في اتجاه واحد في وقت واحد. وهذا أمر فوضوي وغير منظم.
- Schr¨oMind: يبني سلسلة من "الجسور الذكية". إنه ينظر إلى كل شخص (كل "رمز" أو كلمة يوشك الذكاء الاصطناعي على قولها) ويقول له: "أنت، تحديدًا، تحتاج للسير بهذا المسار الدقيق لتصل إلى الحقيقة". إنه ينشئ جسرًا رياضيًا مخصصًا لكل كلمة، مما يضمن أن الانتقال سلس ويستهلك أقل قدر ممكن من الطاقة.
كيف يعمل الأمر فعليًا؟ (الرقصة ذات الخطوتين)
- مرحلة المحقق: ينظر النظام أولًا إلى "موجات الدماغ" (التنشيطات) الخاصة بالذكاء الاصطناعي ليرى أي أجزاء من عقله عرضة للكذب. إنه يحدد "رؤوس الانتباه" (الأجزاء من الدماغ التي تركز على الأشياء الخاطئة) بدقة.
- مرحلة التصحيح: بمجرد أن يجد الأجزاء "الكاذبة" في الدماغ، يطبق الرياضيات (الجسر) ليدفع تلك الأفكار بلطف نحو الواقع البصري للصورة.
لماذا يهم هذا الأمر؟
في الحياة اليومية، قد تكون هلوسة الذكاء الاصطناعي بشأن قطة في صورة مجرد خطأ مضحك. لكن إذا كان الذكاء الاصطناعي يساعد طبيبًا في فحص صورة أشعة، أو يساعد سيارة ذاتية القيادة في رؤية إشارة توقف، فإن الهلوسة قد تكون خطيرة.
يجعل Schr¨oMind هذه النماذج أكثر موثوقية. فهو لا يتطلب "إعادة تدريب" الدماغ بالكامل (وهو أمر مكلف وبطيء)؛ بل يوفر فقط "دفعة ذكية" في اللحظة التي يتحدث فيها الذكاء الاصطناعي. إنه يجعل الذكاء الاصطناعي أكثر صدقًا، دون أن يجعله أقل ذكاءً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.