Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs
تقدم هذه الورقة معايير REST و+REST لتوضيح أن النماذج اللغوية الكبيرة متعددة الوسائط والمتطورة تظهر عدم اتساق ملحوظ عبر الوسائط عند معالجة معلومات دلالية متطابقة عبر الصور والنصوص والوسائط المختلطة، وهي ظاهرة تتأثر بالخصائص البصرية وأعداد الرموز (tokens) بدلاً من مجرد أخطاء التعرف على النصوص.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك طالباً عبقرياً يُدعى أليكس. أليكس ذكي للغاية في قراءة الكتب وحل المسائل الرياضية المكتوبة على الورق. لكن أليكس يمتلك أيضاً كاميرا، وعندما تعرض على أليكس صورة لمسألة رياضية، يصاب أليكس بالارتباك أحياناً، حتى لو كانت الصورة واضحة تماماً.
هذه الورقة البحثية تدور حول اكتشاف أن نماذج اللغات الكبيرة متعددة الوسائط (MLLMs) — وهي الأدمغة الذكية للغاية التي تشغل أدوات مثل ChatGPT وGemini وClaude — تشبه أليكس تماماً. فهي تعاني من حالة تُسمى "عدم الاتساق عبر الوسائط" (Cross-Modal Inconsistency).
إليك قصة ما وجده الباحثون، مشروحة ببساطة:
1. مشكلة "المحتوى نفسه، الإجابات المختلفة"
سأل الباحثون سؤالاً بسيطاً: إذا أعطيت الذكاء الاصطناعي نفس المعلومات بالضبط بثلاث طرق مختلفة، فهل سيعطي نفس الإجابة؟
لقد اختبروا ذلك باستخدام ثلاث "نكهات" لنفس السؤال:
- نكهة النص: السؤال مكتوب في صندوق دردشة.
- نكهة الصورة: السؤال مكتوب على ورقة، تم تصويرها وإرسالها كصورة.
- النكهة المختلطة: السؤال مكتوب نصياً، لكن السياق (مثل الرسم التوضيحي) عبارة عن صورة.
النتيجة الصادمة: حتى عندما كان بإمكان الذكاء الاصطناعي قراءة الصورة بوضوح تام (لا توجد نصوص ضبابية، ولا أخطاء إملائية)، فإنه غالباً ما كان يعطي إجابات مختلفة بناءً على كيفية تقديم السؤال.
- مثال: إذا سألت "ما هو 7 + 1؟" في نص، سيقول الذكاء الاصطناعي "8". أما إذا عرضت عليه صورة لـ "7 + 1"، فقد يقول بثقة "9" أو "7".
الأمر يشبه أن يكون أليكس الطالب بارعاً في الرياضيات عندما يقرأ كتاباً مدرسياً، ولكن إذا سلمته صورة لصفحة الكتاب، فإنه ينسى فجأة كيفية الجمع.
2. اختبار "REST": اختبار الإجهاد للذكاء الاصطناعي
لإثبات أن هذا لم يكن مجرد صدفة، بنى الباحثون امتحاناً جديداً يسمى REST (اختبارات الإجهاد لتكافؤ العرض - Render-Equivalence Stress Tests).
اعتبر REST بمثابة "اختبار تورينج" للاتساق. لقد أخذوا ألغازاً رياضية ومنطقية شهيرة وحولوها إلى صور. وتأكدوا من أن الصور واضحة جداً لدرجة أن أي إنسان يمكنه قراءتها فوراً. ثم طلبوا من 15 نموذج ذكاء اصطناعي مختلف حلها.
النتائج:
- لم ينجح أحد بتفوق باهر. حتى النماذج الأكثر ذكاءً (مثل GPT-5-mini وClaude Haiku) أخطأت في حوالي 10% من الحالات لمجرد تغير التنسيق.
- "انحياز النص": فضلت جميع نماذج الذكاء الاصطنانا تقريباً تنسيق النص. فقد كانوا أكثر ذكاءً بشكل ملحوظ عند قراءة الكلمات مقارلة بالنظر إلى صور الكلمات.
- ليست مشكلة "تعرف على الحروف" (OCR): قد تظن "ربما لا يستطيع الذكاء الاصطناعي قراءة الخط اليدوي في الصورة؟" لقد أثبت الباحثون خطأ ذلك. فقد استبعدوا أي سؤال فشل الذكاء الاصطناعي في قراءة نصه. حتى عندما قرأ الذكاء الاصطناعي النص بشكل مثالي، ظل يستنتج بشكل سيء فيما يتعلق بنسخة الصورة.
3. تجربة "النظارات السحرية" (الخصائص البصرية)
قام الباحثون بعد ذلك بارتداء "نظارات سحرية" لمعرفة ما إذا كان تغيير مظهر الصورة سيساعد. قاموا بتغيير:
- الدقة (Resolution): جعل الصورة ضبابية (دقة منخفضة DPI) أو حادة (دقة عالية DPI).
- الخط: استخدام الخط المتصل، أو حروف الطباعة، أو خطوط الآلة الكاتبة.
- اللون: جعل النص أحمر، أو أزرق، أو أصفر بدلاً من الأسود.
المفاجآت:
- الضبابية سيئة: عندما كانت الصورة ضبابية جداً، ارتبك الذكاء الاصطناعي.
- اللون جيد: للمفاجأة، النص الملون جعل أداء الذكاء الاصطناعي أفضل من النص الأسود! يبدو أن الذكاء الاصطناعي يحب القليل من الألوان ليتمكن من تركيز انتباهه.
- الخطوط لم تكن مهمة كثيراً: سواء كان الخط متصلاً أو مطبعياً، ظل أداء الذكاء الاصطناعي ثابتاً في الغالب.
4. نظرية "العقلين" (لماذا يحدث هذا؟)
بحث الباحثون في "عقل" الذكاء الاصطناعي (كوده الداخلي) للعثور على السبب الجذري. واكتشفوا وجود "فجوة وسائط" (Modality Gap).
تخيل أن لدى الذكاء الاصطناعي خزانتي ملفات مختلفتين للمعلومات:
- خزانة النصوص: حيث يخزن معنى الكلمات.
- خزانة الصور: حيث يخزن معنى الصور.
المشكلة هي أن هاتين الخزانتين في غرفتين مختلفتين. عندما يحصل الذكاء الاصطناعي على سؤال في نص، فإنه يذهب إلى "غرفة النصوص". وعندما يحصل على سؤال في صورة، فإنه يذهب إلى "غرفة الصور". ورغم أن المعلومات هي نفسها، إلا أن "العنوان" في عقل الذكاء الاصطناعي مختلف.
- الارتباط: وجد الباحثون أنه كلما زاد "التوافق" بين هاتين الغرفتين (بمعنى أن التمثيل الداخلي لكلمة "تفاحة" يشبه جداً التمثيل الداخلي لصورة "تفاحة")، زاد اتساق إجابات الذكاء الاصطناعي.
- الاستنتاج: الذكاء الاصطناعي لا "يفكر" بشكل مختلف؛ هو فقط ينظر إلى المعلومات من خلال عدستين مختلفتين لا تتطابقان تماماً.
5. لماذا يجب أن نهتم؟
هذا أمر بالغ الأهمية لأننا نبني أنظمة ذكاء اصطناعي لمساعدتنا في مهام حيوية، مثل تشخيص الأمراض من الأشعة السينية أو تحليل الوثائق القانونية.
إذا كان بإمكان الذكاء الاصطناعي حل مسألة رياضية عندما تكتبها، ولكنه يفشل عندما تعرض عليه صورة لنفس المسألة، فلا يمكننا الوثوق به تماماً. هذا يعني أن ذكاء الذكاء الاصطناعي هش ويعتمد بشدة على كيفية طرح السؤال، وليس فقط على ما تسأل عنه.
الخلاصة
تخلص الورقة البحثية إلى أنه بينما تعد هذه النماذج مذهلة، إلا أنها لا تزال تتعلم التحدث بـ "لغة عالمية" تربط بين الرؤية والسمع. في الوقت الحالي، هم يشبهون شخصاً يتحدث لهجتين مختلفتين لنفس اللغة، ويصاب بالارتباك عند الانتقال بينهما. ويأمل الباحثون أنه من خلال فهم هذه "الفجوة"، يمكننا بناء ذكاء اصطناعي متسق حقاً، بغض النظر عن كيفية تقديم المعلومات.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.