HueManity: Probing Fine-Grained Visual Perception in MLLMs
تقدم الورقة البحثية HueManity، وهو معيار مرجعي واسع النطاق يستخدم صوراً بأسلوب إيشيهارا (Ishihara) ليكشف أن النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) المتطورة تعاني من عجز حرج في الإدراك البصري دقيق التفاصيل مقارنة بالبشر والنماذج المتخصصة، على الرغم من قدراتها القوية في التفكير عالي المستوى.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك روبوتًا ذكيًا جدًا يمكنه قراءة الكتب، وكتابة القصائد، ووصف المشاهد المعقدة في لوحة فنية. قد تعتقد: "بما أنه ذكي جدًا، فمن المؤكد أنه يستطيع رؤية كل شيء بوضوح، أليس كذلك؟"
ورقة بحثية بعنوان "HueManity" تقول: "ليس بهذه السرعة".
لقد صمم الباحثون اختبارًا خاصًا لمعرفة ما إذا كانت هذه "النماذج اللغوية الكبيرة متعددة الوسائط" (MLLMs) — وهي العقول الاصطناعية التي تقف وراء العديد من برامج الدردشة الآلية — يمكنها حقًا رؤية التفاصيل الدقيقة، أم أنها مجرد تخمين بناءً على ما قرأته سابقًا.
إليك تفصيل لنتائجهم باستخدام تشبيهات بسيطة:
1. الاختبار: لغز "الحبر غير المرئي"
أنشأ الباحثون مكتبة ضخمة تضم 83,850 صورة. تبدو كل صورة مثل كومة ملونة وفوضوية من النقاط، تشبه اختبارات إيشيهارا (Ishihara) لعمى الألوان التي قد تراها في عيادة الطبيب.
- الخدعة: داخل النقاط الفوضوية، تختبئ حرفان أو رقمان (مثل "42" أو "X7").
- التحدي: لكي تجدهما، عليك تجاهل الضجيج وتمييز الاختلافات الطفيفة في الألوان التي تشكل شكل الحروف.
- الهدف: لا يتعلق الأمر بـ "التفكير" أو "الاستنتاج"، بل يتعلق فقط بـ الرؤية. هل يمكن للذكاء الاصطناعي التقاط الإبرة في كومة القش؟
2. النتائج: البشر مقابل الذكاء الاصطناعي
أجرى الباحثون هذا الاختبار على البشر، وعلى برنامج رؤية حاسوبية قياسي (ResNet50)، وعلى تسعة من أذكى نماذج الذكاء الاصطناعي المتاحة اليوم (مثل GPT-4، وClaude، وLLaVA).
- البشر: كانوا مثاليين تقريبًا. رأوا الأرقام والحروف فورًا (دقة 99% و93%).
- الرؤية الحاسوبية القياسية: نجحت أيضًا بشكل رائع (96% و94%). إنها مثل عين مدربة تعرف بالضبط ما الذي تبحث عنه.
- نماذج الذكاء الاصطناعي "الذكية": فشلت فشلاً ذريعًا.
- أفضل نموذج ذكاء اصطناعي نجح في 33% فقط من اختبارات الأرقام البسيطة.
- في الاختبارات الأصعب (الحروف/الأرقام)، حقق أفضل نموذج ذكاء اصطناعي 3% فقط.
- معظم النماذج الأخرى حصلت على 0% إلى 1%.
التشبيه: تخيل أنك تسأل عبقريًا قرأ كل كتاب في المكتبة عن كيفية العثور على كلمة محددة مكتوبة بحبر غير مرئي على صفحة. قد يعرف العبقري مفهوم الكلمة، لكنه لا يستطيع حقًا رؤية الحبر على الصفحة. إنه "يهلوس" بالإجابات بدلاً من رؤية الحقيقة.
3. لماذا فشل الذكاء الاصطناعي؟
تشير الورقة البحثية إلى أن الذكاء الاصطناعي ليس "غبيًا"، لكن لديه نقطة عمياء محددة:
- التركيز الزائد على "الصورة الكبيرة": تم تدريب هذه الأنظمة لفهم معنى الصورة (على سبيل المثال، "هذه قطة تجلس على حصيرة"). إنهم بارعون جدًا في الصورة الكبيرة لدرجة أنهم يتجاهلون التفاصيل الصغيرة والفوضوية (الألوان والأشكال المحددة للنقاط).
- الاعتماد على التخمين: عندما لا يستطيع الذكاء الاصطناعي رؤية النقاط، فإنه يحاول التخمين بناءً على الأنماط اللغوية. الأمر يشبه طالبًا لا يعرف حل مسألة رياضية، لكنه يخمن إجابة لأنها تبدو كشيء سمعه من قبل.
- تأثير "تضييق العين": من المثير للاهتمام أنه عندما جعل الباحثون الصور أكثر ضبابية (دقة منخفضة)، أصبح أحد نماذج الذكاء الاصطناعي أفضل. يبدو أن الذكاء الاصطناعي يحتاج إلى تنعيم "الضجيج" ليتمكن من تخمين الشكل، بدلًا من رؤية التفاصيل فعليًا.
4. "الخدعة السحرية" التي لم تنجح
حاول الباحثون "تعليم" الذكاء الاصطناعي كيفية اجتياز هذا الاختبار:
- عرض الأمثلة: عرضوا على الذكاء الاصطناعي بعض الأمثلة أولاً. لم يساعد ذلك.
- الضبط الدقيق (Fine-Tuning): حاولوا إعادة تدريب الذكاء الاصطناعي خصيصًا على هذه الألغاز. لم يساعد ذلك. في الواقع، جعل ذلك الذكاء الاصطناعي ينسى كيفية قراءة النصوص البسيطة!
الخلاصة: المشكلة ليست في أن الذكاء الاصطناعي لم يتعلم بما يكفي؛ بل المشكلة تكمي في كيفية بناء هذا الذكاء الاصطناعي. إنه يشبه محاولة تعليم سمكة تسلق الشجرة عبر إعطائها المزيد من الكتب حول التسلق. السمكة (الذكاء الاصطناعي) ببساطة ليست مهيأة لهذا النوع من الرؤية.
لماذا يهم هذا الأمر؟
تجادل الورقة البحثية بأننا لا نستطيع الوثوق بهذه الأنظمة في المواقف التي تكون فيها الرؤية الواضحة أمرًا بالغ الأهمية.
- إذا كان الذكاء الاصطناعي يقود سيارة، فعليه أن يرى شقًا طفيفًا في الزجاج الأمامي أو لافتة صغيرة تحت المطر، وليس فقط أن "يخمن" وجود طريق.
- إذا كان الذكاء الاصطناعي يفحص صورًا طبية، فعليه أن يرصد خللاً صغيرًا، وليس فقط وصف الشكل العام للعضو.
باخت de مختصر: نماذج الذكاء الاصطناعي هذه ممتازة في سرد القصص ورائعة في فهم المفاهيم، لكنها حاليًا سيئة جدًا في الرؤية دقيقة التفاصيل. إنهم مثل شخص يمكنه وصف لوحة فنية بشكل مثالي، لكنه لا يستطيع العثور على التوقيع الصغير المختبئ في الزاوية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.