Can Vision-Language Models See Squares? Text-Recognition Mediates Spatial Reasoning Across Three Model Families
تُثبت هذه الورقة أن نماذج الرؤية واللغة تمتلك قصوراً جوهرياً في الاستدلال المكاني، حيث تنهار قدرتها على تحديد مواقع الخلايا المملوءة في الشبكات الثنائية دون وجود أدلة نصية، مما يكشف عن اعتماد كبير على مسارات التعرف النصي بدلاً من المعالجة البصرية الأصلية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك لوحة شطرنج عملاقة بحجم 15 في 15 مربعاً. بعض المربعات مطلية باللون الأسود، وبعضها تُركت بيضاء. مهمتك هي النظر إلى هذه الصورة وإخبار الكمبيوتر بالضبط أي المربعات سوداء.
قد تعتقد: "لا مشكلة! الذكاء الاصطناعي بارع في رؤية الصور". لكن هذه الورقة البحثية تكشف عن سر مضحك ومحبط: نماذج الذكاء الاصطناعي هذه في الواقع سيئة جداً في رؤية الصور "الخالصة"، لكنها مذهلة في قراءة "الصور التي تشبه النصوص".
إليك قصة التجربة، مشروحة ببساطة.
النسختان من نفس اللغز
قام الباحثون بإنشاء أنماط لوحة الشطرنج نفسها بطريقتين مختلفتين:
- نسخة "الآلة الكاتبة": رسموا الشبكة باستخدام رموز نصية. المربعات الفارغة كانت نقاطاً (
.) والمربعات المملوءة كانت علامات هاشتاج (#).- مثال:
.#.#.
- مثال:
- نسخة "الكتلة الصلبة": رسموا الشبكة باستخدام مربعات سوداء وبيضاء صلبة، بدون خطوط شبكة وبدون نصوص. مجرد كتلة من البكسلات السوداء.
- مثال: مربع أسود صلب بجانب مربع أبيض.
التحول المفاجئ: بالنسبة لـ "عين" الكمبيوتر (المُشفّر البصري)، كلتا الطريقتين هما مجرد صور. لا توجد أي منهما "نصاً حقيقياً" يمكن للكمبيوتر قراءته مثل الكتاب. كلاهما مجرد بكسلات.
النتائج: حكاية عقلين
عندما طلب الباحثون من ثلاثة نماذج ذكاء اصطناعي رفيعة المستوى (Claude و ChatGPT و Gemini) نسخ هذه الشبكات، كانت النتائج صادمة:
- عندما بدت الشبكة كأنها نص (
.#.#): كانت نماذج الذكاء الاصطناعي مثالية تقريباً. لقد أصابوا حوالي 90% من المربعات بشكل صحيح. كان بإمكانهم إخبارك بالضبط بمكان كل مربع أسود. - عندما بدت الشبكة ككتل صلبة: انهارت النماذج وفشلت فشلاً ذريعًا. انخفضت دقتها إلى 60-70%، وانهارت قدرتها على تحديد المربعات السوداء بالضبط لتصل إلى 30-40%.
التشبيه:
تخيل أنك تحاول العثور على شخص محدد في حشد من الناس.
- السيناريو (أ) (النص): الجميع يرتدي بطاقة تعريفية مكتوب عليها أسماؤهم بخط كبير. يمكنك قراءة الأسماء وتجد الشخص فوراً.
- السيناريو (ب) (الكتل): الجميع يرتدي قناعاً أسود صلبًا. يمكنك رؤية حشد من الأشكال السوداء، لكن لا يمكنك تمييز شخص عن آخر أو العثور على الشخص المحدد الذي تحتاجه.
نماذج الذكاء الاصطناعي تشبه الأشخاص الذين هم سريعون جداً في قراءة بطاقات التعريف، لكنهم سيئون جداً في تمييز الوجوه وسط حشد من الأقنعة.
لماذا يحدث هذا؟
تشير الورقة البحثية إلى أن هذه النماذج تستخدم "طريقة غش" عندما ترى نصاً.
- "قوة التعرف الضوئي على الحروف" (OCR) الخارقة: عندما يرى الذكاء الاصطناعي رمز
#فإنه لا يراه مجرد شكل أسود. إنه يتعرف عليه كـ "علامة هاشتاج". ولأنه يعرف أن هذا "رمز"، فإنه يستخدم عقل القراءة الخاص به (وهو جيد جداً في معرفة مكان الحروف على الصفحة) لتحديد الموقع. إنه يقوم فعلياً بعملية "تعرف ضوئي داخلي على الحروف" (قراءة الصورة كنص) لحل لغز مكاني. - "الضعف البصري": عندما يرى الذكاء الاصطناعي مربعاً أسود صلباً، لا يمكنه استخدام عقل القراءة الخاص به. يجب عليه الاعتماد على عقل الرؤية (المعالجة البصرية الصرفة). وتظهر الورقة أن "عقل الرؤية" للذكاء الاصطناعي الحالي ضبابي للغاية عندما يتعلق الأمر بتحديد المواقع بدقة. يمكنه أن يقول لك "هناك كتلة سوداء هناك"، لكن لا يمكنه إخبارك "هذا هو المربع رقم 4 في الصف 2" بدقة.
"الشبح" في الآلة
وجد الباحثون أن كل نموذج ذكاء اصطناعي فشل بطريقته الفريدة والغريبة عند النظر إلى الكتل الصلبة:
- Claude كان "مُقللاً للعد": رأى المنطقة السوداء لكنه اعتقد أن "هذا عدد كبير جداً من المربعات"، فقام بتخطي بعضها.
- ChatGPT كان "مُبالغاً في العد": تحمس وتخيل وجود مربعات سوداء إضافية لم تكن موجودة، مما جعل الكتل تبدو أكبر مما هي عليه.
- Gemini كان "مزيفاً للأنماط": عندما أصبحت الشبكة مزدحمة جداً، استسلم ورسم نمط "علامة زائد" أو "شكل حرف L" عشوائي لا يشبه الشبكة الحقيقية على الإطلاق. كان ببساطة يخمن بناءً على ما يعتقد أن الشبكة يجب أن تبدو عليه.
تجربة "الملصق السحري"
لإثبات نظريتهم، جرب الباحثون حلاً وسطاً. أخذوا المربعات السوداء الصلبة وكتبوا داخلها رقماً صغيراً "1" في المربعات السوداء و"0" في المربعات البيضاء.
- بالنسبة لـ Claude و Gemini: نجح هذا الأمر كالسحر! بمجرد رؤية الأرقام، ارتفع أداؤهما بشكل صاروخي ليعود إلى مستويات قريبة من المثالية. النص "ثبّت" رؤيتهما.
- بالنسبة لـ ChatGPT: أصيب بالارتباك. النص الصغير داخل المربعات السوداء جعل أداءه أسوأ. يبدو أن "عقل القراءة" و"عقل الرؤية" لديه قد تشابكا وتعثرا ببعضهما البعض.
الخلاصة الكبرى
تعلمنا هذه الورقة درساً متواضعاً حول الذكاء الاصطناعي الحديث:
هذه النماذج لا "ترى" العالم كما نفعل نحن البشر. إنها في الغالب "تقرأ" العالم. إذا أعطيتها صورة تشبه وثيقة أو جدول بيانات، فهي عبقرية. ولكن إذا أعطيتها صورة تتكون فقط من أشكال وألوان وكتل دون أي نص، فإن تفكيرها المكاني ينهار.
الأمر يشبه امتلاك أمين مكتبة يمكنه العثور على أي كتاب على الرف إذا كانت عناوين الكتب واضحة، ولكنه يضيع تماماً إذا كانت الكتب مغلفة بورق بني سادة. وحتى يتم إصلاح هذا، لا يمكننا الوثوق تماماً في قدرة هذه النماذج على التنقل في العالم المرئي ما لم نمنحها ملصقات نصية للتمسك بها.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.