← أحدث الأبحاث
🤖 AI

Probing Perceptual Constancy in Large Vision-Language Models

تقيم هذه الدراسة 155 من نماذج الرؤية واللغة عبر 236 تجربة حول ثبات اللون والحجم والشكل، مما يكشف عن تباين كبير في الأداء وانفصال متميز بين قدرات ثبات الشكل وتلك المتعلقة باللون والحجم.

المؤلفون الأصليون: Haoran Sun, Bingyang Wang, Suyang Yu, Yijiang Li, Qingying Gao, Haiyun Lyu, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Maijunxian Wang, Dezhi Luo, Ho
نُشر 2026-02-09
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Haoran Sun, Bingyang Wang, Suyang Yu, Yijiang Li, Qingying Gao, Haiyun Lyu, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Maijunxian Wang, Dezhi Luo, Hokin Deng

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تنظر إلى تفاحة حمراء. إذا ابتعدت عنها، ستبدو أصغر حجمًا. إذا سلطت عليها كشافًا أزرق، ستبدو بنفسجية. إذا نظرت إليها من الجانب، ستبدو بيضاوية بدلاً من أن تكون دائرية.

إن عقل الإنسان مذهل لأنه يعرف أن التفاحة لا تزال تفاحة كبيرة وحمراء ومستديرة، بغض النظر عن هذه التغييرات. إنه لا ينخدع بالمسافة، أو الإضاءة الغريبة، أو الزاوية. تُسمى هذه القدرة الخارقة بـ "الثبات الإدراكي" (Perceptual Constancy).

هذه الورقة البحثية تشبه "تقرير درجات" ضخم لـ 155 "عقلاً اصطناعيًا" مختلفًا (تُسمى نماذج الرؤية واللغة - Vision-Language Models) لمعرفة ما إذا كانت تمتلك هذه القدرة الخارقة نفسها. لقد صمم الباحثون اختبارًا خاصًا يسمى ConstancyBench لفحص ثلاث مهارات محددة:

1. المهارات الثلاث المختبرة

فكر في هذه المهارات كأنها ثلاثة مستويات مختلفة في لعبة فيديو:

  • ثبات اللون (مستوى "الإضاءة"): هل يمكن للذكاء الاصطناعي أن يدرك أن الجدار الأبيض لا يزال أبيض، حتى لو كانت الغرفة مضاءة بمصباح أصفر أو لافتة نيون زرقاء؟
    • الاختبار: ينظر الذكاء الاصطناعي إلى مكعب روبيك تحت إضاءة غريبة، وعليه أن يخمن اللون الحقيقي للمربع الأوسط.
  • ثبات الحجم (مستوى "المسافة"): هل يمكن للذكاء الاصطناعي أن يفهم أن السيارة البعيدة هي نفس حجم السيارة القريبة منها، رغم أن البعيدة تبدو ضئيلة على الشاشة؟
    • الاختبار: ينظر الذكاء الاصطناعي إلى صاروخين، أحدهما في الخلف والآخر قريب جدًا، وعليه أن يقرر ما إذا كانا في الواقع مختلفين في الحجم أم أنهما يبدوان مختلفين فقط بسبب المنظور.
  • ثبات الشكل (مستوى "الزاوية"): هل يمكن للذكاء الاصطناعي أن يعرف أن الطبق المستدير لا يزال دائرة، حتى لو مال بحيث يبدو كشكل بيضاوي؟
    • الاختبار: ينظر الذكاء الاصطناعي إلى باب مفتوح قليلاً ومائل، مما يجعله يبدو كشكل شبه منحرف، وعليه أن يدرك أنه في الأصل مستطيل.

2. النتائج: من الذي نجح؟

اختبر الباحثون 155 نموذجًا مختلفًا للذكاء الاصطناعي، تتراوح بين النماذج الصغيرة والخفيفة إلى النماذج الضخمة وفائقة الذكاء (مثل GPT-4o). وإليكم ما وجدوه:

  • مهارة "الشكل" سهلة: كانت نماذج الذكاء الاصطناعي جيدة بشكل مفاجئ في ثبات الشكل. الأمر يشبه كونها بارعة في التعرف على "المخطط الخارجي" للأشياء. حتى النماذج الصغيرة استطاعت أن تدرك أن المستطيل المائل لا يزال مستطيلًا.
  • مهارتا "اللون" و"الحجم" صعبة: واجهت النماذج صعوبة أكبر بكثير مع اللون والحجم. غالبًا ما تعرضت للخداع بسبب الإضاءة أو المسافة. يبدو الأمر كما لو أنها تنظر إلى صورة مسطحة وتنسى أن العالم ثلاثي الأبعاد وله إضاءة متغيرة.
  • الأدمغة الأكبر تؤدي بشكل أفضل: كان هناك قاعدة واضحة: كلما زاد حجم نموذج الذكاء الاصطناعي، كان أفضل في هذه الاختبارات.
    • النماذج الصغيرة غالبًا ما فشلت، حيث ارتبكت بسبب خدع بسيطة.
    • أما النماذج الضخمة (العمالقة في عالم الذكاء الاصطناعي) فقد أدت بشكل أفضل بكثير، خاصة في فهم الحجم والمسافة. يبدو أنه كلما منحت الذكاء الاصطنا حادث "قوة دماغية" (معاملات/parameters)، أصبح أفضل في فهم العالم ثلاثي الأبعاد.

3. الخلاصة الكبرى

تخلص الورقة البحثية إلى أن الذكاء الاصطناعي لا يمتلك رؤية "بشرية" واحدة ومثالية بعد. بدلاً من ذلك، لديه رؤية طبقية (متدرجة):

  • هو جيد في الهندسة البسيطة (الشكل).
  • وهو يتحسن في فهم مقاييس العالم والإضاءة (الحجم واللون)، ولكن فقط إذا كان النموذج ضخمًا.

يشير المؤلفون إلى أنه بينما تصبح هذه النماذج أكثر ذكاءً، إلا أنها قد لا "ترى" العالم بالطريقة التي يراه بها البشر. قد تكون مجرد بارعة جدًا في التخمين بناءً على الأنماط التي رأتها في بيانات تدريبها، وليس بناءً على فهم حقيقي للفيزياء.

باخت-اختصار: إذا طلبت من الذكاء الاصطناعي تحديد شكل ما، فغالبًا ما سيكون ذكيًا. أما إذا طلبت منه معرفة الحجم أو اللون الحقيقي لشيء ما عندما تكون الإضاءة أو المسافة مخادعة، فهو لا يزال في مرحلة التعلم. وكلما كان الذكاء الاصطناعي أكبر، قل احتمال تعرضه للخداع.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →