CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models
تقدم هذه الورقة CompareBench، وهي مجموعة اختبار شاملة تضم TallyBench وOmniCaps ومجموعة بيانات للمقارنة البصرية مكونة من 1,200 سؤال، لتقييم وكشف نقاط الضعف المنهجية في نماذج الرؤية واللغة الحالية فيما يتعلق بعدّ الأشياء، والاستدلال الهندسي، والمكاني، والزمني.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إن الرؤية البشرية لا تقتصر مجرد رؤية الأشياء؛ بل تتعلق بالمقارنة. فعندما ننظر إلى غرفة ما، فنحن لا نسجل فقط وجود الكراسي والطاولات، بل نحدد فوراً أي الكراسي هو الأطول، وأي الطاولات هي الأقرب، وكم عدد الأكواب الموجودة على المنضدة، أو ما إذا كانت صورة ما تعرض مشهداً من الماضي أو الحاضر. هذه القدرة على موازنة شيء مقابل آخر هي جزء أساسي من كيفية فهمنا للعالم. وفي السنوات الأخيرة، تعلمت الحواسيب الرؤية بمهارة ملحوية، حيث أصبحت قادرة على وصف الصور والإجابة عن أسئلة حول محتواها. هذه الأنظمة، المعروفة بنماذج الرؤية واللغة، هي المحركات الكامنة وراء العديد من الأدوات الحديثة التي يمكنها قراءة رسم بياني، أو وصف صورة، أو حل لغز بصري. ومع ذلك، وبينما أصبحت هذه الآلات بارعة في التعرف والوصف، ظل من غير الواضح ما إذا كانت تمتلك نفس الإدراك الحدسي للمقارنة الذي يستخدمه البشر في كل ثانية من يومهم.
قام أحد الباحثين الآن ببناء اختبار متخصص للإجابة على هذا السؤال، حيث أنشأ مجموعة تقييم جديدة مصممة لعزل عملية مقارنة المعلومات البصرية تحديداً. وقد وجد أن أكثر الأنظمة الحاسوبية تقدماً تؤدي بشكل جيد في المهام العامة، لكنها تعاني بشكل كبير عندما يُطلب منها إجراء مقارنات مباشرة حول الكمية، أو الحجم، أو المسافة، أو الزمن. وتكشف الدراسة أنه حتى النماذج الأكثر ذكاءً يمكن أن تخفق في عد الأشياء التي تكون واضحة تماماً، أو تخطئ في تقدير أي من عنصرين هو الأطول، أو ترتبك بشأن أيهما يقف أقرب إلى الكاميرا من الشخصين. اكتشف الباحث أن هذه الأنظمة غالباً ما تتعثر في مهام تعتبر تافهة بالنسبة للإنسان، مما يشير إلى أن القدرة على مقارنة التفاصيل البصرية تظل ضعفاً منهجياً في الذكاء الاصطناعي الحالي.
ولاستقصاء هذه الفجوة، أنشأ الباحث مجموعة شاملة من الاختبارات تسمى "CompareBench"، وهي مدعومة بموردين آخرين طورهما أيضاً وهما "TallyBench" و"OmniCaps". يمثل "TallyBench" مجموعة من ألفي صورة، كل منها مقترن بسؤال بسيط يطلب من الحاسوب عد نوع معين من الأشياء، مثل الكلاب أو الكتب أو الملاعق. يعمل هذا المورد كأساس لاختبار مدى قدرة النموذج على عد العناصر الفردية، كما يوفر الصور المصدر لمهمة مقارنة الكميات. أما "OmniCaps" فهو مجموعة أصغر تضم سبعمائة وست عشرة صورة تصور أحداثاً تاريخية، ومعالم شهيرة، وشخصيات بارزة، وكل منها موسوم بتاريخ محدد. تسمح هذه المجموعة للباحث باختبار ما إذا كان بإمكان النموذج فهم مرور الوقت من خلال ترتيب الصور زمنياً. ويجمع الاختبار الرئيسي، "CompareBench"، هذه العناصر معاً في ألف ومائتي سؤال تطلب من الحاسوب إجراء مقارنات مباشرة. وتنقسم هذه الأسئلة إلى أربع فئات: مقارنة الكميات، ومقارنة الخصائص الهندسية مثل الطول والسمك، والحكم على العلاقات المكانية مثل العمق والارتفاع، وترتيب الأحداث زمنياً. وتستمد مجموعة مقارنة الكميات تحديداً من "TallyBench لتشكل ستمائة سؤال.
اختبر الباحث تسع نسخ مختلفة من أنظمة الرؤية الحاسوبية الرائدة من ثلاث شركات تكنولوجية كبرى. وطلب من هذه النماذج حل ألف ومائتي سؤال مقارنة وألفي مهمة عدّ. وأظهرت النتائج انقساماً واضحاً بين الأداء البشري وأداء الآلة. فقد حقق البشر درجات تقترب من المثالية في كل مهمة تقريباً، حيث عدوا الأشياء وصنفوا الأحجام بسهولة. ومع ذلك، أظهرت النماذج الحاسوبية أخطاءً مستمرة. ففي مهام العد، حصلت أفضل النماذج على حوالي سبعة وثمانين بالمائة من الإجابات الصحيحة، مما يعني أنها أغفلت أو أخطأت في عد الأشياء في أكثر من صورة واحدة من بين كل عشر صور. أما في مهام المقارنة، فقد تباين الأداء حسب الفئة؛ حيث كانت النماذج جيدة بشكل معقول في مقارنة الكميات، لكنها عانت بشكل كبير في الاستدلال المكاني، فغالباً ما فشلت في تحديد أي جسم كان أقرب إلى الكاميرا أو أي نقطة كانت أعلى عن الأرض. كما واجهت صعوبة في المقارنات الهندسية، مثل تحديد أي من كتابين كان أكثر سمكاً.
ظهرت إحدى النتائج الأكثر إثارة للدهشة في فئة المقارنة الزمنية، أو القائمة على الوقت. في هذا القسم، طُلب من النماذج النظر في صور لمشاهد تاريخية، أو معالم، أو شخصيات مشهورة، وتحديد أيهما ظهر في تاريخ أبكر. وهنا، تفوقت النماذج الحاسوبية في الواقع على المشاركين البشريين. فالبشر، الذين اقتصر دورهم على النظر إلى الأدلة البصرية في الصور، لم يتمكنوا غالباً من تحديد الترتيب الصحيح لأن الصور بدت متشابهة جداً. ومع ذلك، امتلكت النماذج الحاسوبية إمكانية الوصول إلى كم هائل من المعرفة المسبقة بالتاريخ، والعمارة، والشخصيات الشهيرة. واستطاعت استدعاء هذه القاعدة البيانية الداخلية لترتيب الصور زمنياً بشكل صحيح، حتى عندما كانت الأدلة البصرية وحدها غير كافية. يشير هذا إلى أنه بينما تفتقر النماذج إلى فهم بصري حقيقي للمساحة والحجم، إلا أنها تستطيع أحياناً التعويض عن ذلك باستخدام ذاكرتها الضخمة من الحقائق لحل المشكلات التي تتطلب معرفة خارجية.
وعلى الرغم من هذه النجاحات العرضية، تسلط الدراسة الضوء على أن القدرة الجوهرية على مقارنة العناصر البصرية لا تزال غير متقنة تماماً من قبل الذكاء الاصطناعي. لاحظ الباحث أن النماذج كثيراً ما خلطت بين طول الشيء وارتفاعه، أو فشلت في التمييز بين جسم في المقدمة وآخر في الخلفية. كما وجد أن النماذج غالباً ما تغفل عن الأشياء المخفية جزئياً عند العد، وهي مهمة يتعامل معها البشر بالفطرة. وخلص الباحث إلى أن الأنظمة الحالية ليست موثوقة بعد للمهام التي تتطلب مقارنة بصرية دقيقة، وأن هذه الإخفاقات ليست مجرد أخطاء عشوائية بل هي قيود منهجية في كيفية معالجة النماذج للمعلومات البصرية. ومن خلال توفير مجموعة مركزة من الاختبارات التي تعزل هذه المهارات المحددة، يوفر هذا المعيار الجديد طريقة واضحة لقياس التقدم في هذا المجال. ويأمل الباحث أنه من خلال جعل بياناته وأساليبه عامة، سيتمكن علماء آخرون من استخدام هذه الأدوات لبناء نماذج أفضل يمكنها في النهاية مضاهاة القدرة البشرية على الرؤية والمقارنة وفهم العالم من حولنا.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.