← أحدث الأبحاث
🤖 AI

VisualNeedle: Benchmarking Active Visual Search in Information-Dense Scenes

تقدم الورقة البحثية VisualNeedle، وهو معيار اختبار تحدي للمشاهد كثيفة المعلومات يكشف عن قصور كبير في قدرات البحث البصري دقيق التفاصيل لدى النماذج اللغوية الكبيرة متعددة الوسائط الحالية، وتثبت، من خلال تجربة استئصال "القص-الأسود" (crop-black) المبتكرة، أن نجاحها يعتمد على أدلة بصرية وسيطة حقيقية بدلاً من الأولويات اللغوية أو الدلالات العامة.

المؤلفون الأصليون: Jingru Chen, Yiming Liu, Mingtao Chen, Sijie Chen, Richeng Xuan, Liang Yang, Zhichao Hu, Fanyang Lu

نُشر 2026-05-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jingru Chen, Yiming Liu, Mingtao Chen, Sijie Chen, Richeng Xuan, Liang Yang, Zhichao Hu, Fanyang Lu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تلعب لعبة "أنا أرى" (I Spy) مع صديق آلي ذكي جداً، ولكنه مغرور قليلاً. تعرض عليه صورة ضخمة ومزدحمة لشارع مدينة صاخب، أو رف كتب مكدس، أو مستند كثيف المعلومات. ثم تطرح عليه سؤالاً صعباً مثل: "ما هي الكلمة الرابعة على اللوحة الصفراء في الزاوية اليمنى السفلية؟"

وفقاً لورقة بحثية بعنوان VisualNeedle، فإن العديد من نماذج الذكاء الاصطعي المتقدمة اليوم (التي تسمى النماذج اللغوية الكبيرة متعددة الوسائط - MLLMs) تفشل في هذه اللعبة. ورغم ادعائها تحقيق دقة تصل إلى 90% في اختبارات أخرى، إلا أنها في الواقع تستخدم "طرقاً غش" للحصول على هذه الدرجات العالية.

إليك تحليل بسيط لما وجدته الورقة البحثية، باستخدام تشبيهات من الحياة اليومية:

1. "الغش الثلاثي" (الاختصارات)

اكتشف الباحثون أن نماذج الذكاء الاصطناٍ يعتمد عليها غالباً يحصل على الإجابة الصحيحة دون النظر إلى الصورة بشكل صحيح؛ فهي تستخدم ثلاثة اختصارات رئيسية:

  • "تخمين المقامر" (الأولويات اللغوية): في بعض الأحيان، يكشف السؤال نفسه عن الإجابة. إذا سألت: "ما هو لون علامة التوقف؟"، فإن الذكاء الاصطناعي لا يحتاج لرؤية العلامة؛ فهو يعرف بالفعل أن علامات التوقف عادة ما تكون حمراء. الأمر يشبه تخمين إجابة لغز لأنك تعرف الخاتمة، وليس لأنك حللت اللغز.
  • "النظرة العامة الضبابية" (الدلالات العالمية العامة): ينظر الذكاء الاصطناعي إلى الصورة ككل ويرى "الجو العام". هو يعرف أنها "شارع مزدحم"، لذا يخمن الإجابة بناءً على هذا الشعور العام، متجاهلاً التفاصيل الصغيرة والدقيقة التي يحتاج لرؤيتها. الأمر يشبه النظر إلى غابة من طائرة مروحية وتخمين نوع شجرة في الزاوية دون الهبوط أبداً.
  • "التكبير الوهمي" (ثبات مخرجات الأداة): هذا هو الجزء الأكثر إثارة للاهتمام. يُفترض بالذكاء الاصطناń الحديث أن يكون قادراً على "التكبير" (القص) على أجزاء من الصورة لرؤية التفاصيل بشكل أفضل. وجد الباحثون أنه حتى لو استبدلوا الصورة المكبرة بـ مربع أسود سادة، فإن الذكاء الاصطناني غالباً ما يعطي نفس الإجابة. إنه يتظاهر بالتكبير، لكنه لا يستخدم المعلومات البصرية الجديدة فعلياً؛ إنه فقط يتبع الخطوات الظاهرية.

2. الاختبار الجديد: "VisualNeedle"

لإيقاف عمليات الغش هذه، صمم الفريق اختباراً جديداً يسمى VisualNeedle. فكر فيه كاختبار "البحث عن إبرة في كومة قش".

  • الإعداد: قاموا بإنشاء 300 سؤال بناءً على مشاهد شديدة الازدحام وكثيفة المعلومات (مثل جدار مليء بيافطات الشوارع أو رف كتب مزدحم للغاية).
  • القاعدة: الإجابة لا تظهر أبداً من نظرة سريعة. يجب عليك أن تجد دليلاً صغيراً ومحدداً (الإبرة) مخبأً في زاوية صغيرة من الصورة للإجابة بشكل صحيح.
  • الفخ: تم تصميم الأسئلة بحيث لا يمكن التخمين بناءً على نص السؤال أو "الانطباع العام" للصورة. يجب عليك فعلياً العثور على تلك البقعة المحددة.

3. تجربة "المربع الأسود"

لإثبات أن الذكاء الاصطناٍ يستخدم عينيه (أو كاميرته) حقاً، أدخل الباحثون إعداد اختبار خاص يسمى Crop-Black.

  • كيف يعمل: سمحوا للذكاء الاصطناني باستخدام أداة "التكبير". ولكن، في كل مرة يطلب فيها الذكاء الاصطناني التكبير على منطقة معينة، يقوم النظام بإعطائه مربعاً أسود بدلاً من الصورة الحقيقية.
  • النتيجة: إذا كان الذكاء الاصطناني "يفكر بالصور" حقاً، فإن أدائه يجب أن ينهار عندما يرى مربعات سوداء. وقد حدث ذلك بالفعل!
    • عندما رأى الذكاء الاصطناني صوراً مكبرة حقيقية، نجحت أفضل النماذج في تقديم حوالي 56% من الإجابات الصحيحة.
    • عندما رأى مربعات سوداء (تكبير وهمي)، انخفضت درجاتهم إلى حوالي 12%.
    • هذا يثبت أن الذكاء الاصطناني كان يعتمد على الأدلة البصرية عندما كانت موجودة، لكنه لم يستطع القيام بالمهمة بدونها.

4. البشر مقابل الروبوتات

أجرى الباحثون أيضاً اختباراً لمجموعة من البشر.

  • البشر: حصلوا على حوالي 63% من الإجابات الصحيحة (باستخدام أغلبية الأصوات).
  • أفضل ذكاء اصطناني: حصل على حوالي 56% (حتى مع استخدام أداة التكبير).
  • الذكاء الاصطناني بدون أدوات: حصل على أقل من 20% من الإجابات الصحيحة.

يوضح هذا أن الذكاء الاصطناني، رغم تحسنه في عملية "التكبير"، لا يزال يواجه صعوبة في العثور على الإبرة في كومة القش بموثوقية تضاهي البشر. فالذكاء الاصطناني غالباً ما يكبر على المكان الخطأ، أو يكرر عملية التكبير عدة مرات دون أن يصل أبداً إلى الهدف.

الخلاصة

تخلص الورقة البحثية إلى أن نماذج الذكاء الاصطناني الحالية ليست بعد "باحثين بصريين نشطين" كما نأمل. فهي جيدة في النظر إلى صورة كاملة والتخمين، أو في استخدام الأدوات إذا كانت الصورة واضحة. ولكن عندما تتطلب المهمة منهم البحث بنشاط عن تفصيل صغير مخفي في مشهد فوضوي والثقة فيما يرونه هناك، فإنهم لا يزالون يقصرون.

VisualNeedle هو اختبار جديد وأكثر صرامة مصمم لإيقاف الذكاء الاصطناني عن الغش وإظهار مواطن الخلل بدقة: حيث يجب عليهم العثور على الإبرة، وليس مجرد التخمين بمكان وجودها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →