← أحدث الأبحاث
💬 NLP

Do Vision-Language Models Understand Visual Persuasiveness? A Diagnosis via Visual Persuasive Factors

تشخص هذه الورقة أوجه القصور في نماذج الرؤية واللغة عند تقييم الإقناع البصري، كاشفةً عن ميلها للإفراط في التنبؤ بالإقناع بسبب انحياز موجه نحو الاستدعاء وفشل في مواءمة تحديد الأشياء مع السياق الدلالي بشكل صحيح، بينما تثبت إمكانية تحسين الأداء من خلال تدخلات عوامل الإقناع البصري (VPFs) المستهدفة.

المؤلفون الأصليون: Gyuwon Park, Hyounghun Kim

نُشر 2026-09-11
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Gyuwon Park, Hyounghun Kim

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في العالم الحديث، نادراً ما تكون الصور مجرد زينة. فمن التحذيرات الصحية العامة على علب السجائر إلى الملصقات السياسية للحملات الانتخابية، يتم تصميم العناصر المرئية لتشكيل طريقة تفكيرنا، وشعورنا، وتصرفاتنا. هذه العملية، المعروفة باسم الإقناع البصري، تعتمد على تفاعل معقد بين ما نراه والرسالة التي نقرؤها. فقد تجعل الصورة المبهجة والمشرقة نصيحة تتعلق بالسلامة تبدو مشجعة، بينما قد تجعل صورة مظلمة ومزدحمة النصيحة ذاتها تبدو مهددة. لعقود من الزمن، درس علماء النفس كيفية معالجة البشر لهذه الإشارات، مدركين أن أدمغتنا تزن الألوان، ووضع الأشياء، ووجود الأشخاص لتقرر ما إذا كانت الرسالة مقنعة أم لا. والآن، مع قدرة أنظمة الذكاء الاصطناعي على رؤية وقراءة الصور في آن واحد، برز سؤال حاسم: هل تفهم هذه الآلات الإقناع بالطريقة التي يفهم بها البشر، أم أنها مجرد تخمين بناءً على أنماط سطحية؟

سعى فريق من الباحثين في جامعة "بوستيك" (POSTECH) في كوريا الجنوبية للإجابة على ذلك من خلال وضع نماذج الرؤية واللغة الحديثة تحت اختبار صارم. هذه النماذج هي أنظمة حاسوبية متطورة يمكنها النظر في صورة وقراءة نص، ثم محاولة فهم مدى دعم الصورة للنص. بدأ الباحثون بمجموعة منسقة بعناوة تضم 562 زوجاً من (الصورة والرسالة). لم تكن هذه الصور عشوائية من الإنترنت؛ بل تم اختيارها لأن حكامًا بشريين قد اطلعوا عليها بالفعل واتفقوا بشكل شبه تام على ما إذا كان كل زوج مقنعاً للغاية أم غير مقنع. خلق هذا "حقيقة أرضية" واضحة يمكن قياس النماذج الحاسوبية بناءً عليها. كان الهدف هو معرفة ما إذا كانت الآلات تستطيع محاكة الحكم البشري أو ما إذا كانت تفتقر إلى شيء جوهري حول كيفية عمل الإقناع البصري.

كشفت النتائج عن خلل صارخ ومتسق في كيفية عمل أنظمة الذكاء الاصطناعي هذه. فعندما طُلب منها الحكم على مدى الإقناع، أظهرت النماذج انحيازاً قوياً للقول بـ "نعم". لقد كانت بارعة جداً في رصد الصور التي يجدها البشر مقنعة، لكنها كانت أيضاً متحمسة للغاية لتصنيف الصور غير المقنعية على أنها مقنعة. ومن الناحية التقنية، حققت هذه النماذج معدل "استدعاء" عالياً، لكنها عانت من فيض من "الإيجابيات الكاذبة". وبشكل أساسي، كانت الآلات تبالغ في التنبؤ بالإقناع، حيث اعتبرت أي صورة تحتوي على عنصر مرئي منطقي بمثابة حجة ناجحة. بدا أنها تفتقر إلى القدرة البشرية على التمييز بين كون الإشارة المرئية موجودة فحسب، وبين كونها تقوم بالفعل بعملية الإقناع.

لفهم سبب حدوث ذلك، قام الباحثون بتفكيك العالم المرئي إلى مكونات محددة وقابلة للقياس أطلقوا عليها "العوامل الإقناعية البصرية". تراوحت هذه العوامل من التأثير الحسي المباشر للصورة، مثل سطوعها وألوانها، إلى تكوينها، مثل ما إذا كان الموضوع الرئيسي موضوعاً في المركز أو عند تقاطع خطوط شبكية وهمية. كما نظروا أيضاً في العناصر الدلالية، مثل ما إذا كان هناك جسم رئيسي، أو شخص، أو قطعة نص مرئية. وعندما قارن الباحثون كيف يزن البشر وهذه الآلات هذه العوامل، ظهر تباين واضح. استخدم البشر هذه الإشارات ببراعة، مدركين أن الصورة الزاهية قد تكون مقنعة لرسالة إيجابية ولكن ليس لرسالة سلبية. أما الآلات، فقد كانت غالباً ما تعامل مجرد وجود الإشارة كضمان للنجاح. فعلى سبيل المثال، إذا احتوت الصورة على وجه بشري أو جسم معين مذكور في النص، فمن المرجح أن تعلن النماذج أنها مقنعة، حتى لو كان السياق العام يوحي بخلاف ذلك. لقد كانوا يخطئون بين مكونات الوصفة والطبق النهائي.

ثم استكشف البحث ما إذا كان إعطاء الآلات تعليمات أكثر صراحة يمكن أن يحل هذه المشكلة. جرب الباحثون نهجين رئيسيين. أولاً، قاموا بتغذية النماذج بمعرفة مفصلة حول العوامل المرئية، فأخبروها مثلاً أن وجود شخص يجب أن يُعامل كدليل داعم وليس كعامل حاسم. ثانياً، طلبوا من النماذج التفكير خطوة بخطوة، عبر تفكيك منطقها قبل اتخاذ حكم نهائي. كانت النتائج هنا دقيقة؛ فتقديم السياق المناسب للنماذج - وتحديداً تأطير هذه الإشارات المرئية كشيء يجب تفسيره بدلاً من كونه قاعدة ثابتة - ساعد في تقليل عدد الأخطاء. ومع ذلك، فإن مجرد مطالبة النماذج بالتفكير في المشكلة أو الإشارة إلى وجود جسم ما لم يكن كافياً. وفي بعض الحالات، أدى إجبار النماذج على التفكير باستخدام إشارات صريحة إلى جعل انحيازها يزداد سوءاً، مما جعلها تصر على أحكام خاطئة.

اكتشف الباحثون أن المشكلة الجوهرية تكمن في "عنق زجاجة" محدد في عملية التفكير لدى الآلة. فعندما حلل الفريق التفسيرات التي تم إنتاجها خطوة بخطوة، وجدوا أن الآلات جيدة بشكل عام في تحديد الأشياء ووصف النصوص. كما استطاعت أيضاً شرح كيفية ارتباط جسم ما برسالة ما. لكن الفشل حدث في الخطوة الأخيرة: ربط تلك الأدلة بالهدف النهائي للتواصل. لقد كافحت النماذج لتقرير ما إذا كانت الأدلة المرئية التي وجدتها تدعم الرسالة المقصودة حقاً أم أنها مجرد مصادفة. لقد استطاعت رؤية الأجزاء، لكنها لم تستطع الاعتماد على ربطها ببعضها لتكوين حكم متماسك حول القصد.

يشير هذا البحث إلى أنه بينما حقق الذكاء الاصطناعي خطوات هائلة في التعرف على ما يوجد في الصورة، إلا أنه لا يزال يفتقر إلى فهم سياقي عميق لسبب أهمية تلك الصورة. فالآلات حالياً ممتازة في رصد "مكونات" الإقناع، لكنها ضعيفة في "تذوق" المنتج النهائي. فهي تميل إلى افتراض أنه إذا وجدت العناصر المرئية الصحيحة، فلا بد أن تكون الرسالة مقنعة، متجاهلة القدرة البشرية الدقيقة على وزن السياق والنبرة والقصد. وتخلص الدراسة إلى أنه لكي تتمكن هذه الأنظمة من فهم الإقناع البصري حقاً، فإنها تحتاج إلى تجاوز مجرد تحديد الأشياء وتعلم ربط تلك الملاحظات بالغرض التواصلي الكامن وراءها. وإلى أن تتمكن من تحقيق تلك القفزة، ستظل عرضة لرؤية الإقناع حيث لا يوجد، وتخطئ في اعتبار وجود الإشارة دليلاً على قوة الرسالة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →