← أحدث الأبحاث
💻 computer science

Can Vision-Language Models Answer Face to Face Questions in the Real-World?

تقدم هذه الورقة مجموعة بيانات كوالكوم للفيديو التفاعلي (IVD) لتقييم قدرة نماذج الرؤية واللغة على الإجابة على الأسئلة في الوقت الفعلي حول الفيديو والصوت المباشر، مما يكشف أنه بينما تتخلف النماذج الحالية بشكل كبير عن البشر، فإن الضبط الدقيق المستهدف يمكن أن يحسن أداءها بشكل كبير في هذه المهام التفاعلية.

المؤلفون الأصليون: Reza Pourreza, Rishit Dagli, Apratim Bhattacharyya, Sunny Panchal, Guillaume Berger, Roland Memisevic

نُشر 2026-02-24
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Reza Pourreza, Rishit Dagli, Apratim Bhattacharyya, Sunny Panchal, Guillaume Berger, Roland Memisevic

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك صديقًا آليًا يدعى "VisionBot". لقد قمت بتدريب VisionBot على النظر إلى صورة لغرفة معيشة ليقول لك: "هذه أريكة حمراء"، أو "هناك قطة نائمة على السجادة". VisionBot بارع في هذا؛ إنه يشبه أمين مكتبة ذكي جدًا يمكنه العثور فورًا على الحقائق في كتاب ثابت.

لكن الآن، تخيل أنك تريد من VisionBot أن يكون شريكًا في محادثة في الوقت الفعلي. أنت تمسك بهاتفك، وتتجول في منزلك، وتسأل VisionBot: "مهلًا، هل أمسك هذا الكوب بالطريقة الصحيًا؟" أو "كم مرة صفقْتُ للتو؟" بينما تقوم بذلك.

هنا يبدأ VisionBot في التعثر. الأمر يشبه طلب من أمين المكتبة أن ينضم إليك في حفلة رقص حية وأن يواكب الإيقونة، لكن أمين المكتبة معتاد على قراءة الكتب في مكتبة هادئة. هم يعرفون الحقائق، لكنهم لا يعرفون متى يتحدثون أو كيف يتفاعلون مع الأشياء التي تحدث الآن.

المشكلة: فجوة "السفر عبر الزمن"

تجادل الورقة البحثية بأن نماذج الذكاء الاصطناعي الحالية تشبه المسافرين عبر الزمن الذين يعرفون المستقبل فقط.

  • الذكاء الاصطناعي القديم: تعطيه الفيديو الكامل لشخص يصفق 10 مرات، ثم تسأله: "كم مرة صفق؟" يشاهد الذكاء الاصطناعي الفيديو بالكامل، يعدّ، ثم يجيب. إنه يشبه مشاهدة فيلم ثم إجراء اختبار قصير عنه.
  • الحياة الواقعية: في العالم الحقيقي، أنت تطرح السؤال بينما الشخص يصفق. يجب على الذكاء الاصطناعي الاستماع إلى السؤال، ومشاهدة الفيديو وهو يتكشف، وإدراك: "أوه، هم لا يزالون يصفقون، يجب أن أنتظر"، ثم يجيب في اللحظة المناسبة تمامًا.

نماذج الذكاء الاصطناعي الحالية سيئة جدًا في هذا. فهي إما تجيب مبكرًا جدًا (قبل انتهاء الحركة) أو ترتبك لأنها لا تستطيع الجمع بين ما تراه (الفيديو) وما تسمعه (الصوت) في الوقت الفعلي.

الحل: ملعب "QIVD"

لإصلاح ذلك، أنشأ الباحثون في Qualcomm ملعبًا جديدًا يسمى QIVD (مجموعة بيانات Qualcomm للفيديو التفاعلي).

فكر في QIVD كـ صالة ألعاب رياضية لروبوتات الذكاء الاصطناعي.

  • التمرين: قاموا بتسجيل 2,900 فيديو قصير لأشخاص حقيقيين يقومون بأشياء عشوائية (التصفيق، الإشارة، الإمساك بالأشياء) ويطرحون أسئلة مثل: "هل هذا أنفي أم عيني؟" أو "هل رميت الكرة للتو؟"
  • اللمسة المميزة: تتضمن مجموعة البيانات "ساعة توقيت" خاصة لكل سؤال. هي تخبر الذكاء الاصطناعي بالضبط متى ظهرت معلومات كافية للإجابة بشكل صحيح.
    • مثال: إذا سأل شخص ما: "كم مرة صفقْتُ؟" تقول ساعة التوقيت: "لا تجب بعد! انتظر حتى يتوقف التصفيق".
  • الهدف: تدريب الذكاء الاصطناعي ليس فقط على تعلم ماذا يقول، بل متى يقوله.

ما اكتشفوه

وضع الباحثون أذكى نماذج الذكاء الاصطناعي (مثل GPT-4o وغيرها) في هذه الصالة الرياضية، وكانت النتائج مفاجئة:

  1. "النقطة العمياء": فشلت حتى أذكى نماذج الذكاء الاصطناعي فشلًا ذريعًا في الأسئلة "وجهًا لوجه". فغالبًا ما أجابوا قبل انتهاء الحركة أو تجاهلوا الإشارات الصوتية. إنه يشبه طالبًا يعرف الصيغة الرياضية ولكنه ينسى انتظار المعلم حتى ينهي قراءة السؤال قبل أن يصرخ بالإجابة.
  2. "العمى الصوتي": تجاهلت العديد من النماذج الصوت. إذا سألت: "هل أتحدث بصوت عالٍ؟" وكان النموذج يعتمد فقط على الفيديو، فلن يتمكن من الإجابة. إنهم يشبهون أشخاصًا يحاولون إجراء محادثة في غرفة صاخبة وهم يرتدون سماعات إلغاء الضوضاء.
  3. "سحر الضبط الدقيق": إليكم الخبر السار. عندما أخذوا هذه الروبوتات المتعثرة وأعطوها ممارسة إضافية خصيصًا على بيانات هذا "الملعب" (الضبط الدقيق)، أصبحوا أفضل بكثير. تعلموا كيف ينتظرون، وكيف يستمعون، وكيف يجمعون بين الرؤية والصوت. إنه يشبه إعطاء سائق جديد بضع ساعات من التدريب في موقف للسيارات؛ فجأة، لا يصطدم بكل شيء.

الصورة الكبيرة

هذه الورقة البحثية هي بمث stand-up call (نداء استيقاظ). نحن نبني ذكاءً اصطناعيًا مذهلاً في وصف الصور الثابتة، لكننا بعيدون كل البعد عن امتلاك ذكاء اصطناعي يمكن أن يكون شريكًا مفيدًا في الوقت الفعلي في حياتنا اليومية.

التشبيه:

  • الذكاء الاصطناعي الحالي يشبه المصور الفوتوغرافي الذي يلتقط صورة مثالية ويكتب تعليقًا عليها لاحقًا.
  • ما نحتاجه حقًا هو مصور فيديو (Cameraman) يمكنه السير بجانبك، والاستماع إلى أسئلتك، ومراقبة ما تفعله، وتقديم نصيحة مفيدة لك بينما تقوم بذلك.

تعد مجموعة بيانات QIVD الخطوة الأولى نحو تعليم مصوري الفيديو من الذكاء الاصطناعي كيفية التوقف، والنظر، والاستماع، والتحدث في الوقت المناسب. إنها الجسر بين "الحواسيب الذكية" و"الروبوتات المفيدة".

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →