← أحدث الأبحاث
💻 computer science

Do You See What I Am Pointing At? Gesture-Based Egocentric Video Question Answering

تقدم هذه الورقة البحثية EgoPointVQA، وهي مجموعة بيانات ومعيار جديد للإجابة على الأسئلة من منظور الشخص الأول القائمة على الإيماءات، إلى جانب طريقة رموز نية اليد (HINT) التي تستفيد من النقاط المفتاحية ثلاثية الأبعاد لليد لتحسين قدرة النماذج اللغوية الكبيرة متعددة الوسائط بشكل كبير على استنتاج نية التأشير من فيديوهات منظور الشخص الأول.

المؤلفون الأصليون: Yura Choi, Roy Miles, Rolandos Alexandros Potamias, Ismail Elezi, Jiankang Deng, Stefanos Zafeiriou

نُشر 2026-03-17
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yura Choi, Roy Miles, Rolandos Alexandros Potamias, Ismail Elezi, Jiankang Deng, Stefanos Zafeiriou

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك ترتدي نظارات ذكية يمكنها رؤية ما تراه بالضبط. تريد أن تسأل مساعدك الذكي سؤالاً حول العالم من حولك.

المشكلة: فجوة "الإشارة"
في الوقت الحالي، إذا أشرت إلى قدر معين على موقدك وسألت: "هل يجب أن أستخدم هذا؟"، فإن معظم المساعدين الذكيّين يصابون بالارتباك. قد ينظرون إلى المطبخ بأكمله، ويرون قدرين، ثم يخمنون عشوائياً. إنهم لا يفهمون أن إصبعك هو "المؤشر" الذي يخبرهم بالضبط أي قدر تقصد.

الأمر يشبه محاولة لعب لعبة "أنا أرى" (I Spy) مع شخص معصوب العينين؛ أنت تقول: "أنا أرى شيئاً أحمر"، لكنه لا يستطيع رؤية إصبعك وهو يشير إلى التفاحة الحمراء المحددة على الطاولة، فيخمن السيارة الحمراء في الممر بدلاً من ذلك.

الحل: EGOPOINTVQA
قام الباحثون وراء هذه الورقة البحثية ببناء ساحة تدريب جديدة تسمى EGOPOINTVQA. فكر في هذا كـ "مدرسة تعليم قيادة" ضخمة للذكاء الاصطناعي، ولكن بدلاً من تعلم قيادة السيارات، يتعلم الذكاء الاصطناعي فهم الإشارة.

لقد أنشأوا آلاف الفيديوهات (بعضها تم إنتاجه بواسطة الكمبيوتر، وبعضها صُوّر لأشخاص حقيقيين يرتدون نظارات ذكية) حيث يشير شخص ما إلى أشياء ويسأل أسئلة مثل:

  • "ما هذا؟"
  • "أي من هذين هو الأقرب؟"
  • "كم عدد هذه الأشياء الموجودة هنا؟"

الهدف هو تعليم الذكاء الاصطناعي أن كلمة "هذا" أو "ذلك" ليست مجرد كلمة عشوائية، بل هي أمر يقول: "انظر هنا تماماً، إلى الشيء الذي يلمسه إصبعي".

السر الخفي: HINT (رموز نية اليد)
حتى مع وجود هذه الفيديوهات، لا تزال نماذج الذكاء الاصطناعي القياسية تواجه صعوبات. كان بإمكانها رؤية الفيديو وقراءة السؤال، لكنها لم تستطع "الشعور" بالإيماءة.

لإصلاح ذلك، ابتكر الباحثون خدعة ذكية تسمى HINT (رموز نية اليد).

تخيل أنك تحاول شرح حركة رقص معقدة لصديق عبر الهاتف. يمكنك فقط وصف الخطوات (النص)، أو يمكنك إرسال فيديو للرقصة (الصورة). ولكن ماذا لو أرسلت له خريطة خاصة توضح بالضبط أين تتحرك يداك في كل ثانية؟

هذا هو ما يفعله HINT.

  1. الخريطة: يستخدم النظام أداة خاصة لتتبع الموقع ثلاثي الأبعاد ليد المستخدم وأصابعه في كل إطار من إطارات الفيديو.
  2. الترجمة: يقوم بتحويل مواضع اليد هذه إلى رمز سري (رموز/tokens) يمكن للذكاء الاصطناعي قراءته.
  3. الدمج: يقوم بدمج "رمز اليد" هذا داخل عقل الذكاء الاصطناعي جنباً إلى جنب مع الفيديو والسؤال.

الآن، عندما يقرأ الذكاء الاصطناعي السؤال "هل هذا القدر أسود؟"، فإنه لا يخمن فحسب. بل ينظر إلى "خريطة اليد"، ويرى الإصبع وهو يشير إلى القدر الأسود، ويجيب بثقة: "نعم".

لماذا هذا مهم؟
هذا البحث هو خطوة كبيرة نحو جعل المساعدين الذكيّين يشعرون بأنهم طبيعيون حقاً. في المستقبل، لن تضطر لقول: "يا ذكاء اصطناعي، انظر إلى القدر الأسود الموجود على اليسار". يمكنك فقط الإشارة إليه والسؤال: "هل هذا جاهز؟" وسيعرف الذكاء الاصطناعي بالضبط ما تعنيه.

باختصاف شديد:

  • المشكلة: الذكاء الاصطناعي سيء في فهم متى يشير البشر إلى الأشياء.
  • مجموعة البيانات: قاموا ببناء مكتبة ضخمة من فيديوهات الإشارة لتدريب الذكاء الاصطناعي.
  • الإصلاح: منحوا الذكاء الاصطناعي "قوة خارقة" (HINT) تترجم حركات اليد إلى لغة يفهمها الذكاء الاصطناعي، مما يسمح له أخيراً بـ "رؤية" ما تشير إليه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →