← أحدث الأبحاث
💻 computer science

UGotMe: An Embodied System for Affective Human-Robot Interaction

تقدم هذه الورقة نظام UGotMe، وهو نظام تفاعل عاطفي متجسد بين الإنسان والروبوت مصمم للمحادثات متعددة الأطراف يتغلب على تحديات الضوضاء البيئية وزمن الاستجابة في الوقت الفعلي من خلال استخراج الوجه النشط ونقل البيانات الفعال، وقد تم التحقق من صحته على الروبوت البشري Ameca.

المؤلفون الأصليون: Peizhen Li, Longbing Cao, Xiao-Ming Wu, Xiaohan Yu, Runze Yang

نُشر 2026-03-18
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Peizhen Li, Longbing Cao, Xiao-Ming Wu, Xiaohan Yu, Runze Yang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك في حفلة صاخبة ومليئة بالضجيج. أنت تحاول إجراء محادثة عميقة مع صديق لك، لكن هناك أشخاصاً آخرين يصرخون، ويرقصون، ويقومون بحركات مضحكة بجانبك تماماً. الآن، تخيل روبوتاً يقف في منتصف هذه الحفلة، يحاول فهم مشاعر صديقك فقط لكي يتفاعل بشكل مناسب.

هذا هو بالضبط المشكل الذي تحاول ورقة البحث "UGotMe" حله.

إليك شرح بسيط لما قام به الباحثون، باستخدام تشبيهات من الحياة اليومية:

1. المشكلة: "الدماغ المرتبك" للروبوت

الروبوتات الحالية تشبه الأشخاص الذين يعانون من سوء التمييز بين الضوضاء والواقع. إذا نظر الروبوت إلى مجموعة من الناس، فإنه يرى وجوه الجميع.

  • السيناريو: أنت (المتحدث النشط) تروي قصة حزينة. ولكن بجانبك تماماً يقف غريب يضحك، وخلفك رف عليه مزهرية غريبة.
  • خطأ الروبوت: بدون مساعدة، ينظر الروبوت إلى الصورة بأكملها. يرى الغريب الضاحك والمزهرية الغريبة. يصاب بالارتباك وقد يظن: "أوه، الجميع سعداء!" أو "ما هي تلك المزهرية؟". إنه يفشل في التركيز على وجهك الحزين.
  • مشكلة السرعة: أيضاً، الروبوتات غالباً ما تكون بطيئة. بحلول الوقت الذي يستوعب فيه الروبوت ما قلته، تكون المحادثة قد انتقلت بالفعل. الأمر يشبه محاولة إجراء محادثة مع شخص يستغرق 10 ثوانٍ للرد على كل كلمة.

2. الحل: UGotMe (المضيف الذكي للحفلة)

قام الباحثون ببناء نظام يسمى UGotMe (اختصار لـ "You Got Me"، مما يوحي بأن الروبوت فهمك أخيراً). إنه يعمل مثل مضيف حفلة ذكي جداً يعرف تماماً كيف يتعامل مع الفوضى.

لقد حل المشكلتين الرئيسيتين بخدعتين ذكيتين:

الخدعة (أ): استراتيجية "تسليط الضوء" (إزالة الضجيج)

بدلاً من النظر إلى الغرفة الفوضوية بأكملها، يضع الروبوت تسليط ضوء (Spotlight) على الشخص الذي يتحدث إليه.

  • كيف تعمل: يستمع الروبوت إلى مصدر الصوت. يقوم بتدوير رأسه فعلياً (مثل الإنسان الذي يلتفت لمواجهة المتحدث) بحيث يكون الشخص الذي يتحدث في منتصف رؤية الكاميرا تماماً.
  • الفلتر (المصفاة): بعد ذلك يقوم "بقص" وجه ذلك الشخص رقمياً ويتجاهل الغريب الضاحك والمزهرية في الخلفية. الأمر يشبه استخدام برنامج تعديل الصور لقص الخلفية بحيث لا ترى إلا الشخص الذي تهتم به.
  • "إعادة الضبط المحايد": أحياناً، يبدو وجه الشخص مختلفاً بناءً على مزاجه أو الإضاءة. يقوم النظام أولاً بأخذ لقطة "محايدة" لوجه ذلك الشخص (مثل صورة مرجعية أساسية) ثم يقيس مدى تغير تعبيراته عن هذه اللقطة الأساسية. هذا يساعد الروبوت على فهم العاطفة بدلاً من مجرد شكل وجه الشخص الفريد.

الخدعة (ب): "المسار السريع" (السرعة في الوقت الفعلي)

لجعل الروبوت سريعاً، لم يرسلوا بيانات الفيديو بطريقة بطيئة ومعقدة.

  • التشبيه: تخيل إرسال رسالة ورقية مقابل إرسال بث فيديو مباشر. معظم الأنظمة ترسل الرسالة كاملة وتنتظر الرد. أما UGotMe فيرسل تدفقاً مستمراً وعالي السرعة من البيانات (مثل بث الفيديو المباشر) إلى كمبيوتر قوي قريب.
  • النتيجة: يعالج الروبوت البيانات فوراً، بحيث يمكنه التفاعل في الوقت الفعلي، تماماً كما يفعل البشر في المحادثة.

3. الدماغ: VL2E (محقق العواطف)

يستخدم النظام نموذج ذكاء اصطناعي خاص يسمى VL2E (الرؤية واللغة إلى العاطفة - Vision-Language to Emotion).

  • ماذا يفعل: يجمع بين ما يراه الروبوت (الوجه المقصوص) وما يسمعه الروبوت (الكلمات التي يتم نطقها).
  • السحر: هو لا ينظر فقط إلى الوجه؛ بل يتذكر الجمل القليلة الأخيرة من المحادثة. إذا قلت "أنا بخير"، ولكن وجهك يبدو حزيناً وكنت تبكي للتو، سيفهم الروبوت أنك حزين في الواقع وليس بخير. إنه يعمل مثل صديق جيد ينتبه للسياق.

4. الاختبار: الروبوت "Ameca"

اختبر الباحثون هذا على روبوت حقيقي مادي يسمى Ameca (روبوت بشري ذو تعبيرات قوية جداً).

  • التجربة: جعلوا بشرًا حقيقيين يتحدثون مع Ameca في إطار جماعي.
  • النتيجة:
    • بدون UGotMe: ارتبك الروبوت بسبب الأشخاص في الخلفية وأعطى رد فعل عاطفي خاطئ (على سبيل المثال، ابتسم بينما كان الإنسان حزيناً).
    • مع UGotMe: حدد الروبوت عاطفة المتحدث بنسبة 77% من المرات (وهي قفزة هائلة عن الطرق السابقة) وجعل الناس يشعرون وكأنهم في محادثة طبيعية ومتعاطفة.

الخلاصة

فكر في UGotMe كأنه يمنح الروبوت "مهارات اجتماعية". إنه يعلم الروبوت كيف:

  1. يتجاهل الضجيج (يتجاهل ضجيج الحفلة في الخلفية).
  2. يركز على المتحدث (يدير رأسه ويكبّر الصورة).
  3. يستمع للسياق (يتذكر ما قيل للتو).
  4. يتفاعل فوراً (لا يكون بطيئاً).

الهدف هو صنع روبوتات لا تكتفي فقط بـ تمثيل دور البشر، بل تجعلنا نشعر حقاً أنها تفهمنا، مما يجعل تفاعلاتنا معها أكثر طبيعية وأقل آلية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →