← أحدث الأبحاث
💻 computer science

SocioGesture: Real-Time and Adaptive Social Gesture Perception for Human-Robot Interaction

تقدم الورقة البحثية SocioGesture، وهو نظام لإدراك الإيماءات الاجتماعية في الوقت الفعلي والتكيفي للتفاعل بين الإنسان والروبوت، يستخدم نموذجاً خفيف الوزن ثنائي المسار تم تدريبه باستخدام فساد مدرك للاحتجاب لتحقيق إدراك قوي ومنخفض زمن الوصول على أجهزة الحافة مع توسيع مفرداته باستمرار من خلال التكيف غير المتصل بالإنترنت.

المؤلفون الأصليون: Wenjin Fu, Li-Fan Wu, Jerin Peter, Chip Huyen, Boyuan Chen, Jan Liphardt

نُشر 2026-09-07
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Wenjin Fu, Li-Fan Wu, Jerin Peter, Chip Huyen, Boyuan Chen, Jan Liphardt

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تتعلم الروبوتات كيفية التحرك في عالمنا، ولكن لكي تتفاعل معنا بشكل طبيعي، يجب عليها أن تفعل ما هو أكثر من مجرد اتباع الأوامر المنطوقة. فهي بحاجة إلى فهم اللغة الصامتة لحركة البشر: تلويحة للتحية، أو كف مرفوع للقول "توقف"، أو هاتف مرفوع إلى الأذن للإشارة إلى "أنا مشغول". هذا هو تحدي التفاعل بين الإنسان والروبوت، وهو مجال مخصص لتعليم الآلات كيفية قراءة هذه الإشارات الاجتماعية. تكمن الصعوبة في الواقع الفوضوي للعالم الحقيقي؛ فخلافًا لمقطع فيديو يُشاهد في مكتب هادئ، يرى الروبوت الناس من زوايا متحركة، وغالبًا ما تكون أيديهم مخفية خلف أجسادهم أو ضائعة في الظلال. علاوة على ذلك، لا يمكن للروبوت أن يتحمل التوقف والتفكير لفترة طويلة؛ فإذا تردد كثيرًا في تفسير إيماءة ما، سيبدو التفاعل مكسورًا وغير طبيعي. الهدف هو بناء نظام سريع بما يكفي لمواكبة المحادثة، وذكي بما يكفي للتعامل مع الأجزاء المفقودة من المعلومات، وقادر على التعلم من أخطائه دون الحاجة إلى إعادة برمجة بشرية في كل مرة.

لقد طور الباحثون في "OpenMind" نظامًا جديدًا يسمى "SocioGesture" لحل هذه المشكلة. وهو أداة إدراك في الوقت الفعلي مصممة خصيصًا للروبوتات التي تحتاج إلى التعرف على الإيماءات الاجتماعية أثناء حركتها وعملها. يعمل النظام من خلال مراقبة الهيكل العظمي للشخص — أي خريطة مفاصله وعظامه — بدلًا من محاولة تحليل ملابسه أو الخلفية. وقد اختير هذا النهج لأن الهيكل العظمي يظل قابلاً للتمييز حتى عندما تتغير الإضاءة أو يرتدي الشخص ملابس مختلفة. ومع ذلك، أدرك الباحثون أن تتبع الهيكل العظمي القياسي غالبًا ما يفشل عندما تكون اليد محجوبة أو يتغير زاوية الكاميرا. ولإصلاح ذلك، بنوا نموذجًا يولي اهتمامًا لمدى ثقة كل مفصل بمفرده. فإذا كانت كاميرا الروبوت غير متأكدة من مكان اليد، فإن النظام يسجل عدم اليقين هذا بدلًا من التخمين الأعمى. إنه يجمع بين الحركة الواسعة للجسم والتفاصيل الدقيقة لليد، ويدمجهما معًا في عملية حسابية واحدة فائقة السرعة تعمل مباشرة على الكمبيوتر المدمج للروبوت.

يكمن الابتكار الجوهري لـ "SocioGesture" في كيفية تعامله مع الفجوات الحتمية في البيانات. في العديد من الأنظمة السابقة، إذا فُقد مفصل رئيسي مثل المعصم، فإن محاولة التعرف بأكملها ستفشل. لقد تم تدريب هذا النظام الجديد على توقع تلك الفجوات؛ حيث قام الباحثون عمدًا بـ "إفساد" بيانات التدريب الخاصة بهم عبر إخفاء الأيدي والأذرع في المحاكاة الحاسوبية، مما أجبر النموذج على تعلم كيفية التعرف على الإيماءة حتى عندما تكون أجزاء من الهيكل العظمي غير مرئية. يحدث هذا التدريب قبل أن يغادر الروبوت المختبر، لذا لا يحتاج الروبوت إلى قدرة حوسبية إضافية ليكون قويًا. وعندما يكون الروبوت في الميدان، فإنه يتخذ القرارات بناءً على ما يراه. فإذا كان واثقًا جدًا من إيماءة ما، فإنه يتصرف فورًا. أما إذا كان غير متأكد، فهو لا يخمن؛ بل بدلاً من ذلك، يحفظ تلك اللحظة من التفاعل للمراجعة اللاحقة. وهذا يخلق حلقة أمان تجنب الروبوت ارتكاب أخطاء خطيرة، مثل الاقتراب من شخص يحاول إيقافه، بينما يستمر في جمع البيانات ليصبح أكثر ذكاءً.

تم اختبار النظام في مجموعة متنوعة من البيئات الداخلية والخارجية مع أشخاص حقيقيين. جمع الباحثون مجموعة بيانات لسبع إيماءات اجتماعية شائعة، بما في ذلك التلويح لدعوة الروبوت للاقتراب، أو رفع اليد لإيقافه، أو التظاهر بإجراء مكالمة هاتفية للإشارة إلى عدم التوافر. كما تضمنوا إيماءة "تشتيت" مثل حك الرأس، لضمان عدم خلط الروبوت بينها وبين المكالمة الهاتفية. وعند اختبار النظام على أشخاص لم يرهم الروبوت من قبل، حدد الإيماءات بشكل صحيح في جميع الحالات تقريبًا، حتى عندما كانت الأيدي مخفية جزئيًا. وفي اختبار محدد حيث تم حجب الأيدي تمامًا من البيانات، قفزت دقة النظام من نسبة ضعيفة بلغت 31 بالمائة إلى نسبة قوية بلغت 85 بالمائة، مما أثبت نجاح طريقة التدريب. كما عمل النظام بسرعة كافية لمواكبة كاميرا فيديو قياسية، حيث عالج إطارًا كاملاً في 25 ميلي ثانية فقط على كمبيوتر مثبت على الروبوت، وهي سرعة كافية لتبدو فورية للمراقب البشري.

ربما يكون الاكتشاف الأكثر أهمية هو قدرة النظام على التعلم بعد النشر. فقد وضع الباحثون عملية حيث يقوم الروبوت بتحديد اللحظات التي كان فيها غير متأكد ويرسل مقاطع الفيديو تلك إلى كمبيوتر أكثر قوة في السحابة. يقوم هذا الكمبيوتر القوي بتصنيف الإيماءة، ويستخدم الروبوت هذه المعلومة الجديدة لتحديث دماغه. وفي اختبار تعلم فيه الروبوت ثلاث إيماءات جديدة — علامة الإبهب للأعلى، والمصافحة، والتحية العسكرية — نجح في تعلمها دون نسيان الإيماءات السبع الأصلية. حافظ النظام على دقته العالية في الإيماءات القديمة مع تحديد الإيماءات الجديدة بدقة تصل إلى الثلثين تقريبًا. وهذا يوضح مسارًا مستقبليًا حيث يمكن للروبوتات توسيع مفرداتها من الإشارات الاجتماعية بمرور الوقت، والتكيف مع المواقف الجديدة دون الحاجة إلى إيقاف تشغيلها وإعادة تدريبها من الصفر.

اختبر الباحثون أيضًا النظام على روبوت حي، وهو آلة بشرية الشكل تسمى "Unitery G1"، يتفاعل مع خمسة أشخاص جدد لم يشاركوا في التدريب. في 150 تجربة، تعرف الروبوت على الإيماءة بشكل صحيح بنسبة 97 بالمائة. وعندما قرر الروبوت التصرف، اختار السلوك الصحيح — مثل الاقتراب أو التوقف — بنسبة 98 بالمائ المائة. الحالات القليلة التي لم يتصرف فيها لم تكن بسبب ارتكاب خطأ، بل لأنه كان حذرًا؛ فقد اختار الانتظار بدلًا من المخاطرة بحركة خاطئة. هذا النهج التحفظي هو بالضبط ما قصده المصممون لروبوت في مكان عام. تشير الدراسة إلى أنه من خلال الجمع بين نموذج خفيف وسريع مع استراتيجية تعطي الأولو للسلامة وحلقة للتعلم غير المتزامن، يمكننا بناء روبوتات ليست فعالة فحسب، بل واعية اجتماعيًا وقادرة على التكيف مع الطبيعة غير المتوقعة للتفاعل البشري.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →