← أحدث الأبحاث
💻 computer science

Gesture Matters: Pedestrian Gesture Recognition for AVs Through Skeleton Pose Evaluation

تقدم هذه الدراسة إطار عمل لتصنيف الإيماءات للمركبات ذاتية القيادة يستخدم تقدير الوضعية ثنائي الأبعاد و76 ميزة مستخرجة من مجموعة بيانات WIVW لتصنيف إيماءات المشاة إلى أربع فئات، محققة دقة بنسبة 87% من خلال تسليط الضوء على القدرة التمييزية لموقع اليد وسرعة الحركة.

المؤلفون الأصليون: Alif Rizqullah Mahdi, Mahdi Rezaei, Natasha Merat

نُشر 2026-02-10
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Alif Rizqullah Mahdi, Mahdi Rezaei, Natasha Merat

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل شارعًا مزدحمًا في مدينة ما كأنه ساحة رقص عملاقة، مليئة بالفوضى. لعقود من الزمن، رقص البشر معًا بأمان لأننا نعرف الخطوات: تواصل بصري، إيماءة بالرأس، أو موجة سريعة باليد للقول: "تفضل أنت أولاً" أو "أنا أتوقف". ولكن الآن، نحن نُدخل راقصًا جديدًا إلى الساحة: المركبة ذاتية القيادة (AV). المشكلة؟ المركبة ذاتية القيادة هي روبوت لا يتحدث "لغة الجسد البشرية". هي ترى شخصًا واقفًا هناك، لكنها لا تعرف ما إذا كان هذا الشخص على وشك العبور، أو يلوح مرحبًا، أو واقفًا بلا حراك فحسب.

هذه الورقة البحثية تشبه المترجم الذي يحاول تعليم الروبوت كيفية فهم حركات رقص المشاة.

المشكلة: "العمى الاجتماعي" للروبوت

في العالم الحقيقي، قواعد المرور تشبه القواعد المكتوبة للعبة، لكنها ليست كافية. أحيانًا، تحتاج إلى التفاوض. إذا وقع سائق ومشاة في حالة جمود، فإنهما يستخدمان إشارات غير لفظية — مثل إيماءة باليد أو إمالة الرأس — لقول: "تفضل بالمرور". البشر بارعون في هذا؛ يمكننا قراءة إمالة رأس صغيرة أو رفع يد فورًا.

ومع ذلك، فإن المركبات ذاتية القيادة حاليًا "عمياء اجتماعيًا". فهي تعتمد على قواعد صارمة وأجهزة استشعار. إذا لم تتمكن من قراءة هذه الإشارات الاجتماعية الدقيقة، فقد تتعثر، أو تتصرف بحذر مفرط، أو والأسوأ من ذلك، قد تفوت إشارة تدل على أن شخصًا ما على وشك العبور.

الحل: تعليم الروبوت كيف "يرى" الهياكل العظمية

قرر الباحثون بناء نظام يساعد المركبة ذاتية القيادة على "رؤية" هيكل الشخص وتفسير حركاته. لم ينظروا فقط إلى ملابس الشخص أو وجهه؛ بل نظروا إلى "الرجل العصوي" داخل الشخص (الهيكل العظمي) لفهم هندسة الحركة.

مجموعة البيانات: مكتبة من الحركات الواقعية
لتدريب نظامهم، استخدموا مكتبة خاصة من مقاطع الفيديو تسمى مجموعة بيانات WIVW. فكر في هذا كأرشيف فيديو لأشخاص يقومون بإيماءات محددة في الحياة الواقعية. قام الباحثون بتصفية مئات الفيديوهات للعثور على تلك التي تطابق أربع "حركات رقص" محددة أرادوا من الروبوت التعرف عليها:

  1. توقف: "تمهل، أنا أعبر الطريق."
  2. انطلق: "يمكنك الذهاب أمامك."
  3. شكر وتحية: تلويحة أو "إبهام للأعلى" للقول شكرًا أو مرحبًا.
  4. لا توجد إيماءة: مجرد الوقوف دون فعل أي شيء.

كيف يعمل النظام: "الوضعية" و"النبض"

قسم الباحثون المشكلة إلى جزأين، مثل تحليل أغنية من خلال كلماتها وإيقاعها.

1. الوضعية الثابتة (الكلمات)
يتعلق هذا بـ أين توجد أجزاء الجسم في لحظة معينة.

  • الاستعارة: تخيل تجميد إطار فيديو. أين اليدان؟ هل هما فوق الرأس مباشرة؟ هل هما عند مستوى الصدر؟
  • الحيلة: أدرك الباحثون أن مجرد النظر إلى اليدين ليس كافيًا لأن إشارة "التوقف" (رفع اليد) قد تشبه كثيرًا إشارة "الترحيب" (رفع اليد). ولحل هذه المشكلة، قاموا بقياس المسافة بين الكتفين والوركين لإنشاء "مسطرة" لكل شخص. بهذه الطريقة، يمكن مقارنة شخص طويل بشخص قصير بشكل عادل. وقد وجدوا أن موضع اليدين هو دليل ضخم.

2. الحركة الديناميكية (الإيقاع)
يتعلق هذا بـ كيفية تحرك أجزاء الجسم بمرور الوقت.

  • الاستعارة: إذا جمدت حركة "التوقف"، فستبدو كتمثال. إذا جمدت حركة "الترحيب"، فقد تبدو متشابهة، لكن "الترحيب" يتضمن عادةً تلويحة (حركة ذهاب وإياب).
  • الحيلة: قام النظام بحساب السرعة والتسارع لليدين. إشارة "التوقف" غالبًا ما تكون ثابتة، بينما تتضمن "الشكر والتحية" تلويحة سريعة وإيقاعية. أصبحت سرعة حركة اليد هي الميز التفريق الرئيسي.

النتائج: ضبط رقصة الحركة

اختبر الباحثون نظامهم باستخدام خوارزمية "الغابة العشوائية" (Random Forest) (فكر في هذا كفريق من صناع القرار يصوتون على نوع الإيماءة).

  • النتيجة: عندما دمجوا "الكلمات" (الموضع الثابت) و"الإيقاع" (السرعة/الحركة)، نجح النظام في تحديد الإيماءات بشكل صحيح بنسبة 87%.
  • الاختراق: واجه النظام صعوبة أكبر في التمييز بين "التوقف" و"الشكر والتحية" عندما نظر فقط إلى الموضع. ولكن بمجرد أن بدأ في "الاستماع" إلى سرعة اليد، أصبح أفضل بكثير في التفريق بينهما.
  • الرؤية الأساسية: كانت أهم الأدلة هي أين كانت اليد ومدى سرعة حركتها. وتحديدًا، كانت سرعة اليد اليسرى هي المؤشر الأكبر، ويرجع ذلك على الأرج de أن المشاة على جانب الطريق غالبًا ما يستخدمون يدهم اليسرى للإشارة للسيارات.

الخاتمة

لا تدعي هذه الورقة أنها حلت كل مشاكل المرور بعد. بدلاً من ذلك، قامت ببناء أساس متين. لقد أظهرت أنه إذا علمت المركبة ذاتية القيادة أن تنظر إلى وضعية الهيكل العظمي وتقيس سرعة اليدين، فيمكنها فهم إيماءات المشاة بدقة عالية.

إنها خطوة نحو ضمان أنه عندما يلتقي روبوت وبشر على ساحة رقص المدينة، يمكنهما أخيرًا فهم حركات بعضهما البعض دون أن يخطو كل منهما على قدم الآخر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →