Human-robot conversation with multiple participants in noisy public spaces
تقدم هذه الورقة نظاماً صوتياً لمصفوفة ميكروفونات متعددة القنوات مصمماً للأماكن العامة الصاخبة، يعمل على تعزيز الكلام لكل من الاستماع اليقظ بواسطة الروبوت "إيريكا" (ERICA) والتفاعلات عبر الروبوتات الرمزية (Avatar) عن بُعد بواسطة روبوتات "تليكو" (Teleco)، مع توفير صوت مكاني أيضاً لتحسين الانغماس في المحادثات متعددة الأطراف.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل محاولة إجراء محادثة جادة في منتصف محطة قطار صاخبة، حيث تتنافس زئير المحركات، وثرثرة الحشود، وصدى الهندسة المعمارية على جذب انتباهك. يستطيع البشر القيام بهذا الإنجاز بسلاسة، وهي مهارة يسميها العلماء "تأثير حفلة الكوكتيل"، حيث تقوم أدمغتنا بتصفية الضجيج في الخلفية للتركقيز على صوت واحد. أما بالنسبة للروبوت، فإن هذا يمثل تحدياً هائلاً. وبينما أصبح الذكاء الاصطناعي جيداً بشكل ملحوظ في إجراء المحادثات القائمة على النصوص، فإن منح الروبوت القدرة على الاستماع والتحدث بشكل طبيعي في مكان عام صاخب ومزدحم لا يزال يمثل عقبة كبيرة. ويظهر هذا بوضوح خاصة عندما يتحدث عدة أشخاص في وقت واحد، أو عندما يتحرك الروبوت نفسه عبر البيئة المحيطة. فبدون وسيلة لعزل الكلام البشري عن الفوضى، تنهار قدرة الروبوت على الفهم والاستجابة، مما يجعله أصم عن الأشخاص الذين من المفترض أن يخدمهم.
لقد شرع باحثون من عدة جامعات في اليابان وسنغافورة في حل هذه المشكلة من خلال بناء نظام يسمح للروبوتات بالسمع بوضوح في العالم الحقيقي. وقد اختبروا عملهم في معرض إكسبو 2025 العالمي في أوساكا، وهو موقع تم اختياره خصيصاً لأنه صاخب وغير متوقع ومليء بآلاف الزوار. طور الفريق نظاماً صوتياً متخصصاً قادراً على التقاط أصوات عدة أشخاص في آن واحد، حتى عندما يتحدثون فوق بعضهم البعض، وتنقية الصوت بحيث يمكن لكل من الروبوت والمشغل البشري عن بُعد فهمهم. وكانت النتيجة عرضاً توضيحياً نجحت فيه الروبوتات في إجراء محادثات مع مجموعات من الناس في جناح صاخب، مما أثبت أن الآلات يمكن تعليمها الاستماع بنفس التركيز الذي يستخدمه الإنسان في غرفة مزدحمة.
يكمن جوهر هذا الإنجاز في كيفية تجهيز الروبوتات للسمع. فبدلاً من الاعتماد على ميكروفون واحد، والذي سيلتقط جميع الضوضاء في الغرفة بالتساوي، استخدم الباحثون مصفوفة دائرية مكونة من أربعة ميكروفونات. يعمل هذا الجهاز مثل مجموعة من الآذان التي يمكن توجيهها إلكترونياً للتركيز على اتجاهات محددة. فعندما يتحدث شخص ما، يحدد النظام موقعه ويعزز صوته مع كتم الضوضاء القادمة من الاتجاهات الأخرى. وتخلق هذه العملية إشارة صوتية نظيفة يمكن استخدامها لغرضين متميزين: فهي تسمح للكمبيوتر الداخلي للروبوت بالتعرف على الكلمات المنطوقة، وترسل نسخة واضحة وعالية الجودة من المحادثة إلى مشغل بشري قد يتحكم في الروبوت من موقع بعيد.
استعرض الفريق هذه التكنولوجيا في سيناريوهين مختلفين، لكل منهما تحدياته الفريدة. في الإعداد الأول، جلست الروبوت الأندرويد (الإنسان الآلي) المسمى "إريكا" (ERICA) مع مشاركين بشريين. كان الهدف هو إظهار أن الروبوت يمكنه العمل كمستمع منتبه، يتابع المحادثة ويستجيب بإيماءات أو عبارات قصيرة. ولأن البشر كانوا جالسين في وضع ثابت، أمكن وضع مصفوفة الميكروفونات على حامل ثلاثي القوائم بينهما، مما خلق بيئة استماع مستقرة. نجح النظام في فصل أصوات الشخصين، مما سمح لـ "إريكا" بفهم من يتحدث وتوليد استجابات مناسبة، مثل طرح أسئلة متابعة بناءً على ما قيل للتو. أثبت هذا السيناريو أن التكنولوجيا يمكنها التعامل مع تعقيدات المحادثة الجماعية حيث قد يقاطع الناس بعضهم البعض أو يتحدثون في نفس الوقت.
كان السيناريو الثاني أكثر صعوبة لأنه تضمن الحركة. هنا، استخدم الباحثون روبوتات صغيرة متنقلة تسمى "تليكوس" (Telecos). كان أحد هذه الروبوتات يتم التحكم فيه من قبل مشغل بشري يجلس في غرفة منفصلة، ليعمل كأفاتار افتراضي، بينما تحرك الروبوت الآخر من تلقاء نفسه لدعم المحادثة. في هذه الحالة، تم تركيب مصفوفة الميكروفونات على رأس الروبوت الذي يتحكم فيه الإنسان. ومع دوران رأس الروبوت أو تحركه عبر الأرضية، كان اتجاه "آذانه" يتغير باستمرار. اضطر الباحثون إلى برمجة النظام لتتبع موقع المشارك البشري والروبوت الآخر باستمرار، والتبديل الفوري لتركيز الميكروفون إلى أي اتجاه تأتي منه المحادثة. سمح هذا التعديل الديناميكي للمشغل البعيد بسماع المشارك البشري بوضوح، حتى أثناء تحرك الروبوت، وبجعله يشعر وكأنه حاضر جسدياً في المحادثة.
لجعل هذا العمل ممكناً، لم يكن يتعين على النظام مجرد تضخيم الصوت؛ بل كان عليه خلق شعور بالمكان. فعندما يستمع المشغل عن بُعد عبر سماعات الرأس، يتم ضبط الصوت بحيث إذا كان المشارك البشري واقفاً إلى يسار الروبوت، يأتي الصوت من الجانب الأيسل لسماعات رأس المشغل. ساعد تأثير الصوت المجسم هذا المشغل على الشعور بالاندماج في التفاعل، مما حافظ على العلاقة الطبيعية بين المتحدثين. بالإضافة إلى ذلك، تضمن النظام ميزة إلغاء الصدى لمنع صوت المشغل نفسه، الذي يتم تشغيله عبر مكبر صوت الروبوت، من أن يلتقطه الميكروفون ويربك النظام.
كانت نتائج العرض التوضيحي مشجعة. فعلى مدار ستة أيام في معرض إكسبو، تفاعل الأنظمة مع مئات الزوار في جناح مليء بضجيج المعارض الأخرى وصوت المطر العابر. تمكنت الروبوتات من إجراء محادثات متماسكة، وأفاد المشغلون عن بُعد أنه بإمكانهم سماع الأشخاص الذين يتحدثون إليهم بوضوح، رغم مستويات الضوضاء العالية. وفي الاختبارات المنضبطة قبل الحدث، كانت قدرة النظام على التعرف على الكلام مماثلة لاستخدام ميكروفون يدوي قياسي، حتى عندما كان الروبوت يتحرك أو عند وجود ضوضاء خلفية كبيرة. وأشار الباحثون إلى أنه على الرغم من أن النظام لم يكن مثالياً — حيث كان يفقد أحياناً المتحدثين الهادئين أو يواجه صعوبة عندما يدير الشخص ظهره للميكروفون — إلا أنه يمثل خطوة كبيرة للأمام في جعل الروبوتات قادرة على العمل في المساحات العامة الواقعية.
يسلط هذا العمل الضوء على تحول حاسم في كيفية تفكيرنا في التفاعل بين الإنسان والروبوت. فهو ينتقل من البيئات الهادئة والمسيطر عليها في المختبرات إلى الواقع الفوضوي والصاخب للحياة اليومية. ومن خلال حل مشكلة السماع بوضوح وسط الحشد، مهد الباحثون الطريق لروبوتات يمكنها العمل كرفقاء، أو مرشدين، أو مساعدين في أماكن مثل المطارات والمتاحف ومراكز التسوق. إن القدرة على تصفية الضوضاء والتركيز على الصوت البشري ليست مجرد إنجاز تقني؛ بل هي الأساس لبناء آلات يمكنها حقاً فهمنا والتواصل معنا، حتى في أكثر الأماكن فوضوية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.