Can People Distinguish Human and AI Agency in Humanoid Teleoperation? A Preliminary Study of Agency Perception
تقدم هذه الدراسة الأولية إطار عمل "الشبح في الحلقة" (Ghost-in-the-Loop) لتوضيح أن المشاركين غالباً ما يواجهون صعوبة في التمييز بين الوكالة البشرية والذكاء الاصطناعي في التشغيل الآلي للروبوتات البشرية، حيث تعتمد أحكامهم بشكل أساسي على الإدراك بمدى الطبيعية والاتساق متعدد الوسائط بدلاً من المصدر الفعلي للتحكم.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل مستقبلاً لا يكون فيه الروبوت الواقف في غرفة معيشتك مجرد آلة تتبع نصاً برمجياً، بل شريكاً في الحوار، قادراً على الابتسام، والإيماء، والاستجابة بسلاسة تشبه البشر. تعتمد هذه الرؤية على "التحكم عن بُعد" (teleoperation)، وهي طريقة يجلس فيها شخص بعيد ويتحكم في حركات الروبوت وصوته، مستخدماً الآلة فعلياً كجسدٍ بديلٍ له عن بُعد. لسنوات طويلة، تطلب هذا الأمر وجود مشغل بشري حاضر باستمرار، مما حدّ من عدد الأشخاص الذين يمكن للشخص الواحد مساعدتهم أو من مدة المحادثة التي يمكن أن تستمر. ومع ذلك، أدى الصعود السريع للذكاء الاصطناعي إلى تقديم إمكانية جديدة: أنظمة يمكنها توليد الكلام، وتعبيرات الوجه، وإيماءات الجسد من تلقاء نفسها، محاكيةً الإنسان بدقة تجعل الفرق بينهما صعب التمييز. وهذا يطرح سؤالاً رائعاً ومثيراً للقلق في آن واحد لأي شخص يتفاعل مع هذه الآلات: إذا كان الروبوت يمثل دوراً، فهل يمكنك معرفة ما إذا كان هناك شخص حقيقي يحرك الخيوط، أم أن خوارزمية هي من تقوم بالعمل؟
سعى باحثون في مختبرات سوني لعلوم الحاسوب وجامعة طوكيو للإجابة على هذا السؤال عبر بناء نظام أطلقوا عليه اسم "الشبح في الحلقة" (Ghost-in-the-Loop). تتيح هذه الإطار للروبوت البشري (humanoid) الانتقال بسلاسة بين كونه خاضعاً لسيطرة مشغل بشري وبين كونه مدفوعاً بالكامل بواسطة الذكاء الاصطناعي، كل ذلك مع الحفاظ على مظهره وصوته تماماً كما هما. يعمل الروبوت، وهو من طراز "Unitree G1" مجهز بشاشة للوجه وكاميرات لرؤية محيطه، كمسرح لهذه العملية. عندما يكون الإنسان هو المسيطر، يرتدي سماعة رأس ليرى ما يراه الروبوت ويستخدم مستشعرات الحركة لتوجيه يدي الروبوت ووجهه. وعندما ينتقل النظام إلى وضع الذكاء الاصطناعي، يستمع الروبوت إلى المحادثة ويستخدم نماذج توليدية لإنشاء صوته الخاص، وحركات وجهه، وإيماءات يديه، بما يطابق نفس الأسلوب البصري والسمعي للنسخة التي يتحكم فيها البشر. لم يكن الهدف هو معرفة أيهما أفضل، بل معرفة ما إذا كان المراقب البشري يستطيع تمييز الفرق.
لاختبار ذلك، صمم الفريق سلسلة من مقاطع الفيديو القصيرة التي تُظهر الروبوت في حالة حوار. سجلوا ثمانية تفاعلات مختلفة، تراوحت بين الدردشات العابرة والمناقشات الموجهة نحو مهام محددة، حيث استغرقت كل منها ما بين خمس إلى أربعين ثانية. في نصف هذه المقاطع، كان مشغل بشري هو من يتحكم في الروبوت. وفي النصف الآخر، قام نظام الذكاء الاصطناعي بتوليد السلوك. ومن الناحية الجوهرية، ظل صوت الروبوت ووجهه وجسده متسقين عبر جميع المقاطع، لذا كان المتغير الوحيد هو مصدر التحكم. ثم دعا الباحثون خمسين شخصاً لمشاهدة هذه الفيديوهات عبر الإنترنت. وبعد كل مقطع، طُلب من المشاركين تحديد ما إذا كان الروبوت يُدار بواسطة إنسان أو كمبيوتر، مع تقييم درجة يقينهم على مقياس يتراوح من سالب عشرة (للدلالة على ذكاء اصطناعي مؤكد) إلى موجب عشرة (للدلالة على إنسان مؤكد). كما طُلب منهم أيضاً شرح سبب شعورهم بذلك.
تشير النتائج إلى أنه في هذه اللحظات القصيرة، يصبح الخط الفاصل بين الإنسان والآلة ضبابياً بشكل ملحوظ. فقد عانى المشاركون بشكل كبير للتمييز بين مصدري التحكم. وفي المتوسط، لم تتغير تقييماتهم إلا قليلاً بين المقاطع التي يتحكم فيها البشر والمقاطع التي يتحكم فيها الذكاء الاصطناعي، وكان الفرق صغيراً جداً لدرجة أنه لا يمكن تمييزه إحصائياً عن التخمين العشوائي. تشير الدراسة إلى أنه بالنسبة للتفاعلات القصيرة، لا يمكن للناس ببساطة التمييز بشكل موثوق بين ما إذا كان الروبوت يُقاد من قبل شخص أو خوارزمية. وعندما نظر الباحثون فيما كان يفكر فيه المشاركون فعلياً، ظهر نمط واضح في تفسيراتهم؛ إذ اعتمد أولئك الذين شعروا بقدرتهم على إصدار حكم على "الطبيعية" العامة لسلوك الروبوت. لقد انتبهوا بدقة إلى توقيت المحادثة، وإيقاع الحركات، وما إذا كان الصوت وتعبيرات الوجه وإيماءات اليد تعمل معاً في تناغم.
عندما كانت حركات الروبوت تبدو متيبسة، أو عندما كان التوقيت غير دقيق، أو عندما بدت أجزاء جسمه المختلفة غير متزامنة مع صوته، كان المشاركون أكثر عرضة لتخمين أنه ذكاء اصطناعي. وعلى العكس من ذلك، عندما تحرك الروبوت بتدفق متماسك، حيث تطابقت الإيماءات والتعبيرات مع الكلام تماماً، كان الناس أكثر ميلاً للاعتقاد بأن بشراً هو من يقف خلف التحكم. لا يعني هذا أن الذكاء الاصطناعي كان مثالياً، بل يعني أن عيوب أداء الذكاء الاصطناعي كانت دقيقة بما يكفي لتمر دون ملاحظة في نظرة سريعة. تشير الدراسة إلى أن قدرتنا على اكتشاف "الوكالة" (agency) تعتمد أقل على التكنولوجيا المستخدمة وأكثر على اتساق الأداء. فإذا تصرف الروبوت ككيان موحد، فإن الدماغ يتقبله كوكيل واحد، بغض النظر عما إذا كان هذا الوكيل من لحم ودم أو من كود برمجي.
يفتح هذا العمل الأولي فصلاً جديداً في كيفية تصميم روبوتات المستقبل. فهو يشير إلى أنه في المدى القريب، قد لا نحتاج للقلق بشأن تساؤل المستخدمين المستمر عما إذا كان الروبوت حقيقياً أم مزيفاً خلال التبادلات القصيرة. بدلاً من ذلك، يمكن تحويل التركيز إلى كيفية دمج هذه الأنظمة بين الذكاء البشري والاصطناعي، ربما من خلال السماح للإنسان بالتدخل عندما تصبح المحادثة معقدة، بينما يتولى الذكاء الاصطناعي الأجزاء الروتينية. ويشير الباحثون إلى أن نتائجهم محددة بهذه المقاطع القصيرة والمنظمة، وأن التفاعلات الأطول والأكثر تعقيداً قد تكشف عن أنماط مختلفة. أما الآن، فتؤكد الدراسة أنه عندما يتحدث الروبوت، ويبتسم، ويتحرك بقدر كافٍ من التماسك، فإن العقل البشري يسعد بقبوله كشريك، تاركاً الطبيعة الحقيقية لوكالته لغزاً هادئاً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.