Attune: A Self-Annotation Tool for Understanding Robot Operator Attention Profiles
تقدم الورقة البحثية أداة "Attune"، وهي أداة للتوسيم الذاتي تسخر الذكاء الاصطناعي لتحليل نظرات عين المشغل وتوليد ملفات تعريف الانتباه، مما يوفر توجيهاً تجريبياً لمعايرة سلوكيات الروبوت بهدف إدارة انتباه البشر بفعالية في سيناريوهات الإشراف على روبوتات متعددة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك قبطان سفينة فضاء، ولكن بدلاً من توجيه سفينة واحدة، أنت تراقب أسطولاً كاملاً من الطائرات المسيرة الصغيرة ذاتية القيادة التي توصل البيتزا عبر مدينة مزدحمة. مهمتك هي الجلوس في غرفة تحكم أمام جدار من الشاشات، كل منها يعرض وجهة نظر طائرة مسيرة مختلفة. إذا علقت إحدى الطائرات أو رأت عائقاً غريباً، عليك أن تلاحظ ذلك فوراً وتخبرها بما يجب فعله. هذا هو عالم الإشراف على الروبوتات المتعددة. لكن الجزء الصعب هو أن عقلك لديه قدرة محدودة على الانتباه. إذا حدقت لفترة طويلة في طائرة مسيرة "مملة"، فقد تفوتك أزمة تحدث في شاشة أخرى. وإذا تنقلت بين الشاشات بسرعة كبيرة، فستصاب بالتعب والارتباك. يسمي العلماء هذا "انتباه المشغل"، وهم يريدون معرفة كيف ينظر الناس المختلفون إلى هذه الشاشات بالضبط حتى يتمكنوا من بناء غرف تحكم أفضل. السؤال الكبير هو: كيف نصمم سلوكيات الروبوت لتجذب انتباهك عندما تكون هناك حاجة لذلك، ولكنها تتركك تسترخي عندما تكون الأمور هادئة؟
إليك Attune، وهي أداة جديدة ابتكرها باحثون من جامعة جورج ميسون. فكر في Attune كـ "مرآة تقرأ العقل" لمشغلي الروبوتات. بدلاً من مجرد التخمين حول ما يجعل مشغل الروبوت ينظر إلى شاشة معينة، تتيح Attune للمشغل مشاهدة فيديو لنفسه وهو يراقب الروبوتات، ثم تسأله: "مهلاً، لماذا انتقلت عيناك إلى تلك الشاشة في تلك اللحظة؟". الأمر يشبه مشاهدة إعادة لمباراة رياضية، ولكن بدلاً من تحليل تحركات اللاعبين، أنت تحلل عينيك لفهم عاداتك الخاصة. بنى الباحثون هذه الأداة لمساعدة المصممين على فهم أن كل مشغل يختلف عن غيره؛ فما قد يجعل شخصاً ما ينظر إلى روبوت قد يجعل شخصاً آخر يتجاهله. ومن خلال اكتشاف "ملفات تعريف الانتباه" الشخصية هذه، يمكن للمصممين في النهاذ تعديل سلوكيات الروبوت لتناسب الشخص المحدد الجالس على كرسي التحكم، مما يجعل النظام بأكلى أكثر أماناً وأقل توتراً.
المشكلة: معضلة "الكثير من الشاشات"
تخيل أنك تلعب لعبة فيديو حيث يتعين عليك مراقبة ست كاميرات مختلفة في وقت واحد. إحدى الكاميرات تعرض رأس الروبوت، وأخرى تعرض قابضه (يده)، وأخرى تعرض السقف. إذا أسقط الروبوت صندوقاً، فأنت بحاجة لرؤية ذلك فوراً. ولكن إذا كان الروبوت يمشي ببطء فقط، فلا داعي للتحديق فيه. المشكلة هي أننا لا نعرف حقاً لماذا يقرر المشغل البشري النظر إلى كاميرا واحدة ثم ينتقل فجأة إلى أخرى. هل هو لأن الروبوت فعل شيئاً مثيراً للاهتمام؟ هل لأن شيئاً لامعاً جذب عينيه؟ أم أنه شعر بالملل فحسب؟
حالياً، يضطر مصممو الروبوتات إلى التخمين. قد يجعلون الروبوت يصدر صوتاً عالياً لجذب الانتباه، ولكن قد يؤدي ذلك إلى إزعاج المشغل أو جعله يتجاهل الروبوت لاحقاً. أراد الباحثون تجاوز مرحلة التخمين. أرادوا طريقة لسؤال المشغل: "لماذا نظرت إلى هناك؟" والحصول على إجابة حقيقية. ولكن إذا سألوه أثناء مراقبته للروبوتات، فقد يتشتت انتباهه ويتوقف عن أداء عمله بشكل طبيعي. لذا، احتاجوا إلى طريقة ذكية للسؤال بعد انتهاء المهمة دون إفساد الذاكرة.
الحل: Attune، محقق "تتبع العين"
بنى الباحثون أداة تسمى Attune. إليك كيف تعمل، خطوة بخطوة، باستخدام تشبيه ممتع:
الخطوة 1: ليلة عرض الفيلم
أولاً، يجلس المشغل ويشاهد فيديو لروبوتين يقومان بمهام (مثل تنظيف المطبخ أو البحث في ممر). وبينما يشاهد، تستخدم Attune كاميرا تتبع العين لتسجيل مكان نظر عينيه بالضبط، ميلي ثانية بميلي ثانية. إنها مثل كاميرا سينما عالية التقنية تصور بؤبؤ عين المشغل فقط. يسجل النظام متى قفزت العين من شاشة إلى أخرى. تُسمى هذه القفزات "تحولات النظر" (gaze shifts).
الخطوة 2: إعادة العرض و "لماذا؟"
بعد انتهاء الفيلم، يدخل المشغل إلى غرفة "التعليق" (annotation) الخاصة. تعرض له Attune قائمة بالأوقات التي قفزت فيها عيناه. إنه يشبه شريط "أبرز اللحظات" لانتباهه الخاص. يختار المشغل قفزة ويضغط على "إعادة التشغيل". يقوم النظام بعمل زووم (تكبير) على تلك اللحظة، ويعرض أفعال الروبوت وبث الفيديو قبل وبعد قفزة العين مباشرة.
بعد ذلك، يتعين على المشغل شرح ما حدث. تسأل Attune سؤالين بسيطين:
- لماذا تركت الشاشة القديمة؟ (هل توقف الروبوت عن الحركة؟ هل شعرت بالملل؟)
- لماذا وصلت إلى الشاشة الجديدة؟ (هل رأيت شخصاً؟ هل بدا أن الروبوت في ورقة؟)
يمكن للمشغل أيضاً تحديد ما إذا كانت القفزة تفاعلية (حدث شيء مفاجئ وصاخب، مثل جذب "من الأسفل إلى الأعلى") أو استباقية (قرر التحقق من الروبوت لأنه كان فضولياً، وهو خيار "من الأعلى إلى الأسفل").
الخطوة 3: محقق الأنماط (الذكاء الاصطناعي للإنقاذ)
بمجرد أن يشرح المشغل بعض القفزات، يستخدم Attune "عقلاً حاسوبياً ذكياً" (ذكاء اصطناعي) للبحث عن الأنماط. الأمر يشبه المحقق الذي يلاحظ أنه في كل مرة يسقط فيها الروبوت كوباً، ينظر المشغل إلى كاميرا القابض. أو ربما في كل مرة يتوقف فيها الروبوت عن الحركة، ينظر المشغل إلى كاميرا السقف. يقوم الذكاء الاصطناعي بتجميع هذه التفسيرات معاً ويقول: "مهلاً، يبدو أنك تتحقق دائماً من كاميرا الرأس عندما يمشي الروبوت بالقرب من شخص ما".
الخطوة 4: التعليق التلقائي
الآن، تصبح الأداة أكثر روعة. تأخذ الأنماط التي تعلمتها من القفزات الأولى وتطبقها على بقية الفيديو. تقول الأداة: "أراهن أنك نظرت إلى هذه الشاشة لأن الروبوت كان يمشي بالقرب من شخص ما. هل هذا صحيح؟". يتعين على المشغل فقط قول "نعم" أو "لا" وربما تعديل الإجابة. هذا يجعل العملية سريعة للغاية، محولاً المهمة الطويلة المملة إلى لعبة سريعة من "ابحث عن النمط".
الخطوة 5: الملف الشخصي
أخيراً، تعطي Attune المشغل ملخصاً لـ "ملف تعريف الانتباه" الخاص به. إنه يشبه تقرير الدرجات الذي يقول: "أنت تميل إلى النظر إلى يدي الروبوت عندما يحمل شيئاً ثقيلاً، لكنك تتحقق من السقف عندما يمشي الروبوت فقط". يتم إعطاء هذا الملف لمصممي الروبوتات. يمكنهم استخدامها لبناء روبوتات تتصرف بطرق تتناسب مع طريقة تفكير هذا المشغل تحديداً.
ماذا وجدوا؟
اختبر الباحثون أداة Attune مع 12 شخصاً لم يستخدموا مثل هذه الأداة من قبل. شاهدوا فيديوهات لروبوتات في ثلاثة إعدادات مختلفة: غرفة معيشة، مطبخ، وممر. إليكم ما اكتشفوه:
- الجميع مختلفون: الاكتشاف الأكبر هو أنه لا يوجد شخصان متشابهان. بعض الناس شاهدوا جميع الكاميرات الست بالتساوي، بينما شاهد آخرون اثنتين أو ثلاثاً فقط. كان بعض الناس تفاعليين للغاية، يقفزون إلى الشاشة كلما تحرك شيء ما. بينما كان آخرون استباقيين، يتحققون من الشاشات بترتيب محدد. هذا يشير إلى عدم وجود واجهة روبوت واحدة "مثالية"؛ بل يجب تخصيصها للشخص.
- الروبوتات تقود العيون: وجدت الدراسة أن سلوك الروبوت كان السبب الأكبر لجعل الناس ينظرون إلى الشاشة. إذا كان الروبوت يقوم بشيء دقيق (مثل التقاط كوب)، فإن الناس يراقبون عن كثب. أما إذا كان الروبوت يتحرك ببطء أو يجلس ساكناً، فإن الناس ينظرون بعيداً. يقترح الباحثون أنه إذا كانت أفعال الروبوت مربكة أو يصعب فهمها، فإن عيون المشغل ستتشتت لأنهم يحاولون فهم ما يحدث.
- فخ "الذاكرة المزيفة": لاحظ الباحثون أمراً مثيراً للاهتمام بخصوص طريقة "إعادة التشغيل". أحياناً، عندما يشاهد الناس الإعادة، لا يتذكرون ما كانوا يفكرون فيه فعلياً في تلك اللحظة؛ بل يؤلفون قصة تبدو منطقية الآن بعد أن عرفوا النتيجة. على سبيل المثال، إذا رأوا الروبوت يسقط كوباً في الإعادة، فقد يقولون: "لقملت النظر إلى هناك لأنني كنت أعرف أنه سيسقط"، حتى لو لم يكونوا يعرفون ذلك في تلك اللحظة. ساعدتهم الأداة على إدراك ذلك، لكنه تذكير بأن النظر إلى انتباهك الخاص ليس دقيقاً بنسبة 100%.
- الذكاء الاصطناعي هو مساعد وليس مديراً: أحب المشاركون اقتراحات الذكاء الاصطناعي، ولكن فقط إذا شعروا أن الذكاء الاصطناعي على حق. إذا أخطأ الذكاء الاصطناعي في تخمينه، جعل ذلك المشغل يشعر أنه يتعين عليه بذل جهد أكبر للإصلاح. وجد الباحثون أن الناس يريدون من الذكاء الاصطناعي أن يكون "سقالة" (scaffold)—شيئاً يساعدهم على التفكير، لا شيئاً يقوم بالتفكير بدلاً منهم. قدروا أن الذكاء الاصطناعي يحتاج إلى دقة تتراوح بين 80% إلى 90% قبل أن يثقوا به تماماً.
لماذا هذا مهم
لا تدعي هذه الورقة أنها حلت مشكلة الإشراف على الروبوتات للأبد. في الواقع، يوضح الباحثون بحذر أن أداتهم هي مجرد خطوة أولى. لقد اختبروها مع روبوتين فقط وفيديوهات مسجلة مسبقاً، وليس مع أسطول حقيقي من الروبوتات التي تعمل في مستشفى الآن. كما استخدموا أشخاصاً غير خبراء، لذا قد يتصرف مشغلو الروبوتات الحقيقيون بشكل مختلف.
ومع ذلك، تشير الدراسة إلى طريقة جديدة قوية للتفكير في تصميم الروبوتات. بدلاً من التخمين حول ما يريده البشر، يمكننا سؤالهم: "لماذا نظرت إلى هناك؟" واستخدام إجاباتهم لبناء أنظمة أفضل. هذا يحول المشغل من مراقب سلبي إلى شريك نشط في تصميم سلوك الروبوت.
يشير الباحثون أيضاً إلى جانب حساس: إذا بدأنا في تتبع انتباه الجميع بهذا القرب، فيجب أن نكون حذرين بشأن الخصوصية. لا نريد أن تُستخدم "ملفات تعريف الانتباه" هذه للتجسس على العمال أو الحكم على أدائهم. الأداة تهدف لمساعدة الروبوتات على العمل بشكل أفضل للإنسان، وليس للحكم على الإنسان.
في النهاية، Attune هي جسر. إنها تربط بين الطريقة الفوضوية وغير المتوقعة لحركة عيون البشر، وبين العالم المنطقي والمبرمج للروبوتات. ومن خلال فهم "السبب" وراء "المكان"، قد نصل يوماً ما إلى أساطيل روبوتات لا تبدو كازدحام مروري فوضوي من الشاشات، بل كرقصة منسقة جيداً، حيث يتم تصميم كل حركة لإبقاء القبطان البشري هادئاً، ومركزاً، ومسيطراً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.