← أحدث الأبحاث
💻 computer science

Not What You Asked For: Typographic Attacks in Household Robot Manipulation

تُثبت هذه الورقة أن الهجمات الطباعية على الروبوتات المنزلية التي تستخدم نماذج الرؤية واللغة يمكن أن تتجاوز الحكم البصري لتتسبب في إخفاقات ملموسة في التلاعب المادي، محققةً معدل نجاح بنسبة 67.8% في بيئة محاكاة من خلال تسميم الخريطة الدلالية للروبوت مما يؤدي إلى الإمساك بنقل الأشياء بشكل خاطئ.

المؤلفون الأصليون: Ali Iranmanesh, Peng Liu

نُشر 2026-05-19
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ali Iranmanesh, Peng Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل روبوتًا منزليًا يعمل كمساعد مفيد ولكنه ساذج بعض الشيء. يمتلك الروبوت طريقتين رئيسيتين لفهم العالم من حوله:

  1. عيناه (الرؤية): ينظر إلى جسم ما ويقول: "هذا يبدو ككوب قهوة".
  2. دماغه (اللغة): يستمع إلى أمرك، "من فضلك أحضر لي كوب القهوة"، ويطابق الكلمات بما يراه.

في الروبوتات الحديثة، يتم لصق هذين النظامين معًا في "دماغ" واحد (يسمى نموذج الرؤية واللغة - Vision-Language Model). هذا أمر رائع لأن الروبوت يمكنه فهم آلاف الأشياء الجديدة دون الحاجة إلى إعادة تدريبه. ومع ذلك، تجادل الورقة البحثية بأن هذا "اللصق" يخلق ثغرة خطيرة.

خدعة "الملصق السحري"

اكتشف الباحثون أنه إذا وضعت قطعة من الورقة مطبوع عليها الكلمات "COFFEE MUG" (كوب قهوة) على جسم مختلف تمامًا — مثل محمصة خبز، أو حذاء، أو مصباح — فإن دماغ الروبوت يصاب بالارتباك.

لأن جزأي "اللغة" و"الرؤية" لدى الروبوت مرتبطان ببعضهما بقوة، يتوقف الروبوت عن النظر إلى شكل الجسم ولونه. بد بدلًا من ذلك، يبدأ في قراءة النص أولاً ثم ينظر لاحقًا. فهو يرى الكلمات "COFFEE MUG" ويقرر فورًا: "آه، لا بد أن هذا هو كوب القهوة"، متجاهلًا تمامًا حقيقة أنه في الواقع محمصة خبز.

تأثير الدومينو: من مجرد نظرة إلى إمساك بالجسم

ما يجعل هذا الأمر خطيرًا ليس مجرد أن الروبوت يعتقد أن محمصة الخبز هي كوب. بل ما يحدث بعد ذلك.

  1. الخريطة المسمومة: لا يرتكب الروبوت خطأً عابرًا فحسب؛ بل يكتب هذا الخطأ في خريطته الذهنية ثلاثية الأبعاد الدائمة للغرفة. الأمر يشبه قيام الروبوت بكتابة "هذا كوب" على ملاحظة لاصقة ولصقها على محمصة الخبض في ذاكرته.
  2. الثقة العمياء: حتى لو ابتعد الروبوت وعاد مرة أخرى، أو إذا تم إخفاء الملصق عن الأنظ、، فإنه لا يزال يثق في خريطته الذهنية. يفكر: "أنا أعلم أن هناك كوبًا هناك"، لأنه دون ذلك سابقًا.
  3. الفشل الحركي: يقوم الروبوت بعد ذلك بالمشي فعليًا نحو محمصة الخبز، ويمسكها، ويحاول تقديمها لك أو وضعها في حامل الأكواب.

تسمي الورقة البحثية هذا "فشلاً حركيًا" (Kinetic Failure). إنه ليس مجرد خلل برمجِي حيث يقول الروبوت الشيء الخطأ؛ بل هو فعل مادي حيث يلتزم الروبوت بالجسم الخطأ ويحمله في أرجاء المنزل.

التجربة: كيف اختبروه؟

لم يستطع الباحثون اختبار ذلك على روبوتات حقيقية في منازل حقيقية (لأن ذلك مكلف للغاية ومحفوف بالمخاطر)، لذا استخدموا محاكاة فيديو واقعية للغاية تسمى Habitat.

  • الإعداد: أخذوا روبوتًا كان بارعًا بالفعل في العثور على الأشياء والتقاطها.
  • الهجوم: وضعوا ملصقًا مطبوعًا يحمل اسم الجسم المستهدف (مثل "CUP") على جسم عشوائي قريب (مشتت للانتباه).
  • النتيجة: من بين 59 سيناريو اختبار محددًا كان الروبوت قادرًا فيها بالفعل على أداء المهمة، خدع الملصق الروبوت في 67.8% من المرات.

في الحالات الأكثر نجاحًا، لم يكتفِ الروبوت بالإمساك بالشيء الخطأ فحسب؛ بل نجح في الانتقال إلى الجسم الخطأ، والتقاطه، وحمله عبر الغرفة، ومحاولة وضعه في المكان الصحيح. لقد كان الروبوت "ملتزمًا" تمامًا بالخطأ.

لماذا يهم هذا الأمر (وفقًا للورقة البحثية)

تسلط الورقة الضوء على أن الأبحاث السابقة بحثت في كيفية خداع الملصقات للروبوتات للتوجه (Navigation) إلى المكان الخطأ (مثل طائرة بدون طيار تطير إلى سطح مبنى خاطئ). لكن هذه هي المرة الأولى التي يظهر فيها أي شخص أن الملصقات يمكن أن تخدع الروبوت في الإمساك بجسم ما وتحريكه فعليًا.

الخطر يكمكمن في أن "ذاكرة" الروبوت (الخريطة ثلاثية الأبعاد) تحافظ على بقاء هذا "السم" حيًا. حتى لو أزلت الملصق، فقد لا يزال الروبوت يحاول التقاط الجسم الخطأ لأن خريطته الداخلية قد فسدت.

الحل المقترح

يقترح المؤلفون أنه لا يمكننا مجرد إصلاح "عيون" الروبوت لتجاهل النص. بدلاً من ذلك، نحتاج إلى تغيير كيفية استخدام الروبوت لذاكرته. هم يقترحون ثلاثة ضوابط للسلامة:

  1. التحقق المزدوج: لا تثق في نظرة واحدة. اجعل الروبوت ينظر إلى الجسم من زوايا مختلفة قبل كتابته في ذاكرته الدائمة.
  2. رصد النص: وجود نظام ثانوي يقول: "انتظر، هناك ملصق على هذا الجسم. لا تثق في التسمية بعد".
  3. التحقق النهائي: قبل أن يمسك الروبوت بالجسم مباشرة، اجعله ينظر إليه مرة أخيرة للتأكد من أنه لم يتعرض للخداع.

باختًا: قطعة من الورق مكتوب عليها كلمات يمكن أن تخدع روبوتًا ذكيًا وتجعله يعتقد أن محمصة الخبز هي كوب، وسيقوم الروبوت بكل سرور بحمل محمصة الخبز تلك إلى طاولة المطبخ الخاصة بك. تثبت الورقة أن هذا خطر حقيقي ومادي لروبوتات المستقبل المنزلية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →