← أحدث الأبحاث
💻 computer science

Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation

يُعد Gaze2Act إطار عمل جديداً للرؤية واللغة والعمل يعزز التلاعب الروبوتي من خلال دمج نظرة الإنسان كإشارة قصد ديناميكية، مما يسد الفجوات بين منظور الأنا والمنظور الخارجي لتحقيق أداء رائد في تمييز الأشياء، والتفاعل دقيق التفاصيل، وتوجيه القصد الديناميكي على روبوت Unitree G1 البشري.

المؤلفون الأصليون: Kuangji Zuo, Gen Li, Bofan Lyu, Yanshuo Lu, Boyu Ma, Shijia Han, Xinyu Zhou, Xichen Yuan, Chuhao Zhou, Jiaqi Bai, Geng Li, Jianfei Yang

نُشر 2026-05-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Kuangji Zuo, Gen Li, Bofan Lyu, Yanshuo Lu, Boyu Ma, Shijia Han, Xinyu Zhou, Xichen Yuan, Chuhao Zhou, Jiaqi Bai, Geng Li, Jianfei Yang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت كيف يساعدك في المطبخ. تقول له: "ناولني ذلك الكوب". ولكن هناك خمسة أكواب على الطاولة: واحد أحمر، وواحد أزرق، وواحد به شرخ، واثنان متطابقان باللون الأبيض. إذا قلت فقط "الكوب"، فقد يلتقط الروبوت الكوب الخطأ، أو الأسوأ من ذلك، قد يلتقط الكوب الذي لا تريده.

هذه هي المشكلة التي تحاول ورقة بحثية بعنوان Gaze2Act حلها. فهي تجادل بأن لغة البشر غالبًا ما تكون غامضة للغاية بحيث لا يستطيع الروبوت فهم ما نريده بالضبط، خاصة عندما نحتاج إلى الدقة أو عندما تتغير أفكارنا في منتصف المهمة.

إليك كيف تشرح الورقة حلهم، باستخدام تشبيهات بسيطة:

الفكرة الجوهرية: "العيون تقود الأيدي"

لاحظ المؤلفون شيئًا نفعله نحن البشر بشكل طبيعي: نحن ننظر إلى ما نحن بصدد لمسه قبل أن نلمسه. إذا كنت تريد التقاط تفاحة معينة، فإن عينيك تثبتان عليها قبل أجزاء من الثانية من وصول يدك إليها.

تقترح الورقة أنه بدلًا من مجرد التحدث إلى الروبوت، يجب أن نجعل الروبوت "يرى" أين تتجه نظراتنا. هم يسمون هذا Gaze2Act. الأمر يشبه إعطاء الروبوت "نظارات قراءة الأفكار" التي تظهر له بالضبط ما تركز عليه، في الوقت الفعلي.

كيف يعمل: "خدعة السحر ذات الثلاث خطوات"

تصف الورقة نظامًا يجسّر الفجوة بين ما "تراه أنت" وما "يراه الروبوت".

1. المترجم (الربط عبر الرؤى - Cross-View Grounding)

  • المشكلة: أنت ترتدي نظارات ذكية تنظر من خلالها إلى كوب من منظورك الخاص. الروبوت ينظر إلى نفس الكوب من زاوية مختلفة. لذا، فإن "نقطة نظرك" (المكان الذي تنظر إليه عيناك) لا تتطابق مع رؤية كاميرا الروبوت.
  • الحل: يعمل النظام كمترجم فائق الذكاء. يأخذ نقطة نظرك ويستخدم أداة "مطابقة بصرية" للعثور على نفس الكائن تمامًا في رؤية كاميرا الروبوت. يقوم برسم قناع رقمي (مثل قلم التحديد/الهايلايتر) حول الكائن الذي تنظر إليه ويحدد النقطة الدقيقة التي تحدق فيها.
  • التشبيه: تخيل أنك تشير إلى شجرة معينة في غابة من فوق تلة. الروبوت موجود عند أسفل التلة. يقوم النظام فورًا برسم دائرة مضيئة حول تلك الشجرة بالتحديد في رؤية الروبوت، رغم أن الزوايا مختلفة تمامًا.

2. قلم التحديد (التحفيز على مستوى الإدراك - Perception-Level Prompting)

  • المشكلة: مجرد معرفة "أين" ليس كافيًا؛ يحتاج الروبوت أيضًا إلى معرفة "ماذا" يفعل بهذه المعلومات.
  • الحل: يأخذ النظام ذلك التحديد الرقمي ويرسمه مباشرة على الصورة التي يراها الروبوت.
    • إذا كنت بحاجة للإمساك بالكائن بالكامل، فإنه يرسم إطارًا ملونًا حوله.
    • إذا كنت بحاجة للمس جزء صغير ومحدد (مثل مقبض المطرقة)، فإنه يرسم خريطة حرارية (بقعة حمراء متوهجة) مباشرة على ذلك المقبض.
  • التشبيه: الأمر يشبه معلمًا يشير إلى خريطة ويرسم دائرة حمراء حول المدينة التي تريد زيارتها، حتى لا يضطر الروبوت للتخمين أي مدينة تقصد.

3. الصوت الداخلي (التهيئة على مستوى الفعل - Action-Level Conditioning)

  • المشكلة: أحيانًا، لا يكفي مجرد عرض صورة للروبوت لجعله يتحرك بشكل مثالي؛ فقد يظل مرتبكًا بعض الشيء.
  • الحل: النظام لا يكتفي بعرض الصورة للروبوت فحسب، بل يهمس أيضًا بتعليمات سرية مباشرة في "دماغ" الروبوت (كود توليد الحركة الخاص به). يخبر الروبوت: "هيا، تجاهل كل شيء آخر، وركز فقط على هذه البقعة المتوهجة".
  • التشبيه: الأمر يشبه مدربًا لا يكتفي بالإشارة إلى المرمى فح، بل يربت على كتف اللاعب قائلاً: "اركض مباشرة نحو تلك البقعة، وليس تلك التي بجانبها".

ما الذي اختبروه (الإثبات في "العالم الحقيقي")

اختبر الباحثون هذا النظام على Unitree G1، وهو روبوت بشري يشبه الإنسان. أعطوه 16 مهمة مختلفة، بما في ذلك:

  • التقاط الكوب الصحيح عندما توجد العديد من الأكواب المتشابهة (إزالة الغموض).
  • الإمساك بأجزاء محددة من جسم ما، مثل مقبض المطرقة بدلاً من رأسها (التفاعل دقيق التفاصيل).
  • تغيير الهدف أثناء التنفيذ. تخيل أن الروبوت بدأ يسير نحو كوب أحمر، لكنك فجأة نظرت إلى كوب أزرق. يتوقف الروبوت، ويدرك أنك غيرت رأيك، وينتقل إلى الكوب الأزرق.

النتائج

تدعي الورقة أن Gaze2Act كان أفضل بكثير من الروبوتات التي تعتمد فقط على اللغة أو الروبوتات التي تحاول التخمين بناءً على الأوصاف النصية.

  • الروبوتات التي تعتمد على اللغة فقط ارتبكت بسهولة (بنسبة نجاح تبلغ حوالي 33% في المهام الصعبة).
  • Gaze2Act أصاب الهدف في كل مرة تقريبًا (بنسبة نجاح تبلغ حوالي 89%).
  • كان متميزًا بشكل خاص في تغيير رأيه عندما تغيرت نظرة المستخدم، وهو أمر عانت منه الروبوتات الأخرى.

الخلاصة

تخلص الورقة إلى أن النظر (Gaze) هو وسيلة طبيعية ومنخفضة الجهد لإخبار الروبوت بالضبط بما تريده. إنه يزيل عنصر التخمين. لست بحاجة لتكون مبرمج روبوتات أو تتحدث بلغة برمجية مثالية؛ كل ما عليك فعله هو النظر إلى ما تريد من الروبوت فعله، وسوف يتبع الروبوت عينيك.

القيود المذكورة في الورقة:
النظام ليس مثاليًا بعد. إذا حركت رأسك بسرعة كبيرة، أو إذا حجب شيء ما رؤيتك (الانسداد)، فقد يرتبك الروبوت. كما يفترض النظام أنك تنظر إلى ما تنوي لمسه بالفعل، ولكن في بعض الأحيان تتجول أعين البشر وتنظر إلى أشياء لا يريدون الإمساك بها فعليًا.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →