← أحدث الأبحاث
🤖 AI

Contextual Safety Reasoning and Grounding for Open-World Robots

تقدم الورقة البحثية CORE، وهو إطار عمل سلامة مبتكر يسخر نماذج الرؤية واللغة من أجل الاستدلال السياقي عبر الإنترنت والتمركز المكاني لفرض سلوكيات روبوتية آمنة احتماليًا وتكيفية في بيئات العالم المفتوح دون معرفة مسبقة بالبيئة.

المؤلفون الأصليون: Zachary Ravichandran, David Snyder, Alexander Robey, Hamed Hassani, Vijay Kumar, George J. Pappas

نُشر 2026-02-26
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zachary Ravichandran, David Snyder, Alexander Robey, Hamed Hassani, Vijay Kumar, George J. Pappas

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تُعلم روبوتاً كيف يمشي في مدينة مزدحمة وغير متوقعة.

في الماضي، كانت سلامة الروبوت تشبه إعطاء الروبوت خريطة مطبوعة وصارمة بها مناطق "ممنوع الدخول" مرسومة باللون الأحمر. إذا رأى الروبوت علامة "أرضية مبللة"، فلن يعرف ماذا يفعل ما لم يقم شخص ما ببرمجة تلك العلامة تحديداً في خريطته مسبقاً. إذا دخل الروبوت مكتباً جديداً أو حديقة، فسيكون أعمى عن القواعد الخاصة بهذا المكان.

يقدم هذا البحث CORE (الاستدلال والإنفاذ السياقي للسلامة)، وهي طريقة جديدة لتعليم الروبوتات أن تكون آمنة من خلال منحها حساً مشتركاً بدلاً من مجرد خريطة.

إليك كيف يعمل CORE، مشروحاً من خلال قصة بسيطة:

- ١. "العيون الذكية" (نموذج الرؤية واللغة)

تخيل أن الروبوت يرتدي نظارات فائقة الذكاء متصلة بعقل يعرف كيف يتحدث ويفهم العالم (هذا هو نموذج الرؤية واللغة أو VLM).

  • الطريقة القديمة: يرى الروبوت مخروطاً أحمر. يفكر: "هذا جسم. يجب أن أتوقف".
  • طريقة CORE: يرى الروبوت صفاً من المخاريط الحمراء. ينظر "عقل" الروبوت إلى الصورة ويفكر: "آه، هذه المخاريط مرتبة في خط. هذا ليس مجرد كومة من البلاستيك؛ إنه حاجز. هذا يعني أن المنطقة خلفها منطقة بناء. لا ينبغي لي فقط أن أتوقف؛ بل أحتاج إلى الالتفاف حولها".

لا يحتاج الروبوت إلى قاعدة مكتوبة مسبقاً لـ "المخاريط". إنه ينظر إلى المشهد، ويستدل على السياق (لماذا هذه المخاريط هنا؟)، ويستنتج قاعدة السلامة في اللحظة ذاتها.

٢. "المترجم" (التأسيس الدلالي)

بمجرد أن يفهم عقل الروبوت القاعدة ("لا تذهب خلف المخاريط")، فإنه يحتاج إلى إخبار أرجله (المحركات) بمكان التوقف بدقة.

  • التشبيه: تخيل أن الروبوت ينظر إلى صورة لغرفة. يرى منطقة "ممنوع الدخول". وحدة التأسيد (Grounding) هي مثل المترجم الذي يأخذ جملة "لا تذهب خلف المخاريط" ويرسم جداراً افتراضياً غير مرئي على الأرض في العالم الحقيقي للروبوت.
  • إنها تحول فكرة المنطقة الآمنة إلى حدود فيزيائية يمكن للروبوت قياسها واحترامها.

٣. "رد الفعل" (دوال الحاجز التحكمي)

الآن أصبح لدى الروبوت جداره غير المرئي. ولكن ماذا لو كان الروبوت يتحرك بسرعة وكانت "عيونه" ضبابية قليلاً؟ ماذا لو أخطأ في تقدير المسافة؟

  • التشبيه: فكر في هذا كأنه ردود فعل الروبوت. حتى لو كان عقل الروبوت يفكر: "أعتقد أنني أستطيع المرور عبر الفتحة"، فإن وحدة رد الفعل تعمل مثل حزام الأمان والوسادة الهوائية. فهي تضمن رياضياً أنه بغض النظر عن سرعة الروبوت أو مدى ضبابية الصورة، فإنه سيتوقف فيزيائياً قبل الاصطدام بالجدار غير المرئي.
  • إنها تأخذ في الاعتبار عدم اليقين. إذا لم يكن الروبوت متأكداً بنسبة 100% من مكان الجدار، فإن "ردود الفعل" تجعل الجدار أكبر قليلاً لضمان السلامة، مما يضمن عدم اصطدام الروبوت أبداً.

لماذا يعد هذا أمراً هاماً؟

  • مشكلة "العالم المفتوح": الحياة الواقعية فوضوية. لا يمكنك برمجة الروبوت بكل سيناريوهات علامات "الأرضية المبللة"، أو "الممرات المزدحمة"، أو "المزهريات الهشة" التي قد يراها على الإطلاق.
  • حل CORE: يسمح CORE للروبوت بالدخول إلى بيئة جديدة تماماً (مثل منزل غريب أو مستشفى مزدحم) وفهم قواعد السلامة فوراً بمجرد النظر إلى الصور. إنه يتعلم القواعد أثناء سيره.

"شبكة الأمان"

لقد أثبت الباحثون أيضاً رياضياً أنه حتى لو ارتكب "عقل" الروبوت خطأً أو كانت الكاميرا ضبابية، فإن نظام "رد الفعل" قوي بما يكفي للحفاظ على سلامة الروبوت باحتمالية عالية جداً (مثل 90%+).

باختصار:
قبل ذلك، كانت الروبات مثل سياح يحملون دليلاً إرشادياً جامداً يضيعون إذا تغيرت المناظر الطبيعية.
مع CORE، تصبح الروبوتات مثل سكان محليين ذوي خبرة يمكنهم النظر إلى شارع، ورؤية علامة "أرضية مبللة"، وفهم أن الأرض زلقة، ومعرفة كيفية المشي بحذر، كل ذلك دون الحاجة إلى خريطة. إنهم يستخدمون العيون للرؤية، والعقل للاستدلال، وردود الفعل للبقاء آمنين.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →