← أحدث الأبحاث
🤖 AI

DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination

يُعد DeCAL نموذجاً للرؤية واللغة والعمل يتسم بالبراعة والارتباط الفيزيائي، حيث يستفيد من بنية "خليط من المحولات" (Mixture-of-Transformers) مع دمج بصري-لمسي تكيفي وتخيل مشترك كامن لتحقيق أداء رائد في مهام المناولة الغنية بالتلامس عبر الدمج الديناميكي للاستشعار اللمسي ونمذجة الديناميكيات الفيزيائية.

المؤلفون الأصليون: Yankai Fu, Ning Chen, Junkai Zhao, Heng Zhang, Guocai Yao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

نُشر 2026-09-09
📖 7 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Yankai Fu, Ning Chen, Junkai Zhao, Heng Zhang, Guocai Yao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لطالما كانت الروبوتات بارعة في أرض المصنع، حيث تنقل الأشياء الثقيلة عبر مسارات متوقعة بدقة صارمة. ومع ذلك، عندما نطلب منها دخول منازلنا والقيام بالمهام الدقيقة والمربكة للحياة اليومية — مثل ربط مصباح كهربائي، أو مسح مزهرية، أو تدوير غطاء زجاجة — فإنها غالباً ما تتعثر. إن العالم ليس شبكة نظيفة وثابتة؛ بل هو مكان مليء بالاحتكاك الخفي والمستمر. لكي ينجح، يجب على الآلة أن تفعل أكثر من مجرد الرؤية؛ يجب أن تشعر. يتعين عليها فهم الفيزياء غير المرئية للتلامس: اللحظة التي تنزلق فيها الإصبع، أو الضغط المطلوب لتدوير مقبض، أو الطريقة التي يتشوه بها جسم ناعم تحت اللمس. لعقود من الزمن، حاول العلماء سد هذه الفجوة عبر منح الروبوتات كلاً من العين والجلد، لكن تعليم الآلة كيفية دمج هذه الحواس في حدس واحد سلس ظل أحد أكثر التحديات استعصاءً في الذكاء الاصطناğı.

لقد خطت مجموعة من الباحثين الآن خطوة كبيرة للأمام من خلال نظام جديد يسمى DeCAL. هذا ليس مجرد روبوت يمكنه الرؤية واللمس؛ بل هو نظام مصمم لتخيل مستقبل التفاعل الفيزيائي قبل حدوثه. ومن خلال بناء نموذج يوحد الفهم، والخيال، والعمل، أنشأ الباحثون سياسة روبوتية يمكنها التنقل في عالم معقد وغني بالتلامس من التلاعب البشري بمستوى من البراعة لم يسبق له مثيل. تم اختبار النظام في ست مهام متميزة، تتراوح من مسح مزهرية إلى تجميع أجز صغيرة، وقد تفوق باستمرار على أكثر الأساليب المتقدمة حالياً. في هذه التجارب الواقعية، حقق DeCAL معدل نجاح يصل إلى 100 في المائة في المهام الأبسط، وحافظ على متوسط معدل نجاح قوي بلغ 71 في المائة عبر جميع التحديات الستة، حتى عندما تغيرت البيئة بطرق غير متوقعة.

المشكلة الجوهرية التي عالجها الباحثون هي أن الرؤية وحدها غالباً ما تكون عمياء عن اللحظات الأكثر حرجاً في عملية التلاعب. فعندما تصل يد الروبوت إلى جسم ما، غالباً ما تحجب الأصابع رؤية الكاميرا، مما يخلق "نقطة عمياء" في الوقت الذي يحتاج فيه الروبوت إلى المعرفة أكثر من أي وقت آخر. علاوة على ذلك، لا تستطيع البيانات المرئية إخبار الروبوت بمدى قوة دفعه أو ما إذا كان الجسم على وشك الانزلاق. وبينما كانت المحاولات السابقة لإضافة مستشعرات اللمس إلى الروبوتات تعاملها كإضافات بسيطة، يقوم DeCAL بدمج المعلومات اللمسية كجزء أساسي من عملية تفكيره. يستخدم النظام مستشعرات عالية الدقة على كل طرف إصبع يمكنها اكتشاف شكل سطح الجسم أثناء تشوهه تحت الضغط، بالإضافة إلى القوى الدقيقة التي يتم تطبيقها. وهذا يسمح للروبوت بأن "يشعر" بالعالم بطريقة غنية ومفصلة تماماً كما يراه.

ما يجعل DeCAL فريداً حقاً هو كيفية معالجته لهذه المعلومات. فبدلاً من مجرد الاستجابة لما يراه أو يشعر به في اللحظة الراهنة، يتم تدريب النظام على تخيل ما سيحدث لاحقاً. إنه يعمل من خلال ثلاث قدرات متميزة ولكنها متصلة. أولاً، يفهم الوضع الحالي من خلال النظر إلى المشهد البسكري، وقراءة تعليمات لغوية، والشعيد بنقاط التلامس. ثانياً، ينخرط في نوع من "التخيل المشترك"، حيث يتنبأ بكيفية تطور المشهد البصري والأحاسيس اللمسية في الثواني القليلة القادمة. إنه يسأل نفسه جوهرياً: "إذا أدرت الغطاء الآن، كيف ستتغير القوة، وكيف سيبدو الجسم بعد لحظة؟". وأخيراً، يستخدم هذا المستقبل المتخيّل لتحديد الحركات الدقيقة اللازمة لإكمال المهمة. هذا النهج الاستشرافي يسمح للروت بتخطيط أفعاله بناءً على فيزياء التفاعل، بدلاً من مجرد التخمين بناءً على أنماط سابقة.

ولإنجاح هذا العمل، طور الباحثون طريقة خاصة لتقرير متى يجب الوثوق بحاسة اللمس. في العديد من المهام، قد يتحرك الروبوت عبر الهواء حيث يكون اللمس غير ذي صلة، ثم يصطدم فجأة بجسم ما. إذا أعطى الروبوت اهتماماً متساوياً لإشارات اللمس في جميع الأوقات، فسيصاب بالارتباك بسبب ضجيج الهواء أو عدم وجود تلامس. يستخدم DeCAL آلية بوابة ذكية تعمل مثل مفتاح التحكم في مستوى الصوت لحاسة اللمس. فعندما لا يلمس الروبوت أي شيء، يخفض النظام "مستوى صوت" الإشارات اللمسية، معتمداً بشكل أساسي على الرؤية. وفي اللحظة التي يحدث فيها التلامس، يرفع النظام "مستوى الصوت" فوراً، مما يسم يسمح للبيانات اللمسية بتوجيه الحركة بدقة عالية. هذا التعديل الديناميكي يضمن أن الروبوت يستخدم الحاسة الصحيحة في الوقت الصحيح، مما يمنع تضارب المدخلات الحسية مع بعضها البعض.

وُضع النظام تحت الاختبار في سلسلة من التجارب الصارمة التي شملت زوجاً من الأذرع الروبوتية المزودة بأيدٍ ذات اثنين وعشرين إصبعاً. كلف الباحثون الروبوت بست أنشطة مختلفة: مسح مزهرية، ومسح سبورة بيضاء، وتجميع أجزاء، وتدوير غطاء، ونقل السائل بالماصة، وربط مصباح كهربائي. تم اختيار هذه المهام لأنها تتطلب جميعها تحكماً دقيقاً وتلامساً فيزيائياً مستمراً. تمت مقارنة الروبوت بعدة نماذج رائدة أخرى، بما في ذلك تلك التي تعتمد على الرؤية فقط وتلك التي تستخدم اللمس ولكنها تفتقر إلى القدرة على تخيل الحالات المستقبلية. كانت النتائج واضحة: نجح DeCAL في إكمال المهام في كثير من الأحيان أكثر من أي نظام آخر. على سبيل المثال، في مهمة ربط مصباح كهربائي، حيث غالباً ما تحجب اليد الرؤية وتتطلب المهمة عزماً دقيقاً، نجح DeCAL بنسبة 40 في المائة من الوقت، بينما حقق النموذج التالي الأفضل نسبة 35 في المائة فقط. وفي مهمة مسح مزهرية، حقق DeCAL معدل نجاح بنسبة 100 في المائة، بينما نجح أفضل نموذج منافس يعتمد على الرؤية فقط بنسبة 30 في المائة.

ولعل الأمر الأكثر إثارة للإعجاب هو قدرة النظام على التعامل مع مواقف لم يسبق له رؤيتها. اختبر الباحثون DeCAL في بيئات بخلفيات مختلفة، ومزدحمة بأشياء عشوائية، وتحت إضاءة خافتة، ومع أجسام جديدة تماماً ذات أشكال وأحجام مختلفة. في هذه السيناريوهات "خارج التوزيع"، حيث لا يستطيع الروبوت الاعتماد على الأنماط المحفوظة، استمر DeCAL في الأداء بقوة. فعندما طُلب منه تدوير غطاء على كوب جديد وغير معروف، نجح النظام بنسبة 75 في المائة، متفوقاً بشكل كبير على منافسيه. يشير هذا إلى أن الروبوت لا يقوم فقط بحفظ مجموعة محددة من الحركات، بل يتعلم فعلياً المبادئ الفيزيائية الأساسية لكيفية تفاعل الأشياء، مما يسمح له بالتكيف مع التحديات الجديدة آنياً.

نظر الباحثون أيضاً عن كثب في كيفية تعلم النظام التنبؤ بالمستقبل. ومن خلال تحليل تنبؤات الروبوت الداخلية، وجدوا أنه يمكنه التنبؤ بدقة بالقوى والتشوهات التي ستحدث أثناء التفاعل. فعندما تنبأ الروبوت بمقدار القوة المطلوبة لتدوير غطاء أو كيف سيتشوه سطح ناعم، جاءت هذه التنبؤات متوافقة تماماً مع الواقع الفيزيائي الفعلي. هذه القدرة على محاكاة فيزياء العالم داخلياً هي ما يمنح الروبوت "حسه السليم". فهي تسمح للنظام بفهم أنه إذا ضغط بقوة زائدة، فقد ينزلق الجسم، أو إذا دار ببطء شديد، فستستغرق المهمة وقتاً طويلاً. هذه المعرفة الضمنية بالفيزياء، المستمدة من الجمع بين البصر واللمس، هي ما يمكّنه من التصرف بمرونة وثقة.

وعلى الرغم من هذه النجاحات، يوضح المؤلفون بعناً حدود عملهم. فالنظام يعتمد بشكل كبير على دقة مستشعرات اللمس الخاصة به، وإذا أصبحت تلك المستشعرات مشوشة أو غير معايرة، فقد يتدهور أداء الروبوت. بالإضافة إلى ذلك، يتطلب الإعداد الحالي وجود مشغل بشري لاستعراض المهام باستخدام نظام التحكم عن بعد، وهو ما لا يوفر للمشغل إحساساً باللمس. وهذا يعني أن بيانات التدريب قد لا تلتقط بدقة التعديلات الدقيقة التي قد يقوم بها الإنسان لو كان بإمكانه الشعور بالجسم نفسه. ويشير الباحثون أيضاً إلى أن نموذجهم لم يتم تدريبه بعد على نطاق هائل من البيانات اللمسية المتنوعة، مما يشير إلى أن التحسينات المستقبلية قد تأتي من تعريض النظام لمجموعة أوسع بكثير من التفاعلات الفيزيائية.

يمثل هذا العمل تحولاً في طريقة تفكيرنا في الذكاء الروبوتي. فبدلاً من بناء روبوتات تكون ببساطة أسرع أو أقوى، يركز هذا النهج على بناء آلات يمكنها فهم العالم المادي كمكان ديناميكي وتفاعلي. ومن خلال منح الروبوت القدرة على تخيل عواقب أفعاله والتكيف مع حواسه حسب الموقف، أنشأ الباحثون نظاماً يبدو أقل شبهاً بآلة تتبع نصاً وأكثر شبهاً بوكيل قادر على التفاعل الحقيقي. ومع نضوج هذه التكنولوجيا، يكمن الأمل في أن تتمكن هذه الأنظمة في نهاية المطاف من أداء المهام المعقدة التي تتطلب تلامساً كثيفاً والتي تحدد الكثير من حياة البشر، من الطبخ والتنظيف إلى رعاية كبار السن، ببراعة تضاهي براعتنا. ويتضمن المسار المستقبلي تحسين هذه المستشعرات، وتوسيع بيانات التدريب، والاستمرار في سد الفجوة بين الرؤية، والشعور، والفعل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →