← أحدث الأبحاث
🤖 AI

MemCorr-DP: Counterfactual Correspondence Conditioning for a Diffusion Policy Guided by a Reference

تُعد MemCorr-DP سياسة انتشار تعزز المتانة البصرية الحركية في ظل التحولات المكانية وتحولات زوايا الرؤية المركبة، وذلك عبر رفع مطابقات الميزات ثنائية الأبعاد إلى علاقات ثلاثية الأبعاد صريحة مع مسار مرجعي، وتوظيف التكييف المضاد للواقع لمواءمة الهندسة مع المشهد الحالي.

المؤلفون الأصليون: Tan Su, Haoxiang Yang, Ruxin Wang, Binghui Xie

نُشر 2026-09-09
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Tan Su, Haoxiang Yang, Ruxin Wang, Binghui Xie

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

أصبحت الروبوتات التي تتعلم من خلال مراقبة البشر أثناء أداء مهمة ما شائعة بشكل متزايد، لكنها تواجه عائقاً مستعصياً: فهي غالباً ما تفشل بمجرد تغير العالم قليلاً. فإذا تعلم الروبوت فتح باب وهو يقف في بقعة معينة، فقد يصاب بالارتباك إذا تحرك الباب بضع بوصات فقط أو إذا تغيرت زاوية الكاميرا التي تراقب المشهد. يحدث هذا لأن العديد من وحدات التحكم في الروبوت تعتمد على حفظ أنماط بصرية محددة، مثل الشكل الدقيق لمقبض الباب في زاوية معينة من الصورة، بدلاً من فهم الهندسة الأساسية للتفاعل. وعندما يتغير المشهد، يختفي النمط المألوف، وتنهار خطة الروبوت. ومن أجل بناء آلات يمكنها التكيف حقاً، يستكشف الباحثون طرقاً لتعليم الروبوتات التركيز على العلاقة المكانية بين الأشياء وحركاتها الخاصة، بدلاً من مجرد التركال على البكسلات الموجودة على الشاشة. يهدف هذا النهج إلى خلق شكل من أشكال "ذاكرة العضلات" التي تفهم كيف يجب أن تتحرك القبضة بالنسبة لشيء ما، بغض النظر عن مكان وجود ذلك الشيء أو كيفية رؤية الكاميرا له.

في دراسة جديدة، طور الباحثون نظاماً يسمى MemCorr-DP يعالج هذه المشكلة من خلال تعليم الروبوت مواءمة أفعاله مع مثال مسجل للنجاح، حتى عندما يبدو المشهد مختلفاً تماماً. الفكرة الجوهرية بسيطة ولكنها قوية: بدلاً من محاولة حفظ مظهر المحاولة الناجحة، يتعلم الروبوت مطابقة الهندسة الفيزيائية لوضعه الحالي مع هندسة مسار ناجح محفوظ. تخيل روبوتاً يحاول فتح باب؛ يقدم له الباحثون تسجيلاً فيديو لعملية فتح ناجحة. وبينما يحاول الروبوت تنفيذ المهمة في موقع جديد وبزاوية كاميرا مختلفة، فإنه يستخدم نظام مطابقة بصري للعثور على نقاط مقابلة للباب ويد الروبوت في كل من العرض المباشر والفيديو المسجل. بعد ذلك، يقوم برفع هذه النقاط المتطابقة إلى مساحة ثلاثية الأبعاد مشتركة، مما يخلق مجموعة من العلاقات التي تصف موقع يد الروبوت بالنسبة للباب، وموقع اليد في التسجيل بالنسبة للباب في تلك اللحظة نفسها. يتيح ذلك للروبوت أن يرى أنه، رغم وجود الباب في مكان مختلف، فإن العلاقة الفيزيائية بين اليد والمقبض هي نفسها، ويمكنه المضي قدماً في الحركة الصحيحة.

اختبر الباحثون هذا النظام في مهمة محاكاة حيث يجب على الروبوت فتح وإغلاق باب. لقد جعلوا المهمة صعبة عمداً عبر تحريك الباب إلى مواضع خارج النطاق الذي رآه الروبوت أثناء التدريب، وعبر تغيير زاوية الكاميرا بمقدار خمس عشرة درجة. وفي هذه الظروف الصعبة، نجح النظام الجديد في 96.67% من المحاولات. وبالمقارنة، نجح متحكم الروبوت القياسي الذي اعتمد على الصور البصرية وحدها، دون هذه المطابقة الهندسية، بنسبة 88% فقط. قد يبدو الفرق ضئيلاً، ولكن في عالم الروبوتات، يمثل معدل فشل 12% مقابل 3% فجوة هائلة في الموثوقية. وقد أظهرت الدراسة أن نجاح النظام اعتمد بشكل كبير على استخدام العلاقات ثلاثية الأبعاد الكاملة بين النقاط. فعندما جرد الباحثون عملية المطابقة من التفاصيل الدقيقة للنقطة إلى النقطة واستبدلوها بمعلومات أبسط، مثل مركز الباب فقط أو اتجاه الحركة العام، انخفض معدل النجاح بشكل ملحوظ. وقد أثبت ذلك أن الروبوت كان بحاجة إلى الخريطة المكانية الدقيقة التي يوفرها نظام المطابقة للتنقل عبر التحولات الصعبة.

ولضمان أن الروبوت يتبع حقاً التعليمات الموجودة في الفيديو المرجعي وليس مجرد التخمين، استحدث الباحثون طريقة تدريب ذكية. فقد علموا الروبوت التمييز بين فتح الباب وإغلاقه من خلال إعطائه نفس وضعية البداية ونفس المدخلات المشوشة وغير المؤكدة، ولكن مع مطالبته بالتنبؤ بالفعل لنتيجتين مختلفتين بناءً على فيديوهين مرجعيين مختلفين. إذا لم يستطع الروبوت التمييز بين الفتح والإغلاق عند تغير المرجع، فهذا يعني أنه لم يتعلم الدرس الصحيح. هذه التدريب "المضاد للواقع" (counterfactual) أجبر النظام على الانتباه الشديد للتفاصيل المحددة للمسار المرجعي. وأظهرت النتائج أنه عندما تم إعطاء الروبوت فيديو مرجعياً خاطئاً، فإنه يحاول القيام بالفعل الخاطئ، مما يثبت أنه كان يستجيب حقاً للتوجيه المقدم من المرجع بدلاً من الاعتماد على عادة تعلمها مسبقاً.

كما بحثت الدراسة مدى قدرة النظام على التعامل مع الأخطاء في عملية المطابقة البصرية. في العالم الحقيقي، لا تكون مطابقة النقاط بين صورتين مختلفتين مثالية أبداً؛ إذ يوجد دائماً خطأ صغير ما. ووجد الباحثون أن نظامهم ظل قوياً حتى عندما كانت المطابقة غير مثالية، حيث حافظ على معدلات نجاح عالية حتى عندما كانت المواضع المحسوبة منحرفة بعدة سنتيمترات. تشير هذه المرونة إلى أن النظام لا يحتاج إلى محاذاة دقيقة للبكسلات ليعمل، بل يحتاج فقط إلى تقريب جيد للعلاقات ثلاثية الأبعاد لتوجيه أفعال الروبوت. وأشار الباحثون إلى أنه بينما عمل النظام بشكل جيد في محاكاتهم، إلا أنه لم يُختبر بعد على روبوتات فيزيائية أو مع أنواع مختلفة من المهام. لقد اقتصر التقييم على حالة واحدة للباب وأنواع محددة من الحركة وتحولات الكاميرا. ومع ذلك، توفر النتائج دليلاً قوياً على أن النمذجة الصريحة للعلاقات ثلاثية الأبعاد بين الروبوت، وكائن ما، ومثال مرجعي، هي مسار واعد لخلق روبوتات يمكنها تعميم مهاراتها في بيئات جديدة وغير متوقعة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →