Dual Process Motion Planning
تقترح هذه الورقة إطار عمل لتخطيط الحركة يعتمد على المعالجة المزدوجة العصبية الرمزية، والذي يدمج ديناميكياً بين التعلم السريع القائم على الخبرة ("النظام-1") والاستدلال الرمزي المتين ("النظام-2") لتحقيق كفاءة ودقة وقدرة فائقة على التعميم في المهام الروبوتية غير الخطية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تنتقل الروبوتات من أرضيات المصانع إلى حياتنا اليومية، حيث تُكلف بكل شيء بدءاً من قيادة السيارات وصولاً إلى التنقل في الممرات المزدحمة. وللقيام بذلك بأمان، يجب على الروبوت حل لغز معقد في كل ثانية: كيف ينتقل من حيث هو الآن إلى حيث يحتاج أن يذهب دون الاصطدام بأي شيء، مع الالتزام بقوانين الفيزياء التي تحكم حركته. لعقود من الزمن، اعتمد المهندسون على طريقتين رئيستين لحل هذه المعضلة. إحدى الطريقتين تشبه خبيراً متمرساً يحسب كل مسار محتمل بدقة متناهية، مما يضمن السلامة ولكنه يستغرق وقتاً طويلاً في التفكير. أما الطريقة الأخرى فهي تشبه الغريزة السريعة، حيث يستخدم الروبوت تجارب سابقة لتخمين مسار جيد فوراً، لكن هذا التخمين قد يكون خاطئاً أو غير آمن أحياناً. لقد كان التحدي دائماً يتمثل في إيجاد وسيلة للحصول على سرعة الغريزة دون فقدان سلامة الحسابات.
اقترح فريق من الباحثين في الجامعة الصينية في هونغ كونغ (شنتشن)، وجامعة أكسفورد، طريقة جديدة للتعامل مع هذه المقايضة. لقد بنوا نظاماً يحاكي كيفية اتخاذ البشر للقرارات غالباً، عبر الجمع بين رد الفعل السريع والبديهي وبين الفحص الأكثر تأنياً وبطئاً. أطلقوا على هذا "بنية العمليات المزدوجة". في إعدادهم، يحاول الروبوت أولاً حل المشكلة باستخدام سياسة متعلمة سريعة—وهي نوع من الحدس الرقمي الذي تم تدريبه على آلاف الرحلات الناجحة السابقة. يعمل هذا "النظام 1" بسرعة، حيث يقترح مساراً في جزء من الثانية. ومع ذلك، قبل أن يتحرك الروبوت، تقوم بوابة أمان بالتحقق مما إذا كان هذا التخمين السريع خالياً حقاً من الاصطدامات وهل يصل بالفعل إلى الهدف. إذا اجتاز التخمين السريع الفحص، يتحرك الروبوت فوراً. أما إذا فشل التخمين السريع أو بدا خطيراً، فإن النظام ينتقل فوراً إلى حاسب أكثر دقة وبطئاً—وهو "النظام 2"—الذي يستنبط مساراً مثالياً من الصفر، تماماً مثل أساليب الخبراء التقليدية.
اختبر الباحثون هذا النهج في مجموعة متنوعة من البيئات الرقمية الصعبة، والتي تراوحت من المساحات المفتوحة التي تحتوي على بعض العوائق الكبيرة إلى المتاهات الضيقة ذات الفتحات الصغيرة العديدة. ووجدوا أن هذا النظام الهجين كان فعالاً بشكل ملحوظ. فمن خلال ترك الحدس السريع يتولى التعامل مع المواقف السهلة أو المباشرة، تجنب النظام التكلفة الحسابية الثقيلة للحاسب البطيء في معظم الأوقات. وفي البيئات ذات المساحات الواسعة أو التي تحتوي على عوائق صغيرة كثيرة، نجح النظام السريع في حل المشكلات بمفرده في أكثر من نصف الحالات، مما وفر طاقة معالجة كبيرة. وعندما كان النظام السريع يتعثر أو يرتكب خطأً، كان النظام الأبطأ يتدخل لإصلاحه، مما يضمن عدم اصطدام الروبوت أبداً. وكانت النتيجة روبوتاً يكاد يكون موثوقاً مثل الخبير البطيء والمتأني، ولكنه أسرع بكثير بشكل عام، حيث نجح في التنقل عبر مسارات معقدة في جميع الاختبارات تقريباً.
كان جزء رئيسي من اكتشافهم هو كيفية تعلم الروبوت بمرور الوقت. ترك الباحثون النظام يمر عبر مئات السيناريوهات، وكلما اضطر النظام البطيء والمتأني للتدخل لإصلاح خطأ ارتكبه النظام السريع، قام بحفظ ذلك التصحيح الناجح. ثم درس النظام السريع هذه التصحيحات وحسّن حدسه الخاص للجولة التالية. هذه العملية، المعروفة باسم التعلم المستمر، سمحت للنظام السريع بأن يصبح أفضل وأفضل، ليحل في النهاية المزيد من المشكلات بمفرده دون الحاجة لمساعدة النظام البطيء. ومع ذلك، وجد الباحثون حداً لهذا التعلم؛ فقد تحسن النظام السريع بشكل أكبر عندما قدم النظام البطيء إصلاحات محلية قصيرة، لكنه واجه صعوبة في التعلم من النظام البطيء عندما كان الحل يتطلب خطة طويلة ومعقدة تتغير بناءً على المسار بأكلى. وهذا يشير إلى أنه بينما يمكن للروبوت أن يتعلم ليكون أسرع، فإنه لا يزال يعتمد على الحاسب المتأني في مهام الملاحة الأكثر تعقيداً وطويلة المدى.
كما بحث الفريق فيما إذا كان تغذية الحاسب البطيء بالتخمين الفاشل القادم من النظام السريع سيساعده على حل المشكلة بشكل أسرع. ووجدوا أن هذا لم يعمل كما هو متوقع؛ إذ إن إعطاء الحاسب البطيء نقطة بداية سيئة غالباً ما كان يربكه أو يؤدي به إلى نفس الطريق المسدود، دون تقديم أي توفير حقيقي في الوقت. وقد استبعد هذا فكرة شائعة مفادها أن تمرير حل جزئي يساعد دائماً. بدلاً من ذلك، كان النهج الأكثر كفاءة هو ترك النظام السريع يحاول، ثم التحقق من النتيجة، وفقط في حالة الفشل، ترك النظام البطيء يبدأ من جديد.
في النهاية، تثبت الدراسة أن الجمع بين رد فعل سريع ومتعلم وبين تحقق بطيء ومتأني يخلق روبوتاً سريعاً وآمناً في آن واحد. فهو لا يتطلب أن يكون النظام السريع مثالياً بمفرده، ولا يجبر الروبوت على استخدام الحساب المكلف لكل حركة. ومن خلال التحديد الدقيق لمتى يمكن الوثوق بتخمين سريع ومتى يجب المطالبة بخطة مفصلة، يحقق النظام توازناً لم يستطع أي من الطريقتين الوصول إليه بمفرده. ويقدم هذا النهج مساراً عملياً للروبوتات التي تحتاج إلى التحرك بسرعة وأمان في عالم البشر المليء بالمتغيرات والمزدحم.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.