EMERGE-Policy: A Robot Mind Emerges Beyond a Single Policy
يقدم EMERGE-Policy إطار عمل وكيلِيّاً ذا بنية رسومية حيث يقوم وكيل رئيسي مركزي بتنسيق وكلاء فرعيين متخصصين للإدراك والاستدلال والتحقق ضمن سياقات معزولة، مما يتيح أداءً روبوتياً قوياً دون الحاجة إلى ضبط دقيق من خلال التعاون الناشئ على مستوى النظام والتصحيح في حلقة مغلقة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
لطالما كانت الروبوتات خبيرة في تكرار حركة واحدة مثالية، مثل آلة اللحام في خط التجميع أو ذراع تقوم برص صناديق متطابقة. لكن منح الروبوت عقلاً قادراً على التعامل مع عالم حقيقي فوضوي وغير متوقع أثبت أنه أصعب بكثير. لعقود من الزمن، حاول الباحثون حل هذه المشكلة عبر بناء برنامج حاسوبي واحد ضخم — "دماغ" — يمكنه رؤية جسم ما، وفهم أمر معين، وتحريك الذراع بالكامل في آن واحد. وبينما أصبحت هذه الأنظمة مثيرة للإعجاب، إلا أنها غالباً ما تتعثر عندما تسوء الأمور. فإذا انزلق كوب أو تغيرت الإضاءة، قد يصاب "الدماغ الواحد" بالارتباك لأنه يحاول القيام بكل شيء في قفزة واحدة عملاقة. ويشير التفكير الجديد في مجال الروبوتات إلى أن الذكاء قد لا يحتاج إلى العيش في مكان واحد؛ بدلاً من ذلك، يمكن لعقل الروبوت أن ينبثق من فريق من المساعدين المتخصصين الذين يعملون معاً، حيث يراقب جزءٌ ما المشهد، ويخطط جزءٌ آخر، ويتحقق جزء ثالث من العمل، بينما يتذكر جزء رابع ما حدث. هذا النهج يعامل الروبوت ليس ككيان واحد، بل كمجموعة منسقة، مما يسمح له بالتعافي من الأخطاء والتكيف مع التغييرات بطرق لا يستطيع البرنامج الواحد القيام بها.
هذه هي الفكرة الجوهرية وراء إطار عمل جديد يسمى EMERGE-Policy، والذي طوره باحثون من عدة جامعات بما في ذلك جامعة تسينغ هوا وجامعة بكين. فبدلاً من الاعتماد على نموذج واحد ضخم للقيام بكل شيء، بنى الباحثون نظاماً يعمل فيه "وكيل رئيسي" (Main Agent) كمدير مشروع. هذا المدير لا يشاهد بث الفيديو الخام ولا يحسب كل حركة للمحرك بنفسه، بل يقوم بتفكيك مهمة معقدة، مثل "رص هذه الكؤوس في شكل هرم"، إلى خطوات أصغر. ثم يفوض مهام محددة إلى "وكلاء فرعيين" (Sub Agents). حيث يركز فريق من المساعدين حصرياً على رؤية المشهد وإيجاد الكؤوس، ويراقب فريق آخر ذراع الروبوت للتأكد من أنها تتحرك بشكل صحيح، بينما يتحقق فريق ثالث مما إذا كان الكوب مستقراً بالفعل بعد وضعه. وإذا ساءت الأمور، يساعد فريق رابع الروبوت على تذكر الفشل وتجربة نهج مختلف. يقوم الوكيل الرئيسي بالتنسيق بين هذه المجموعات، حيث يتلقى فقط المعلومات الأساسية والملخصة التي يحتاجها لاتخاذ القرار التالي، بينما تتم المعالجة الثقيلة للبيانات الخام في الخلفية.
اختبر الباحثون هذا النظام عبر سلسلة من الاختبارات المعيارية الصعبة، بما في ذلك مهام كان على الروبوت فيها التعامل مع أجسام على طاولة تحت ظروف صعبة. وقارنوا نهجهم القائم على الفريق بأفضل نماذج البرامج الأحادية المتاحة حالياً. وأظهرت النتائج أن الفريق المنسق تفوق بشكل كبير على النماذج الأحادية، خاصة عندما تغيرت البيئة أو كانت التعليمات غامضة. وفي الاختبارات القياسية، حقق النظام معدلات نجاح تقترب من 99 بالمائة، وهو تحسن طفيف ولكنه ملموس عن أفضل النماذج الأحادية. والأهم من ذلك، عندما أدخل الباحثون اضطرابات — مثل تغيير الإضاءة، أو تغيير حجم الكؤوس، أو حجب رؤية الروبوت — ظل النظام القائم على الفريق قوياً. فبينما كانت النماذج الأحادية تفشل تماماً في ظل هذه الظروف الجديدة، كان نظام EMERGE-Policy قادراً على اكتشاف المشكلة، وتشخيصها، وتعديل خطته للنجاح. وفي اختبار محدد يتضمن روبوتاً حقيقياً يقوم برص أكواب ورقية في هرم مكون من ثلاث طبقات، نجح النظام في 94 بالمائة من التجارب، حتى عندما كانت الكؤوس ذات أحجام مختلفة أو تغيرت زوايا الكاميرا.
يتمثل جزء رئيسي من هذا النجاح في كيفية تعامل النظام مع الذاكرة والأخطاء. فبدلاً من محاولة تذكر كل إطار فيديو، مما قد يرهق الحاسوب، يقوم النظام بتدوين ملخص موجز لما حدث في سجل رقمي. إذا أسقط الروبوت كوباً، فلا يحاول النظام مجرد المحاولة مرة أخرى بشكل أعمى؛ بل يحلل سبب السقوط، ويكتب ملاحظة حول الفشل، ويضع خطة محددة لإصلاح ذلك الجزء من المشكلة قبل المضي قدماً. وهذا يسمح للروبوت بالتعافي من الأخطاء محلياً دون الحاجة إلى إعادة المهمة بأكملها. كما وجد الباحثون أن إعطاء النظام "معاينة" لما قد يحدث لاحقاً ساعد في تجنب الأخطاء قبل وقوعها. فمن خلال محاكاة بعض الحركات المحتملة في ذهنه والتحقق من أي منها يبدو الأفضل، استطاع الروبوت اختيار المسار الأكثر أماناً. هذه الخطوة التي تشبه "الخيال"، جنباً إلى جنب مع عملية تحقق صارمة، جعلت الروبوت أقل عرضة لارتكاب أخطاء لا يمكن الرجوع عنها.
ولم تقتصر التجارب على عمليات المحاكاة الحاسوبية فحسب، بل قام الفريق بنشر النظام على ذراع روبوت حقيقي لأداء سلسلة طويلة من المهام: إزالة الأكواب الورقية من الطاولة، ووضعها مقلوبة، ورصها في طبقات. وقد أثبت هذا الاختبار في العالم الحقيقي أن إطار العمل يمكنه التعامل مع عدم القدرة على التنبؤ بالأجسام المادية، مثل الكؤوس التي قد تتأرجح أو تنزلق. أكمل النظام المهمة بنجاح في 94 بالمائة من الحالات، وحتى عندما قاطع الباحثون العملية أو غيروا الإضاءة، كان الروبوت قادراً على إعادة التخطيط وإنهاء العمل. تشير الدراسة إلى أن مستقبل ذكاء الروبوتات قد لا يكمن في بناء دماغ واحد أكبر وأذكى، بل في إيجاد طريقة أفضل لعمل العديد من الأدوات الأصغر والمتخصصة معاً. ومن خلال تنظيم هذه الأدوات في تسلسل هرمي واضح حيث لكل منها وظيفة محددة وطريقة واضحة للتقرير، نجح الباحثون في إنشاء نظام ليس أكثر دقة فحسب، بل أكثر قدرة على الصمود في وجه فوضى العالم الحقيقي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.