← أحدث الأبحاث
💻 computer science

Learning Communication-Conditioned Generative Policies for Decentralized Multi-Agent Collision Avoidance

تقترح هذه الورقة إطار عمل توليديًا لامركزيًا مشروطًا بالاتصال، يستخدم سياسات مطابقة التدفق (flow-matching) المدربة على بيانات غير متصلة متميزة لتمكين تجنب الاصطدام بين الوكلاء المتعددين من خلال تبادل النوايا الكامنة المتعلم، محققةً أداءً بمستوى الخبراء وتعميمًا قويًا في كل من سيناريوهات المحاكاة والواقع دون تخطيط مركزي.

المؤلفون الأصليون: Prajwal Koirala, Mark Campbell

نُشر 2026-09-16
📖 6 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Prajwal Koirala, Mark Campbell

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في المساحات المزدحمة حيث تتحرك الآلات والبشر معاً—سواء في أرض مستودع مزدحم، أو شارع في مدينة، أو في السماء فوقنا—تعتمد السلامة على حقيقة بسيطة ولكنها صعبة: يجب على كل جسم متحرك أن يتكهن بما سيفعله الآخرون بعد ذلك. لعقود من الزمن، حاول المهندسون حل هذه المعضلة عبر كتابة قواعد صارمة لكيفية استجابة الروبوتات، تماماً مثل قوانين المرور للسيارات. تعمل هذه القواعد بشكل جيد عندما يتبع الجميع نفس السيناريو وتكون البيئة قابلة للتنبؤ. ولكن في العالم الحقيقي، تكون الحشود فوضوية، وغالباً لا تستطيع الروبوتات رؤية كل شيء حولها. قد يحجبها جدار، أو قد تفشل مستشعراتها في رصد نظير يتحرك بسرعة. وعندما لا يستطيع الروبوت رؤية الصورة الكاملة، يجب عليه الاعتماد على رؤيته المحدودة، مما يجعل من الصعب تجنب الاصطدام دون وجود كمبيوتر مركزي يخبر الجميع بما يجب فعله. إن هذا التحدي المتمثل في جعل العديد من الآلات المستقلة تتحرك بأمان معاً، دون وجود "رئيس" في المنتصف، هو مشكلة جوهرية في علم الروبوتات.

قام فريق من الباحثين في جامعة كورنيل بتطوير طريقة جديدة لهذه الآلات لتعلم كيفية التنقل في مثل هذه الحشود. وبدلاً من برمجة قواعد جامدة، علموا مجموعة من الروبوتات التعلم من خلال الخبرة، وتحديداً عبر مراقبة "خبير متميز" (privileged expert) يمكنه رؤية كل شيء. والابتكار الرئيسي هو أن الروبوتات تعلمت كيف تتحدث مع بعضها البعض، ولكن ليس بالكلمات أو إشارات الراديو القياسية؛ بل تعلمت تبادل رسائل مجردة وغير مرئية تلخص نواياها. ومن خلال دمج هذه الرسائل الخفية مع ما يمكنهم رؤيته محلياً، تعلمت الروبوتات التنبؤ بكيفية تحرك الآخرين وتعديل مساراتها الخاصة لتجنب الاصطدامات. والنتيجة هي نظام يعمل فيه كل روبوت بشكل مستقل، ومع ذلك يتحرك بانسجام مع المجموعة، حتى لو انقطع الاتصال بينهم أو كان مشوشاً.

بدأ الباحثون بإنشاء ساحة تدريب رقمية مليئة بأربعة روبوتات. تركوا برنامج كمبيوتر قوياً، يمتلك صلاحية الوصول إلى الموقع والسرعة الدقيقة لكل روبوت في المحاكاة، يتنقل في هذه المساحة بشكل مثالي. هذا "الخبير" لم يصطدم أبداً لأنه كان يعرف مستقبل كل وكيل. ثم طلب الباحثون من روبوتاتهم الجديدة والأبسط تعلم سلوك هذا الخبير. ومع ذلك، كان هناك شرط: لم يكن مسموحاً للروبوتات الجديدة برؤية العالم بأكله، بل كان بإمكانها فقط رؤية موقعها الخاص وأقرب جار لها، تماماً كما سيكون حال روبوت حقيقي في غرفة مظلمة أو مزدحمة. ولتجسير هذه الفجوة، منح الباحثون الروبوتات وسيلة لإرسال إشارات قصيرة ومضغوطة إلى بعضها البعض. لم تكن هذه الإشارات مبرمجة مسبقاً؛ بل كان على الروبوتات اكتشاف المعلومات المفيدة التي يجب مشاركتها لتجنب الاصطدام بأنفسهم.

عملت عملية التعلم كرقصة من خطوتين: الفهم والعمل. أولاً، تعلمت الروبوتات ضغط ملاحظاتها المحلية في رسالة صغيرة تلخص "نيتها"—أي ما تخطط لفعله تالياً. ثم شاركت هذه الرسائل مع الروبوتات المجاورة. ثانياً، استخدم كل روبوت الرسائل التي تلقاها، مدمجة مع رؤيته المحلية، لإنشاء خطة حركة قصيرة. وبدلاً من اتخاذ قرار بشأن منعطف واحد أو سرعة واحدة، تخيل الروبوت تسلسلاً من التحركات للثواني القليلة القادمة. ثم اختار الحركة الأولى من ذلك التسلسل، ونفذها، وبدأ فوراً في التخطيط للثواني القليلة التالية بناءً على معلومات جديدة. سمحت هذه الدورة المستمرة للروبوتات بالبقاء مرنة، والاستجابة للتغيرات في الحشد بشكل فوري.

ما يجعل هذا النهج ذكياً بشكل خاص هو كيفية تعلم الروبوتات للتواصل. لم يخبر الباحثون الروبوتات بما يجب أن تقوله، بل اكتشفت الروبوتات أنه لتجنب الاصطدام، يتعين عليها مشاركة نوع محدد من المعلومات الخفية حول مساراتها المستقبلية. تم تدريب النظام بحيث يمكن للروبوتات أيضاً العمل بدون هذه الرسائل، والعمل بناءً على ملاحظاتها المحلية فقط. هذا التصميم يعني أنه إذا فشل رابط الاتصال، فإن الروبوتات لن تتوقف عن الحركة أو تصطدم؛ بل ستعود ببساطة للعمل بشكل مستقل، معتمدة على خططها الخاصة. وجد الباحثون أن النظام كان متيناً للغاية؛ فحتى عندما قاموا بمحاكاة سيناريو فقدت فيه الروبوتات قدرتها على التحدث مع بعضها البعض لمدة تصل إلى 75% من الوقت، نجحت في الوصول إلى أهدافها دون حدوث اصطدامات. لقد اعتمدت الروبوتات ببساطة على الخطط التي وضعتها قبل لحظات قليلة، مما حافظ على سلاسة وحماية حركتها.

اختبر الفريق هذه الطريقة في عمليات محاكاة مع مجموعات مكونة من أربعة، وستة، وثمانية روبوتات. ومن المثير للدهشة أنهم دربوا النظام فقط على مجموعات من أربعة روبوتات، ومع ذلك عمل بنفس الكفاءة عند إضافة المزيد من الروبوتات دون أي تدريب إضافي. يشير هذا إلى أن الروبوتات تعلمت مبدأً عاماً للملاحة في الحشود بدلاً من حفظ نمط محدد لأربعة وكلاء. وفي عمليات المحاكاة، حققت الروبوتات معدل نجاح يقارب 97% في السيناريوهات التعاونية مع أربعة وكلاء، وحافظت على معدلات نجاح عالية حتى عندما تضاعف حجم المجموعة. كما أدت أداءً جيداً عندما تمت برمجة بعض الروبوتات في المجموعة لتكون "أنانية" وتتجاهل الآخرين، مما أظهر أن النظام يمكنه التعامل مع مزيج من السلوكيات التعاونية وغير التعاونية.

لإثبات أن هذا لم يكن مجرد خدعة حاسوبية، نقل الباحثون البرمجيات التي تم تدريبها بالكامل في العالم الرقمي وثبتوها على أربعة روبوتات فيزيائية صغيرة في مختبر حقيقي. لم يقوموا بتعديل الكود أو إعادة تدريب الروبوتات لتناسب العالم الحقيقي. كان على الروبوتات الفيزيائية، المجهزة بمستشعاتها ومعالجاتها الخاصة، تبادل المواقع في مساحة ضيقة، وتقاطع المسارات مع بعضها البعض. وبالرغم من الضجيج والعيوب الموجودة في العالم الحقيقي، نجحت الروبوتات في تنفيذ المهمة، متجنبة بعضها البعض ووصلت إلى وجهاتها. هذا الانتقال "صفري الاستعداد" (zero-shot transfer)، حيث يعمل النظام في العالم الحقيقي فوراً بعد التدريب في المحاكاة، يعد خطوة كبيرة للأمام. فهو يثبت أن الروبوتات تعلمت حقاً المنطق الأساسي للتفاعل الآمن، وليس فقط التفاصيل المحددة لبيئة رقمية.

كشفت الدراسة أيضاً عن ميزة فريدة لهذا الأسلوب في التعلم: القدرة على التحكم في مستوى التنسيق. نظرًا لأن الروبوتات تعلمت توليد تحركاتها بناءً على مزيج من ملاحظاتها الخاصة والرسائل الواردة من الآخرين، استطاع الباحثون تعديل الوزن الذي تعطيه الروبوتات لإشارات المجموعة. فمن خلال تدوير "مقبض" بسيط، يمكنهم جعل الروبوتات تعمل بشكل مستقل تماماً، متجاهلة بعضها البعض، أو تتحرك بتنسيق عالٍ، وتنسج مساراتها حول بعضها البعض بدقة. تشير هذه المرونة إلى أن النظام يمكنه التكيف مع مواقف مختلفة، من غرفة هادئة حيث يمكن للروبوتات التحرك بحرية إلى حشد فوضوي حيث يكون التواصل المستمر أمراً ضرورياً.

يرى الباحثون أن هذا النهج يقدم مساراً جديداً للأنظمة ذاتية القيادة. فالطرق التقليدية غالباً ما تعتمد على قواعد معقدة مكتوبة يدوياً أو تتطلب كمبيوتراً مركزياً لإدارة حركة المرور، وهو أمر يمكن أن يكون هشاً وبطيئاً. ومن خلال استخدام نموذج توليدي يتعلم التنبؤ بتسلسلات الأفعال ويتواصل عبر إشارات مجردة متعلمة، تصبح الروبوتات أكثر شبهاً بسرب من الطيور أو مدرسة من الأسماك، حيث ينبثق السلوك الجماعي المعقد من تفاعلات محلية بسيطة. يوضح العمل أن الآلات يمكنها تعلم فهم نوايا بعضها البعض دون الحاجة إلى لغة مشتركة أو عقل مركزي، مما يمهد الطريق لأساطيل أكثر أماناً وكفاءة من الروبوتات في مساحاتنا المشتركة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →