← أحدث الأبحاث
💻 computer science

COHORT: Hybrid RL for Collaborative Large DNN Inference on Multi-Robot Systems Under Real-Time Constraints

تقدم هذه الورقة COHORT، وهو إطار عمل تعاوني قائم على نظام تشغيل الروبوتات (ROS) للأنظمة متعددة الروبوتات، والذي يستفيد من استراتيجية تعلم تعزيزي هجينة (غير متصلة وغير متصلة بالإنترنت) لتوزيع مهام استدلال الشبكات العصبية العميقة الكبيرة ديناميكيًا، محققًا تحسينات كبيرة في كفاءة البطارية، واستغلال وحدة معالجة الرسومات، والامتثال للمواعيد النهائية تحت القيود الزمنية الحقيقية.

المؤلفون الأصليون: Mohammad Saeid Anwar, Anuradha Ravi, Indrajeet Ghosh, Gaurav Shinde, Carl Busart, Nirmalya Roy

نُشر 2026-03-12
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Mohammad Saeid Anwar, Anuradha Ravi, Indrajeet Ghosh, Gaurav Shinde, Carl Busart, Nirmalya Roy

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل فريقًا من روبوتات الإنقاذ أُرسلت إلى منطقة كوارث — مثل مبنى منهار أو منطقة حرائق غابات. مهمتهم هي استكشاف المكان، والعثور على الناجين، وتحديد الحطام، والإجابة على أسئلة مثل: "كم عدد الأشخاص الذين تراهم؟" أو "أين المسار الأكثر أمانًا؟"

للقيام بذلك، يحتاجون إلى تشغيل برامج حاسوبية ذكية جدًا ولكنها ثقيلة للغاية تسمى الشبكات العصبية العميقة الضخمة (Large DNNs). فكر في هذه البرامج كأنها أدمغة عملاقة جائعة تحتاج إلى الكثير من الكهرباء وقوة المعالجة لكي تفكر.

المشكلة: معضلة "البطارية مقابل الدماغ"

هنا تكمن العقبة: هذه الروبوتات صغيرة، وبطارياتها محدودة، وغالبًا لا يمكنها الاتصال بـ "السحابة" (الإنترنت) لأن منطقة الكوارث تفتقر إلى شبكة Wi-Fi.

  • إذا حاول الروبوت تشغيل هذه "الأدمغة العملاقة" بمفرده تمامًا، فسيستنزف بطاريته في دقائق وقد يتوقف عن العمل قبل انتهاء المهمة.
  • إذا حاولوا إرسال البيانات إلى خادم مركزي، فلن يكون هناك خادم لإرسالها إليه.
  • إذا قاموا فقط بالتخمين حول من يجب أن يقوم بالعمل، فقد يرسلون مهمة ثقيلة إلى روبوت ضعيف بالفعل، مما يؤدي إلى فشل الفريق بأكمله.

الحل: COHORT (قائد الفريق الذكي)

ابتكر الباحثون نظامًا يسمى COHORT. فكر في COHORT كأنه قائد فريق فائق الذكاء وغير مرئي يعيش داخل كل روبوت. مهمته الوحيدة هي اتخاذ القرار: "هل أقوم بهذه المهمة بنفسي، أم يجب أن أطلب من زميلي القيام بها؟"

لكن COHORT ليس مجرد كتاب قواعد بسيط. إنه آلة تعلم تصبح أكثر ذكاءً في كل مرة تعمل فيها.

كيف يتعلم COHORT: استراتيجية "التدريب" و"يوم المباراة"

يصف البحث عملية تدريب ذكية مكونة من خطوتين، يمكننا مقارنتها بتدريب فريق رياضي:

1. مرحلة "التدريب" (التعلم غير المتصل - Offline Learning)
قبل أن تدخل الروبوتات إلى منطقة الكوارث الحقيقية، تقوم بتشغيل آلاف المحاكاة في جهاز كمبيوتر.

  • التشبيه: تخيل مدربًا يشاهد ساعات من تسجيلات المباريات. يستخدم المدرب قاعدة بسيطة (مثل المزاد) ليرى من كان ينبغي له أن يفعل ماذا. "الروبوت (أ) لديه بطارية ممتلئة، لذا يجب أن يتولى هو المهام الشاقة".
  • السحر: يقوم النظام بتسجيل كل هذه القرارات. ثم يستخدم تقنية تسمى الانحدار المرجح بالميزة (Advantage-Weighted Regression - AWR). هذا يشبه قول المدرب: "انظروا إلى كل المرات التي فزنا فيها. دعونا نحفظ بالضبط ما فعله الفريق الفائز، وننسى المرات التي خسرنا فيها". هذا يمنح الروبوتات استراتيجية أساسية قوية دون الحاجة إلى ارتكاب أخطاء خطيرة في العالم الحقيقي أولاً.

2. مرحلة "يوم المباراة" (التعلم المتصل - Online Learning)
الآن، الروبوتات في العالم الحقيقي. يستخدمون الاستراتيجية التي تعلموها في التدريب، لكنهم لا يتوقفون عند هذا الحد.

  • التشبيه: هذا يشبه فريق كرة قدم يلعب مباراة حقيقية. يبدأون بخطة المدرب، ولكن مع استمرار المباراة، يتكيفون. إذا تغيرت اتجاهات الرياح، أو تعب أحد اللاعبين، فإنهم يعدلون تشكيلهم فورًا.
  • السحر: تستخدم الروبوتات تقنية PPO متعددة الوكلاء (MAPPO). تتيح لها هذه التقنية التحدث مع بعضها البعض (لفترة وجيزة جدًا) لتقول: "مهلاً، بطاريتي منخفضة، تولَّ أنت المهمة التالية"، أو "أنا سريعة الآن، أعطني تلك المهمة". إنهم يتعلمون في الوقت الفعلي، ويصبحون أفضل في موازنة العمل مع تقدم المهمة.

نظام "المزاد"

كيف يقررون من يقوم بما؟ يستخدمون مزادًا رقميًا.

  • في كل مرة تظهر فيها مهمة (مثل "مسح هذه المنطقة")، يقدم كل روبوت عرضًا سريًا حول مدى "تكلفة" القيام بها بالنسبة له.
  • "التكلفة" ليست مالًا؛ بل هي عمر البطارية، وحجم العمل الحالي، والسرعة.
  • الروبوت صاحب "التكلفة" الأقل (الذي يمتلك طاقة ووقت فراغ أكثر) يفوز بالمزاد ويتولى المهمة.
  • قوة COHORT الخارقة: على عكس الأنظمة القديمة التي تنظر فقط إلى اللحظة الحالية، يتعلم COHORT التنبؤ بـ المستقبل. قد يقول: "لدي طاقة الآن، ولكن إذا أخذت هذه المهمة، فسأكون متعبًا جدًا للمهمة التالية. سأترك الروبوت (ب) يتولاها".

النتائج: لماذا يهم هذا؟

اختبر الباحثون هذا النظام على ثلاثة روبوتات مختلفة تمامًا:

  1. Husky: روبوت ضخم وقوي يعمل بالعجلات ويمتلك كمبيوتر قوي.
  2. Jackal: روبوت متوسط الحجم ورشيق.
  3. Spot: روبوت يشبه الكلب يمكنه تسلق السلالم ويمتلك كمبيوتر أصغر.

النتيجة:

  • عمر البطارية: وفر الفريق حوالي 15% أكثر من البطارية مقارنة بالطرق الأخرى. في مهمة إنقاذ، قد تعني هذه الـ 15% الإضافية الفرق بين العثور على ناجٍ أو لا.
  • السرعة: كانوا أفضل بنسبة 51% في استخدام شرائح الكمبيوتر الخاصة بهم (GPUs)، مما يعني أنهم لم يهدروا الطاقة في الانتظار دون عمل.
  • الموثوقية: حققوا أهداف السرعة والتوقيت بواقع 2.5 مرة أكثر من الطرق الأخرى.

الخلا الخلاصة

COHORT يشبه منح فريق من روبوتات الإنقاذ دماغًا مشتركًا يعرف تمامًا كيفية تقاسم عبء العمل. إنه يضمن أن الروبوتات القوية تساعد الضعيفة، والروبوتات السريعة تساعد البطيئة، وألا ينفد وقود أي منها قبل انتهاء المهمة. إنه يحول مجموعة من الروبوتات الفردية إلى فريق تعاوني حقًا، صامد، وقادر على التعامل مع الفوضى في عالم الكوارث الحقيقي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →