← أحدث الأبحاث
💻 computer science

D-VLC: Decentralized Vision-Language Collaboration for Heterogeneous Embodied Multi-Robot Systems in Unknown Environments

تقترح الورقة البحثية إطار عمل D-VLC، وهو إطار عمل لامركزي يستفيد من نماذج الرؤية واللغة لتمكين أسراب الروبوتات غير المتجانسة من تنفيذ مهام معقدة بشكل تعاوني في بيئات غير معروفة دون الاعتماد على خرائط محددة مسبقاً، أو تحكم مركزي، أو تدريب خاص بمهمة معينة، محققةً معدلات نجاح عالية وتقليلاً كبيراً في أوقات الإنجاز.

المؤلفون الأصليون: Yuan Zhou, Ruitong Lin, Shen Wang, Weiqi Gai, Mo zhu, Xin Zhou, Yuze Wu, Fei Gao

نُشر 2026-08-03
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yuan Zhou, Ruitong Lin, Shen Wang, Weiqi Gai, Mo zhu, Xin Zhou, Yuze Wu, Fei Gao

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل عالماً حيث يتم إنزال مجموعة من الروبوتات في منزل جديد وفوضوي لم يروه من قبل. يعطيها مديرهم البشري أمراً غامضاً ومحيراً مثل: "ابحث عن الساعة القديمة والمرآب، ولكن كن حذراً!". في الماضي، كان جعل فريق من الروبوتات المختلفة يعمل معاً في مهمة كهذه يشبه محاولة قيادة أوركسترا حيث يتحدث كل موسيقي لغة مختلفة ويمتلك نوتة موسيقية مختلفة. كانوا بحاجة إلى نص صارم مكتوب مسبقاً (خطة "قائمة على القواعد") تخبرهم بالضبط بما يجب فعله، مما يعني أنهم لم يستطيعوا التعامل مع المفاجآت أو التعليمات الجديدة بشكل جيد.

لحل هذه المشكلة، بدأ العلماء في استخدام "أدمغة كبيرة" للروبوتات. أولاً، أعطوهم "نماذج لغوية كبيرة" (LLMs)، وهي تشبه قارئات النصوص فائقة الذكاء التي يمكنها فهم الجمل المعقدة وتقسيم المهام الكبيرة إلى خطوات أصغر. ثم أضافوا إليها "نماذج رؤية ولغة" (VLMs)، وهي تشبه قارئات النصوص تلك ولكن مع عيون؛ حيث يمكن لهذه النماذج النظر إلى صورة، وفهم ما تراه (مثل "هذا باب" أو "هذا كوب أحمر") وربط ذلك بالكلمات التي تسمعها. السؤال الكبير الذي يطرحه الباحثون هو: هل يمكننا منح فريق من الروبوتات المختلفة هذه "العيون والأدمغة" لكي يتمكنوا من اكتشاف الأمور والتعامل معها فورياً، دون الحاجة إلى خريطة مكتوبة مسبقاً أو مدير مركزي يملي عليهم كل حركة؟

هذا هو بالضبط ما يستكشفه بحث "D-VLC" (التعاون اللامركزي للرؤية واللغة). فقد بنى الباحثون نظاماً حيث يعمل فريق من الروبوتات المختلفة - وتحديداً طائرتان بدون طيار (درونز) وروبوت أرضي مزود بأذرع - معاً في بيئات غير معروفة باستخدام هذه النماذج الذكية للذكاء الاصطناعي. وبدلاً من وجود كمبيوتر مركزي واحد يتخذ جميع القرارات (والذي قد يصبح بطيئاً ومشوشاً)، يفكر كل روبوت لنفسه، ويشارك فقط المعلومات الأكثر أهمية، ويساعد زملائه عند الحاجة.

إليك كيف يحدث السحر: تخيل الروبوتات كأنها مجموعة من المستكشفين في كهف مظلم. بدلاً من الصراخ بقصص حياتهم الكاملة لبعضهم البعض، يتبادلون رسماً تخطيطياً صغيراً ومبسطاً للكهف الذي رأوه حتى الآن ("خريطة مصغرة"). إذا رأت طائرة بدون طيار باباً لا تستطيع فتحه، فهي لا تتوقف فحسب؛ بل تسأل الروبوت الأرضي: "مهلاً، هل يمكنك فتح هذا؟". فيجيب الروبوت الأرضي: "بالتأكيد"، ويقوم بذلك. ثم تنطلق الطائرة بدون طيار بسرعة للبحث عن الدليل التالي. يفعلون ذلك دون انتظار اجتماع جماعي؛ فهم يستمرون في الحركة والتفكير ومساعدة بعضهم البعض بشكل غير متزامن.

أظهر البحث أن هذا النهج فعال للغاية في عمليات المحاكاة. فعند اختباره في سيناريوهات معقدة مثل حطام ما بعد الكوارث، ومستشفى، ومنزل، نجح فريق الروبوتات في العثور على أهدافهم أكثر من 70% من المرات، بغض النظر عن نموذج الذكاء الاصطناعي "الدماغي الكبير" المحدد الذي استخدموه. والأفضل من ذلك، أنهم أنهوا مهامهم بشكل أسرع بكثير من فريق الروبوتات الذي يتحرك بعشوائية نحو أقرب مساحة فارغة (نهج "الجشع الهندسي"). في الواقع، كان الإعداد الأكثر ذكاءً أسرع بنسبة 55.8%.

وجد الباحثون أن هذه الطريقة رائعة لأنها لا تتطلب إعادة تدريب لكل روبوت جديد أو كل غرفة جديدة. يمكن للروبوتات فهم التعليمات، والنظر إلى ما حولها، وتحديد من يجب أن يفعل ماذا بناءً على قدراتها الخاصة. وبينما تم اختبار هذا في محاكاة حاسوبية وليس على روبوتات حقيقية في الواقع بعد، فإن النتائج تشير إلى أن منح الروبوتات هذا النوع من "المنطق السليم" التعاوني واللامركزي يمكن أن يكون المفتاح للسماح لها بمعالجة الوظائف المعقدة في العالم الحقيقي معاً دون الحاجة إلى إنسان يدير كل خطوة بدقة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →