← أحدث الأبحاث
💻 computer science

M3^3P-R1: Reinforcement Learning for Large Language Model Guided Multi-Modal Motion Planning via MIP Code Generation

تقترح الورقة البحثية M3^3P-R1، وهو إطار عمل للتعلم المعزز يعمل على ضبط النماذج اللغوية الكبيرة لإنتاج كود البرمجة الخطية المختلطة (MIP) القابل للتنفيذ لحل مهام تخطيط الحركة متعددة الأنماط المعقدة بمتانة من خلال تفكيكها إلى متغيرات وقيود وأهداف قابلة للحل.

المؤلفون الأصليون: Xingpeng Sun, Zherong Pan, Kai Cheng, Xindi Tang, Syed Talha Bukhari, Aniket Bera

نُشر 2026-09-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xingpeng Sun, Zherong Pan, Kai Cheng, Xindi Tang, Syed Talha Bukhari, Aniket Bera

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لطالما عانت الروبوتات من الفجوة بين الأمر البسيط والواقع المعقد للتحرك عبر العالم. فعندما يطلب إنسان من آلة أن "تلتقط ذلك الكوب"، يبدو الطلب مباشرًا، ولكن بالنسبة للروبوت، فإنه لغز من المتغيرات اللانهائية. يجب على الآلة أن تقرر كيف تحرك أرجلها لتقترب، وكيف تثني ذراعها دون الاصطدام بطاولة، وأين تضع أصابعها بالضبط لتمسك بالشيء دون أن تسقطه. وتحدث هذه القرارات بلغتين مختلفتين: المنطق المنفصل والخطوات المتتالية لـ "اذهب إلى هنا، ثم افعل هذا"، والفيزياء المستمرة والانسيابية لـ "تحرك بسلاسة عبر الفضاء". لعقود من الزمن، حاول المهندسون بناء أنظمة يمكنها التحدث بكلتا اللغتين في آن واحد، لكن الرياضيات المطلوبة لحل هذه المشكلات في وقت واحد غالبًا ما تكون ثقيلة جدًا على قدرة الحاسوب على معالجتها في الوقت الفعلي، أو جامدة للغاية بحيث لا تستطيع التكيف مع المواقف الجديدة.

لقد اتخذ فريق من الباحثين في جامعة بوردو نهجًا مختلفًا، متجاوزين الحاجة إلى كتابة البشر لقواعد رياضية معقدة لكل سيناريو محتمل. وبدلاً من ذلك، علموا نموذج لغة كبير — وهو نوع من الذكاء الاصطناعي المعروف بقدرته على فهم المحادثة البشرية — ليعمل كمترجم يحول التعليمات باللغة الطبيعية مباشرة إلى خطة رياضية صارمة. وقد أطلقوا على نظامهم اسم M3P-R1. وبدلاً من ترك الذكاء الاصطناعي يخمن الإجابة أو يصف مسارًا فحسب، يجبر النظام الذكاء الاصطناعي على كتابة كود برمجي قابل للتنفيذ يعمل كمجموعة من التعليمات لمحلل رياضي متخصص. يقوم هذا المحلل بعد ذلك بالتحقق من الخطة مقابل قوانين الفيزياء والهندسة لضمان أنها ممكنة بالفعل قبل أن يحرك الروبوت أي عضلة.

بدأ الباحثون بإنشاء مكتبة ضخمة من مسائل التدريب، تغطي كل شيء بدءًا من ذراع روبوت واحدة تصل إلى جسم ما، وصولًا إلى طائرات بدون طيار متعددة تطير في تشكيل مع تجنب العوائق. لقد علموا الذكاء الاصطناعي كيفية تفكيك هذه المهام المعقدة إلى قطع أصغر وأسهل في الإدارة، تمامًا كما يفعل مهندس بشري، ولكن مع اختلاف جوهري: كان على الذكاء الاصطناعي كتابة الكود الذي يحدد قواعد اللعبة. فإذا كانت المهمة هي طيران طائرة بدون طيار حول مبنى ثم الهبوط على منصة متحركة، كان على الذكاء الاصطناعي توليد القيود الرياضية المحددة التي تضمن بقاء الطائرة ضمن مناطق آمنة ووصولها إلى المنصة في الوقت المناسب. تم تدريب النظام باستخدام طريقة كان فيها الحاسوب نفسه يعمل كمعلم. ففي كل مرة يكتب فيها الذكاء الاصطناعي قطعة من الكود، يحاول المحلل الرياضي تشغيلها. وإذا كان الكود معطلًا أو كانت الخطة مستحيلة، يتلقى النظام إشارة واضحة للمحاولة مرة أخرى. وعبر آلاف المحاولات، تعلم الذكاء الاصطناعي ليس فقط التحدث بلغة الروبوتات، بل وأيضًا بناء الهياكل الرياضية الدقيقة اللازمة لجعل الروبوتات تتحرك.

كانت نتائج هذا التدريب مذهلة. فعند اختبار النظام على مجموعة واسعة من المهام، نجح في حل المسائل أحادية النمط، مثل مشي الروبوت أو طيران الطائرة بدون طيار، بنسبة تقارب 92 بالمائة. وعندما أصبحت المهام أكثر تعقيدًا، تتطلب من الروبوت المشي ثم الإمساك بجسم ما، أو تنسيق مسارات طائرتين بدون طيار، ظلت نسبة النجاح مرتفعة عند حوالي 81 بالمائة. ويمثل هذا تحسنًا كبيرًا عن الطرق السابقة التي اعتمدت على مجرد تخمين الذكاء الاصطناعي للمسار الأفضل بناءً على بيانات التدريب الخاصة به، والتي نجحت في أقل من نصف الحالات في المهام المعقدة. وقد تحقق الباحثون من هذه النتائج ليس فقط في عمليات المحاكاة الحاسوبية، بل عن طريق إرسال الخطط إلى أجهزة حقيقية. فقد اختبروا النظام على ذراع روبوت مادية وطائرات بدون طيار حقيقية، حيث حقق معدل نجاح بلغ 87.5 بالمائة. وكانت حالات الفشل القليلة التي حدثت ناتجة في الغالب عن الاختلاف بين العالم الرقمي النظيف في المحاكاة والواقع الفوضوي للعالم المادي، مثل عدم الدقة الطفيفة في كيفية إدراك مستشعرات الروبوت لشكل الجسم.

وما يجعل هذا العمل متميزًا هو كيفية تعامله مع عدم اليقين في العالم الحقيقي. فالأنظمة القديمة كانت تعتمد غالبًا على البشر لبرمجة القواعد مسبقًا لكل موقف محدد، أو استخدمت نهج "التجربة والخطأ" الذي قد يؤدي إلى اصطدامات أو طرق مسدودة. أما هذه الطريقة الجديدة فتجبر الذكاء الاصطناعي على التفكير في المشكلة بأكملها رياضيًا قبل التنفيذ، مما يضمن أن الخطة صالحة من البداية إلى النهاية. ووجد الباحثون أن الذكاء الاصطناعي تعلم إنشاء هذه الخطط من خلال دمج وحدات بناء بسيطة رآها أثناء التدريب، بدلاً من مجرد حفظ إجابات محددة. وقد سمح هذا له بالتعامل مع تركيبات جديدة من المهام لم يسبق له رؤيتها من قبل، مثل ذراع روبوت مثبتة على طائرة بدون طيار، بدرجة عالية من الموثوقية. وتشير الدراسة إلى أنه من خلال ترسيخ الذكاء الاصطناعي في أدوات رياضية قابلة للتحقق، يمكننا الانتقال إلى ما وراء التفاعلات البسيطة بين الأمر والاستجابة إلى مستقبل يمكن فيه للروبوتات فهم تعليمات معقدة ومتعددة الخطوات وتنفيذها بدقة الخبير البشري، مع التنقل في جميع حالات التحديات غير المتوقعة في العالم المادي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →