← أحدث الأبحاث
💻 computer science

LaGEA: Language Guided Embodied Agents for Robotic Manipulation

إن LaGEA هو إطار عمل يستفيد من التغذية الراجعة اللغوية المهيكلة والمؤطرة زمنياً من نماذج الرؤية واللغة لتوليد مكافآت تشكيل تكيفية، مما يمكن الوكلاء الروبوتيين من التأمل الذاتي بفعالية في أخطائهم والتفوق بشكل كبير على الأساليب المتطورة في مهام المعاللة.

المؤلفون الأصليون: Abdul Monaf Chowdhury, Akm Moshiur Rahman Mazumder, Safaeid Hossain Arib, Rabeya Akter

نُشر 2026-08-25
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Abdul Monaf Chowdhury, Akm Moshiur Rahman Mazumder, Safaeid Hossain Arib, Rabeya Akter

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لطالما كانت الروبوتات بارعة في التكرار، حيث تمتلك القدرة على أداء نفس الحركة الدقيقة آلاف المرات دون خطأ. ومع ذلك، عندما تواجه موقفًا جديدًا أو خطأً لم تره من قبل، فإنها غالبًا ما تتعثر، عاجزة عن فهم سبب فشلها أو كيفية تصحيح مسارها. لعقود من الزمن، تطلب تعليم الروبوت التعلم من أخطائه من المهندسين كتابة قواعد معقدة يدويًا لكل سيناريو محتمل، وهي عملية مضنية وهشة. وقد بدأ مجال الروبوتات مؤخرًا في تسخير "نماذج التأسيس" (foundation models)، وهي أنظمة حاسوبية قوية مدربة على كميات هائلة من النصوص والصور التي يمكنها فهم اللغة الطبيعية والمشاهد البصرية. وبينما يمكن لهذه الأنظمة وصف ما يفعله الروبوت أو اقتراح هدف ما، إلا أنها لم توفر بعد وسيلة موثوقة للروبوت لاستخدام تلك اللغة لتشخيص إخفاقاته وتعديل سلوكه في الوقت الفعلي. والسؤال المركزي الذي يحرك هذا البحث الجديد هو ما إذا كان بإمكان المرء ببساطة إخبار الروبوت، بلغة إنجليزية بسيطة، بما حدث من خطأ، ومن ثم استخدام ذلك التفسير ليعلم نفسه كيف يؤدي بشكل أفضل في المرة القادمة.

لقد طور فريق من الباحثين إطار عمل جديدًا يسمى LAGEA، وهو اختصار لـ "الوكلاء المتجسدين الموجهين باللغة" (Language Guided Embodied Agents)، للإجابة على هذا السؤال. وبدلاً من الاعتماد على المهندسين لكتابة مكافآت يدوية لكل نجاح أو فشل، يستخدم النظام نموذجًا لغويًا بصريًا لمراقبة محاولة الروبوت لأداء مهمة ما، مثل فتح باب أو دفع جسم، ثم توليد ملخص مهيكل باللغة الطبيعية لما حدث. وإذا فشل الروبوت، فلا يكتفي النظام بتصنيف المحاولة كخسارة فحسب؛ بل يحلل الفيديو الخاص بالمحاولة، ويحدد اللحظة المحددة التي وقع فيها الخطأ، ويكتب تفسيرًا موجزًا، مثل "اقترب الملقط من زاوية خاطئة" أو "لم تكن القبضة محكمة بما يكفي". ثم يتم تحويل هذا التفسير إلى إشارة توجه عملية تعلم الروبوت، مما يخبر الروبوت فعليًا ليس فقط بأنه فشل، بل لماذا وكيف يصلح ذلك بالضبط.

اختبر الباحثون هذا النهج في سلسلة من البيئات المحاكية حيث تعين على الروبوتات أداء مهام تلاعب مختلفة، تتراوح من الضغط على الأزرار إلى تحريك الأشياء عبر الطاولة. وفي هذه المحاكاة، مُنحت الروبوتات مكافآت متفرقة، مما يعني أنها لا تتلقى سوى إشارة واضحة للنجاح أو الفشل في نهاية المحاولة، دون أي توجيه في المنتصف. وبدون التوجيه اللغوي، عانت الروبوتات في التعلم، وغالبًا ما كانت تتخبط بلا هدف أو تكرر نفس الأخطاء. ومع ذلك، عندما تم تجهيزها بنظام LAGEA، بدأت الروبوتات تتعلم بشكل أسرع بكثير. عمل النظام من خلال تقسيم محاولة الروبوت إلى لحظات رئيسية، وطلب من النموذج اللغوي نقد تلك اللحظات المحددة، ثم ترجمة ذلك النقد إلى تدفق كثيف من التغذية الراجعة التي وجهت خطوات الروبوت التالية. وقد سمح هذا للروبوت بفهم الرابط السببي بين إجراء معين ونتيجة سلبية، محولًا الفشل الغامض إلى درس ملموس.

كانت نتائج هذه المحاكاة مذهلة. ففي مجموعة قياسية من عشر مهام روبوتية، حققت الروبوتات التي استخدمت LAGEA معدل نجاح أعلى بنسبة 9.0 بالمائة من أفضل الطرق الموجودة عندما كانت الأهداف عشوائية، و5.3 بالمائة أعلى عندما كانت الأهداف ثابتة. وفي مجموعة منفصلة من المهام التي تتضمن ذراعًا روبوتية مصممة لجلب الأشياء، كان التحسن أكثر وضوحًا، مع زيادة قدرها 17 بالمائة في معدلات النجاح مقارنة بالأسالهم المتقدمة السابقة. وفضلاً عن مجرد الفوز بشكل أكثر تكرارًا، تعلمت الروبوتات بشكل أسرع بكثير، ووصلت إلى مستويات عالية من الكفاءة في عدد أقل من المحاولات. ووجد الباحثون أن التغذية الراجعة اللغوية كانت أكثر فعالية عندما كانت مهيكلة ومرتبطة بلحظات زمنية محددة، بدلاً من كونها تعليقًا عامًا على المحاولة بأكملها. ومن خلال تركيز التغذية الراجعة على الإطارات (frames) الدقيقة التي اتُخذ فيها القرار، ساعد النظام الروبوت على تحديد الخطأ بدقة، متجنبًا الارتباك الذي يأتي غالبًا من التعليمات الغامضة أو الواسعة للغاية.

ومن الأهمية بمكان أن الدراسة أظهرت أن هذا الأسلوب يتسم بالمتانة تجاه التغييرات في كيفية رؤية الروبوت للعالم. فقد درب الباحثون الروبوتات باستخدام زاوية كاميرا محددة ثم اختبروها من وجهات نظر مختلفة تمامًا، مثل النظر مباشرة من الأعلى أو من الخلف. وحتى بدون رؤية المهمة من نفس المنظور الذي تدربت عليه، حافظت الروبوتات على معدلات نجاح عالية، مما يشير إلى أن الاستدلال القائم على اللغة ساعدها على فهم المنطق الأساسي للمهمة بدلاً من مجرد حفظ الأنماط البصرية. كما أثبت النظام أن جودة التغذية الراجعة كانت مهمة؛ فعندما سمح الباحثون للنموذج اللغوي بكتابة نص حر وغير مهيكل، تعلمت الروبوتات بشكل أقل فعالية. وكان التنسيق المهيكل، الذي أجبر النموذج على تحديد رموز أخطاء محددة وتقديم مبررات واضحة، ضروريًا لنجاح عملية التعلم.

وعلى الرغم من أن الدراسة أُجريت بالكامل في بيئة محاكاة، إلا أن النتائج تقدم مسارًا واعدًا للمستقبل في عالم الروبوتات الحقيقي. ويقر الباحثون بأن النماذج اللغوية المستخدمة قد تنتج أحيانًا أوصافًا غير صحيحة، وهو ما يُعرف بـ "الهلوسة"، لكن نهجهم المهيكل يساعد في التخفيف من هذه الأخطاء. ويقترحون أن الخطوة التالية هي نقل هذه الأنظمة من شاشة الكمبيوتر إلى الروبوتات الفيزيائية، لسد الفجوة بين التدريب الافتراضي والتطبيق في العالم الحقيقي. ومن خلال التعامل مع اللغة الطبيعية ليس فقط كوسيلة لإعطاء الأوامر، بل كأداة للتأمل الذاتي وتصحيح الأخطاء، يشير هذا العمل إلى مستقبل يمكن للروبوتات فيه التعلم من أخطائها بمستوى من التكيف كان بعيد المنال لفترة طويلة، مما قد يجعلها مساعدين أكثر فائدة في المنازل والمصانع والمختبرات.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →