← أحدث الأبحاث
🤖 machine learning

Runtime-Incremental Transformer for Reinforcement-Learning-Based Adaptive Control

تقدم هذه الورقة آلية "ترانسفورمر" (transformer) ذات زيادة تدريجية أثناء وقت التشغيل، تعمل على نمو وتقليص رؤوس الانتباه ديناميكيًا أثناء التعلم التعزيزي بناءً على القدرة التمثيلية للسياق وفائض الرؤوس، مما يقضي على الإخفاقات الكارثية في التحكم التكيفي طويل الأمد للمناولات الروبوتية ذات ذاكرة الاحتكاك غير المرئية، ويزيل الحاجة إلى الضبط المسبق المكلف للمعلمات الفائقة.

المؤلفون الأصليون: Giansalvo Cirrincione, Adriano Fagiolini

نُشر 2026-09-15
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Giansalvo Cirrincione, Adriano Fagiolini

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تعتمد الروبوتات التي تتحرك بدقة، مثل الأذرع المستخدمة في المصانع لتجميع السيارات أو التعامل مع المواد الحساسة، على رياضيات معقدة لمعرفة مقدار القوة التي يجب تطبيقها. لعقود من الزمن، استخدم المهندسون طريقة تسمى "التحكم بالتحكم في عزم الدوران المحسوب"، والتي تحسب قوة الدفع أو السحب الدقيقة اللازمة لتحريك مفصل إلى نقطة مرغوبة. يعمل هذا بشكل جيد عندما تكون حركة الروبوت قابلة للتنبؤ، لكن الآلات في العالم الحقيقي تواجه مشكلة خفية: الاحتكاك. وبينما يكون بعض الاحتكاك بسيطًا وثابتًا، فإن أنواعًا أخرى، مثل سلوك "الالتصاق والانزلاق" المعروف باسم احتكاك "سترايبك"، تعتمد على حالة داخلية خفية تتغير بمر over الوقت. ولأن مستشعرات الروبوت لا تستطيع رؤية هذه الحالة الخفية مباشرة، يفقد النظام قدرته على التنبؤ بسلوكه المستقبلي بناءً على موقعه الحالي فقط. ولحل هذه المشكلة، لجأ الباحثون إلى الذكاء الاصطناعي، وتحديدًا نوع من التعلم يسمى "التعلم المعزز"، حيث يتعلم برنامج الكمبيوتر من خلال التجربة والخطأ. ومع ذلك، غالبًا ما تستخدم هذه البرامج ميزة هيكلية محددة تسمى "آلية الانتباه"، والتي تعمل مثل كشاف الضوء، مما يسمح للذكاء الاصطناعي بالتركيز على أجزاء مختلفة من تاريخه القريب. وعادة ما يكون عدد هذه الكشافات، أو "الرؤوس"، ثابتًا قبل بدء التدريب، ويتم اختياره من خلال عملية بحث طويلة ومكلفة. فإذا كان العدد المختار صغيرًا جدًا، يفشل الروبوت في التعلم؛ وإذا كان كبيرًا جدًا، يصبح النظام غير فعال.

لقد سعى الباحثون وراء هذه الدراسة لإصلاح هذه الصلابة عبر إنشاء نظام يمكنه تغيير رأيه أثناء التعلم. فقد طوروا متحكمًا جديدًا لا يقرر عدد رؤوس الانتباه مسبقًا. بدلاً من ذلك، يراقب النظام أداءه الخاص أثناء عملية التدريب ويضيف رؤوسًا جديدة عندما يشعر بأنه مثقل بتعقيد المهمة، أو يزيلها عندما يدرك أن بعضها لا يفعل شيئًا. يحدث هذا في الوقت الفعلي، دون إيقاف عملية التعلم. يستخدم النظام إشارتين بسيطتين لاتخاذ هذه القرارات. أولاً، يقيس مقدار المعلومات الجديدة القادمة من تاريخ الروبوت؛ فإذا كانت المعلومات معقدة للغاية بحيث لا يستطيع العدد الحالي من الرؤوس التعامل معها، يقوم النظام بنمو رأس جديد. ثانيًا، يتحقق من مدى مساهمة كل رأس في القرار النهائي؛ فإذا كان الرأس لا يقوم بأي عمل يُذكر، يقوم النظام بإزالته بهدوء. ومن الأهمية بمكان أن الباحثين صمموا النظام بحيث لا تؤدي إضافة أو إزالة رأس إلى قفزة مفاجئة أو خطأ في سلوك الروبوت. فعند إضافة رأس جديد، يبدأ بتأثير صفري، مما يضمن بقاء حركة الروبوت سلسة. وعند إزالة رأس، يكون التغيير صغيرًا جدًا لدرجة أنه لا يعطل عملية التعلم.

اختبر الفريق هذا النهج على ذراع روبوتية محاكية ذات مفصلين تواجه مستويات مختلفة من ذاكرة الاحتكاك، تتراوح من التأخير قصير المدى إلى طويل المدى. وفي التجارب السابقة باستخدام أعداد ثابتة من الرؤوس، فشل النظام تمامًا في سيناريوهات الذاكرة الطويلة الأكثر صعوبة، مما تسبب غالبًا في فقدان الروبوت للسيطرة أو تجاهل الوزن الذي يحمله. ومع النظام الجديد القابل للتعديل أثناء التشغيل، نجح الروبوت في كل اختبار، حتى في الحالات الصعبة التي فشلت فيها الطريقة القديمة. ووجد الباحثون أن النظام لم يكتشف عددًا "طبيعيًا" محددًا من الرؤوس متأصلًا في المهمة؛ بل إنه وصل إلى الحد الأقصى لعدد الرؤوس في كل جولة من الحملة الرئيسية، ولم يتم تفعيل محفز التقليم لإزالة الرؤوس غير المستخدمة أبدًا. ومن المثير للاهتمام أن الفائدة لم تأتِ من الحجم النهائي للنظام، بل من الطريقة التي نما بها. فقد عملت عملية إضافة الرؤوس تدريجيًا كمنهج تدريبي، مما ساعد الروبوت على التعلم خطوة بخطوة بدلاً من إلقائه في مهمة معقدة دفعة واحدة. وهذا يشير إلى أن القدرة على تكييف البنية التحتية أثناء التعلم أكثر أهمية من امتلاك هيكل ضخم مسبق البناء. والنتيجة هي طريقة أكثر قوة وكفاءة لتعليم الروبوتات كيفية التعامل مع الاحتكاك الفوضوي وغير المتوقع في العالم الحقيقي، مما يلغي الحاجة إلى عمليات البحث المكلفة القائمة على التجربة والخطأ للعثور على الإعدادات الصحيحة قبل أن يتحرك الروبوت.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →