← أحدث الأبحاث
🤖 machine learning

Accelerating Visual Policy Learning with Sampling-Based Model Predictive Control

تقترح هذه الورقة البحثية "البحث عن السياسة الموجه بالعينات" (SGPS)، وهو إطار عمل يجمع بين التحكم التنبئي بالنموذج القائم على أخذ العينات وتحسين السياسة من الدرجة الأولى لتدريب السياسات البصرية بكفاءة لمهام الحركة والتلاعب المعقدة للروبوتات، محققاً انتقالاً صفري الاستباق إلى الأجهزة الواقعية.

المؤلفون الأصليون: Yilang Liu, Haoxiang You, Qian Wang, Daniel Rakita, Ian Abraham

نُشر 2026-09-18
📖 7 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Yilang Liu, Haoxiang You, Qian Wang, Daniel Rakita, Ian Abraham

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لم تعد الروبوتات التي يمكنها السير فوق الأراضي الوعرة، أو دفع الأشياء الثقيلة، أو التنقل في الغرف المزدحمة مجرد خيال علمي، ولكن تعليمها القيام بذلك يمثل تحديًا هائلًا. لكي تتحرك الآلة بفعالية، يجب عليها تنسيق أطرافها باستمرار مع العالم المادي، وتحديد متى وأين تضع قدمًا أو يدًا بالضبط. تقليديًا، حاول المهندسون حل هذه المشكلة عن طريق برمجة كل حركة ممكنة يدويًا، وهي عملية مضنية غالبًا ما تفشل عندما يواجه الروبوت شيئًا غير متوقع. مؤخرًا، لجأ العلماء إلى طريقة تسمى "التعلم المعزز"، حيث يتعلم الروبوت من خلال التجربة والخطأ، تمامًا مثل طفل يتعلم المشي. يحاول الروبوت القيام بحركة ما، ويرى ما إذا كان سيسقط أم سينجح، ثم يعدل قواعده الداخلية للقيام بشكل أفضل في المرة القادمة. ومع ذلك، فإن عملية التعلم هذه مكلفة للغاية؛ فهي تتطلب كميات هائلة من قوة الكمبيوتر والوقت، خاصة عندما يتعين على الروبوت تعلم رؤية عالمه من خلال الكاميرات بدلاً من الاعتماد فقط على المستشعرات الداخلية. يجب أن يتعلم الروبوت ترجمة ما يراه إلى أفعال مادية، وهي مهمة غالبًا ما تؤدي إلى حركات غير مقصودة وخرقاء إذا لم يتم توجيه التدريب بعناية.

قام فريق من الباحثين في جامعة ييل وجامعة سيدني بتطوير نهج جديد لحل هذه المشكلة، مما يسمح للروبوتات بتعلم السلوكيات البصرية المعقدة بشكل أسرع وأكثر موثوقية من ذي قبل. لقد ابتكروا نظامًا يسمونه "البحث عن السياسة الموجه بالعينات" (Sampling-Guided Policy Search). وبدلاً من ترك الروبوت يتخبط عشوائيًا عبر ملايين المحاولات، يستخدم هذا النظام أداة تخطيط ذكية لإنشاء مسودة أولية للحركة الصحيحة أولاً. فكر في أداة التخطيط هذه كمدرب يجري محاكاة سريعة في ذهنه لتحديد تسلسل الخطوات الأفضل لمهمة معينة، مثل تخطي حاجز أو دفع صندوق. ثم يستخدم الروبوت هذه المسودة كنقطة انطلاق. وقد وجد الباحثون أنه من خلال الجمع بين هذا التوجيه الأولي وطريقة تسمح للروبوت بالتعلم مباشرة من صور الكاميرا، استطاعوا تدريب روبوتات عالية القدرة في جزء ضئيل من الوقت الذي يتطلبه الأمر عادةً.

يكمن جوهر اكتشافهم في كيفية تعاملهم مع عملية التعلم. في العديد من المحاولات السابقة، قام الباحثون بتدريب الروبوت باستخدام بيانات داخلية مثالية عن جسمه وبيئته، ثم حاولوا تعليم نسخة ثانية من الروبوت التعلم فقط مما تراه الكاميرا. كانت هذه العملية المكونة من خطوتين بطيئة وغالبًا ما نتج عنها روبوت لا يستطيع التعامل مع العيوب في العالم الحقيقي. الطريقة الجديدة تتخطى هذه الوساطة؛ فهي تدرب الروبوت على التعلم مباشرة من صور العمق — وهي بيانات بصرية توضح مدى بعد الأشياء — بينما تستخدم أداة التخطيط في الوقت نفسه لتنقيح أهداف الروبوت. يعمل النظام في دورة: حيث يولد حركة مستهدفة، ويترك الروبوت يحاول اتباعها، ثم يستخدم أداة التخطيط لتصحيح الهدف إذا انحرف الروبوت قليلاً عن المسار. يضمن هذا الذهاب والإياب المستمر أن الروبوت لا يتعلم فقط محاكاة مسار مثالي، بل يتعلم أيضًا كيفية التعافي من الأخطاء والتكيف مع التغيرات في التضاريس أو وزن الأشياء التي يحملها.

اختبر الباحثون هذا النظام على نوعين مختلفين من الروبوتات: روبوت رباعي الأرجل يشبه الكلب، وروبوت بشري ثنائي الأرجل. في عمليات المحاكاة، تعلم الروبوت رباعي الأرجل الجري بخطوات سريعة (trot) عبر أرض مسطحة، والزحف تحت عارضة منخفضة، والقفز فوق حاجز. أما الروبوت البشري فقد تعلم دفع صندوق ثقيل عبر الأرض وحمل صندوق أثناء الجري. وما جعل هذه النتائج مثيرة للإعجاب بشكل خاص هو أن الروبوتات تعلمت هذه المهارات باستخدام بطاقة رسومات واحدة فقط، وهي قطعة من أجهزة الكمبيوتر القياسية الموجودة في العديد من أجهزة الكمبيوتر المخصة للألعاب. في الماضي، كان تدريب مثل هذه السلوكيات المعقدة يتطلب أجهزة كمبيوتر فائقة ضخمة أو أسابيع من المحاكاة المستمرة. هنا، تعلم النظام أداء هذه المهام في غضون ساعات. كما أظهر الباحثون أن أداة التخطيط لم تكتفِ بمجرد توفير نقطة انطلاق، بل ساهمت بنشاط في تحسين عملية التعلم طوال فترة التدريب، مما ساعد الروبوت على اكتشاف طرق أكثر كفاءة للحركة وتجنب الوقوع في عادات سيئة.

لإثبات أن هذه الطريقة تعمل في العالم الحقيقي، قام الباحثون بأخذ البرنامج المدرب وتثبيته على روبوت مادي رباعي الأرجل دون إجراء أي تعديلات إضافية. يُعرف هذا باسم "النقل الصفري" (zero-shot transfer)، مما يعني أن الروبوت لم يرَ العالم الحقيقي من قبل، ومع ذلك استطاع فورًا أداء المهام التي تعلمها في المحاكاة. نجح الروبوت في الجري بخطوات سريعة عبر غرفة، والزحف تحت حاجز، والتسلق فوق صندوق، كل ذلك أثناء استخدام كاميرته الموجودة على متنه فقط لرؤية طريقه. لم يكن بحاجة إلى مستشعرات خارجية، أو كاميرات التقاط الحركة، أو توجيه بشري للتنقل. اتخذ الروبوت قراراته الخاصة بشأن متى يخفض جسمه للزحف أو متى يرفع أرجله للقفز، مستجيبًا على الفور للعقبات التي أمامه. وقد أثبت هذا أن عملية التعلم قد خلقت فهمًا قويًا للحركة يمكن أن يصمد أمام الطبيعة الفوضوية وغير المتوقعة للعالم الحقيقي.

كما سلطت الدراسة الضوء على سبب فشل الطرق السابقة. فعندما حاول الباحثون تدريب روبوت بدون توجيه أداة التخطيط، كان الروبوت غالبًا ما يطور حركات غريبة وغير منسقة. على سبيل المثال، عندما يُطلب منه الجري بخطوات سريعة، قد يقوم الروبوت المدرب بدون هذا التوجيه بسحب قدميه بطريقة لا تشبه المشية السليمة على الإطلاق. عملت أداة التخطيط كمثبت، مما ضمن أن الروبوت يتعلم الإيقاع والتنسيق الصحيحين منذ البداية. كان هذا مهمًا بشكل خاص للمهام التي تتضمن اتصالًا مع البيئة، مثل دفع جسم ثقيل. فبدون التوجيه، قد يدفع الروبوت في الاتجاه الخاطه أو يفقد توازنه. ومع التوجيه، تعلم تنسيق جسمه وأذرعه لتحريك الجسم بسلاسة وكفاءة.

أحد الجوانतम الأكثر أهمية في هذا العمل هو كيفية تعامله مع المعلومات البصرية. غالبًا ما تواجه الروبوتات صعوبة في التعلم من صور الكاميرا لأن عملية تحويل صورة إلى أمر مادي صعبة رياضيًا. حل الباحثون ذلك من خلال فصل المعالجة البصرية عن الحسابات الفيزيائية. سمح هذا للروبوت بالتعلم من الصور دون أن يغرق في الرياضيات المعقدة لكيفية عمل الكاميرا. بدلاً من ذلك، ركز على تعلم العلاقة بين ما يراه وكيف يجب أن يتحرك. جعل هذا الفصل عملية التدريب أسرع وأكثر استقرارًا، مما سمح للروبوت بتعلم مهارات معقدة مثل حمل صندوق أثناء الجري دون السقوط.

استكشف الباحثون أيضًا كيفية دمج مهارات مختلفة في روبوت واحد. فقد قاموا بتدريب خبراء منفصلين للجري بخطوات سريعة، والزحف، والقفز، ثم علموا روبوتًا واحدًا كيفية التبديل بين هذه السلوكيات من تلقاء نفسه. فعندما يرى الروبوت عارضة منخفضة، يعرف أنه يجب أن يزحف. وعندما يرى حاجزًا، يعرف أنه يجب أن يقفز. لم يكن بحاجة إلى إنسان ليخبره أي وضع يستخدم؛ بل كان ينظر ببساطة إلى العالم ويختار الإجراء المناسب. هذه القدرة على دمج سلوكيات مختلفة في نظام واحد مرن هي خطوة كبيرة للأمام في مجال الروبوتات. وهذا يعني أن الروبوتات يمكن أن تتنقل في بيئات معقدة، من الأرض المسطحة إلى العقبات وما بعدها، دون الحاجة إلى برنامج جديد لكل موقف جديد.

يوحي نجاح هذه الطريقة بمسار جديد لمستقبل الروبوتات. فمن خلال استخدام أداة تخطيط لتوجيه عملية التعلم، يمكن للباحثين تعليم الروبوتات أداء مهام مادية معقدة بشكل أسرع من ذي قبل. يقلل هذا النهج من الحاجة إلى كميات هائلة من قوة الحوسبة ويسمح للروبوتات بالتعلم مباشرة مما تراه. وبينما أجريت التجارب الحالية في المحاكاة وعلى روبوت مادي واحد، فإن النتائج تشير إلى أنه يمكن توسيع نطاق هذه الطريقة لتعليم الروبوتات مهام أكثر صعوبة، مثل التعامل مع الأدوات أو التنقل في الأماكن المزدحمة. المفتاح هو أن التعلم ليس مجرد بحث أعمى عن الإجابة الصحيحة؛ بل يمكن أن يكون رحلة موجهة حيث يساعد المخطط الذكي الروبوت في إيجاد طريقه.

في النهاية، يوضح هذا العمل أن الفجوة بين المحاكاة والواقع يمكن جسرها بشكل أكثر فعالية مما كان يعتقد سابقًا. لم تتعلم الروبوتات مجرد محاكاة مسار مثالي؛ بل تعلمت التكيف، والتعافي، واتخاذ القرارات بناءً على ما تراه. الروبوت رباعي الأرجل، الذي كان مجرد نموذج في المحاكاة، أصبح آلة حقيقية قادرة على الحركة المستقلة في مساحة مادية. لقد زحف، وجرى، وقفز بمرونة تشير إلى فهم عميق لجسمه وللعالم من حوله. هذا ليس مجرد إنجاز تقني؛ بل هو خطوة نحو مستقبل يمكن للروبوتات فيه التحرك بحرية وأمان بجانب البشر، والقيام بمهام تتطلب القوة والبراعة معًا. لقد أظهر الباحثون أنه مع التوجيه الصحيح، يمكن للآلات أن تتعلم التحرك بنفس النعمة والقدرة على التكيف التي نعتبرها من المسلمات في العالم الطبيعي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →