← أحدث الأبحاث
🤖 machine learning

VGFM: Expressive Robot Policies via Dense Value Guidance in Flow Matching

تقترح الورقة البحثية "مطابقة التدفق الموجه بالقيمة" (VGFM)، وهو إطار عمل قابل للتوسع للتعلم التعزيزي غير المتصل (offline reinforcement learning) يدمج التوجيه الكثيف القائم على القيمة في سياسات مطابقة التدفق التعبيرية للتحكم الروبوتي دون الحاجة إلى الانتشار العكسي عبر الزمن أو أعباء خوارزمية إضافية، محققاً أداءً قوياً عبر مهام متنوعة من الحركة والتلاعب.

المؤلفون الأصليون: Prajwal Koirala, Mark Campbell

نُشر 2026-09-15
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Prajwal Koirala, Mark Campbell

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لطالما كانت الروبوتات بارعة في المهام المتكررة والمتوقعة، لكن تعليمها كيفية التعامل مع التنوع الفوضوي وغير المتوقع للعالم الحقيقي ظل تحديًا مستعصيًا. لسنوات، حاول الباحثون حل ذلك عبر تغذية الروبوتات بمكتبات ضخمة من الحركات الماضية، آملين أن تتعلم الآلة محاكاة المهارة البشرية دون الحاجة أبدًا إلى التدرب في العالم الحقيقي. هذا النهج، المعروف باسم التعلم غير المتصل (offline learning)، يوفر مسارًا آمنًا وفعالًا للتدريب، لكنه يصطدم بحائط عندما يواجه الروبوت موقفًا يختلف قليلًا عن بيانات التدريب. عندها، يجب على الروبوت أن يقرر كيف يتصرف، وغالبًا ما يختار بين طرق عديدة مختلفة وصحيحة للتحرك، تمامًا مثل سائق عند تقاطع معقد يمكنه الانعطاف يسارًا، أو السير مستقيمًا، أو المناورة عبر حركة المرور. وتكافح الأساليب التقليدية لاستيعاب هذا التنوع الغني من الخيارات، مما يجبر الروبوت غالبًا على اتباع مسار واحد جامد يفشل عندما تتغير الظروف. ولتجاوز هذه القيود، يتجه العلماء نحو النماذج التوليدية، وهي نوع من الذكاء الاصطناعي القادر على تخيل طيف واسع من الإجراءات المحتملة بدلاً من إجراء واحد فقط.

تكمن الصعوبة الجوهرية في تعليم هذه النماذج الخيالية ألا تكون مبدعة فحسب، بل ذكية أيضًا. يحتاج الروبوت إلى معرفة أي من أفعاله المتخيلة سيؤدي بالفعل إلى النجاح. في الماضي، تطلب توجيه خيال الروبوت نحو نتيجة جيدة عملية ثقيلة حاسوبيًا حيث كان على الكمبيوتر تتبع كل خطوة من خطوات عملية تفكير الروبوت إلى الوراء لمعرفة أين أخطأ. كان هذا بطيئًا، وغير مستقر، وغالبًا ما جعل عملية التدريب معقدة للغاية بحيث يصعب توسيع نطاقها. وقد قدم باحثون في جامعة كورنيل الآن طريقة جديدة تسمى "مطابقة التدفق الموجه بالقيمة" (Value-Guided Flow Matching) التي تتجاوز هذه العقبة تمامًا. فبدلاً من إجبار الكمبيوتر على إعادة تتبع خطواته عبر الزمن، يسمح هذا النهج الجديد للروبوت بتلقي التوجيه في كل لحظة من لحظات اتخاذ القرار، مما يضمن أن حتى أفكاره المتوسطة توجهه نحو نتيجة ناجحة.

صمم الفريق، بقيادة براجوال كويرالا ومارك كامبل، نظامًا يتم فيه بناء سياسة الروبوت، أو استراتيجيته في الحركة، كتدفق مستمر بدلاً من سلسلة من القفزات المنفصلة. تخيل نهرًا يتدفق من مصدر إلى وجهة؛ يبدأ الروبوت بفكرة بسيطة وعشوائية للحركة ثم يشكلها تدريجيًا لتصبح إجراءً محددًا. الابتكار هنا هو أن النظام يتحقق من جودة هذا الإجراء عند كل نقطة على طول مسار النهر، وليس فقط في النهاية. ومن خلال التنبؤ بالوجهة النهائية للحركة عند كل خطوة متوسطة، يمكن للنظام تطبيق إشارة "القيمة" — وهو مقياس لمدى جودة هذا الإجراء — دون الحاجة إلى فك عملية التوليد بأكملها. وهذا يعني أن الروبوت يتعلم صقل حركاته باستمرار، مسترشدًا بناقد يقيم جودة الإجراء في الوقت الفعلي، وكل ذلك مع تجنب التكلفة الحسابية الثقيلة للعودة إلى الوراء عبر الزمن.

لاختبار هذه الفكرة، وضع الباحثون نظامهم في اختبار صارم باستخدام معيار قياسي يسمى OGBench، والذي يتضمن مجموعة واسعة من المهام الصعبة. تراوحت هذه المهام بين التنقل في متاهات معقدة باستخدام روبوتات رباعية الأرجل وروبوتات بشرية الشكل، وبين التحكم في الأشياء باستخدام أذرع روبوتية. في سيناريوهات المتاهة، كان على الروبوتات إيجاد طريقها عبر ممرات متعرجة، بينما تطلبت مهام التحكم في الأشياء تكديس المكعبات أو التفاعل مع الأشياء في بيئات مزدحمة. تم تدريب النظام على مجموعات بيانات ثابتة من الحركات الماضية، مما يعني أنه لم يرَ البيئة أثناء مرحلة التعلم، بل رأى البيانات المسجلة فقط. وكانت النتائج مذهلة: تفوقت الطريقة الجديدة باستمرار أو ساوت أفضل التقنيات الموجودة عبر جميع هذه المهام المتنوعة تقريبًا. فقد حققت معدلات نجاح عالية في التنقل في بيئات AntMaze وHumanoidMaze، وتفوقت في الحركات الدقيقة المطلوبة لمهام التحكم في المكعبات والمشاهد (Cube and Scene manipulation).

تعد المرونة أثناء الاستخدام الفعلي للروبوت ميزة رئيسية لهذا النهج. فبمجرد تدريب النظام، يمكن للمهندسين تعديل مقدار القوة الحسابية المستخدمة لتوليد إجراء واحد دون الحاجة إلى إعادة تدريب النموذج. وجد الباحثون أنه من خلال زيادة عدد الخطوات التي يتخذها الكمبيوتر لحساب الحركة النهائية ببساطة، يمكن للروبوت أداء مهام أكثر دقة وتعقيدًا. هذه المقايضة بين السرعة والدقة أمر بالغ الأهمية للتطبيقات في العالم الحقيقي، حيث قد يحتاج الروبوت إلى التحرك بسرعة في موقف بسيط، أو التمهل ليكون دقيقًا في موقف حساس. وأظهرت الدراسة أن هذه القدرة على التوسع تأتي بتكلفة إضافية ضئيلة جدًا من حيث الوقت، مما يسمح للروبوت بأن يصبح أكثر تعبيرًا وقدرة بمجرد استخدام المزيد من قوة المعالجة في لحظة اتخاذ القرار.

يوحي نجاح هذه الطريقة بمسار جديد للتحكم في الروبوتات، مسار يوازن بين الحاجة إلى السلامة وكفاءة البيانات وبين المتطلبات المتمثلة في السلوك المعقد والقابل للتكيف. ومن خلال إزالة العبء الحسابي الثقيل لتتبع كل خطوة إلى الوراء، جعل الباحثون من الممكن تدريب روبوتات يمكنها التعامل مع تسلسلات طويلة ومعقدة من الإجراءات بمستوى من التعبير كان بعيد المنال سابقًا. لا يعتمد النظام على السحر أو الاختصارات؛ بل يعيد ببساطة التفكير في كيفية تطبيق التوجيه، مما يسمح للروبوت بالتعلم من تدفق كثيف من التغذية الراجعة طوال رحلة اتخاذ القرار بأكملها. ومع استمرار المجال في دفع الروبوتات نحو العمل في بيئات بشرية غير منظمة، فإن أساليب مثل هذه توفر طريقة قابلة للتوسع وفعالة لتعليمها الفن الدقيق المتمثل في اختيار الإجراء الصحيح من بين عالم من الاحتمالات.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →