← أحدث الأبحاث
💻 computer science

TraceFlow: Guiding Frozen Flow-Matching Robot Policies with Success and Failure Traces

يقدم TraceFlow طريقة توجيه في وقت الاختبار تعزز سياسات الروبوت القائمة على مطابقة التدفق المجمدة من خلال الاستفادة من حقل تصحيح متوافق مع التقدم مستمد من مسارات التنفيذ الناجحة والفاشلة المخزنة في TraceBank، مما يحسن بشكل كبير معدلات نجاح المهام في اختبارات التعبئة الواقعية ومعايير محاكاة محددة دون الحاجة إلى أي تحديثات لأوزان النموذج.

المؤلفون الأصليون: Jiaxuan Zhang, Ruizhe Liu, Yu Zhang, Yanchao Yang

نُشر 2026-09-18
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jiaxuan Zhang, Ruizhe Liu, Yu Zhang, Yanchao Yang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لم تعد الروبوتات التي يمكنها الرؤية، وفهم اللغة، وتحريك أذرعها لإنجاز مهام معقدة مجرد خيال علمي؛ بل هي واقع يتم بناؤه في المختبرات اليوم. تعتمد هذه الآلات على نوع من البرمجيات يسمى "سياسة الرؤية واللغة والفعل" (vision-language-action policy). فكر في هذه السياسة كدماغ ينظر إلى بث الكاميرا، ويقرأ تعليمات بشرية، ثم يقرر الحركة الفيزيائية التي سيقوم بها تالياً. ولضمان السلامة والموثوقية، غالباً ما يقوم المهندسون بـ "تجميد" هذه الأدمغة بمجرد تدريبها، مما يعني أن الإعدادات الداخلية يتم قفلها في مكانها حتى لا يتعلم الروبوت عن طريق الخطأ ما يعرفه أثناء العمل. ومع ذلك، فإن الدماغ المجمد لديه نقطة عمياء: إذا ارتكب الروبوت خطأً أثناء مهمة ما، فلا يمكنه استخدام هذا الفشل لتغيير حركته التالية مباشرة، لأن تعليماته ثابتة. الأمر يشبه سائقاً حفظ مساراً ما بشكل مثالي ولكنه لا يستطيع تعديل توجيهه عندما يرى فجوة مفاجئة في الطريق، لأن يديه مقيدتان بنص مكتوب مسبقاً. والسؤال الذي يواجه الباحثين هو كيفية السماح للروبوت بالتعلم من أخطائه في الوقت الفعلي دون إعادة تدريب دماغه بالكامل أو إضافة مستشعرات جديدة معقدة.

لقد طور فريق من الباحثين في جامعة هونغ كونغ والجامعة الجنوبية للعلوم والتكنولوجيا طريقة تسمى "تريس فلو" (TraceFlow) لحل هذه المشكلة. فبدلاً من محاولة إعادة تدريب دماغ الروبوت المجمد، قاموا ببناء نظام يعمل كمرشد مؤقت، يستخدم سجلاً بسيطاً لمحاولات الروبوت السابقة لتوجيه أفعاله الحالية. يعمل النظام من خلال تخزين كل مرة يحاول فيها الروبوت أداء مهمة، مع تدوين ما إذا كان قد نجح أم فشل، والاحتفاظ بسجل مفصل للحركات التي قام بها خلال المسار. وعندما يبدأ الروبوت محاولة جديدة، يبحث نظام "تريس فلو" في حالته الراهنة بسرعة في هذا السجل بحثاً عن لحظات مشابهة من الماضي. فإذا وجد محاولة سابقة ناجحة، فإنه يسحب خطة حركة الروبوت الحالية بلطف نحو ما نجح سابقاً. وإذا وجد محاولة سابقة فاشلة، فإنه يدفع خطة الروبوت بعيداً عن ذلك الخطأ المحدد. ومن الأهمية بمكان أن هذا التوجيه يكون محدوداً، بمعنى أنه قوي بما يكفي لتصحيح المسار ولكنه ضعيف بما يكفي لعدم تجاوز تدريب الروبوت الأساسي، مما يضمن بقاء الآلة آمنة ومستقرة.

اختبر الباحثون هذا النهج على ذراع روبوت حقيقية في غرفة مزدحمة، وطلبوا منها تنفيذ تسلسل محدد من المهام، مثل تحريك قطعة من الشريط اللاصق ثم وضع مطرقة على خزانة. بدون نظام التوجيه، أكمل الروبوت التسلسل الكامل بالترتيب 21 مرة فقط من أصل 50 محاولة، وغالباً ما كان يخطئ في ترتيب الخطوات. ومع تفعيل "تريس فلو"، نجح الروبوت 39 مرة من أصل 50. وكان التحسن أكثر دراماتيكية بعد أن سمح الباحثون للروبوت بتشغيل جولة أخرى من المهام، وتغذية نجاحاته وإخفاقاته الجديدة في النظام. في تلك الجولة الثانية، أكمل الروبوت التسلسل بشكل صحيح 47 مرة من أصل 50، ولم يرتكب أي أخطاء في ترتيب الخطوات. حقق النظام ذلك باستخدام تسمية واحدة فقط بـ "نعم" أو "لا" لكل محاولة سابقة للإشارة إلى النجاح أو الفشل، دون الحاجة إلى تحليل معقد لمكان وقوع الخطأ بالضبط.

في المحاكاة الحاسوبية، كانت النتائج أكثر انتقائية، حيث أظهرت أن الطريقة تعمل بشكل أفضل للمهام التي تتطلب تذكر الترتيب الصحيح للخطوات أو نقل مهارة إلى جسم جديد. فعلى سبيل المثال، في محاكاة تتضمن تكديس الكتل، ارتفع معدل النجاح من حوالي 54% إلى 62% عندما سُمح للنظام بالتعلم من إخفاقاته. ومع ذلك، وجد الباحثون أن هذا التوجيه لم يساعد في جميع أنواع المهام؛ فعندما كان المطلوب من الروبوت عد الأشياء أو العثور على عناصر مخبأة خلف أشياء أخرى، لم يحسن النظام الأداء بل جعله أسوأ قليلاً في بعض الأحيان. وهذا يشير إلى أن الطريقة جيدة خصيصاً في إصلاح الأخطاء في تسلسل الأفعال، لكنها لا تستطيع إصلاح المشكلات التي يفتقر فيها الروبوت ببساطة إلى المعلومات اللازمة لرؤية أو فهم المشهد.

استكشفت الدراسة أيضاً المدة التي يمكن للروبوت أن يستمر فيها في التعلم من تاريخه الخاص. أجرى الباحثون عشر جولات من المهام، مع إضافة تجارب جديدة إلى النظام بعد كل جولة. ووجدوا أن أداء الروبوت يتحسن بسرعة في البداية ثم يستقر، حيث يصل إلى ذروته حول الجولة الثانية أو السابعة اعتماداً على المهمة. وهذا يشير إلى وجود حد لما يمكن للروبوت الاستفيد منه من تاريخه الأخير دون تغيير دماغه الأساسي. علاوة على ذلك، اكتشف الفريق أن نسبة المحاولات الناجحة إلى الفاشلة في الماضي لم تتنبأ بمدى نجاح النظام؛ إذ استطاع الروبوت التحسن حتى لو كان لديه عدد أكبر من الإخفاقات مقارنة بالنجاحات في ذاكرته. وتتحدى هذه النتيجة الفكرة القائلة بأن الروبوت يحتاج إلى سجل حافل بالنجاحات ليتعلم من ماضيه.

في النهاية، يوفر "تريس فلو" طريقة عملية لجعل سياسات الروبوت المجمدة أكثر قدرة على التكيف. فمن خلال استخدام تصحيح بسيط ومحدود يعتمد على تاريخ من المكاسب والخسائر، يمكن للروبوت تنفيذ المهام المعقدة والمرتبة بموثوقية أكبر دون الحاجة إلى إعادة تدريبه من الصفر. وقد أظهر الباحثون أن هذا النهج يعمل بفعالية على الأجهزة الحقيقية، محولاً روبوتاً كان يعاني في ترتيب الخطوات إلى روبوت يمكنه إكمال تسلسل من الأفعال بموثوقية. ورغم أنه ليس حلاً سحرياً لكل تحديات الروبوتات، خاصة تلك المتعلقة بالعد أو الأشياء المخفية، إلا أنه يوفر مساراً واضحاً لجعل الروبوتات أكثر متانة في العالم الحقيقي من خلال السماح لها بالتعلم من أخطائها في اللحظة ذاتها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →