← أحدث الأبحاث
💻 computer science

WARP-RM: A Warp-Augmented Relative Progress Reward Model for Data Curation

تقدم الورقة البحثية WARP-RM، وهو نموذج مكافأة ذاتي الإشراف بالكامل يولد إشارات تقدم نسبي كثيفة من عروض توضيحية ناجحة مشوهة زمنياً لتمكين WARP-BC، وهي طريقة لنسخ السلوك تعمل على تحسين أداء الروبوت بشكل كبير في المهام طويلة المدى من خلال تصفية وإعادة وزن كتل الأفعال من بيانات مختلطة الجودة.

المؤلفون الأصليون: Justin Yu, Andrew Goldberg, Kavish Kondap, Karim El-Refai, Ethan Ransing, Qianzhong Chen, Mac Schwager, Fred Shentu, Philipp Wu, Ken Goldberg

نُشر 2026-09-09
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Justin Yu, Andrew Goldberg, Kavish Kondap, Karim El-Refai, Ethan Ransing, Qianzhong Chen, Mac Schwager, Fred Shentu, Philipp Wu, Ken Goldberg

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لطالما عانت الروبوتات في تعلم كيفية التعلم من مراقبة البشر. فبينما يمكن للإنسان أن يلقي نظرة خاطفة على مهمة ما ويفهم تدفق الحركة، فإن الروبوت الذي يتم تدريبه على بيانات الفيديو غالباً ما يتعلم الأخطاء جنباً إلى جنب مع النجاحات. إذا توقف المشغل البشري ليفكر، أو تعثر في إمساك شيء ما، أو حاول استخدام قبضة خرقاء قبل النجاح، فإن الروبوت يرى هذه الترددات كجزء من المسار الصحيح. وهذه مشكلة خاصة في المهام الطويلة والمعقدة مثل طي الملابس أو تجميع الأشياء، حيث يمكن للحظة واحدة من الارتباك أن تعطل التسلسل بأكه. لسنوات، حاول الباحثون تعليم الروبوتات تجاهل هذه اللحظات السيئة، لكن معظم الطرق كانت تتطلب تسميات بشرية مكلفة لتحديد مكان وقوع الخطأ بالضبط، أو كانت تستبعد مقاطع الفيديو بأكملها إذا احتوت على أي أخطاء، مما يؤدي إلى التخلص من حركات الاستعادة القيمة المخبأة داخل العروض غير المثالية.

قام فريق من الباحثين في جامعة كاليفورنيا، بيركلي وجامعة ستانفورد، بتطوير طريقة جديدة لتعليم الروبوتات التمييز بين الحركة المثمرة والوقت الضائع دون الحاجة إلى أي تسميات بشرية. لقد ابتكروا نظاماً يسمى WARP، وهو اختصار لـ (Warp-Augmented Relative Progress) أو "التقدم النسبي المعزز بالتشويه". وبدلاً من مطالبة إنسان بمشاهدة ساعات من الفيديو ورسم مربعات حول اللحظات الجيدة والسيئة، علم الباحثون الكمبيوتر فهم سرعة واتجاه التقدم عن طريق تشغيل مقاطع الفيديو بسرعات مختلفة وحتى بشكل عكسي. ومن خلال تدريب الروبوت على التعرف على شكل التقدم "للأمام" مقارنة بالحركة "للخلف" أو المتوقفة، تعلم النظام تخصيص درجة لكل إطار في الفيديو. وتخبر هذه الدرجة الروبوت بمدى سرعة تقدم المهمة، أو ما إذا كانت عالقة، أو ما إذا كانت تتحرك بالفعل إلى الوراء.

اختبر الباحثون هذه الفكرة على روبوت مادي بذراعين، وطلبوا منه طي قمصان (T-shirts) كانت مجعدة في سلة. قاموا بإنشاء مجموعات بيانات تدريبية متفاوتة الجودة؛ ففي أفضل مجموعات البيانات، كانت العروض البشرية سريعة وفعالة، أما في أسوأ مجموعات البيانات، فكانت العروض البشرية مليئة بالتوقفات، والمحاولات المتكررة، وفترات طويلة من التعثر. وعندما قاموا بتدريب نظام تعلم روبوتي قياسي على هذه الفيديوهات الفوضوية ومنخفضة الجودة، فشل الروبوت فشلاً شبه تام، حيث كان يعلق في حلقات من التعديلات الصغيرة عديمة الفائدة، غير قادر على إنهاء المهمة. ومع ذلك، عندما استخدموا نظام WARP الجديد لتصفية البيانات، تغيرت النتائج بشكل كبير. فقد حدد النظام تلقائياً الأجزاء البطيئة والمترددة من الفيديوهات وقلل من أهميتها، بينما احتفظ باللحظات السريعة والحاسمة. وفي مجموعات البيانات الفوضوية التي فشل فيها الروبوت القياسي عشرين مرة من أصل عشرين، نجح الروبوت المدرب بنظام WARP تسع عشرة مرة من أصل عشرين. كما قام بطي القمصان أسرع بثمانية عشر مرة تقريباً من الروبوت القياسي عند إعطائه نفس البيانات ضعيفة الجودة.

لم يتوقف الفريق عند طي القمصان، بل اختبروا الطريقة أيضاً في مهمة تتطلب وضع زجاجات بلاستيكية في سلة. في العالم الحقيقي، وضع النظام الجديد أربع وسبعين زجاجة من أصل ثمانين، بينما تمكن النظام القياسي من وضع تسع وخمسين فقط. كان الروبوت الجديد يضع الزجاجات بشكل أسرع وباتساق أكبر. وللتأكد من أن هذه النتائج لم تكن مجرد صدفة ناتجة عن عتاد الروبوت المحدد، أجرى الباحثون محاكاة ضخمة لخمس مئة واثني عشر سيناريو مختلفاً. في هذا الاختبار الافتراضي، وضع النظام الجديد مئتين وتسعين زجاجة في الساعة، متفوقاً بشكل ملحوظ على النظام القياسي الذي تمكن من وضع مئتين وسبعة وثلاثين زجاجة في الساعة. وحتى عند مقارنته بالطرق المتقدمة الأخرى التي تحاول تنقية البيانات، أنتج النهج الجديد باستمرار النتائج الأسرع والأكثر موثوقية.

جزء رئيسي من سبب نجاح هذا الأمر هو كيفية تعلم النظام للتعرف على التقدم. لم يخبر الباحثون الكمبيوتر كيف يبدو "القميص المطوي"، بل أخذوا فيديوهات ناجحة لبشر يطوون القمصان وشغلوها بسرعات عشوائية، أحياناً بتبطئتها حتى تصبح بطيئة جداً وأحياناً بتسريعها. كما قاموا بتشغيل بعض الفيديوهات بشكل عكسي. ثم طُلب من الكمبيوتر تخمين مقدار الوقت الذي مضى بين بداية المقطع واللحظة الحالية. ومن خلال تعلم التنبؤ بالوقت المنقضي في هذه النسخ المشوهة والمبعثرة من الفيديو، تعلم الكمبيوتر فهم الإيقاع الطبيعي للمهمة. تعلم أن الحركة السريعة والسلسة تعني عادةً أن المهمة تتقدم للأمام، بينما الحركة البطيئة أو المتقطلة أو الحركة للخلف تعني أن المهمة متعثرة أو فاشلة. سمح هذا للنظام بإنشاء درجة مستمرة لكل إطار فيديو، مما يخبر الروبوت بدقة بالأجزاء التي يجب عليه الانتباه إليها وتلك التي يجب عليه تجاهلها.

وجد الباحثون أن مجرد التخلص من الفيديوهات السيئة لم يكن كافياً؛ فالاستراتيجية الأكثر فعالية كانت الإبقاء على الفيديوهات الفوضوية ولكن تغيير كيفية تعلم الروبوت منها. يأخذ النظام جزءاً من الحركة من الفيديو وينظر إلى درجة التقدم في نهاية هذا الجزء؛ فإذا كانت الدرجة عالية، مما يعني أن المهمة تتقدم للأمام بسرعة، يتعلم الروبوت من ذلك الجزء بكامل شدته. أما إذا كانت الدرجة منخفضة أو سالبة، مما يعني أن الروبوت يتردد أو يتحرك للخلف، فإن النظام إما يتجاهل ذلك الجزء تماماً أو يتعلم منه بشكل طفيف جداً. سمح هذا النهج للروبوت بالتعلم من حركات الاستعادة التي يقوم بها البشر عندما يسقطون قميصاً ثم يلتقطونه مرة أخرى، دون تعلم الارتباك والتردد الذي تسبب في السقوط في المقام الأول.

يشير هذا العمل إلى أن الروبوتات لا تحتاج إلى عروض بشرية مثالية للتعلم من المهارات المعقدة، إذ يمكنها التعلم من بيانات العالم الحقيقي الفوضوية إذا امتلكت وسيلة لفهم تدفق الوقت والتقدم داخل تلك البيانات. وأشار الباحثون إلى أن طريقتهم تعتمد على نوع معين من تعزيز البيانات حيث يتم تشغيل الفيديوهات بشكل عكسي، وهو أمر مستحيل فيزيائياً لروبوت حقيقي القيام به. ومع ذلك، تعلم النظام أنماطاً مفيدة من هذا التدريب الاصطناعي. وبينما لا يعد هذا الأسلوب حلاً سحرياً يعمل لكل مهمة ممكنة، فإنه يوفر أداة قوية لتعليم الروبوتات كيفية تجاهل "الضجيج" الناتج عن الخطأ البشري والتركيز على "الإشارة" المتمثلة في الفعل الناجح. وقد جعل الفريق الكود والبيانات متاحة حتى يتمكن الباحثون الآخرون من اختبار هذه الأفكار على روبوتاتهم ومهامهم الخاصة، مما قد يؤدي إلى جيل جديد من الروبوتات القادرة على التعلم بسرعة من العالم غير المثالي الذي نعيش فيه يومياً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →