← أحدث الأبحاث
💻 computer science

DIA: Denoising Intermediate Advantage for Diffusion Policy Optimization

تقدم الورقة البحثية طريقة "ميزة إزالة الضجيج الوسيطة" (DIA)، وهي طريقة تدرج السياسة التي تعزز سياسات الروبوت القائمة على الانتشار من خلال تخصيص ائتمان يعتمد على الحالة لخطوات إزالة الضجيج الوسيطة، مما يتيح استكشافاً أكثر كفاءة وأداءً فائقاً للمهام مقارنة بنهج الضبط الدقيق الحالي.

المؤلفون الأصليون: Arjun Sohal, Yuchi Zhao, Miroslav Bogdanovic, Alan Aspuru-Guzik

نُشر 2026-09-15
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Arjun Sohal, Yuchi Zhao, Miroslav Bogdanovic, Alan Aspuru-Guzik

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لطالما كان الروبوتات التي يمكنها التعامل مع الأشياء ببراعة تشبه براعة البشر هدفاً من أهداف الذكاء الاصطناعي، لكن تعليمها القيام بذلك يعد عملية توازن دقيقة. لسنوات طويلة، كانت الطريقة الأكثر فعالية هي "محاكاة السلوك" (behavior cloning)، حيث يتعلم الروبوت من خلال مشاهدة فيديوهات لبشر يؤدون مهام معينة ثم يحاكي تلك الحركات. وقد أدت هذه الطريقة إلى ظهور فئة قوية جديدة من وحدات التحكم في الروبوت تعتمد على تقنية تسمى "الانتشار" (diffusion). ومثلما قد يبدأ النحات بكتلة صخرية خشنة ويقوم تدريجياً بنحت المادة ليكشف عن تمثال، تبدأ نماذج الانتشار هذه بضجيج عشوائي وتقوم بتنقيحه ببطء ليصبح تسلسلاً دقيقاً من الأفعال. وبينما تعد هذه الطريقة ممتازة في التقاط تنوع ودقة العروض البشرية، إلا أن لها عيباً جوهرياً: فالروبوت يظل مقيداً بشكل صارم بجودة وتنوع البيانات التي عُرضت عليه. فإذا لم تظهر الفيديوهات التدريبية قط روبوتاً يحل مشكلة بطريقة جديدة، فمن المرجح أن يفشل الروبوت عند مواجهة تلك المشكلة في العالم الحقيقي. وللتغلب على ذلك، بدأ الباحثون في دمج نماذج الانتشار هذه مع "التعلم التعزيزي" (reinforcement learning)، وهي تقنية يتعلم فيها الوكيل من خلال التجربة والخطأ، حيث يتلقى مكافآت للنتائج الجيدة وعقوبات للأخطاء. ومع ذلك، فإن التحدي يكمكم في أن نماذج الانتشار لا تتخذ قراراً واحداً دفعة واحدة؛ بل تولد الفعل من خلال عملية تنقيح طويلة وخطوة بخطوة. وقد ثبت أن تحديد الخطوة الدقيقة في ذلك السلسلة الطويلة التي كانت مسؤولة عن النجاح أو الفشل يمثل لغزاً صعباً للطرق الحالية.

اقترح فريق من الباحثين في جامعة تورنتو ومعهد فيكتور حلاً جديداً لهذه المشكلة يسمى "الميزة الوسيطة لإزالة الضجيج" (Denoising Intermediate Advantage - DIA). يعالج عملهم خللاً محدداً في كيفية منح الأنظمة الحالية الائتمان لعملية تعلم الروبوت. في النهج القياسي، عندما يكمل الروبوت مهمة بنجاح بعد سلسلة طويلة من خطوات التنقيح، يمنح النظام نفس القدر من الائتمان لكل خطوة في ذلك التسلسل. الأمر يشبه فريقاً من الرسامين يعملون معاً لإنهاء جدارية، حيث يقوم المدير بالثناء على كل ضربة فرشاة بالتساوي، بغض النظر عما إذا كانت ضربة معينة مجرد تفصيل بسيط أو الخط الجوهري الذي حدد الصورة بأكملها. ويرى الباحثون أن هذا غير فعال لأن الخطوات الوسيطة في عملية التوليد تحتوي على معلومات قيمة حول الاتجاه الذي يسلكه الروبوت. ومن خلال معاملة سلسلة التنقيح بأكملها ككتلة واحدة، فاتت الطرق السابقة فرصة التعلم من القرارات المحددة المتخذة في كل مرحلة من مراحل العملية.

ولإصلاح ذلك، تقدم طريقة DIA وسيلة لتقييم تقدم الروبوت عند كل خطوة من خطوات عملية التنقيح، وليس فقط في النهاية. يتعلم النظام التنبؤ بقيمة الفعل الذي يتم تشكيله أثناء تكوينه، خطوة بخطوة. وهذا يسمح للروبوت بفهم أن بعض القرارات الوسيطة أكثر أهمية للنتيجة النهائية من غيرها. وبدلاً من الانتظار حتى النهاية لمعرفة ما إذا كانت المهمة قد اكتملت أم لا، يوفر النظام تغذية راجعة طوال عملية التوليد، مما يوجه الروبوت لاتخاذ خيارات أفضل في وقت مبكر. وهذا يخلق إشارة تعلم أكثر دقة تساعد الروبوت على التمييز بين النجاح الناتج عن الحظ والاستراتيجية المنفذة بإتقان. اختبر الباحثون هذا النهج عبر أربع مجموعات مختلفة من المهام الروبوتية، تتراوح من التلاعب البسيط بالأشياء إلى مهام التجميع المعقدة متعددة الخطوات التي تتطلب من الروبوت تحريك ذراعيه بتنسيق على مدى فترة طويلة.

كانت نتائج هذه الاختبارات متسقة وكبيرة. ففي مجموعة معيارية من الاختبارات تُعرف باسم Robomimic، والتي تشمل مهام مثل رفع الأشياء، وتحريك العلب، ورسم المربعات، تفوقت طريقة DIA باستمرار على التقنيات الحالية. وفي أصعب مهمة، وهي تحدي النقل باستخدام اليدين حيث يجب على الروبوت نقل جسم باستخدام ذراعين، حققت الطريقة الجديدة درجة مكافأة أعلى بنسبة 23 بالمائة من أفضل نهج سابق، مع الحفاظ على نفس المعدل العالي للنجاح. لم يكن هذا التحسن يتعلق فقط بإنجاز المهمة بشكل متكرر، بل بإنجازها بشكل أفضل. فقد وصل الروبوتات المدربة باستخدام DIA إلى الحالة الناجحة بسرعة أكبر، مستغرقة خطوات أقل لإكمال المهمة. وفي اختبار محدد، انخفض الوقت الذي استغرقه الروبوت للنجاح بنسبة 21 بالمائة. وهذا يشير إلى أن الروبوت لم يكن مجرد متعثر للوصول إلى حل، بل كان يتعلم مساراً أكثر كفاءة نحو الهدف.

وقد أصبحت قوة هذه الطريقة أكثر وضوحاً عندما اختبرها الباحثون في مهام كانت فيها البيانات التدريبية غير مكتملة أو تفتقر إلى الحل الكامل. في محاكاة للمطبخ حيث كان على الروبوت تنفيذ تسلسل من المهام الفرعية مثل تشغيل موقد أو فتح خزانة، كانت البيانات التدريبية القياسية غالباً ما تظهر أجزاء فقط من التسلسل الكامل. عانت الطرق السابقة هنا، حيث علقت غالباً في حلقات مفرغة أو كررت أفعالاً غير ذات صلة لأنها كانت تعتمد بشكل كبير على الأنماط الدقيقة التي رأتها في فيديوهات التدريب. ومع ذلك، استطاعت طريقة DIA إعادة دمج العروض الجزئية التي رأتها لإنشاء تسلسلات أفعال جديدة وناجحة تماماً. وفي النسخة الأكثر تحدياً من هذا الاختبار، حيث لم تظهر أي عملية عرض واحدة المهمة كاملة، فشلت الطرق الأساسية تماماً وحققت نسبة نجاح صفر بالمائة. في المقابل، نجحت طريقة DIA بنسبة 69 بالمائة. لقد تمكنت من تجميع الخطوات اللازمة لإكمال المهمة، ونجحت فعلياً في تعلم استراتيجية لم تكن موجودة صراحة في أي من الأمثلة التدريبية الأصلية.

تشير هذه النتائج إلى أنه من خلال الانتباه إلى الخطوات الوسيطة لاتخاذ القرار، يمكن للروبوتات التحرر من قيود بيانات التدريب الخاصة بها. تسمح هذه الطريقة لها باستكشاف استراتيجيات جديدة واكتشاف طرق أكثر كفاءة لحل المشكلات، بدلاً من مجرد نسخ ما رأته من قبل. وبينما أُجريت التجارب في بيئة محاكاة، فإن النتائج تشير إلى مستقبل يمكن للروبوتات فيه التكيف بمرونة أكبر مع البيئات المعقدة في العالم الحقيقي. ويشير الباحثون إلى أن الخطوة التالية ستكون اختبار هذه الأفكار على روبوتات فيزيائية، وهو انتقال سيتطلب التغلب على التحديات العملية لجمع البيانات في العالم الحقيقي. وفي الوقت الحالي، يوضح هذا العمل أن منح الائتمان للحظات الصحيحة في عملية التفكير لدى الروبوت يمكن أن يؤدي إلى آلات أكثر ذكاءً وقدرة بشكل ملحوظ.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →