STITCH-OPE: Trajectory Stitching with Guided Diffusion for Off-Policy Evaluation
يُعد STITCH-OPE إطار عمل توليدي جديد قائم على النماذج، يستفيد من الانتشار الموجه وحياكة المسارات لإجراء تقييم فعال خارج السياسة في البيئات عالية الأبعاد وطويلة الأمد من خلال تقليل التباين بشكل كبير وتجنب الإفراط في التنظيم.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في عالم الذكاء الاصطناعي، هناك معضلة مستمرة ومكلفة: كيف نعرف ما إذا كانت استراتيجية جديدة لروبوت أو علاج طبي سينجح قبل أن نجربه فعلياً؟ في مجالات مثل الروبوتات أو الرعاية الصحية، يمكن أن يكون التجريب المباشر خطيراً، أو مكلفاً، أو ببساطة مستحيلاً من حيث التكرار. وهنا يأتي دور تقنية تسمى "التقييم خارج السياسة" (off-policy evaluation). فهي تعمل كأرض اختبار افتراضية، مما يسمح للباحثين بتقدير مدى جودة أداء خطة جديدة باستخدام البيانات التي تم جمعها فقط من خطة أخرى موجودة بالفعل. ومع ذلك، فإن التحدي يكمثل في أنه عندما تكون الخطة الجديدة مختلفة بشكل كبير عن القديمة، أو عندما تكون المهام طويلة ومعقدة، فإن التقديرات غالباً ما تصبح غير دقيقة بشكل صارخ. تتراكم الأخطاء، أو يصبح الضجيج الإحصائي عالياً جداً لدرجة تضيع معها الإشارة، مما يجعل من الصعب الوثوق بالنتائج.
قام فريق من الباحثين من جامعة تورنتو ومعهد تويوتا للأبحاث بتطوير نهج جديد لحل هذه المشكلة تحديداً، خاصة للمهام عالية الأبعاد وطويلة الأمد. وقد أطلقوا على طريقتهم اسم STITCH-OPE. فبدلاً من محاولة التنبؤ بتسلسل كامل طويل من الأحداث دفعة واحدة — وهي مهمة تؤدي فيها الأخطاء الصغيرة بسرعة إلى فشل ذريع — يقوم STITCH-OPE بتفكيك المشكلة إلى قطع يمكن إدارتها. تخيل أنك تحاول التنبؤ بمسار رحلة متنزّه عبر رحلة سير لمدة أسبوع. إن التنبؤ بالأسبوع بأكمله في خطوة واحدة عرضة لأخطاء هائلة. بدلاً من ذلك، يتنبأ STITCH-OPE بقطع قصيرة من الرحلة، كبضع ساعات في كل مرة، ثم يربط هذه القطع معاً بعناية لتشكيل الأسبوع الكامل. عملية "الخياطة" (stitching) هذه تسمح للنظام بالحفاظ على الدقة عبر فترات طويلة دون أن تتراكم الأخطاء.
بنى الباحثون نظامهم باستخدام نوع من الذكاء الاصطناعي يُعرف باسم "نموذج الانتشار" (diffusion model). وتتميز هذه النماذج بقدرتها العالية على توليد بيانات واقعية، مثل الصور أو أنماط الحركة، من خلال البدء بضوضاء عشوائية وتكريرها تدريجياً لتصبح شيئاً مهيكلاً. وفي هذه الحالة، تم تدريب النموذج أولاً على مجموعة بيانات ضخمة من الحركات المسجلة من "سياسة سلوكية" (behavior policy) — وهي الخطة الموجودة التي ولدت البيانات. وبمجرد تدريبه، أصبح بإمكان النموذج توليد مسارات حركة جديدة وواقعية. ومع ذلك، فإن مجرد توليد مسارات بناءً على البيانات القديمة لن يساعد في تقييم استراتيجية جديدة ومختلفة. ولحل هذه المشكلة، قام الباحثون بتوجيه عملية التوليد؛ حيث استخدموا "الدرجة" (score) الرياضية للسياسة المستهدفة الجديدة لدفع النموذج نحو توليد مسارات قد يتخذها الاستراتيج الجديد بالفعل، بينما استخدموا في الوقت ذات نفسه درجة السياسة السلوكية القديمة لمنع النموذج من الانحباس في أنماط كانت شائعة جداً في البيانات الأصلية ولكنها غير ذات صلة بالاستراتيجية الجديدة. هذا التوجيه المزدوج يضمن أن تكون المسارات المولدة قابلة للتنفيذ وذات صلة بالخطة الجديدة التي يتم اختبارها.
تم اختبار نتائج هذا النهج على مجموعة متنوعة من المعايير القياسية، بما في ذلك مهام التحكم الروبوتي المعقدة مثل موازنة روبوت ثنائي الأرجل أو تشغيل روبوت يشبه الفهد. وقارن الباحثون طريقتهم مع العديد من التقنيات الأخرى المتطورة، بما في ذلك تلك التي تعتمد على "أخذ العينات بالأهمية" (importance sampling) أو التنبؤ بالمسار الكامل. وفي هذه الاختبارات، تفوق STITCH-OPE باستمرار على غيره؛ فقد أنتج تقديرات كانت أقرب بكثير إلى القيم الحقيقية، وأظهر قدرة أقوى على ترتيب الاستراتيجيات المختلفة من الأفضل إلى الأسوأ بشكل صحيح، وأدى إلى "ندم" (regret) أقل — وهو تكلفة اختيار استراتيجية دون المستوى الأمثل. والأهم من ذلك، ظل النهج قوياً حتى مع زيادة طول المهام، وهو سيناريو تفشل فيه الطرق الأخرى عادةً بسبب النمو الأسي للخطأ. كما أثبت الفريق أن هذا النهج يعمل جيداً حتى عندما تكون الاستراتيجية المستهدفة من نوع حديث ومعقد من السياسات التي لا تمتلك صيغة رياضية بسيطة، وهو قيد يوقف العديد من أدوات التقييم الأخرى في مسارها.
من خلال الجمع بين القدرة على توليد مقاطع قصيرة ودقيقة ونظام توجيه ذكي يصحح الاختلافات بين الاستراتيجيات القديمة والجديدة، يوفر STITCH-OPE طريقة موثوقة لتقييم الخطط المعقدة دون الحاجة إلى تجارب واقعية محفوفة بالمخاطر. وجد الباحثون أن هذه الطريقة توفر انخفاضاً كبيراً في الخطأ مقارنة بالتقنيات السابقة، مما يقدم أداة عملية للنشر الآمن للذكاء الاصطناعي في البيئات عالية المخاطر. وبينما يعتمد النهج على بعض الافتراضات حول البيانات، مثل عدم كون الخطة الجديدة غريبة تماماً عن القديمة، إلا أن التجارب تشير إلى أنه يمثل خطوة قوية للأمام في جعل التقييم "خارج السياسة" جزءاً موثوقاً من مجموعة أدوات تعلم الآلة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.