Reinforcement Learning Using known Invariances
تقترح هذه الورقة إطار عمل للتكرار القيمي بالتربيع الأدنى المتفائل والمدرك للتماثل، والذي يستفيد من تماثلات المجموعات المعروفة عبر النوى الثابتة لإثبات مكاسب كبيرة في كفاءة العينات في التعلم التعزيزي، وذلك نظرياً وتجريبياً.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم روبوت كيفية التنقل في متاهة. في إعداد معيار لتعلم التعزيز (Reinforcement Learning) التقليدي، يتعين على الروبوت تعلم كل شيء من الصفر: "إذا ذهبت يساراً هنا، سأصطدم بجدار. إذا ذهبت يميناً، سأجد عملة معدنية". إنه يجرب آلاف المرات، يرتكب الأخطاء، ويتعلم القواعد ببطء شديد. هذا يشبه طالباً يحاول تعلم لغة عن طريق قراءة كتاب واحد فقط، مراراً وتكراراً، دون أن يدرك أب الله أن قواعد النحو هي نفسها لكل جملة.
تقترح هذه الورقة البحثية طريقة أذكى لتعليم الروبوت باستخدام التماثلات المعروفة.
الفكرة الجوهرية: "خدعة المرآة"
تمتلك العديد من بيئات العالم الحقيقي أنماطاً خفية تسمى التماثلات.
- الدوران: إذا قمت بتدوير غرفة مربعة بزاوية 90 درجة، فستبدو متطابقة تماماً.
- الانعكاس: إذا نظرت إلى ممر في مرآة، فإن قواعد المشي فيه لا تتغير.
- الإزاحة: إذا حركت قطعة أحجية بمقدار بوصة واحدة إلى اليمين، فإن طريقة ملاءمتها تظل كما هي.
في هذه الورقة، يفترض المؤلفون أننا نعرف بالفعل وجود هذه التماثلات (مثل معرفة أن لوحة اللعبة متماثلة دورانياً). وبدلاً من ترك الروبوت يتعلم القواعد لكل بقعة على اللوحة، فإنهم يمنحونه "عدسة سحرية" (أداة رياضية تسمى النواة - kernel) ترى اللوحة كما لو كانت مطوية.
التشبيه:
تخيل أنك تتعلم لعب لعبة فيديو حيث المستوى عبارة عن دائرة مثالية.
- التعلم القياسي: أنت تحاول تعلم تخطيط الدائرة بأكملها. تحفظ أنه "عند الساعة 12، توجد حفرة". ثم يجب عليك حفظ أن "عند الساعة 3، توجد حفرة"، و"عند الساعة 6"، وهكذا. أنت تتعلم الشيء نفسه أربع مرات.
- التعلم المدرك للتماثل (هذه الورقة): أنت تخبر الروبوت، "مهلاً، هذا المستوى عبارة عن دائرة. إذا تعلمت ما يحدث عند الساعة 12، فأنت تعرف تلقائياً ما يحدث عند الساعة 3 و6 و9". يحتاج الروبوت فقط لتعلم شريحة واحدة من الفطيرة، وسيفهم الفطيرة بأكملها فوراً.
كيف فعلوا ذلك؟
بنى المؤلفون نسخة جديدة من خوارزمية تعلم شائعة تسمى LSVI (تكرار القيمة بأقل المربعات).
- "العدسة السحرية" (النوى الثابتة): قاموا بتعديل الرياضيات بحيث يعامل عقل الروبوت المواقف المتماثلة على أنها متطابقة. إذا رأى الروبوت حالة وصورتها المرآتية، فإن الرياضيات تعاملها كنقطة بيانات واحدة بالضبط.
- النظرية: لقد أثبتوا رياضياً أنه من خلال القيام بذلك، يحتاج الروبوت إلى محاولات (عينات) أقل بكثير لتعلم اللعبة. لقد حسبوا بدقة مدى السرعة التي سيصل بها: كلما زادت التماثلات، قل عدد الأخطاء التي تحتاج لارتكابها لتصبح جيداً في المهمة.
- "العدد المغطي" (Covering Number): فكر في هذا كحجم "ورقة الغش" التي يحتاج الروبوت للاحتفاظ بها في رأسه. من خلال استخدام التماثل، أثبتوا أن ورقة الغش تصبح أصغر بكثير، مما يجعل عملية التعلم أكثر كفاءة.
التجارب: هل نجح الأمر؟
اختبروا هذه الفكرة في ثلاث "ألعاب" مختلفة:
- عالم وهمي (اصطناعي): أنشأوا مسألة رياضية بسيطة حيث كانت القواعد متماثلة تماماً. تعلم الروبوت المدرك للتماثل بشكل أسرع بكثير من الروبوت القياسي.
- البحيرة المتجمدة (Frozen Lake): هذه لعبة ذكاء اصطناكلاسيكية حيث ينزلق روبوت على الجليد للوصول إلى هدف دون السقوط في ثقوب.
- أخذوا مستوى جليد قياسياً وأنشأوا أيضاً مستويات حيث وضعت الثقوب والهدف بشكل عشوائي ولكنها لا تزال تتبع قواعد التماثل.
- النتيجة: تعلم الروبوت المدرك للتماثل المسار إلى الهدف بشكل أسرع بكonom significantly وبأخطاء أقل من الروبوت القياسي. كما تفوق على طريقة شبكة عصبية شهيرة (DQN) كانت تحاول تعلم نفس الشيء.
- وضع الرقائق (توزيع ثنائي الأبعاد): تخيل أنك مهندس معماري تحاول وضع 8 قطع أثاث على شبكة دون أن تتداخل.
- هذه مسألة صعبة لأن هناك الملايين من الطرق لترتيب القطع.
- تعلم الروبوت المدرك للتماثل أفضل ترتيب بسرعة أكبر بكثير. فقد أدرك أن تدوير الغرفة بأكملها لا يغير درجة الصعوبة، لذا لم يضع وقته في إعادة تعلم نفس التخطيط لمجرد أنه تم تدويره جانباً.
الخلاصة
تزعم الورقة أنه إذا كنت تعرف أن البيئة تحتوي على تماثلات (مثل الدوران أو الانعكاس)، فلا ينبغي لك فقط "إلقاء المزيد من البيانات" على المشكلة. بدلاً من ذلك، يجب عليك دمج هذه المعرفة مباشرة في خوارزمية التعلم.
من خلال القيام بذلك، لا يضطر الروبوت لإعادة تعلم الدرس نفسه أربع مرات لمجرد أن الغرفة تم تدويرها 90 درجة. إنه يتعلم الدرس مرة واحدة، ويطبقه في كل مكان، ويصبح خبيراً بشكل أسرع بكثير. يقدم المؤلفون الإثبات الرياضي لـ سبب نجاح ذلك ويظهرون أمثلة من العالم الحقيقي حيث يوفر ذلك كمية هائلة من الوقت والجهد.
ما لا تدعيه الورقة:
- هي لا تقول إن هذا يعمل لـ كل المشكلات (فقط تلك التي لها تماثلات معروفة).
- هي لا تدعي أن الروبوت يمكنه اكتشاف هذه التماثلات من تلقاء نفسه؛ الورقة تفترض أننا نخبر الروبوت بما هي التماثلات مسبقاً.
- هي لا تناقش التطبيقات الطبية أو السريرية؛ الأمثلة تتعلق حصرياً بالألعاب، والملاحة، وتخطيط التصاميم.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.