Apple: Toward General Active Perception via Reinforcement Learning
تقدم هذه الورقة APPLE، وهو إطار عمل جديد للتعلم التعزيزي يقوم بتدريب وحدة إدراك قائمة على المحولات (transformer-based) وسياسة اتخاذ قرار بشكل مشترك لإنشاء حل متعدد الاستخدامات وعام الأغراض للإدراك النشط عبر مهام روبوتية متنوعة، بما في ذلك الاستكشاف اللمسي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تبحث عن أداة معينة داخل صندوق أدوات فوضوي ومظلم. لا يمكنك الرؤية في الداخل، لذا يتعين عليك مد يدك للبحث. إذا قمت فقط بتحريك أصابعك بشكل عشوائي، فقد تجد المفتاح في النهاية، ولكن قد يستغرق الأمر وقتاً طويلاً جداً. أما إذا كنت ذكياً، فستتحسس الأشياء، وتلاحظ شكل المقبض، وتمرر يدك على طوله لتعرف بالضبط أين هو وفي أي اتجاه يشير.
تقدم هذه الورقة البحثية APPLE (سياسة الإدراك النشط التعلمية - Active Perception Policy Learning)، وهي طريقة جديدة لتعليم الروبوتات القيام بذلك تماماً: تعلم كيفية "النظر" (أو اللمس) للبحث عن المعلومات بدلاً من مجرد الانتظار للحصول عليها.
إليك تفصيل لكيفية عملها، باستخدام تشبيهات بسيطة:
1. المشكلة: الروبوت "أعمى" ولا يملك أدنى فكرة
معظم الروبوتات بارعة في رؤية الأشياء إذا كانت أمامها مباشرة. ولكن في العالم الحقيقي، غالباً ما تكون الأشياء مخفية، أو يحصل الروبوت فقط على لمحة ضئيلة وضبابية عنها (مثل لمس جزء صغير من جسم ما بطرف الإصبع).
- الطريقة القديمة: استخدمت الروبوتات السابقة "أوراق غش" أو قواعد جامدة. على سبيل المثال، "إذا لمست منحنى، تحرك لليسار". هذا يعمل لمهمة محددة واحدة، ولكنه يفشل إذا غيرت الجسم أو البيئة. الأمر يشبه تعليم كلب أن يجلس فقط إذا قلت له "اجلس" بنبرة معينة؛ إذا قلت له "من فضلك اجلس"، سيصاب الكلب بالارتباك.
- الهدف: أراد الباحثون روبوتاً يمكنه "تعلم كيف يتعلم". أرادوا روبوتاً يمكنه أن يقول: "أنا لا أعرف ما هذا، لذا أحتاج إلى تحريك يدي لأعرف المزيد"، دون أن يتم إخباره بكيفية التحرك بالضبط.
2. الحل: "المحقق الذكي" (APPLE)
ابتكر المؤلفون إطار عمل يسمى APPLE. فكر في APPLE كـ محقق وهو أيضاً طالب.
- جزء الطالب (الإدراك): لدى الروبوت "عقل" (شبكة عصبية) يحاول تخمين ماهية الجسم (مثلاً: "هل هذا مفتاح ربط أم مفك براغي؟").
- جزء المحقق (العمل): لدى الروبوت "يد" تقرر أين ستتحرك تالياً للحصول على أدلة أفضل.
- الخدعة السحرية: عادةً، تقوم بتدريب الطالب والمحقق بشكل منفصل. لكن APPLE يدربهما معاً.
- إذا أخطأ الطالب في التخمين، يتعلم المحقق: "أوه، أحتاج إلى تحريك يدي إلى مكان مختلف للحصول على دليل أفضل!"
- إذا تحرك المحقق إلى مكان ساعد الطالب على التخمين بشكل صحيح، يحصل كلاهما على "هاي فايف" (مكافأة).
إنهم يستخدمون تقنية تسمى التعلم التعزيزي (التجربة والخطأ) مدمجة مع المحولات (Transformers) (نوع من أنواع الذكاء الاصطناعي البارع في فهم التسلسلات، مثل قراءة قصة).
3. كيف يتعلم: تشبيه "لعبة الفيديو"
تخيل أن الروبوت يلعب لعبة فيديو حيث الهدف هو تحديد شكل مخفي.
- الشاشة: يرى الروبوت فقط نافذة صغيرة بحجم 5×5 بكسل (لمحة) من الجسم في كل مرة.
- أدوات التحكم: يمكن للروبوت تحريك هذه النافذة في أي مكان.
- النتيجة (النقاط): يحصل الروبوت على نقاط لتخمين الشكل بشكل صحيح.
- الاستراتيجية:
- اللاعب العشوائي (الأساس) يحرك النافذة حولاً بشكل عشوائي. قد يحالفه الحظ، لكنه عادةً ما يفشل.
- روبوت APPLE يدرك بسرعة: "إذا حركت نافذتي إلى حافة الجسم، يمكنني رؤية المنحنى. إذا اتبعت المنحنى، يمكنني معرفة الشكل بأكامله".
- إنه يتعلم استراتيجية (مثل "ابحث في دائرة"، ثم "انزلق على طول المقبض") لم يخبره بها أي مبرمج بشري. لقد اكتشف هذه الاستراتيجية بنفسه بمجرد محاولة تقليل أخطائه.
4. التجارب: اختبار المحقق
اختبر الباحثون APPLE في عدة تحديات "صندوق الغموض":
- لعبة الشكل: تحديد ما إذا كان الجسم المخفي دائرة أو مربعاً عن طريق اللمس.
- لعبة الأرقام: لمس رقم ثلاثي الأبعاد (مثل "3" أو "7" مصنوع من الطين) لتخمين أي رقم هو.
- لعبة الحجم: تخمين مدى كبر حجم جسم ثلاثي الأبعاد بمجرد الشعور بسطحه.
- لعبة صندوق الأدوات: العثور على مفتاح ربط في صندوق كبير ومعرفة مكانه بالضبط والاتجاه الذي يشير إليه.
النتائج:
- كان APPLE أفضل بكثير من الطرق السابقة.
- تعلم حل هذه الألغاز دون الحاجة إلى كتابة قواعد محددة لكل منها من قبل البشر.
- نجح في المهام البسيطة (دائرة مقابل مربع) والمهام المعقدة (تحديد مفتاح ربط في صندوق مزدحم).
- حتى عندما لم يقوموا بتعديل الإعدادات لمهمة جديدة، ظل APPLE يعمل بشكل جيد، مما يثبت أنه أداة عامة الغرض، وليس مجرد أداة ذات خدعة واحدة.
5. لماذا هذا مهم؟
قبل APPLE، إذا كنت تريد من روبوت استكشاف بيئة جديدة، كان عليك أن تكون مبرمجاً وتكتب قواعد معقدة لكيفية استكشافه.
مع APPLE، أنت فقط تعطي الروبوت هدفاً ("اكتشف ماهية هذا الجسم") وطريقة لقياس النجاح (دالة الخسارة). والروبوت يتولى الباقي. الأمر يشبه إعطاء طفل عدسة مكبرة ولغز ليحله، بدلاً من إعطائه خريطة بها الإجابة محددة مسبقاً.
باختة، يعلم APPLE الروبوتات كيف تكون فضولية. فبدلاً من التحديق بفراغ أو التحرك عشوائياً، فإنها تتعلم كيف تسعى بنشاط وراء المعلومات التي تحتاجها لفهم العالم من حولها.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.