Neuro-Symbolic Skill Discovery for Conditional Multi-Level Planning
تقدم هذه الورقة بنية عصبية رمزية مبتكرة تتعلم مهارات رمزية عالية المستوى وعناصر تحكم منخفضة المستوى من عروض توضيحية شحيحة وغير مصنفة، مما يمكّن الروبوتات من تخطيط وتنفيذ مهام معقدة طويلة الأمد في بيئات غير مرئية ومزدحمة من خلال دمج الشبكات العصبية، ونماذج اللغة المرئية، والتخطيط القائم على التدرج.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم روبوت كيفية صنع شطيرة. إذا عرضت على الروبوت مجرد فيديو لإنسان يصنع شطيرة، فسيشعر الروبوت بالارتباك والارتباك الشديد. سيرى آلاف الحركات العضلية الصغيرة، والزاوية الدقيقة لليد، وسرعة تقطيع الخبز، وملمس الخبز. الأمر يشبه محاولة تعلم قيادة السيارة من خلال حفظ الضغط الدقيق على كل دواسة ودوران كل مسمار في العجلات. إنها بيانات هائلة جداً، ولا يستطيع الروبوت استيعاب القواعد العامة "للصورة الكبيرة".
تقترح هذه الورقة حلاً ذكياً: علم الروبوت أن يفكر في "فصول" بدلاً من "حروف".
إليك كيف يعمل نظامهم، مقسماً إلى مفاهيم بسيطة:
1. المشكلة: "الحرف" مقابل "الكلمة"
معظم الروبوتات بارعة في تحريك أذرعها (الـ "حروف")، لكنها سيئة جداً في التخطيط ليوم كامل (الـ "كلمات" و"الجمل").
- البيانات منخفضة المستوى: الحركة المستمرة والمبعثرة لذراع الروبوت وهي تلتقط حبة طماطم.
- المنطق عالي المستوى: مفهوم "التقاط حبة الطماطم".
يريد المؤلفون سد هذه الفجوة. يريدون من الروبوت أن ينظر إلى فيديو مبعثر لحركات الروبوت (بدون تسميات، بدون تعليمات، مجرد لقطات خام) وأن يستنتج: "أوه، هذه الكتلة من الحركة هي 'فتح درج'، وتلك الكتلة هي 'صب القهوة'".
2. الحل: "الشيف" العصبي-الرمزي (Neuro-Symbolic)
بنى المؤلفون نظاماً يعمل مثل مساعد طباخ ذكي يتعلم من خلال المشاهدة.
الخطوة 1: باحث الأنماط (الشبكة العصبية)
تخيل أنك تعرض على الروبوت 100 فيديو لشخص يفتح درجاً. أحياناً يسحبه بسرعة، وأحياناً ببطء، وأحياناً من اليسار، وأحياناً من اليمين. "دماغ" الروبوت (الشبكة العصبية) ينظر إلى كل هذه الفيديوهات المبعثرة ويدرك: "مهلاً، رغم أن الحركات مختلفة، إلا أنها جميعاً تنتهي بفتح الدرج".
يقوم الروبوت بتجميع هذه الحركات المتشابهة معاً ويعطيها رمزاً سرياً (رمزاً). هو لا يعرف كلمة "درج" بعد؛ هو فقط يعرف أن "الرمز أ" يعني "فتح الدرج". يفعل ذلك لكل مهارة يراها، محولاً الفيديوهات المبعثرة إلى قائمة مرتبة من الرموز المجردة.الخطوة 2: المترجم (روبوت الدردشة الذكي)
الآن أصبح لدى الروبوت قائمة من الرموز (الرمز أ، الرمز ب، الرمز ج)، لكن المخطط البشري لا يعرف معناها. لذا، يأخذ النظام لقطة لما فعله الروبوت عندما استخدم "الرمز أ" ويعرضها على ذكاء اصطناعي فائق الذكاء (مثل النماذج اللغوية الكبيرة).
ينظر الذكاء الاصطناعي إلى الصورة ويقول: "آه، فهمت! الرمز أ هو 'التقاط حبة الطماطم' والرمز ب هو 'صب الماء'".
فجأة، أصبح لدى الروبوت قاموس. يمكنه الآن التواصل مع مخطط عالي المستوى باستخدام اللغة البشرية.الخطوة 3: المخطط الرئيسي (الدماغ)
الآن، تعطي الروبوت هدفاً كبيراً: "اصنع لي سلطة".
يستخدم المخطط عالي المستوى (الـ "دماغ") القاموس لإنشاء قائمة مهام:- التقاط حبة الطماطم.
- التقاط الخس.
- وضعهما في الوعاء.
هذا هو المخطط عالي المستوى. إنه بسيط ومنطقي.
الخطوة 4: ذاكرة العضلات (التنفيذ)
هنا تكمن الخدعة السحرية. عندما يحتاج الروبوت فعلياً للقيام بالخطوة 1 ("التقاط حبة الطماطم")، فهو لا يخمن فحسب. بل يتذكر "الرمز أ" الذي تعلمه سابقاً. ولكن بما أن حبة الطماطم في مكان مختلف قليلاً عن فيديوهات التدريب، يستخدم الروبوت خدعة رياضية (التخطيط القائم على التدرج - gradient-based planning) لتعديل الحركة قليلاً.الأمر يشبه عازف البيانو الذي يعرف أغنية "تشوبستيكس" (Chopsticks). إذا نُقل البيانو إلى غرفة أخرى، فإن العازف لا يعيد تعلم الأغنية؛ بل يقوم فقط بتعديل وضعية يده قليلاً ليضغط على المفاتيح الصحيحة. الروبوت يعدل "الرمز أ" ليتناسب مع موقع حبة الطماطم الجديد.
3. لماذا يعد هذا أمراً هاماً؟
عادةً، لتعليم الروبوت خدعة جديدة، تحتاج إلى إنسان يسجل مئات الأمثلة المثالية ويصنف كل واحدة منها ("هذا التقاط"، "هذا وضع"). وهذا يستغرق وقتاً طويلاً جداً.
هذا النظام مميز لأن:
- يتعلم من البيانات "المبعثرة": يمكنه النظر إلى عدد قليل من الفيديوهات غير المصنفة واستنتاج المهارات بمفرده.
- يعمل في أماكن جديدة: إذا علمته التقاط كوب من الجانب الأيسر للطاولة، يمكنه معرفة كيفية التقاطه من الجانب الأيمن دون الحاجة لتدريب جديد.
- يتعامل مع المهام الطويلة: يمكنه التخطيط لتسلسلات معقدة (مثل "اصنع القهوة، ثم اغسل الكوب، ثم جففه") عن طريق ربط هذه "الرموز" البسيطة معاً.
التشبيه: تعلم لغة
فكر في حركات الروبوت الخام كأنها أصوات (مثل مناغاة الطفل).
- الطريقة القديمة: يجب عليك تعليم الروبوت كل صوت محدد لكل موقف محدد.
- طريقة هذه الورقة: يستمع الروبوت للمناغاة، ويكتشف أن بعض الأصوات تشكل "كلمات" (مهارات)، ثم يستخدم قاموساً (الذكاء الاصطناعي) لترجمة تلك الكلمات إلى جملة (المخطط). وبمجرد معرفة الكلمات، يمكنه تكوين جمل جديدة لم يسمعها من قبل.
النتيجة
في اختباراتهم، استطاع هذا الروبوت الدخول إلى مطبخ لم يره من قبل، والنظر إلى سطح طاولة مزدحم، والنجاح في صنع القهوة أو تحميل غسالة الأطباق، حتى لو كانت الأكواب والأطباء في أماكن غريبة. فعل ذلك من خلال مشاهدة أمثلة قليلة فقط من كل إجراء أولاً.
باخت-صار: لقد علموا الروبوت التوقف عن حفظ كل حركة عضلية دقيقة والبدء في التفكير في "أفعال"، مما سمح له بأن يكون مساعداً مرناً وذكياً بدلاً من كونه آلة جامدة مبرمجة مسبقاً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.