CWM: Contrastive World Models for Action Feasibility Learning in Embodied Agent Pipelines
تقدم هذه الورقة نماذج العالم التباينية (CWM)، وهي نهج مبتكر يعزز تقييم جدوى الأفعال لدى الوكلاء المجسدين من خلال ضبط النماذج اللغوية الكبيرة باستخدام هدف تبايني على الأمثلة السلبية الصعبة، مما يتفوق بشكل كبير على الضبط الدقيق التقلي تحت الإشراف في التمييز بين الأفعال الصالحة فيزيائياً والأفعال غير الصالحة الطفيفة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تعلم روبوتًا كيفية طهي وجبة معقدة، مثل "السوفليه". لدى الروبوت قائمة تضم آلاف الأشياء التي يمكنه القيام بها تاليًا: "كسر البيض"، "تشغيل الفرن"، "أكل الدقيق الخام"، أو "إذابة السكر في الهواء".
معظم هذه الأفعال إما عبثية أو مستحيلة فيزيائيًا. إذا حاول الروبوت "إذابة السكر في الهواء"، فإنه يضيع الوقت، ويحدث فوضى، أو يفسد الوصفة.
تقدم هذه الورقة البحثية "مرشحًا ذكيًا" جديدًا للروبوتات يسمى CWM (نموذج العالم التبايني). مهمته هي الوقوف عند باب المطبخ وقول: "توقف! لا يمكنك فعل ذلك. ولكن، يمكنك فعل هذا".
إليك شرح بسيط لكيفية عمله ولماذا هو أفضل من الطريقة القديمة.
الطريقة القديمة: اختبار "نعم/لا" (SFT)
في السابق، كان المهندسون يعلمون الروبوتات كيفية تصفية الأفعال باستخدام طريقة تسمى الضبط الدقيق الخاضع للإشراف (Svised Fine-Tuning - SFT).
فكر في هذا الأمر كمعلم يعطي طالبًا اختبارًا حيث يتعين عليه الإجابة بـ "صواب" أو "خطأ" لكل سؤال على حدة.
- السؤال: "هل يمكنني أكل الدقيق الخام؟"
- الإجابة: خطأ.
- السؤال: "هل يمكنني كسر البيض؟"
- الإجابة: صواب.
المشكلة: هذا يعمل بشكل جيد للأخطاء الواضحة (مثل أكل الدقيق الخام). لكنه يفشل عندما يكون الخطأ محيرًا.
- السؤال: "هل يمكنني تبريد الماء المغلي؟" (الوصفة تقول "غلي" الماء).
- السؤال: "هل يمكنني تسخين الماء المغلي؟" (هذا هو الصحيح).
بالنسبة للبشر، هذه الأمور واضحة. أما بالنسبة للروبوت المدرب بطريقة "نعم/لا" القديمة، فإن كلتا الجملتين تبدوان متشابهتين جدًا. قد يرتبك الروبوت لأنه تعلم الحكم على كل جملة بمعزل عن الأخرى، دون مقارنتها جنبًا إلى جنب. وقد يخطئ بالخطأ ويقول "صواب" للجملة الخاطئة.
الطريقة الجديدة: مواجهة "اختبار التذوق" (CWM)
يقترح مؤلفو هذه الورقة البحثية CWM، الذي يغير قواعد اللعبة في التدريب. بدلًا من اختبار "نعم/لا"، يستخدمون منافسة اختبار التذوق.
تخيل الروبوت كحكم في برنامج طبخ. بدلًا من تذوق طبق واحد وتحديد ما إذا كان جيدًا أم لا، يُعطى الحكم طبقًا مثاليًا واحدًا (الفعل الصحيح) و 16 طبقًا سيئًا (الأفعال الخاطئة) دفعة واحدة.
مهمة الروبوت الوحيدة هي النظر إلى المجموعة بأكملها وقول: "من هو الفائز؟"
- "السلبيات الصعبة": لم يكتفِ الباحثون بإعطاء الروبوت أطباقًا سيئة واضحة (مثل "أكل القدر")، بل أعطوه "سلبيات صعبة" — وهي أطباق تبدو مشابهة جدًا للفائز ولكنها خاطئة قليلاً.
- الفائز: "تسخين الماء".
- الخاسر الصعب: "تبريد الماء". (كلمة واحدة فقط مختلفة، لكنها كارثة فيزيائية).
من خلال إجبار الروبوت على مقارنة الفائز مقابل الخاسرين "الذين يشبهونه تمامًا"، فإنه يتعلم الحدود الدقيقة لما هو ممكن فيزيائيًا. إنه يتعلم أن "التسخين" و"التبريد" هما ضدان، حتى لو كانت الجملتان متشابهتين في الشكل.
النتائج: لماذا يهم ذلك؟
اختبر الباحثون هذا في عالم رقمي يسمى ScienceWorld، حيث يتعين على الروبوتات حل ألغاز علمية.
- اختبار "الكلمة المحيرة": عندما كان الفعل الخاطئ يختلف عن الفعل الصحيح بكلمة واحدة فقط (مثل "تبريد" مقابل "تسخين")، نجح الروبوت القديم بنسبة 86%. أما روبوت CWM الجديد فقد نجح بنسبة 93%. قد يبدو هذا الرقم صغيرًا، ولكن في سلسلة طويلة من الخطوات، هذا الفرق يمنع الروبوت من الاصطدام بالحائط.
- "اختبار الضغط": وضعوا الروبوت في مطبخ جديد لم يره من قبل. بدأ الروبوت القديم بالتخمين العشوائي وترتيب الأفعال الخاطئة في مراتب عالية جدًا. ومع ذلك، حافظ الروبوت الجديد (CWM) على الفعل الصحيح بالقرب من أعلى القائمة، حتى عندما كان مرتبكًا. لقد كان أكثر "أمانًا" وموثوقية.
تشبيه الصورة الكبيرة
فكر في عقل الروبوت كـ مدير توظيف.
- الطريقة القديمة (SFT) تشبه مديرًا يراجع السير الذاتية واحدة تلو الأخرى. "هل هذا الشخص مؤهل؟" "نعم". "هل هذا الشخص مؤهل؟" "نعم". قد يوظف شخصين يبدوان متشابهين على الورق ولكن لديهما مهارات مختلفة تمامًا، لأنه لم يقارن بينهما مباشرة.
- الطريقة الجديدة (CWM) تشبه مديرًا يراجع كومة كاملة من السير الذاتية في وقت واحد. "حسنًا، نحن بحاجة إلى طاهٍ. هذا الشخص يستطيع الطبخ، ولكن هذا الشخص يمكنه الخبز فقط. هذا الشخص يمكنه الخبز، لكنه لا يستطيع التعامل مع الحرارة. من هو الأنسب لهذه الوظة المحددة الآن؟"
الخاتمة
تثبت هذه الورقة أنه لجعل الروبوتات أكثر ذكاءً في فهم العالم المادي، لا ينبغي لنا فقط تعليمها قول "نعم" أو "لا" للأفعال. نحن بحاجة إلى تعليمها مقارنة الأفعال ببعضها البعض، خاصة تلك الأفعال المحيرة التي تبدو صحيحة تقريبًا ولكنها خاطئة في الواقع.
يعمل "نموذج العالم التبايني" هذا كمرشح أكثر حدة ونقدًا، مما يضمن عدم إضاعة الروبوت للوقت في محاولة فعل المستحيل، مما يجعله شريكًا أكثر أمانًا وكفاءة للبشر.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.