From Pixels to Predicates: Learning Symbolic World Models via Pretrained Vision-Language Models
تقترح هذه الورقة طريقة تستفيد من نماذج الرؤية واللغة سابقة التدريب لتعلم نماذج عالم رمزية، مدمجة ومجردة، من عروض بصرية محدودة، مما يتيح التعميم الصفري والتخطيط طويل المدى لمهام روبوتية معقدة عبر أجسام وبيئات وأهداف جديدة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم روبوت كيفية تنظيف غرفة فوضوية.
الطريقة القديمة (نهج "الببغاء"):
عادةً، إذا أردت أن يتعلم الروبوت، فإنك تعرض عليه فيديو لإنسان يقوم بالتنظيف. يحاول الروبوت حفظ الحركات بدقة: "حرك الذراع لليسار، التقط الكوب الأحمر، تحرك نحو السلة، اترك الكوب".
هذا يعمل بشكل رائع إذا كانت الغرفة تبدو تماماً كما هي في كل مرة. ولكن ماذا لو كان الكوب أزرق؟ ماذا لو كانت السلة على الأرض بدلاً من الطاولة؟ ماذا لو ظهر جسم جديد، مثل لعبة، على الطاولة؟ سيصاب الروبوت بالارتباك. الأمر يشبه ببغاءً لا يمكنه سوى تكرار أغنية لكنه لا يفهم كلماتها؛ إذا تغير اللحن، يتوقف الببغاء عن الغناء.
الطريقة الجديدة (نهج "المترجم" - Pix2Pred):
يقدم هذا البحث طريقة جديدة تسمى pix2pred. بدلاً من مجرد حفظ الحركات، تعلم هذه الطة الروبوت كيفية فهم قصة الغرفة باستخدام "مترجم" خاص (نموذج رؤية ولغة مدعوم بالذكاء الاصطناعي).
إليك كيف يعمل الأمر، خطوة بخطوة:
١. "المترجم" (نموذج الرؤية واللغة)
تخيل أن لديك أمينة مكتبة ذكية ومثقفة جداً، يمكنها النظر إلى صورة ووصفها بلغة إنجليزية مثالية.
- المدخلات: تعرض على الروبوت بعض الفيديوهات القصيرة لإنسان يقوم بالتنظيف.
- السحر: تنظر "أمينة المكتبة" إلى الصور وتبدأ في ابتكار مفردات من المفاهيم (تسمى "المسندات" أو predicates).
- بدلاً من رؤية مجرد "بكسلات"، تقول أمينة المكتبة: "أوه، أنا أرى طاولة"، "هذا ممحاة"، "الطاولة نظيفة"، "السلة ممتلئة"، "يد الروبوت فارغة".
- الروبوت لا يرى مجرد أشكال؛ بل يتعلم معنى المشهد.
٢. "المصفّي" (التحسين/Optimization)
قد تصبح أمينة المكتبة متحمسة أكثر من اللازم وتقترح ١٠٠ مفهوم مختلف (مثلاً: "هل الطاولة مستديرة؟"، "هل الطاولة زرقاء؟"، "هل الطاولة سعيدة؟"). معظم هذه المفاهيم عديمة الفائدة.
- تعمل خوارزمية البحث كـ محرر صارم. تنظر إلى الفيديوهات وتتساءل: "أي من هذه المفاه المائة ساعد الإنسان فعلياً في حل المشكلة؟"
- تقوم بالتخلص من الحشو وتحتفظ فقط بالمفاهيم المهمة، مثل: "هل الطاولة خالية؟" أو "هل الجسم داخل السلة؟".
- الآن، أصبح لدى الروبوت قاموس صغير وقوي من القواعد التي تهم حقاً.
٣. "لاعب الشطرنج" (المخطط/Planner)
الآن، لدى الروبوت هدف جديد: "نظف الطاولة، لكن هذه المرة الممحاة مخبأة داخل صندوق".
- الروبوت القديم: "لم أرَ ممحاة داخل صندوق من قبل! لا أعرف ماذا أفعل!" (يفشل).
- روبوت Pix2Pred: يستخدم قاموسه. يفكر:
- الهدف: الممحاة يجب أن تكون على الطاولة.
- الحالة الحالية: الممحاة داخل صندوق.
- الخطة: يجب أن أفتح الصندوق ← آخذ الممحاة ← أمسح الطاولة.
- يتحقق من قواعده: "هل يمكنني أخذ الممحاة؟ نعم، إذا كانت يدي فارغة".
- يبني خطة خطوة بخطوة، مثل لاعب شطرنج يفكر بثلاث خطوات للأمام.
الاختبار في العالم الحقيقي
اختبر الباحثون هذا على روبوت حقيقي (روبوت الكلب Spot من Boston Dynamics) وفي محاكاة لألعاب الفيديو.
- التحدي: قاموا بتدريب الروبوت على مهام بسيطة (مثل مسح طاولة بجسم واحد).
- الاختبار: ثم طلبوا من الروبوت القيام بأشياء معقدة وجديدة لم يسبق له رؤيتها، مثل:
- تنظيف طاولة تحتوي على خمسة أجسام بدلاً من واحد.
- مسح طاولة في غرفة مختلفة تماماً بإضاءة مختلفة.
- استعادة جسم من سلة، مسح الطاولة، ثم إعادة الجسم إلى مكانه (لغز متعدد الخطوات).
النتيجة: نجح الروبوت! لأنه تعلم المفاهيم (مثل "اليد فارغة" أو "السلة ممتلئة") بدلاً من مجرد نسخ الحركات، فقد استطاع التعميم. كان الأمر أشبه بتعليم طفل قواعد الطبخ بدلاً من مجرد إظهار كيفية صنع شطيرة واحدة؛ بمجرد معرفة القواعد، يمكنهم صنع بيتزا، أو سلطة، أو شطيرة، حتى لو لم يصنعوا ذلك الطبق المحدد من قبل.
باختصار
pix2pred هي طريقة تستخدم ذكاءً اصطناعياً ذكياً لترجمة صور الكاميرا الخام إلى لغة منطقية بسيطة (مثل "الكوب على الطاولة"). ثم تقوم بتصفية الضجيج للعثور على أهم القواعد. هذا يسمح للروبوت بـ تخطيط أفعاله منطقياً، وحل مشكلات جديدة تماماً عبر دمج هذه القواعد البسيطة، بدلاً من مجرد النسخ الأعمى لما رآه من قبل.
إنها تحول الروبوت من ببغاء بلا عقل إلى حلّال مشاكل مفكر.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.