Bridging Learned Visual Perception and Symbolic Belief-Space Planning
تقدم هذه الورقة نموذج "النموذج اللغوي البصري كمرتكز احتمالي" (VLM-as-probabilistic-grounder) المبتكر الذي يلتقط عدم اليقين في الإدراك البصري كتوزيعات احتمالية فوق الحالات الرمزية، مما يتيح تخطيطاً قوياً في فضاء الاعتقاد يتفوق على النهج الحتمية الحالية في البيئات ذات الإدراك الجزئي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل روبوتاً يحاول ترتيب غرفة معيشة فوضوية. يرى كتاباً على طاولة ورفاً في الطرف الآخر من الغرفة، لكن كاميرته مهتزة والإضاءة خافتة. في العالم الحقيقي، نادراً ما تملك الروبوتات رؤية مثالية؛ فهي لا تستطيع رؤية كل شيء دفعة واحدة، فالأشياء قد تختبئ خلف الأثاث، كما أن المستشعرات غالباً ما تسيء تفسير ما تراه. ولكي يعمل الروبوت بأمان وفعالية، يجب عليه أن يعترف بما لا يعرفه. فإذا أخطأ في التخمين بشأن مكان جسم ما، فقد يحاول الإمساك بشيء ليس موجوداً، أو والأسوأ من ذلك، قد يحاول وضع جسم لا يحمله بالفعل. هذا اليقين هو العقبة الأكبر في تعليم الآلات كيفية التنقل في منازلنا المعقدة وغير المتوقعة.
لسنوات، حاول الباحثون حل هذه المشكلة عبر منح الروبوتات "عقلاً" يمكنه النظر إلى صورة واتخاذ قرار فوري بما هو حقيقي. استخدموا نماذج ذكاء اصطناعي قوية تفهم الصور واللغة معاً. كانت الفكرة بسيطة: اعرض على الروبوت صورة، واسأله "هل الخزانة مفتوحة؟"، وإذا أجاب النموذج بـ "نعم"، يتعامل الروبوت مع ذلك كحقيقة مطلقة ويخطط لخطوته التالية. لكن في الممارسة العملية، كان هذا النهج هشاً. فعندما يرتكب النموذج خطأً —وهو أمر يحدث كثيراً عندما تكون الأشياء مخفية أو الرؤية غير واضحة— يتبع الروبوت خطة مبنية على كذبة. قد يقضي دقائق في محاولة فتح باب مفتوح بالفعل، أو الأسوأ من ذلك، قد يستسلم تماماً لأنه يعتقد أن المهمة مستحيلة. المشكلة الجوهرية هي أن هذه الأنظمة تعامل التخمينات غير المؤكدة كحقائق يقينية، مما لا يترك مجالاً للخطأ.
اقترح فريق من الباحثين في معهد "التخنيون" في إسرائيل طريقة مختلفة للتفكير في هذه المشكلة. فبدلاً من إجبار الرخوت على تقديم تخمين واحد جامد حول العالم، علموه كيف يحتفظ باحتمالات متعددة في ذهنه في آن واحد. أطلقوا على نظامهم الجديد اسم "RoVLaP". فبدلاً من مطالبة نموذج الذكاء الاصطناعي بالقول إن "الكتاب على الطاولة" أو "الكتاب ليس على الطاولة"، يطلب النظام من النموذج تحديد مدى احتمالية كل سيناريو من هذه السيناريوهات. قد يقول النموذج إن هناك احتمال 60% أن يكون الكتاب على الطاولة و40% أن يكون مخفياً داخل درج. ومن خلال إبقاء هذه الاحتمالات حية، يمكن للروبوت بناء "اعتقاد" عن العالم يقر بوجود عدم اليقين. فهو لا يخطط للسيناريو الأكثر احتمالاً فحسب، بل يخطط لمجموعة من السيناريوهات المحتملة في وقت واحد.
اختبر الباحثون هذه الفكرة في بيئة منزلية محاكية، وهي عالم رقمي مليء بالأثاث والأدراج والأشياء الافتراضية. أعطوا الروبوت مهاماً شائعة في الأعمال المنزلية، مثل فرز الكتب على الرفوف، أو تنظيف الأدراج، أو إغلاق الأبواب. وفي هذه الاختبارات، كان على الروبوت الاعتماد كلياً على ما يمكن لكاميرته رؤيته، دون أي معرفة خاصة بمكان الأشياء المخفية. وقارنوا طريقتهم الجديدة بطريقتين أخريين شائعتين: إحداهما حيث يخبر نموذج الذكاء الاصطناعي الروبوت بما يجب فعله خطوة بخطوة، والأخرى حيث يقدم النموذج وصفاً واحداً ثابتاً للغرفة ليستخدمه مخطط قياسي.
أظهرت النتائج ميزة واضحة للنهج الجديد. ففي الاختبارات المحاكية، غالباً ما فشلت الطرق القياسية تماماً عندما كانت رؤية الروبوت محجوبة أو مضللة. على سبيل المثال، في مهمة كان فيها وعاء مخفي داخل خزانة مغلقة، يفترض الروبوت القياسي أن الوعاء مرئي ويحاول الإمساك به فوراً، فيفشل في كل مرة. أما النظام الجديد، فقد أدرك أن الوعاء قد يكون مخفياً، فخطط لتسلسل من الأفعال يتضمن فتح الخزانة أولاً. هذا التغيير الوحيد سمح للروبوت بالنجاح في المواقف التي فشلت فيها الطرق الأخرى. وفي المهام الصعبة، حل النظام الجديد 66.7% من المشكلات، بينما لم يحل منهج "المُحدد" (grounder) القياسي أي مشكلة. وفي المهام متوسطة الصعوبة، حسّن النظام الجديد معدلات النجاح بأكثر من 160% مقارنة بالطريقة القياسية.
وبعيداً عن مجرد حل المزيد من المهام، كان النظام الجديد أكثر كفاءة أيضاً. فبسبب تخطيطه لعدم اليقين منذ البداية، ارتكب أخطاء أقل واضاضطر لإعادة تخطيط مساراته بشكل أقل تكراراً. غالباً ما كانت الطرق القياسية تضطر للتوقف، وإدراك أنها مخطئة، ثم المحاولة مرة أخرى، مما يهدر الوقت والطاقة. في المقابل، أنتج النظام الجديد خططاً قوية بما يكفي للتعامل مع الارتباك الأولي دون الحاجة للتوقف وإعادة التفكير. لقد تحرك بنوع من الثقة الحذرة، مستعداً لاحتمال أن يكون تخمينه الأول خاطئاً، ومجهزاً بخطة بديلة تحسباً لذلك.
أثبت الباحثون أيضاً أن هذه الطريقة سليمة رياضياً. فقد أظهروا أنه إذا كان نموذج الذكاء الاصطناعي أفضل قليلاً من التخمين العشوائي، فإن الروبوت سيصل في النهاية إلى معرفة الحالة الحقيقية للعالم إذا استمر في المراقبة وتحديث معتقداته. النظام لا يتطلب أن يكون النموذج مثالياً؛ بل يحتاج فقط لأن يكون أفضل باستمرار من رمية العملة المعدنية. ومع مرور الوقت، ومع جمع الروبوت لمزيد من الأدلة البصرية، يتقلص عدم اليقين وتصبح خططه أكثر دقة. وهذا يوفر شبكة أمان: فحتى لو بدأ الروبوت بفكرة خاطئة، فقد صُمم النظام لتصحيح نفسه دون التعرض للانهيار أو التوقف.
يمثل هذا العمل تحولاً في كيفية بناء الوكلاء المستقلين. فهو ينتقل من فكرة أن الروبوت يجب أن يعرف الحقيقة لكي يعمل، إلى فكرة أن الروبوت يمكنه العمل بحكمة حتى عندما يكون غير متأكد. ومن خلال التعامل مع العالم كمجموعة من الاحتمالات بدلاً من واقع واحد ثابت، يصبح الروبوت أكثر قدرة على التكيف والموثوقية. وفي المنازل المحاكية، كان هذا يعني الفرق بين روبوت يستسلم عندما لا يستطيع رؤية جسم مخفي، وروبوت يفتح الخزانة بصبر ليجده. وبينما تنتقل الروبوتات من المختبرات الخاضعة للسيطرة إلى منازلنا الفعلية، حيث تتغير الإضاءة، وتتحرك الأشياء، وتُحجب الرؤية، قد يكون هذا القدرة على التخطيط للمجهول هو المفتاح لجعلها رفقاء مفيدين حقاً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.