← أحدث الأبحاث
🤖 AI

SCALE: Self-uncertainty Conditioned Adaptive Looking and Execution for Vision-Language-Action Models

تقترح الورقة البحثية استراتيجية SCALE، وهي استراتيجية استدلال أحادية الممر وخالية من التدريب لنماذج الرؤية واللغة والعمل (Vision-Language-Action)، والتي تستفيد من عدم اليقين الذاتي لتعديل كل من الإدراك البصري وتنفيذ العمل بشكل تكيفي، مما يؤدي إلى تحسين المتانة والتفوق على أساليب توسيع وقت الاختبار الحالية دون الحاجة إلى تدريب إضافي أو أدوات تحقق.

المؤلفون الأصليون: Hyeonbeom Choi, Daechul Ahn, Youhan Lee, Taewook Kang, Seongwon Cho, Jonghyun Choi

نُشر 2026-08-31
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Hyeonbeom Choi, Daechul Ahn, Youhan Lee, Taewook Kang, Seongwon Cho, Jonghyun Choi

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لطالما كان حلم الذكاء الاصطناعي هو ابتكار روبوتات يمكنها الرؤية، وفهم اللغة، والتحرك بهدف محدد. واليوم، بدأ جيل جديد من الأنظمة المعروفة بنماذج "الرؤية واللغة والعمل" (vision-language-action models) في تحويل هذا الحلم إلى حقيقة. تعمل هذه الأنظمة كجسر بين ما يراه الروبوت وما يتعين عليه فعله، حيث تستقبل مشهداً بصرياً وتعليماً صوتياً، ثم تقرر الحركة الفيزيائية المناسبة. يتم تدريب هذه الأنظمة على كميات هائلة من البيانات، حيث تتعلم من آلاف الأمثلة لأيدي البشر وهي تتعامل مع الأشياء. ومع ذلك، تماماً مثل أي طالب، يمكن لهذه الروبوتات أن تتعثر عندما تواجه موقفاً لم تره من قبل. فعندما يواجه الروبوت مشهداً مربكاً — ربما طاولة مزدحمة بأشياء متشابهة المظهر أو مهمة ذات حلول متعددة محتملة — فإنه غالباً ما يتجمد أو يرتكب خطأً. ولا يكمصر التحدي الذي يواجه الباحثين في تعليم الروبوت المزيد من الحقائق فحسب، بل في مساعدته على إدراك متى يكون غير متأكد وكيفية التعامل مع حالة عدم اليقين تلك في الوقت الفعلي.

لسنوات طويلة، كان النهج المعياري لتحسين هذه الروبوتات هو جعلها "تفكر بعمق أكبر" قبل التحرك. يتضمن ذلك تشغيل عملية اتخاذ القرار نفسها عدة مرات، وتوليد عدة إجراءات ممكنة، ثم استخدام نظام منفصل لاختيار الإجراء الأفضل. وبينما يعمل هذا نظرياً، إلا أنه بطيء ويتطلب بيانات تدريب إضافية يصعب جمعها. كما أنه يتسم بالجمود؛ إذ تظل عينا الروبوت مثبتتين على نفس أجزاء الصورة بغض النظر عن مدى شعوره بالارتباك. ويقدم دراسة جديدة استراتيجية مختلفة تسمى "SCALE"، والتي تسمح للروبوت بتكييف إدراكه وحركته بناءً على إشارة داخلية بسيطة: مستوى عدم اليقين لديه. فبدلاً من تشغيل عمليات محاكاة متعددة أو الاستعانة بـ "حكم" منفصل، ينظر الروبوت إلى مستوى ثقته في لحظة واحدة. فإذا شعر باليقين، فإنه يتحرك بسرعة ويركز انتباهه بشكل ضيق. أما إذا شعر بعدم اليقين، فإنه يوسع نطاق نظره لجمع المزيد من المعلومات ويستكشف خيارات حركة مختلفة قبل الالتزام بمسار معين.

لقد طور الباحثون هذا الأسلوب من خلال مراقبة كيفية نشوء عدم اليقين بشكل طبيعي في هذه النماذج. فعندما يكون الروبوت واثقاً، تكون توقعاته الداخلية حادة وواضحة، وتشير بقوة إلى إجراء واحد محدد. وعندما يكون مرتبكاً، تصبح توقعاته ضبابية وتنتشر عبر احتمالات عديدة. وقد ابتكر الفريق طريقة لقياس هذه الضبابية دون الحاجة إلى أي بيانات تدريب جديدة. فقد قارنوا توقعات الروبوت الحالية بحالتين متطرفتين: حالة اليقين التام، حيث يكون الروبوت متأكداً بنسبة 100% من خيار واحد، وحالة الارتباك التام، حيث تبدو جميع الخيارات متساوية الاحتمال. ومن خلال قياس مدى قرب توقع الروبوت الحالي من هذين الطرفين، تمكنوا من حساب درجة دقيقة لمدى عدم تأكده. وتعمل هذه الدرجة كمفتاح يتحكم في شيئين في آن واحد: كيف ينظر الروبوت إلى العالم وكيف يقرر الحركة.

من الناحية العملية، يعني هذا أن الروبوت يغير سلوكه أثناء العمل. فعندما تكون درجة عدم اليقين منخفضة، يضيق الروبوت تركيزه البصري، متجاهلاً المشتتات للتركيز على المهمة المنشودة، ويختار حركته التالية بيد ثابتة وحاسمة. ولكن عندما ترتفع هذه الدرجة، مما يشير إلى أن الموقف صعب، يقوم الروبوت بشيء غير متوقع: يوسع انتباهه البصري لمسح المشهد بأكد بحثاً عن أدلة قد يكون قد فاتته، ويجرب مجموعة متنوعة من الحركات المحتملة بدلاً من الالتزام بخطة واحدة. وهذا يخلق حلقة تغذية راجعة حيث تعمل عينا الروبوت ويداه معاً لحل الارتباك. فإذا رأى الروبوت كوباً يشبه وعاءً، فإنه لا يكتفي بالتخمين، بل ينظر حوله بشكل أوسع ويجرب طرقاً مختلفة للوصول إليه حتى يجد النهج الصحيح.

اختبر الفريق هذا النهج في كل من محاكاة الكمبيوتر والتجارب الواقعية باستخدام أذرع روبوتية مجهزة بكاميرات. وقارنوا طريقتهم بأفضل التقنيات الموجودة، بما في ذلك تلك التي تتطلب تدريباً إضافياً ومحاولات متعددة لحل المشكلة. وفي سلسلة من المهام الصعبة، مثل نقل أشياء محددة إلى مواقع محددة في بيئات مزدحمة، تفوقت الطريقة الجديدة باستمرار على غيرها. وفي اختبار معياري مصمم لاختبار تسلسلات طويلة ومعقدة من الإجراءات، نجحت النماذج القياسية بنسبة 53 بالمائة تقريباً. أما الطريقة الجديدة، باستخدام تمريرة واحدة فقط لاتخاذ القرار، فقد رفعت نسبة النجاح إلى 63 بالمائة. وفي الاختبارات الواقعية مع الروبوتات الفيزيائية، كان التحسن أكثر دراماتيكية، حيث قفزت معدلات النجاح من حوالي 36 بالمائة إلى 56 بالمائة لنوع واحد من الروبوتات، ومن 44 بالمائة إلى 56 بالمائة لنوع آخر. وظلت النتائج ثابتة حتى عندما أُعطيت للروبوتات مهام لم يسبق لها رؤيتها، أو عندما كانت الأشياء التي تتعامل معها مصنوعة من مواد مختلفة أو ذات أشكال غير معتادة.

إن ما يجعل هذا الاكتشاف مهماً للغاية هو أنه يحقق هذه المكاسب دون التكلفة الحسابية العالية للأساليب السابقة. فالنهج الجديد لا يتطلب تدريباً إضافياً، ولا حكاماً خارجيين للتحقق من خيارات الروبوت، ولا محاولات متعددة للوصول إلى الإجابة الصحيحة. إنه يعمل في خطوة واحدة، مما يجعله سريعاً بما يكفي للتحكم في الوقت الفعلي. ووجد الباحثون أن مجرد جعل الروبوت "ينظر بجهد أكبر" أو "يتحرك بشكل عشوائي أكثر" لم ينجح؛ بل كان المفتاح هو ربط الانتباه البصري وقرارات الحركة مباشرة بإحساس الروبوت الداخلي بالثقة. فعندما كان الروبوت غير متأكد، كان يستكشف؛ وعندما كان متأكداً، كان يستغل معرفته. وقد سمح هذا التوازن له بالتنقل في البيئات المعقدة وغير المتوقعة بمستوى من المتانة لم تستطع الأنظمة السابقة مضاهاته.

كما استبعدت الدراسة عدة أفكار بديلة قد تبدو بديهية. فعلى سبيل المثال، إن جعل الانتباه البصري للروبوت أوسع طوال الوقت، أو جعل حركاته أكثر عشوائية طوال الوقت، أدى في الواقع إلى إضعاف الأداء. كان الروبوت بحاجة إلى معرفة متى يكون واسع النطاق ومتى يكون مركزاً. وبالمثل، فإن الطرق التي اعتمدت على قياس الانتشار العام لتوقعات الروبوت فقط، دون النظر في مدى حسمه تجاه خياره الأول، فشلت في استيعاب الصورة الكاملة لعدم اليقين. وقد أظهر الباحثون أن الروبوت يمكن أن يكون غير متأكد بشكل عام بشأن المشهد بأكمله، ومع ذلك يظل حاسماً للغاية بشأن إجراء معين، أو العكس صحيح. وقد استوعبت طريقتهم الجديدة كلا الجانبين، مما سمح باستجابة أكثر دقة.

في النهاية، يوضح هذا العمل أن منح الروبوت القدرة على التعرف على ارتباكه والتعامل معه هو وسيلة قوية لتحسين أدائه. فمن خلال السماكن للروبوت بتعديل طريقة نظره وفعلِه بناءً على مدى تأكده، خلق الباحثون نظاماً أكثر قدرة على التكيف والموثوقية. ويشير هذا النهج إلى مسار مستقبلي لبناء روبوتات يمكنها العمل بأمان وفعالية في العالم الحقيقي الفوضوي وغير المتوقع، حيث نادراً ما تسير الأمور تماماً كما هو مخطط لها. لا يحتاج الروبوت إلى أن يكون مثالياً؛ بل يحتاج فقط إلى معرفة متى لا يكون متأكداً، وأن يمتلك الأدوات اللازمة لمعالجة ذلك.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →