← أحدث الأبحاث
💻 computer science

GPT-6-Astra in a Navigation Workflow: Behavioral Analysis in Zero-Shot Vision-and-Language Navigation in Continuous Environments

تقيم هذه الورقة أداء نموذج GPT-6-Astra في مهام الملاحة المستمرة بين الرؤية واللغة بنمط التعلم الصفري (zero-shot)، حيث تُظهر أنه بينما يفسر النموذج التعليمات بفعالية ويطلب التوضيح، فإنه يعاني في ترجمة الأحكام المحلية الصحيحة إلى تقدم ذاتي مستدام وتوقف مناسب، محققاً نسبة نجاح بلغت 52.0% في معيار R2R-CE val-unseen.

المؤلفون الأصليون: Guangzhao Dai, Qi Wu, Bin Zhu

نُشر 2026-09-18
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Guangzhao Dai, Qi Wu, Bin Zhu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل روبوتاً وُضع في غرفة لم يسبق له رؤيتها من قبل، وتلقى تعليمات صوتية بسيطة مثل "غادر غرفة النوم، انعطف يساراً في الممر، ثم توقف بجانب الطاولة". لا تقتصر مهمته على فهم الكلمات فحسب، بل تتعداها إلى التحرك فعلياً عبر المساحة، وتفسير ما يراه، ومعرفة متى يتوقف بالضبط. هذا التحدي، المعروف باسم الملاحة عبر الرؤية واللغة، يقع عند تقاطع كيفية رؤية الآلات للعالم وكيفية فهمها للغة البشر. لسنوات، حاول الباحثون تعليم الروبوتات اتباع هذه التعليمات عبر تدريبها على كميات هائلة من البيانات، أي عرض آلاف الأمثلة للغرف والمسارات عليها حتى تتعلم الأنماط. ومع ذلك، يطرح نهج جديد سؤالاً مختلفاً: هل يمكن لذكاء اصطناعي قوي، لم يتم تدريبه خصيصاً على الملاحة، أن يكتشف كيفية التحرك عبر بيئة جديدة بمجرد النظر إلى الصور وقراءة التعليمات؟ هذا هو مجال الملاحة "صفرية المعرفة" (zero-shot)، حيث يجب على النظام الاعتماد على فهمه العام للعالم بدلاً من ذاكرة متخصصة لغرف محددة.

قام فريق من الباحثين مؤخراً باختبار هذه الفكرة باستخدام نموذج ذكاء اصطناعي متطور يسمى GPT-6-Astra. لم يقوموا ببناء روبوت مخصص أو تدريب النموذج على بيانات الملاحة. بدلاً من ذلك، أنشأوا سير عمل يعمل فيه النموذج كدماغ لوكيل افتراضي. في هذا الإعداد، يتلقى النموذج رؤية بانورامية لما يحيط به وتعليماً باللغة الطبيعية. ثم يتعين عليه تحديد ما سيفعله بعد ذلك: التحرك للأمام، الانعطاف يساراً، الانعطاف يميناً، أو التوقف. والأهم من ذلك، لم يترك الباحثون النموذج يخمن فحسب؛ بل بنوا نظاماً يسجل أفكار النموذج، ويتحقق من قراراته مقابل الواقع الفيزيائي للمحاكاة، ويسمح له بطلب رؤى جديدة إذا كان غير متأكد. كان الهدف هو معرفة ما إذا كان هذا الذكاء العام يمكنه توجيه وكيل بنجاح إلى وجهة ما، والأهم من ذلك، معرفة متى وصل.

مرر الباحثون هذا النظام عبر خمسين مهمة ملاحة مختلفة في مجموعة متنوعة من البيئات الداخلية غير المرئية، تتراوح من الشقق إلى المكاتب. كانت النتائج مزيجاً من الفهم المثير للإعجاب والقيود المحبطة. أدى النظام أداءً جيداً إلى حد معقول، حيث نجح في الوصول إلى المنطقة العامة للوجهة في حوالي نصف المحاولات. وعندما نجح، كان المسار الذي اتخذه غالباً فعالاً للغاية، مطابقاً بشكل وثيق للمسار المثالي الذي قد يتخذه الإنسان. أظهر النموذج قدرة رائمة على الربط بين ما رآه وما قيل له. على سبيل المثال، إذا كانت التعليمات هي البحث عن "الباب الثاني على اليسار"، فقد تمكن النموذج من تمييز ذلك الباب تحديداً عن الأول أو عن الباب الموجود على اليمين، حتى لو بدوا متشابهين جداً. كما استطاع أيضاً النظر إلى تاريخه، متذكراً أنه انعطف للتو، واستخدام هذه الذاكرة للتأكد من أنه على المسار الصحيح.

كان أحد أكثر السلوكيات إثارة للاهتمام التي لاحظها الباحثون هو استعداد النموذج للتوقف وطلب المزيد من المعلومات عندما يكون مرتبكاً. إذا رأى النموذج فتحة باب لكنه لم يكن متأكداً مما إذا كانت تؤدي إلى المكان الصحيح، فإن النظام سمح له بطلب نظرة أقرب أو زاوية مختلفة. وفي كثير من الحالات، كشفت هذه النظرة الإضافية عن تفاصيل مخفية، مثل ممر مسدود بباب أو رف أثبت أن الممر طريق مسدود. ومن ثم يقوم النموذج بتعديل خطته، رافضاً مساراً خاطئاً أو مؤكداً مساراً صحيحاً. هذه القدرة على البحث عن الأدلة وتغيير رأيه بناءً على معلومات بصرية جديدة كانت نقطة قوة واضحة، مما يظهر أن النموذج يمكنه التصرف كمتصف دقيق بدلاً من روبوت يتبع نصاً برمجياً بشكل أعمى.

ومع ذلك، سلطت الدراسة الضوء أيضاً على فجوة كبيرة بين فهم المهمة وإكمالها. كان النموذج بارعاً في كثير من الأحيان في تحديد مكان وجوده وما قام به، حيث ميز بشكل صحيح بين الإجراءات المكتملة وتلك المعلقة، ومع ذلك استمر النظام في الدوران دون عبور العتبة رغم إدراك النموذج للموقف. وفي حالات أخرى، قام النموذج بتقييم الوصول بشكل صحيح من خلال دوره المخصص لتقييم الوصول، ولكن قرار التوقف النهائي تطلب مزيجاً من تقييمه الخاص وفحوصات سير العمل الخارجية ليتم قبوله. أظهرت البيانات أنه بينما وصل النظام إلى الحي الصحيح في العديد من الحلقات، فإنه توقف في المكان الصحيح بنسبة ثلاثين بالمائة وستة وثلاثين بالمائة فقط من الحالات عبر قرار مقبول من سير العمل. يشير هذا إلى أنه بينما كان بإمكان "الدماغ" فهم الخريطة والتعليمات، فإن ترجمة هذا الفهم إلى قرار التوقف النهائي والدقيق لم تكن دائماً تلقائية.

وجد الباحثون أن نجاح النظام كان يعتمد بشدة على الأدوات الخارجية التي بنوها حوله. قام النموذج نفسه بأدوار محددة، بما في ذلك "تقييم الوصول"، ولكن سير العمل كان مسؤولاً عن التحقق من الاكتمال قبل قبول أمر التوقف (STOP). بدون هذه الفحوصات المشتركة، لم يكن حكم النموذج وحده كافياً لضمان الإتمام الناجح. هذا التمييز حيوي: كان الذكاء قادراً على الاستدلال حول البيئة وتقييم وصوله، لكنه لم يستطع إغلاق الحلقة بشكل موثوق بمفرده. تخلص الدراسة إلى أن التحدي المستقبلي لا يكمن فقط في جعل النماذج أكثر ذكاءً في التعرف على المعالم، بل في تعليمها الثقة في أحكامها الخاصة بما يكفي للتوقف عن الحركة عند وصولها. إن الطريق إلى الأمام يتضمن سد الفجوة بين معرفة أنك هناك وبين التوقف فعلياً هناك، وضمان أن لحظة الفهم تؤدي مباشرة إلى لحظة الإنجاز.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →