← أحدث الأبحاث
💻 computer science

AnchorVLN: Geometry-Anchored Vision-Language Grounding Reasoning for Open-Vocabulary Navigation

تقدم الورقة البحثية نظام AnchorVLN، وهو نظام ملاحة بصرية-لغوية مفتوح المفردات يستفيد من خادم بروتوكول سياق النموذج (MCP) لفرض فصل صارم حيث تتولى النماذج البصرية-اللغوية التعامل مع الاستدلال الدلالي بينما تحدد الأدوات الهندسية الكميات المترية بشكل مستقل، مما يؤدي إلى تحسين دقة اتباع التعليمات ودقة تحديد مواقع الأشياء في البيئات غير المرئية بشكل كبير مقارنة بالتقدير المباشر للإحداثيات.

المؤلفون الأصليون: Long Giang Vu, Chengkai Yao, Yuxin Liu, FNU Aryan, Rajath Chandrashekar Aralikatti

نُشر 2026-09-14
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Long Giang Vu, Chengkai Yao, Yuxin Liu, FNU Aryan, Rajath Chandrashekar Aralikatti

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل روبوتًا يدخل غرفة لم يسبق له رؤيتها من قبل، مُكلفًا بالعثور على جسم معين بناءً على وصف منطوق مثل "الكرسي ذو الثلاث أرجل الموجود تحت اللوحة". لعقود من الزمن، كان الروبوتات تحل هذه المشكلة عن طريق بناء خريطة رياضية دقيقة للعالم باستخدام الليزر والكاميرات، ثم البحث في تلك الخريطة عن أسماء أشياء مبرمجة مسبقًا. نجح هذا الأمر جيدًا عند البحث عن "كرسي" أو "طاولة"، لكنه فشل عندما تصبح التعليمات إبداعية أو محددة، مثل "الكرسي الأحمر القريب من النافذة". كانت مفردات الروبوت مجمدة؛ فلم يكن بإمكانه فهم الأوصاف الجديدة. وفي السنوات الأخيرة، ظهرت نماذج ذكاء اصطناعي قوية يمكنها النظر إلى صورة وفهم أي وصف قد يقدمه البشر تقريبًا. ومع ذلك، فإن هذه النماذج بارعة في اللغة ولكنها سيئة للغاية في الرياضيات؛ إذ يمكنها إخبارك ما هو الشيء، لكنها غالبًا ما تخمن بشكل عشوائي عندما يُسأل عن مدى بعده أو المكان الدقيق الذي يجب التحرك إليه للوصول. إذا اعتمد الروبوت كليًا على مثل هذا النموذج للملاحة، فقد يقود نفسه بثقة نحو بقعة غير موجودة، لأن النموذج اخترع مسافة ليست حقيقية.

لقد عالج الباحثون وراء هذا العمل، المعروفون باسم "AnchorVLN"، هذه المشكلة من خلال إنشاء نظام يفصل بصرامة بين ما يعرفه الروبوت وكيفية تحركه. أدركوا أن أفضل نهج هو ترك الذكاء الاصطناعي يتولى مهمة اللغة وتحديد الأشياء، بينما تترك مهمة قياس المسافة والاتجاه لمستشعرات الروبوت الفيزيائية. لقد بنوا نظامًا يعمل فيه الذكاء الاصطناعي كدليل يشير إلى "ما" يجب البحث عنه، لكنه لا يحاول أبدًا تحديد "مدى المسافة" التي يجب قطعها. بدلاً من ذلك، يستخدم النظام مجموعة من الأدوات الرقمية التي تترجم أوصاف الذكاء الاصطناعي إلى إحداثيات فيزيائية باستخدام بيانات ليزر حقيقية من بيئة الروبوت. يضمن هذا عدم اعتماد الروبوت على رقم مخترع. تم اختبار النظام في تحدٍ تضمن خمس عشرة مشهدًا داخليًا مختلفًا، حيث كان على الروبوت اتباع ثلاثين تعليمات معقدة والإجابة على خمسة وأربعين سؤالًا حول مواقع الأشياء. وأظهرت النت la أن النظام عندما استخدم هذا الفصل في المهام، نجح في اتباع التعليمات بنسبة 64.4 بالمائة. وعندما أزال الباحثون الجزء الذي يتحقق من المسافات الفيزيائية، انخفض معدل النجاح بشكل كبير. علاوة على ذلك، عندما طُلب منه تحديد الموقع الدقيق لجسم ما، كان النظام الذي يستخدم بيانات مستشعرات حقيقية أكثر دقة بكثير من النظام الذي يحاول تخمين الموقع، مما قلل متوسط الخطأ في إيجاد مركز الجسم من أكثر من ثلاثة أمتار إلى أقل من مترين ونصف.

يكمن جوهر هذا الإنجاز في طريقة جديدة لربط عقل الروبوت بجسده. صمم الباحثون بروتوكول اتصال حيث يمكن للذكاء الاصطناعي التحدث فقط بالعبارات والأسماء، وليس بالأرقام أبدًا. عندما يرى الروبوت صورة لغرفة، قد يحدد الذكاء الاصطناعي "كرسيًا ذا ثلاث أرجل" ويعطيه اسمًا مؤقتًا، مثل "الجسم رقم سبعة". ثم يطلب الذكاء الاصطناعي من النظام العثور على هذا الكرسي. لا يسأل النظام الذكاء الاصطناعي عن مدى بعد الكرسي، بل ينظر النظام إلى ماسح الليزر الخاص بالروبوت، الذي يقيس المسافة الفعلية إلى الأرض والجدران. يجد النظام الكرسي في بيانات الليزر، ويحسب المسافة الحقيقية، ويخبر الروبوت بالتحرك نحو تلك النقطة المحددة. إذا حاول الذكاء الاصطناعي تخمين مسافة، فإن النظام يتجاهل الرقم ببساطة لأن الأدوات التي يستخدمها غير مبرمجة لقبولها. هذا يجبر الروبوت على الاعتماد على حواسه الخاصة للحركة، تمامًا كما يعتمد الإنسان على عينيه لتقدير المسافة أثناء الاستماع إلى توجيهات صديق. لا يزال بإمكان الروبوت فهم التعليمات المعقدة، مثل "اذهب إلى الكرسي الأقرب إلى التلفاز"، لأن النظام يمكنه مقارنة المسافات الحقيقية لجميع الكراسي التي رآها بالتلفاز، بدلاً من مطالبة الذكاء الاصطناعي بالقيام بالحسابات.

يعالج هذا النهج أيضًا مشكلة تعثر الروبوت أو تحركه نحو مساحة فارغة. إذا لم يتمكن الذكاء الاصطناعي من العثور على جسم ما، فإن النظام لا يجبر الروبوت على التخمين، بل يخبره بالتحرك إلى مكان جديد حيث قد يحصل على رؤية أفضل. يقوم الروبوت بعد ذلك بمسح المنطقة مرة أخرى، ويقوم النظام بتحديث قائمة الأشياء الداخلية لديه. هذه القائمة تشبه ذاكرة متنامية للغرفة، حيث يتم تسجيل كل جسم يراه الروبوت مع حجمه وموقعه الحقيقيين. إذا رأى الروبوت نفس الجسم من زاوية مختلفة، يقوم النظام بتحديث السجل لجعل الشكل أكثر دقة، بدلاً من إنشاء مدخل جديد مربك. يسمح هذا للروبوت ببناء فهم موثوق للمساحة بمرور الوقت، حتى لو بدأ بدون خريطة وبدون معرفة مسبقة بالغرفة. وجد الباحثون أن هذه الطريقة سمحت للروبوت بالملاحة بنجاح في بيئات لم يزرها من قبل، دون الحاجة إلى إعادة برمجته لكل غرفة جديدة أو لكل نوع جديد من الأشياء.

تسلط الدراسة الضوء على تحول جوهري في كيفية تفاعل الروبوتات مع العالم. فبدلاً من محاولة جعل نموذج واحد للذكاء الاصطناعي يقوم بكل شيء، من فهم اللغة إلى حساب الفيزياء، بنى الباحثون فريقًا يقوم فيه كل جزء بما هو بارع فيه. يتولى الذكاء الاصطناعي الإبداع واللغة، بينما تتولى مستشعرات الروبوت الدقة والحركة. هذا التقسيم للعمل يمنع الروبوت من ارتكاب أخطاء خطيرة بناءً على تخمينات واثقة. وتظهر نتائج التحدي أن هذه الطريقة ليست مجرد فكرة نظرية، بل هي حل عملي يعمل في سيناريوهات العالم الحقيقي. ومن خلال إبقاء اللغة والرياضيات منفصلة، يمكن للروبوت اتباع تعليمات معقدة وإيجاد الأشياء بمستوى من الدقة كان مستحيلاً سابقًا للأنظمة التي تعتمد على نموذج واحد. ويشير العمل إلى أنه لكي تتمكن الروبوتات من الملاحة حقًا في عالم البشر غير المتوقع، فإنها تحتاج إلى الثقة في حواسها للأرقام الصعبة، بينما تترك للذكاء الاصطناعي مهمة إرشادها بالكلمات.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →