VLN on the Fly: An Onboard Vision-Language Navigation Stack for Aerial Robots
تقدم الورقة البحثية "VLX on the Fly"، وهو نظام برمجي معياري للملاحة البصرية اللغوية على متن الروبوتات الجوية يفصل بين عمليات الربط والتخطيط والتحكم إلى مراحل متميزة لتحقيق معدلات نجاح عالية وسلامة مع الحفاظ على انخفاض العبء الحسابي.
المؤلفون الأصليون:Marco S. Tayar, Felipe Tommaselli, Gianluca Capezutto, Pedro Antonio Rabelo Saraiva, Pedro H. V. de Freitas, Lucas Kido, Guilherme Sonego, Ricardo V. Godoy, Marcelo Becker
المؤلفون الأصليون: Marco S. Tayar, Felipe Tommaselli, Gianluca Capezutto, Pedro Antonio Rabelo Saraiva, Pedro H. V. de Freitas, Lucas Kido, Guilherme Sonego, Ricardo V. Godoy, Marcelo Becker
داخل الهمهمة الهادئة لمستودع أو الزوايا المزدحمة لمنزل، يتعلم نوع جديد من الروبوتات كيف يصغي. لسنوات، حاول العلماء تعليم الآلات فهم اللغة البشرية والعمل بناءً عليها، وهو مجال يُعرف باسم "الملاحة عبر الرؤية واللغة". الفكرة بسيطة: يقول شخص ما، "اذهب إلى الكرسي الأحمر"، فيحدد الروبوت مكان ذلك الكرسي ويطير أو يقود نفسه إلى هناك. وبينما يعمل هذا بشكل جيد في محاكاة حاسوبية محكومة، فإن جعل ذلك يحدث في روبوت طائر حقيقي هو قصة مختلفة. يجب على الروبوت أن يرى العالم، ويفهم الكلمات، ويخطط مساراً آمناً عبر الهواء، ويتحكم في محركاته، كل ذلك بينما يحمل حاسوبه وبطاريته الخاصة. إذا أخطأ الروبوت في فهم الكلمات، أو إذا أخطأ في حساب منعطف ما، فقد يصطدم. التحدي يكمس في بناء نظام ذكي بما يكفي لاتباع التعليمات، وآمن بما يكفي للطيران دون إشراف بشري مستمر.
قام فريق من الباحثين في جامعة ساو باولو ببناء نظام يسمى "VLN on the Fly" لحل هذه المشكلة. بدلاً من محاولة تعليم برنامج حاسوبي واحد ضخم القيام بكل شيء في وقت واحد، قاموا بتقسيم المهمة إلى ثلاث خطوات واضحة تعمل معاً مثل سباق التتابع. أولاً، ينظر نموذج لغوي متخصص إلى بث الكاميرا والتعليمات المنطوقة لتحديد منطقة عامة قد يتواجد فيها الجسم المستهدف. ثانياً، يأخذ نظام تخطيط تلك المنطقة العامة ويستخدم معلومات العمق لحساب مسار ثلاثي الأبعاد سلس وآمن عبر الهواء. ثالثاً، تأخذ سياسة تحكم مدربة ذلك المسار وتصدر أوامر مباشرة لمحركات الطائرة بدون طيار (الدرون) لاتباعه. يسمح هذا النهج المتدرِب للباحثين بالتحقق من كل جزء من العملية، مما يضمن أنه إذا فشلت خطوة واحدة، فإن النظام يعرف بالضبط مكان المشكلة ويمكنه التوقف قبل وقوع حادث.
اختبر الباحثون هذا النظام على طائرة "كوادروتور" صغيرة مزودة بكاميرا وحاسوب مدمج. وضعوا أشياء يومية مثل سلة مهملات، وكرسي، وطفاية حريق في غرفة وطلبوا من الطائرة الطيران إليها بناءً على أوامر صوتية. في خمس عشرة رحلة منفصلة، وصلت الطائرة إلى هدفها بنجاح في ثلاث عشرة منها. وعند وصولها، كانت على بعد أقل من ستة سنتيمترات في المتوسط من المكان المقصود. عمل النظام بشكل جيد حتى عندما كان على الطائرة التنقل حول العوائق، حيث نجحت في تخطيط مسارات تتجنب الاصطدامات في بيئة مزدحمة. جرت العملية بأكملها على متن الطائرة، مستخدمة حوالي 39 بالمائة من قدرة الحاسوب المدمج، مما يترك مساحة كافية للمهام الأخرى.
كانت إحدى أهم النتائج هي كيفية تعامل النظام مع عدم اليقين. لا يحاول النموذج اللغوي تحديد البكسل الدقيق للجسم، وهو أمر قد يكون عرضة للخطأ. بدلاً من ذلك، يقسم عرض الكاميرا إلى شبكة بسيطة ويختار الخلية العامة التي يُرجح وجود الجسم فيها. أثبت هذا النهج العام أنه أكثر موثوقية. عندما تم اختبار النظام في غرفة مليئة بالعوائق، نجح في تجنب الاصطدامات في معظم المحاولات. وفي الحالات القليلة التي لم يصل فيها إلى الهدف، كان ذلك عادةً بسبب خروج الجسم من مجال رؤية الكاميرا أو لأن مستشعر العمق لم يستطع الرؤية لمسافة بعيدة كافية، وليس لأن الطائرة فقدت السيطرة. وجد الباحثون أيضاً أن النظام يمكنه التمييز بين الأشياء المختلفة، حيث حدد بشكل صحيح الكرسي عندما طُلب منه البحث عن كرسي وسلة المهملات عندما طُلب منه البحث عن سلة، حتى عندما كان كلاهما في نفس الغرفة.
يسلط نجاح هذا المشروع الضوء على تحول في كيفية بناء الروبوتات ذاتية القيادة. فبدلاً من الاعتماد على شبكة عصبية واحدة معقدة تحاول تعلم كل شيء في آن واحد، يظهر هذا العمل أن فصل المهام بين الفهم والتخطيط والتحكم يؤدي إلى نتائج أكثر أماناً وموثوقية. ومن خلال إبقاء الخطوات متميزة، استطاع الباحثون التحقق من أن الطائرة لم تكن مجرد تخمن، بل تتبع مساراً منطقياً من الكلمة المنطوقة إلى الحركة الفيزيائية. وبينما لا يزال النظام يواجه بعض الحدود، مثل الحاجة لرؤية الجسم لإيجاده والاعتماد على مدى مستشعر العمق، إلا أنه يثبت أن الطائرات بدون طيار يمكن الوثوق بها قريباً للتنقل في المساحات الداخلية المعقدة باستخدام لغة بشرية بسيطة، مما يفتح الباب لتطبيقات مستقبلية في التفتيش، والتوصيل، والبحث والإنقاذ.
ملخص تقني: الملاحة بالرؤية واللغة أثناء الطيران (VLN on the Fly)
بيان المشكلة يمثل نشر نظام الملاحة بالرؤية واللغة (VLN) بشكل كامل على متن الروبوتات الجوية تحديات كبيرة بسبب الموارد الحسابية المحدودة وصعوبة عزل الأخطاء في الأنظمة أحادية المرحلة. وبينما تقوم نماذج "الرؤية-اللغة-الفعل" (VLA) من طرف إلى طرف (end-to-end) بربط الملاحظات والتعليمات الخام مباشرة بأوامر التحكم، إلا أنها غالباً ما تضحي بقابلية الملاحظة وفحوصات السلامة المتأصلة في الأنظمة التركيبية (modular stacks). وفي مجال الاستقلالية الفيزيائية، وتحديداً للروبوتات الجوية، يتطلب ربط التعليمات بالواقع ليس فقط الفهم الدلالي، بل وأيضاً التحقق من ملاءمتها لديناميكيات المركبة وقيود السلامة. وعند دمج هذه المراحل في شبكة واحدة، يصبح من الصعب تحديد موقع الإخفاقات، كما يصعب فرض آليات السلامة القياسية—مثل فحوصات التصادم، واختبارات الجدوى، وسلوكيات الاستعادة. علاوة على ذلك، لا يزال دمج مكدس هرمي مع وحدات التحكم في الطيران على الأجهزة المدمجة مجالاً لم يتم استكشافه بشكل كافٍ.
المنهجية يقترح المؤلفون نظام VLN on the Fly، وهو مكدس ملاحة منفصل يعمل على متن الروبوت، يحافظ على مراحل الربط، والتخطيط، والتحكم كخطوات منفصلة وقابلة للفحص. يعمل النظام بالكامل على متن الروبوت دون حسابات خارجية أو تدريب من طرف إلى طرف. تتكون البنية من ثلاث مراحل معالجة أساسية ينسقها مشرف سلامة:
ربط الهدف القائم على نماذج الرؤية واللغة (VLM):
يستخدم النظام نموذج رؤية ولغة مكمم (Qwen-3.5-2B, INT4) لمعالجة إطارات RGB من منظور الشخص الأول والتعليمات اللغوية الطبيعية.
بدلاً من الربط على مستوى البكسل، يحدد النموذج واحداً من تسعة مناطق خشنة في شبكة صورة 3×3 تحتوي على الهدف.
يتم ربط خلية الشبكة المختارة بهدف ثلاثي الأبعاد باستخدام قيم العمق الوسيطة للبكسل المركزي في الخلية لتقليل الحساسية للضجيج. يتم إسقاط هذه النقطة عكسياً في إطار الكاميرا وتحويلها إلى إطار الخريطة باستخدام الوضع الحالي.
لضمان السلامة، يتم تقييد ارتفاع الهدف ضمن نطاق ضيق حول ارتفاع الطيران الحالي.
مشرف السلامة:
يعمل آلة حالة محدودة (finite-state machine) كبوابة بين نموذج الرؤية واللغة والمخطط.
يقوم بالتحقق من صحة الأهداف المرشحة مقابل حجم تشغيل محدود محدد بموقع الإقلاع الأولي.
لمنع الأوامر غير المستقرة، يتطلب المشرف ثلاثة تنبؤات متتالية لنفس منطقة الشبكة فوق عتبة ثقة معينة قبل قبول الهدف.
كما يقوم بضبط تنفيذ المسار بناءً على تقارير الجدوى الخاصة بالمخطط المستمدة من خريطة الإشغال الموجودة على متن الروبوت.
التخطيط ثلاثي الأبعاد والتحكم منخفض المستوى:
يقوم EGO-Planner بتوليد مسارات B-spline سلسة وقابلة للتنفيذ ديناميكياً في الفضاء ثلاثي الأبعاد. وهو يستخدم خريطة إشغال محلية مبنية من بيانات العمق لتجنب الاصطدام دون الحاجة إلى حقل مسافة إقليدي (ESDF) كامل.
يعمل RAPTOR، وهو سياسة تعلم تعزيزي مدربة مسبقاً، كمتحكم منخفض المستوى. حيث يقوم بربط نقاط تحديد الموقع والبيانات الحسية مباشرة بأوامر المحرك، ويتكيف عبر مختلف الطائرات الرباعية (quadrotors) دون الحاجة لإعادة التدريب (zero-shot). وهذا يحل محل تسلسل الموقع-الوضعية التقليدي الذي يتم ضبطه يدوياً.
المساهمات الرئيسية
مكدس منفصل يعمل على متن الروبوت: مكدس ملاحة جوي يعمل بالكامل على متن الروبوت يجمع بين نموذج رؤية ولغة مكمم للربط مفتوح المفردات، وEGO-Planner لتخطيط B-spline ثلاثي الأبعاد، وسياسة تعلم تعزيزي للتحكم منخفض المستوى، وكل ذلك دون تدريب من طرف إلى طرف أو حسابات خارجية.
مشرف سلامة خفيف الوزن: آلية تستخدم آلة حالة محدودة لرفض الأهداف خارج حدود التشغيل وضبط تنفيذ المسار بناءً على جدوى المخطط، مما يضمن السلامة عبر خط الإنتاج الهرمي.
تقييم الجدوى في الطيران الحقيقي: تقييم شامل للمكدس الكامل في مهمة هدف كائن مفتوح المفردات تتضمن ثلاثة مراجع متميزة، مما يثبت القدرة على عزو الإخفاقات إلى مراحل محددة بفضل التصميم التركيبي.
النتائج التجريبية تم تقييم النظام على طائرة رباعية مخصصة (MIRA) مجهزة بكاميرا Intel RealSense D435i وجهاز Jetson Orin NX على متنها، تحلق داخل حجم داخلي محكوم.
معدل النجاح: عبر 15 رحلة على ثلاثة مراجع (سلة مهملات، كرسي، طفاية حريق)، وصل المكدس إلى الهدف في 13 تجربة (معدل نجاح 87%).
الدقة: بلغ متوسط خطأ الهدف 5.72 سم. حققت مهمة سلة المهملات نجاحاً بنسبة 100% مع خطأ في الهدف قدره صفر.
الأداء: حقق نموذج الرؤية واللغة المكمم وسيط وقت استنتاج قدره 0.79 ثانية، مما حافظ على معدل استعلام قدره 0.5 هرتز مع ترك قدر كافٍ من الحوسبة للمخطط والسياسة. بلغ متوسط استهلاك وحدة معالجة الرسومات 39.3%.
البيئات المزدحمة: في 6 تجارب إضافية مع وجود عوائق، تتبع النظام مسارات خالية من الاصطدام بنجاح في 3 عمليات. في عمليتين، منعت طبقة السلامة التنفيذ بشكل صحيح بسبب انتهاكات العمق/الحدود. في عملية واحدة، تجنب المركبة العوائق لكن فشل في الوصول إلى نصف قطر الهدف بسبب انحراف التتبع.
الدراسة الاستقصائية (Ablation): وُجد أن دقة شبكة 3×3 هي الأمثل، حيث قدمت معدل أهداف صالحة بنسبة 100% مع تقليل تذبذب الاختيار بشكل كبير مقارنة بالشبكات الأكثر دقة أو الربط على مستوى البكسل الواحد.
الأهمية والادعاءات يزعم البحث أن نظام VLN on the Fly يثبت جدوى تشغيل مهام ملاحة معقدة ومفتوحة المفردات بالكامل على متن الروبوتات الجوية مع الحفاظ على سلامة وقابلية ملاحظة المكدس التركيبي. ومن خلال فصل الاستدلال الدلالي عن التخطيط المتري والتحكم منخفض المستوى، يسمح النظام بفحص الحالات الوسيطة (الربط، إسقاط الهدف، التخطيط) أثناء الطيران الحقيقي، وهو أمر بالغ الأهمية لتصحيح الأخطاء وضمان السلامة.
يشير المؤلفون بتواضع إلى أن التنفيذ الحالي يعتمد على الطيران بارتفاع ثابت وتتبع خارجي (OptiTrack) لتحديد الموقع. كما يقرون بأن الإسقاط العكسي للعمق محدود بنطاق المستشعر ومناطق العمق غير الصالحة، وأن التصميم غير المتزامن يعني أن أخطاء الربط ستستمر حتى الاستعلام التالي. ومع ذلك، فإن هذا العمل يؤسس لقاعدة للتحسينات المستقبلية في المتانة من خلال الاستشعار المتكامل والربط الوثيق بين عدم اليقين في الإدراك وتوليد المسار.