← أحدث الأبحاث
🤖 AI

HiST-VLA: A Hierarchical Spatio-Temporal Vision-Language-Action Model for End-to-End Autonomous Driving

يُعد HiST-VLA نموذجاً هرمياً جديداً للرؤية واللغة والأفعال (Vision-Language-Action) يعتمد على البعد المكاني والزماني، وهو يعالج أوجه القصور في الإدراك المكاني ثلاثي الأبعاد والاستدلال العددي للقيادة الذاتية من خلال دمج الوعي الهندسي، والتناثر الديناميكي للرموز (dynamic token sparsification)، ومخطط يعتمد على المحولات الهرمية (hierarchical transformer-based planner) لتحقيق أداء رائد في اختبار NAVSIM v2.

المؤلفون الأصليون: Yiru Wang, Zichong Gu, Yu Gao, Anqing Jiang, Zhigang Sun, Shuo Wang, Yuwen Heng, Hao Sun

نُشر 2026-02-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yiru Wang, Zichong Gu, Yu Gao, Anqing Jiang, Zhigang Sun, Shuo Wang, Yuwen Heng, Hao Sun

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم سائقاً مبتدئاً كيفية القيادة في مدينة مزدحمة. لن تكتفي بمجرد قول "قُد السيارة"، بل ستحتاج إلى شرح كيفية القيادة: "خفف السرعة بلطف لأن هناك حفرة"، "انعطف قليلاً جهة اليسار لتجنب سيارة مركونة"، و"راقب الإشارة الحمراء أمامك".

لفترة طويلة، عانت السيارات ذاتية القيادة من هذا الأمر. فإما أنها بارعة جداً في رؤية الطريق لكنها سيئة في فهم التعليمات المعقدة، أو أنها بارعة في فهم اللغة ولكنها سيئة في العمليات الحسابية الفعلية للتوجيه والفرملة.

هنا يأتي دور HiST-VLA، وهو "عقل فائق" جديد للسيارات ذاتية القيادة طوره باحثون في Bosch. فكر فيه كأنه سائق محترف + مدرب دقيق يعملان معاً في حزمة واحدة.

إليك كيف يعمل، مقسماً إلى مفاهيم بسيطة:

1. المشكلة: "العملاق الأخرق"

نماذج الذكاء الاصطناعي الحالية للقيادة تشبه العمالقة الذين يحاولون تمرير خيط عبر إبرة. يمكنهم رؤية الصورة الكاملة (الطريق، السيارات، اللوحات)، لكنهم غالباً ما يكونون:

  • سيئين في الرياضيات ثلاثية الأبعاد: قد يرون سيارة ولكنهم لا يعرفون بالضبط مدى بعدها في الفضاء ثلاثي الأبعاد.
  • سيئين في التوقيت: قد ينسون ما حدث قبل ثانيتين، مما يؤدي إلى حركات مفاجئة ومتشنجة.
  • كثيري الثرثرة: يعالجون الكثير من المعلومات، مما يبطئ سرعتهم (مثل محاولة قراءة كل كتاب في مكتبة قبل اتخاذ قرار بشأن الكتاب الذي ستختاره).

2. الحل: HiST-VLA (النموذج الهرمي المكاني-الزماني)

بنى الباحثون نظاماً يعمل كعملية اتخاذ قرار من خطوتين، تشبه طريقة تفكير السائق البشري.

الخطوة أ: "المفكر في الصورة الكبيرة" (نموذج الرؤية واللغة والأفع actually - VLA)

هذا الجزء من النظام هو المخطط الاستراتيجي. ينظر إلى تغذيات الكاميرا ويستمع إلى أمرك (مثلاً: "اذهب إلى المخرج التالي").

  • النظارات ثلاثية الأبعاد: بدلاً من مجرد النظر إلى صورة مسطحة، يرتدي هذا الذكاء الاصطناعي "نظارات ثلاثية الأبعاد". إنه يفهم العمق والهندسة، لذا يعرف بالضبط أين يوجد الرصيف وكم يبلغ ارتفاع الجسر.
  • ممر الذاكرة: هو لا ينظر فقط إلى اللحظة الحالية؛ بل يتذكر الثواني القليلة الماضية من القيادة. وهذا يساعده على القيادة بسلاسة، مثل الإنسان الذي يتوقع المنعطف بدلاً من مجرد الاستجابة له في اللحظة الأخيرة.
  • "الفلتر الذكي" (تبسيط الرموز - Token Sparsification): هذه خدعة ذكية. تخيل أنك تقرأ مقالاً طويلاً؛ لست بحاجة لقراءة كل كلمة لتفهم الفكرة الرئيسية، بل تحتاج فقط للجمل المهمة. يقوم هذا الذكاء الاصطناعي تلقائياً بتجاهل الأجزاء المملة والمتكررة من صورة الكاميرا (مثل بقعة فارغة من السماء) ويركز فقط على التفاصيل الحاسمة (السيارة، المشاة، اللوحة). وهذا يجعله أسرع وأكثر كفاءة.
  • "درجة الثقة": قبل أن يتصرف، يسأل نفسه: "ما مدى تأكدي؟". إذا لم يكن متأكداً، فإنه يضع علامة على الخطة بدرجة ثقة منخفضة، مما يخبر الجزء التالي من النظام بأن يكون حذراً للغاية.

الخطوة ب: "المدرب الدقيق" (المخطط الهرمي)

يضع المخطط الاستراتيجي خطة أولية (مثلاً: "انعطف يساراً"). لكن الخطة الأولية ليست كافية لسيارة؛ يجب أن تكون سلسة وآمنة.

  • التنقيح: يأخذ هذا الجزء الثاني الخطة الأولية ويصقلها. يشبه الأمر مدرب رقص يأخذ حركات الطالب الأولية ويتقن خطوات قدميه.
  • فحص السلامة: يقوم بتمرير الخطة عبر "مقيّم" يتحقق من ثلاثة أشياء: السلامة (هل سنصطدم بشيء؟)، الراحة (هل سيسكب الراكب قهوته؟)، والكفاءة (هل نتحرك للأمام؟).
  • المخرج النهائي: يحول الفكرة الأولية إلى مسار مثالي وسلس وآمن يمكن للسيارة اتباعه بالفعل.

3. لماذا يعد هذا أمراً هاماً؟

اختبر الباحثون هذا النظام الجديد على محاكي قيادة صعب للغاية يسمى NAVSIM.

  • النتيجة: سجل HiST-VLA 88.6 من 100 (على مقياس يسجل فيه البشر 90.3).
  • المقارنة: سجلت نماذج الذكاء الاصطناعي السابقة عادة حوالي 76 أو 84. هذا النموذج الجديد هو الأول الذي يقترب من مستوى الأداء البشري في هذه الاختبارات.
  • فوز "الحلقة المغلقة الزائفة": حتى عندما تم جعل الاختبار أكثر صعوبة (محاكاة سيارة قد ترتكب أخطاء)، ظل HiST-VLA يتفوق على أي ذكاء اصطناعي آخر، مما يثبت أنه قوي وموثوق.

الخلاصة

فكر في HiST-VLA كفرق بين سائق مبتدئ يصاب بالذعر عند كل إشارة توقف، وسائق محترف يتوقع حركة المرور، ويقود بسلاسة، ويعرف بالضبط مدى بعد الرصيف عنه.

من خلال الجمع بين الرؤية ثلاثية الأبعاد، الذاكرة، الفلترة الذكية، وعملية التخطيط ثنائية الخطوات، يعلم هذا النموذج الجديد السيارات ذاتية القيادة ليس فقط "رؤية" الطريق، بل حقاً فهمه والتنقل فيه بنعمة وسلامة تشبه البشر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →