Large Language Model based Interactive Decision-Making for Autonomous Driving
تقترح هذه الورقة إطار عمل قائماً على النماذج اللغوية الكبيرة يعزز القيادة الذاتية في سيناريوهات حركة المرور المختلطة المعقدة من خلال استخدام منهجية "الشيء-العملية" (Object-Process Methodology) لنمذجة المشهد الدلالي، والاستدلال المدرك للقصد لاتخاذ القرار، والتواصل عبر اللغة الطبيعية من خلال واجهة خارجية بين الإنسان والآلة لتحسين السلامة والكفاءة والتفاعل الشبيه بالبشر.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تقود سيارة عبر تقاطع مزدحم وفوضوي في مدينة مثل نيويورك أو شنغهاي. أنت لا تكتفي فقط باتباع القواعد؛ بل أنت في حالة مستمرة من "قراءة" الأشخاص من حولك. ترى سائقاً يلقي نظرة خاطفة عليك ويبطئ سرعته، فتدرك أنه يفسح لك المجال. ترى سائقاً آخر يتسارع بشكل عدواني، فتقرر الانتظار. أنت تؤدي "رقصة تفاوض" صامتة ومستمرة.
السيارات ذاتية القيادة الحالية سيئة جداً في هذه الرقصة. إنها تشبه طالباً مبتدئاً مهذباً للغاية ومتوتر للغاية: إذا تحرك أي شخص بشكل غير متوقع، تتجمد السيارة أو تضغط على المكابح بقوة لأنها لا "تفهم" الإشارات الاجتماعية.
تقدم هذه الورقة البحثية طريقة لمنح السيارات ذاتية القيادة "دماغاً اجتماعياً" باستخدام النماذج اللغوية الكبيرة (LLMs) (مثل التقنية التي تقف وراء ChatGPT). إليك كيف يفعلون ذلك، مقسماً إلى أربع خطوات بسيطة:
1. "المترجم" (تحويل الرياضيات إلى معنى)
يرى الكمبيوتر العالم كمخطط بيانات ضخم من الأرقام: المركبة (أ) في الإحداثي (X)، وتتحرك بسرعة (Y). هذا يعتبر "ضجيجاً" زائداً يصعب على الدماغ معالجته بسرعة.
ابتكر الباحثون نظاماً يسمى OPM. فكر في هذا كـ مترجم يحول جدول البيانات الفوضوي إلى قصة واضحة. بدلاً من قول "الشيء 42 موجود في 10.5، 20.2"، يخبر النظام السيارة: "هناك شاحنة زرقاء (شيء/كائن) تقوم حالياً بالانعطاف يساراً (عملية)، مما يخلق خطر تصادم (علاقة) معك". هذا يسمح للسيارة بأن "ترى" المشهد كقصة منطقية وليس مجرد مجموعة من النقاط.
2. "قارئ الأفكار" (التنبؤ بالنية)
بمجرد أن تفهم السيارة القصة، يتعين عليها تخمين ما يدور في ذهن السائقين الآخرين. يستخدم الباحثون النموذج اللغوي الكبير ليعمل كـ طبيب نفسي رقمي.
من خلال مراقبة كيفية سلوك السائق البشري — هل هو عدواني؟ هل هو متردد؟ هل هو في عجلة من أمره؟ — يقوم النموذج اللغوي بتحليل "نيته غير المعلنة". الأمر يشبه إدراك أن: "ذلك السائق يتأرجح قليلاً؛ ربما هو في عجلة من أمره وقد يحاول تخطيي". هذا يسمح للسيارة بالاستعداد لما قد يحدث، وليس فقط لما يحدث الآن.
3. "صانع القرار" (النقاش الداخلي)
الآن يجب على السيارة أن تقرر ماذا ستفعل. هي لا تختار حركة واحدة فحسب؛ بل تجري نقاشاً مصغراً في رأسها. تنظر في عدة خيارات: هل يجب أن أسرع؟ هل يجب أن أبطئ؟ هل يجب أن أبقى على مساري؟
وهي تزن هذه الخيارات مقابل ثلاثة أمور:
- السلامة: "هل سأصطدم؟"
- الكفاءة: "هل سأظل عالقة هنا للأبد؟"
- الراحة: "هل ستكون هذه الحركة مفاجئة لدرجة تسبب إصابة الركاب بآلام الرقبة؟"
يعمل النموذج اللغوي الكبير كـ قاضٍ في هذا النقاش، حيث يختار الحركة التي تبدو أكثر "بشرية" ومنطقية.
4. "المتواصل" (التحدث رداً)
هذا هو الجزء الأكثر تميزاً. عادة ما تكون السيارات صامتة، مما يجعل البشر يشعرون بالتوتر. إذا تحركت سيارة فجأة، فأنت لا تعرف لماذا.
لقد منح الباحثون السيارة صوتاً عبر شاشة خارجية (eHMI). بدلاً من مجرد التحرك، يمكن للسيارة أن "تتحدث" إلى الناس من حولها عبر نص بسيط. قد تقول: "أنا أبطئ السرعة، تفضل بالمرور". هذا يحول السيارة من روبوت غامض إلى جار يمكن التنبؤ بتصرفاته. إنه يغلق الحلقة: السيارة تفهمك، وتتخذ قراراً، ثم تخبرك بما تفعله حتى لا تُفاجأ.
النتيجة: "اختبار تورينج" للسيارات
لمعرفة ما إذا كان هذا قد نجح، وضعوا السيارة في محاكي وأجروا اختبار تورينج (الاختبار الشهير لمعرفة ما إذا كان بإمكان الآلة أن تبدو كبشر). جعلوا بشرًا حقيقيين يتفاعلون مع السيارة ثم سألهم: "هل كان ذلك بشراً أم كمبيوتراً؟"
كان البشر مرتبكين في كثير من الأحيان! لم يستطيعوا التمييز بينهما. وهذا يعني أن السيارة لم تكن تقود بأمان فحسب؛ بل كانت تقود بطريقة طبيعية.
باخت-القول: تنتقل بنا هذه الورقة من "الروبوتات التي تتبع القواعد" إلى "السائقين الرقميين الذين يفهمون آداب السلوك الاجتماعي".
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.