SIREN-Bench: Behavior-Driven Generation and Evaluation of Emergency-Vehicle Interactions
تقدم الورقة البحثية SIREN، وهي منصة محاكاة مشتركة ومقياس أداء (SIREN-Bench-v1) يعتمد على السلوك بين SUMO وCARLA، والذي يولد سيناريوهات تفاعل متزامنة مع مركبات الطوارئ لتقييم أنظمة القيادة الذاتية، كاشفاً عن أوضاع فشل كبيرة تعتمد على السلوك في نماذج الإدراك والتنبؤ وفهم المخاطر الحالية.
المؤلفون الأصليون:Yicheng Zhu, Tianmu Zhao, Haoxin Leng, Fan Zuo, Tao Li, Zilin Bian
تخيل شارعاً في مدينة حيث تحتاج سيارة إسعاف، وصوت صفارتها يدوّي، إلى الوصول إلى مستشفى. السيارات من حولها لا تكتفي بالوقوف ساكنة؛ بل تتفاعل. فبعضها يضغط على المكابح بقوة، وبعضها ينحرف نحو مسارات فارغة، وبعضها آخر يلتزم جانب الطريق لتوفير مسار واضح. هذه اللحظة من الحركة المشتركة هي رقصة معقدة من السبب والنتيجة: مركبة الطوارئ تغير قواعد الطريق، ويجب على السائقين المدنيين التكيف فوراً مع سلوكهم الخاص للحفاظ على سلامة الجميع. بالنسبة لأجهزة الكمبيوتر التي ستقود سياراتنا يوماً ما، فإن فهم هذا التفاوض الذي يحدث في أجزاء من الثانية أمر بالغ الأهمية. فإذا لم تتمكن المركبة ذاتية القيادة من التنبؤ بكيفية رد فعل السائق البشري تجاه صوت الصفارة، أو إذا فشلت في رؤية سيارة تحشر نفسها في فجوة ضيقة، فقد تكون العواقب وخيمة. ومع ذلك، فإن اختبار هذه الأنظمة أمر صعب؛ فالبيانات الواقعية نادرة وغير متوقعة، بينما تفتقر المحاكاة الحاسوبية غالباً إلى التفاصيل الواقعية والفوضوية لكيفية تصرف الناس فعلياً عندما يتم مقاطعة روتينهم.
لقد بنى الباحثون أداة جديدة لحل هذه المشكلة، حيث أنشأوا مختبراً افتراضياً حيث يمكنهم دراسة كيفية تفاعل مركبات الطوارئ وحركة المرور العادية بدقة. أطلقوا على نظامهم اسم SIREN. وبدلاً من مجرد تسجيل ما حدث في الماضي، تتيح هذه المنصة للعلماء تصميم مواقف محددة ومراقبة كيفية استجابة عالم رقمي لها. إنهم يضعون القواعد لمركبة الطوارلة — كإخبارها بتجاهل الإشارة الحمراء أو التسلل بين مسارين من السيارات المتوقفة — ثم يبرمجون السيارات المحيطة للتفاعل بطرق مختلفة، من مجرد التباطؤ إلى تشكيل ممر إنقاذ مخصص. ومن خلال تشغيل هذه السيناريوهات في محاكاة عالية الدقة تحاكي المستشعرات الحقيقية وفيزياء الطرق، أنتج الفريق مجموعة ضخمة من البيانات لهذه التفاعلات. ثم استخدموا هذه البيانات لاختبار ثلاثة أنواع مختلفة من الذكاء الاصطناعي: أنظمة تحدد الأشياء، وأنظمة تتنبأ بمكان توجه السيارات لاحقاً، وأنظمة تحاول فهم المخاطر العامة للمشهد.
كشفت النتائج أن ليس كل مواقف الطوارئ متساوية في الصعوبة بالنسبة لهذه الآلات. فعندما كان الهدف هو مجرد رصد السيارات على الطريق، عانى الذكاء الاصطناعي أكثر من غيره خلال سيناريوهات "الإخلاء". في هذه اللحظات، يتحرك السائقون المدنيون بنشاط لإخلاء الطريق، مما يخلق نمطاً فوضوياً ومتغيراً من المركبات التي لم تعد مصطفة بانتظام في مساراتها. وجدت أجهزة الكمبيوتر، التي تدربت على حركة مرور منظمة، صعوبة في تتبع السيارات التي تغير مواقعها فجأة لإفساح المجال. وعلى العكس من ذلك، تبين أن التنبؤ بالمكان الذي ستتحرك إليه السيارة لاحقاً كان أصعب عندما تعبر مركبة الطوارئ تقاطعاً عكس الإشارة الحمراء. في هذه اللحظات، كان السائقون المدنيون لا يزالون يحاولون التنقل عبر التقاطع مع التفاعل مع مركبة الطوارء، مما خلق مزيجاً مربكاً من الحركات التي لم تستطع نماذج التنبؤ توقعها بدقة. في الواقع، لم تكن النماذج الحاسوبية المتقدمة، في المتوسط، أفضل من قاعدة بسيطة تفترض أن السيارة ستستمر في التحرك بنفس السرعة في تخمين المسار المستقبلي لهذه السيارات.
كما اختبرت الدراسة مدى قدرة الذكاء الاصطناعي على فهم خطورة الموقف. طلب الباحثون من الأنظمة النظر إلى لقطات الفيديو وتقرير ما إذا كان المشهد طبيعياً، أو إذا كان وشيك الوقوع، أو إذا كان هناك اصطدام على وشك الحدوث. كانت النتائج صارخة: كانت النماذج منحازة بشدة. فبعض الأنظمة كانت حذرة للغاية بحيث صنفت كل شيء تقريباً على أنه "طبيعي"، متجاهلة الخطر تماماً. بينما كانت أنظمة أخرى حساسة للغاية بحيث رأت خطراً حيث لا يوجد، أو فشلت في التعرف على اللحظات الأكثر حرجاً. لم يتمكن نموذج واحد من تحديد جميع أنواع المواقف الثلاثة بشكل صحيح. وهذا يشير إلى أنه بينما تبرع التكنولوجيا الحالية في رؤية العالم، فإنها لا تزال تكافح لفهم المنطق البشري المعقد وراء سبب تحرك السائقين بالطريقة التي يفعلونها عند اقتراب مركبة الطوارء.
يؤكد الباحثون أن الصعوبة لا تأتي من مركبة الطوارء نفسها، بل من السلوك الذي تثيره في الآخرين. فمن السهل التنبؤ بسيارة تسير على جانب الطريق؛ أما السيارة التي تضغط على المكابح وتنحرف فجأة بسبب دوي صفارة الإنذار فهي أصعب بكثير في الفهم. ومن خلال إنشاء معيار يركز على هذه التفاعلات المحددة، يأمل الفريق في مساعدة المهندسين على بناء مركبات ذاتية القيادة أكثر أماناً. يظهر عملهم أنه لجعل السيارات ذاتية القيادة آمنة حقاً، يجب ألا نعلمها فقط كيف ترى الطريق، بل كيف تفهم القواعد الاجتماعية للطريق، خاصة عندما يتم إعادة كتابة هذه القواعد بواسطة حالة طوارئ. إن المنصة التي بنوها متاحة الآن للعلماء الآخرين لاستخدامها، مما يوفر وسيلة لاختبار أفكار جديدة مقابل مجموعة واسعة من السيناريوهات الواقعية القائمة على السلوك والتي كان من المستحيل دراستها بهذا التفصيل سابقاً.
ملخص تقني: SIREN-Bench
بيان المشكلة
لا تكتفي مركبات الطوارئ (EMVs) بكونها مجرد أجسام نادرة داخل حركة المرور؛ بل إن مرورها يعيد تنظيم حركة المرور المدنية المحيطة بها بشكل جذري من خلال الكبح، وتغيير المسارات، وتشكيل ممرات الإنقاذ. يخلق هذا تفاعلاً متعدد المركبات غير متماثل ومترابطاً، حيث يعمل وكيل ذو امتياز وفق قواعد تنقل معدلة بينما يتكيف الوكلاء المدنيون مع ذلك. يواجه البحث الحالي في القيادة الذاتية فجوة حرجة في تقييم هذه التفاعلات ذات الأهمية البالغة للسلامة. تفتقر مجموعات البيانات الواقعية الحالية (مثل nuScenes وWaymo) إلى التحكم في سلوك مركبات الطوارج واستجابات المدنيين، حيث تكتفي برصد حالات المواجهة المسجلة فقط. ومن ناح অন্যদিকে، تركز محاكيات النقل (مثل SUMO وVISSIM) على التحليل التشغيلي بدلاً من تقييم الذكاء الاصطنا الاصطناعي متعدد الوسائط، كما تعتمد معايير المحاكاة الحالية (مثل تلك القائمة على CARLA) عادةً على مجموعات محدودة من السيناريوهات المحددة مسبقاً بمسارات ثابتة للجهات الفاعلة. هناك نقص في وجود إطار عمل يوفر تحكماً على مستوى السلوك لكل من امتيازات مركبات الطوارج والاستجابات المدنية مع الحفاظ على اتساق الاستشعار والحقيقة الأرضية (ground truth) للتقييم اللاحق.
المنهجية
يقدم المؤلفون SIREN، وهو منصة محاكاة مشتركة مدفوعة بالسلوك تربط بين SUMO وCARLA لتوليد تفاعلات مركبات الطوارج والمدنيين.
منصة SIREN
المحاكاة المشتركة الهجينة: تستفيد SIREN من SUMO لتطور حركة المرور على مستوى الشبكة ومنطق السلوك، بينما تتولى CARLA التحكم المستمر في المركبات والاستشعار المتزامن على متن المركبة.
نقل التحكم: اعتماداً على السلوك النشط، يتم إدارة التحكم في التفاعل بواسطة SUMO، أو CARLA، أو كليهما معاً. تحدد منطقة تفاعل متحركة ذات نصف قطر ثابت ممركزة حول مركبة الطوارج أي محاكي يدير جهات فاعلة محددة.
نموذج السلوك: يستخدم النظام نموذج سلوك مجهري مُعاير لمركبات الطوارج (من Zuo et al) لمعاملات الطول والفجوات. وتوسع SIREN هذا النموذج عبر سياسات استجابة مدنية تعتمد على المستوى:
المستوى الأول (الحركة المميزة): تتمتع مركبة الطوارج بامتيازات (مثل عبور الإشارة الحمراء) ولكن دون استجابة استسلامية مستحثة؛ حيث يتبع المدنيون القواعد الاسمية.
المستوى الثاني (إخلاء المسار): يقوم المدنيون بتغييرات مسار ممكنة لإخلاء مسار مركبة الطوارج.
المستوى الثالث (ممر الإنقاذ): يندفع المدنيون نحو حدود المسارات ويحافظون على مواقعهم لتشكيل ممر.
التوليد بنظام الحلقة المغلقة: بدلاً من فرض مسارات كاملة، تحدد SIREN سياسات مركبات الطوارج وقواعد الاستجابة المدنية. وتنشأ التفاعلات الناتجة من التغذية الراجعة للحلقة المغلقة بين مركبة الطوارج، والوكلاء المدنيين، وحالة حركة المرور.
SIREN-Bench-v1
تتمثل منصة SIREN في SIREN-Bench-v1، والتي تضم سبعة نماذج تفاعلية معلمية عبر ثلاث عائلات سلوكية:
إخلاء حركة المرور: مرور مركبة الطوارج بين طوابير السيارات (S1) أو خروج المركبات من المسار (S2).
عبور التحكم المروري: عبور مركبة الطوارج للإشارات الحمراء (S3, S4) أو لوحات التوقف (S5, S6) مع تنوع في حركة المرور المتقاطعة.
استخدام مساحة الطريق غير القياسي: احتلال مركبة الطوارج لمسارات الكتف (S7).
مواصفات البيانات:
الإدراك والتنبؤ: حلقة أساسية مسجلة واحدة لكل نموذج (25-45 ثانية، 10 هرتز) على خريطة CARLA Town10HD_Opt.
فهم المخاطر: 105 فيديوهات للكاميرا الأمامية (15 لكل نموذج، 190 إطاراً لكل منها).
المستشعرات: مجموعة مثبتة على مركبة الطوارج تشمل ليدار (LiDAR) بـ 64 شعاعاً (مدى 120 متراً، 20 هرتز) وأربع كاميرات RGB بدقة 800×600.
التعليقات التوضيحية: حالات أصلية من المحاكي تشمل مسارات الجهات الفاعلة، والسينماتيكا، ومراحل الإشارات، ومعايرة الكاميرا. يتم تصنيف جميع المركبات كـ "سيارة" (Car) لقياس مدى اضطراب الكشف بدلاً من التعرف المحدد على مركبة الطوارج.
المساهمات الرئيسية
التقييم المرتكز على السلوك: منظور جديد حيث تعد امتيازات مركبات الطوارج والاستجابات المدنية المستحثة هي العوامل الأساسية لتوليد البيانات، متجاوزةً مجرد حالات اختبار السيناريوهات المعزولة.
المحاكاة المشتركة الهجينة (SUMO–CARLA): تطوير SIREN، التي تقوم بمزامنة تبادل الحالة ونقل التحكم لتوليد تفاعلات على مستوى السلوك مع ملاحظات استشعار غنية.
SIREN-Bench-v1 والتقييمات التمثيلية: إصدار سبعة نماذج تفاعلية وتقييم ثلاث مهام لاحقة: الكشف ثلاثي الأبعاد عن الأجسام، التنبؤ بالمسار، وفهم المخاطر عبر الرؤية واللغة.
النتائج التجريبية
قيم المؤلفون تسعة متنبئات بالمسار، وأربعة كواشف ثلاثية الأبعاد تعتمد على الليدار، وخمسة نماذج للرؤية واللغة (VLMs).
1. التنبؤ بالمسار
الأداء: لم يتفوق أي متنبئ متعلم على مرجع السرعة الثابتة (CV) في المتوسط. حقق أفضل نموذج متعلم متوسط خطأ في المسافة (ADE) قدره 1.88 متر، مقارنة بـ 1.44 متر للسرعة الثابتة.
أنماط الفشل: كان التنبؤ أكثر صعوبة أثناء عبور التقاطعات المميزة (تحديداً التقاطعات التي تتحكم فيها لوحات التوقف، S6)، حيث تتفاوض المركبات المحيطة داخل التقاطع أثناء الاستجابة لمركبة الطوارج.
ملاحظة: تنبع الصعوبة من التفاعل المستحث في حركة المرور المحيطة بدلاً من الحركة غير التقليدية لمركبة الطوارج وحدها.
2. الكشف ثلاثي الأبعاد عن الأجسام
الأداء: كانت درجات الكشف هي الأدنى باستمرار في حلقات إخلاء حركة المرور (S1, S2)، حيث يؤدي الاستسلام لإخلاء الطريق إلى تكوينات مركبات كثيفة وغير مركزية.
المقارنة: حققت عمليات عبور التحكم المروري (S3–S4) واستخدام الكتف (S7) درجات mAP أعلى.
رؤية: إعادة التنظيم الهندسي لحركة المرور في سيناريوهات الإخلاء تشكل تحدياً للكواشف صفرية القدرة (zero-shot) أكبر من مسار مركبة الطوارج نفسه.
3. فهم المخاطر عبر الرؤية واللغة
الأداء: أظهرت نماذج الرؤية واللغة (VLMs) تحيزات قوية تعتمد على الفئة. لم يحقق أي نموذج تم تقييمه درجة F1 غير صفرية عبر فئات المخاطر الثلاث (طبيعي، وشيك الخطورة، اصطدام).
التحيزات: مالت بعض النماذج (مثل Qwen3.5-9B) إلى التنبؤ بـ "طبيعي"، بينما كانت نماذج أخرى (مثل LLaVA-Llama3-8B) حساسة للغاية تجاه "وشيك الخطورة".
رؤية: تعاني النماذج في الموازنة بين تصنيف الأحداث الحرجة للسلامة (وشيك الخطورة، اصطدام) مقابل حركة المرور الطبيعية، وتفشل في تحديد الأحداث النادرة بشكل موثوق.
الأهمية والادعاءات
يزعم البحث أن الحركة غير التقليدية لمركبات الطوارج وحدها لا تحدد الصعوبة؛ بل إن السلوك الذي تستحثه في حركة المر Verkehr المحيطة هو العامل الحاسم، مما يؤثر على الإدراك والتنبؤ والفهم الدلالي بشكل مختلف.
التوليد المدفوع بالسلوك: تثبت النتائج قيمة التقييم المرتكز على السلوك كنهج مكمل لمجموعات السيناريوهات الثابتة لدراسة كيفية استجابة خوارزميات النقل لتفاعلات الوكيل ذي الامتياز.
القابلية للتوسع: تم تأسيس SIREN كمنصة قابلة للتوسع لأبحاث القيادة الذاتية وسلامة النقل، قادرة على دعم مهام تتجاوز المهام الثلاث الأولية (مثل نمذجة السلوك، والتخطيط، وتقييم السلامة).
القيود: أشار المؤلفون بتواضع إلى أن الإصدار الحالي (v1) يقيم النماذج عند مستوى طوارئ واحد وخريطة واحدة، ويستخدم واقعة أساسية واحدة للكشف/التنبؤ، ويعتمد على تسميات عامة لـ "السيارة". ومن المخطط في العمل المستقبلي معالجة ذلك عبر إدخال تجليات عشوائية، وتسميات خاصة بمركبات الطوارج، وتقييمات عبر خرائط ومستويات مختلفة.