PanguMotion: Continuous Driving Motion Forecasting with Pangu Transformers
تقدم هذه الورقة البحثية PanguMotion، وهو إطار عمل جديد للتنبؤ بالحركة للقيادة الذاتية يستفيد من كتل Pangu-1B Transformer لتعزيز تمثيل الميزات ويعالج أوجه القصور في الطرق الحالية من خلال نمذجة سيناريوهات القيادة المستمرة عبر مجموعة بيانات Argoverse 2 المعاد تنظيمها.
المؤلفون الأصليون:Quanhao Ren, Yicheng Li, Nan Song
تخيل أنك تعلم روبوتاً قيادة السيارة. الجزء الأصعب ليس مجرد رؤية الطريق في الوقت الحالي؛ بل هو التنبؤ بما سيحدث لاحقاً. هل سيهبط ذلك المشاة من على الرصيف؟ هل ستضغط السيارة التي أمامك على المكابح فجأة؟
معظم أنظمة الذكاء الاصطني للقيادة الذاتية الحالية تشبه السياح فاقدي الذاكرة. إنهم ينظرون إلى صورة للشارع، ويخمنون ما سيحدث في الثانية التالية، ثم ينسون كل شيء فوراً. إنهم يعاملون كل لحظة كأنها لقطة جديدة ومنفصلة.
PanguMotion هو نهج جديد يغير قواعد اللعبة. إنه يشبه منح ذلك الروبوت ذاكرة تصويرية ومساعد طيار فائق الذكاء قد قرأ كل الكتب الموجودة في المكتبة.
إليك تفصيل لكيفية عمله، باستخدام تشبيهات بسيطة:
1. المشكلة: "اللقطة" مقابل "الفيلم"
الطريقة القديمة (اللقطة): تخيل مشاهدة فيلم حيث تسود الشاشة السوداء كل 5 ثوانٍ، وعليك أن تخمن ما سيحدث بناءً فقط على الإطار الوحيد الذي رأيته للتو. ليس لديك أدنى فكرة عما إذا كانت السيارة تسرع أم تبطئ. هكذا تعمل معظم أنظمة الذكاء الاصطناي للقيادة اليوم.
حل RealMotion: ابتكر اختراع سابق يسمى "RealMotion" هذا الحل عن طريق دمج تلك اللقطات معاً لتصبح فيلماً مستمراً. إنه يتذكر تاريخ الرحلة، لذا يعرف الذكاء الاصطناعي أن السيارة كانت تتسارع، وليس مجرد أنها "موجودة هناك".
تطوير PanguMotion: يأخذ هذا البحث فكرة "الفيلم المستمر" ويضيف إليها محرراً عبقرياً إلى المزيج.
2. المكون السري: "الدماغ المجمد"
قام الباحثون بأخذ نموذج لغوي ضخم (LLM) مدرب مسبقاً يسمى Pangu-1B.
ما هو Pangu؟ فكر في Pangu كأنه أمين مكتبة فائق الذكاء قد قرأ مليارات الكتب (معظمها باللغة الصينية). إنه يفهم الأنماط، والعلاقات، و"تدفق" القصص بشكل رائع.
التحول: عادةً، نستخدم هذه النماذج لكتابة القصائد أو الإجابة على الأسئلة. لكن هذا البحث يسأل: "هل يمكن لهذا الأمين أن يساعدنا في التنبؤ بحركة المرور؟"
خدعة "التجميد": لم يقوموا بتعليم الأمين أشياء جديدة (لأن ذلك سيستغرق وقتاً طويلاً وسيكلف ثروة). بدلاً من ذلك، قاموا بـ "تجميد" دماغ الأمين. لقد أخذوا طبقة واحدة محددة من هذا الدماغ الضخم ودمجوها في ذكاء القيادة الاصطناعي.
التشبيه: تخيل أن ذكاء القيادة الاصطناعي الخاص بك هو طالب يؤدي اختباراً. "كتلة Pangu المجمدة" تشبه وجود معلم عبقري يجلس بجانبه مباشرة. المعلم لا يكتب الإجابات نيابة عنه؛ بل ينظر فقط إلى ملاحظات الطالب ويقول: "مهلاً، انظر إلى هذا النمط هنا. لقد فاتك دليل دقيق. دعني أسلط الضوء عليه لك."
3. "محسن الميزات" (الفلتر السحري)
يطلق الورقة البحثية على هذا الاسم "محسن الميزات" (Feature Enhancer). إليك كيف يعمل باللغة البسيطة:
ينظر ذكاء القيادة الاصطناعي إلى الطريق ويرى آلاف نقاط البيانات (خطوط، نقاط، سرعات). الأمر يشبه النظر إلى كومة فوضوية من قطع الأحجية (البازل).
يعمل كتلة Pangu كـ فلتر ذكي. ينظر إلى تلك الكومة الفوضوية ويعرف فوراً أي القطع مهمة وأيها مجرد ضجيج. إنه يضخم المعلومات "الجيدة" (مثل سيارة تضغط على المكابح) ويتجاهل المعلومات "السيئة" (مثل ظل على الطريق).
ولأن نموذج Pangu قد تدرب على الكثير من اللغة البشرية، فإنه بارع بشكل مفاجئ في فهم التسلسلات والعلاقات، وهو بالضبط ما تتطلبه عملية القيادة.
4. الاكتشاف المفاجئ: "الأقل هو الأكثر"
هذا هو الجزء الأكثر إثارة للاهتمام في البحث.
كان نظام "RealMotion" الأصلي يتكون من جزأين رئيسيين: جزء لفهم سياق الطريق (الفيلم) وجزء لتتبع مسارات الوكلاء (المسارات المحددة للسيارات الأخرى).
عندما أضاف الباحثون "المعلم العبقري" (Pgangu)، وجدوا أن "المعلم العبقري" بارع جداً في تحسين تنبؤات المسار لدرجة أن الجزء الثاني (تتبع المسارات المحددة) أصبح زائداً عن الحاجة.
النتيجة: قاموا بـ إزالة الجزء الثاني تماماً.
التشبيه: تخديل أن لديك فريقاً من اثنين من المحررين يراجعان مخطوطة. تقوم بتعيين ناقد أدبي مشهور عالمياً (Pangu) لمراجعتها. تدرك أن المحرر الثاني يكرر فقط ما يقوله الناقد. لذا، تقوم بفصل المحرر الثاني. ومن المثير للدهشة، خرج الكتاب أفضل وأسرع في الإنتاج لأن الفريق أصبح أقل ازدحاماً.
5. لماذا يهم هذا (الأثر في "العالم الحقيقي")
سلامة أفضل: يتنبأ النظام بالمسار الأكثر احتمالاً للسيارة بدقة أعلى بكثير (حوالي 1.5% إلى 2% أفضل). في القيادة الذاتية، هذا الفرق الضئيل في النسبة المئوية هو الفرق بين النجاة من حادث وبين وقوعه.
جاهز للأجهزة: لم يكتفوا بالقيام بذلك على كمبيوتر قوي؛ بل قاموا بتكييفه ليعمل على رقائق Ascend NPUs (نوع محدد من شرائح الذكاء الاصطناዊ الصينية). هذا يعني أنه جاهز ليتم وضعه في السيارات الفعلية، وليس فقط في مختبرات الأبحاث.
سحر عبر المجالات: يثبت هذا أن نموذجاً تدرب على فهم اللغة يمكنه أيضاً فهم الحركة. إنه يشبه إثبات أن الشخص البارع في كتابة الشعر هو أيضاً بارع في تصميم لوحات الرقص.
الملخص
PanguMotion هو نظام قيادة ذاتية:
يتذكر الماضي (على عكس الأنظمة القديمة).
يستخدم "دماغاً مجمداً" فائق الذكاء (Pangu) لتسليط الضوء على التفاصيل الأكثر أهمية في مشهد المرور.
يستغني عن الأجزاء غير الضرورية من دماغه ليعمل بشكل أسرع وأكثر دقة.
إنها خطوة نحو سيارات لا تكتفي فقط بـ "رؤية" الطريق، بل تفهم حقاً قصة حركة المرور من حولها.
إليك ملخص تقني مفصل لورقة البحث بعنوان "PanguMotion: Continuous Driving Motion Forecasting with Pangu Transformers".
1. بيان المشكلة
يهدف التنبؤ بحركة القيادة في القيادة الذاتية إلى التنبؤ بالمسارات المستقبلية للوكلاء المحيطين لضمان السلامة. ومع ذلك، تواجه الأساليب الحالية عقبتين رئيسيتين:
معالجة المشاهد المنفصلة: تعامل معظم النماذج المتطورة (مثل Wayformer وScene Transformer) مشاهد القيادة كلقطات مستقلة ومنعزلة. وهذا يتجاهل الاستمرارية الزمنية والسياق التاريخي المتأصل في القيادة الواقعية، حيث تتطور المشاهد بشكل متسلسل.
عدم الاستفادة من النماذج الضخمة: بينما أظهرت النماذج اللغوية الكبيرة (LLMs) مثل Pangu قدرات مذهلة في "تصفية المعلومات" في المهام البصرية، إلا أن إمكاناتها في تعزيز أطر التنبؤ بالحركة المستمرة لا تزال غير مستغلة إلى حد كبير.
القيود العتادية: تفتقر العديد من النماذج المتقدمة إلى عمليات تنفيذ محسنة لمسرعات عتادية محددة مثل وحدات معالجة النيو (NPUs) من نوع Ascend، مما يعيق النشر في الوقت الفعلي.
2. المنهجية: PanguMotion
يقترح المؤلفون PanguMotion، وهو إطار عمل يدمج كتلة Transformer من نموذج Pangu-1B المجمد في بنية تنبؤ بالحركة المستمرة. يعتمد هذا النهج على إطار عمل RealMotion ولكنه يقدم تعديلات هيكلية جوهرية.
أ. استراتيجية البيانات: إعادة تنظيم RealMotion
يستخدم النموذج استراتيجية إعادة تنظيم بيانات RealMotion، والتي تحول المشاهد المستقلة من مجموعة بيانات Argoverse 2 إلى تسلسلات مستمرة. هذا يحاكي القيادة في العالم الحقيقي من خلال السماح للنموذج باستخدام السياق التاريخي من المشاهد المتعاقبة.
ب. التصميم الهيكلي
يتبنى PanguMotion هيكل مشفر-فك تشفير (encoder-decoder) مع تركيز خاص على تعزيز الميزات:
تمثيل المدخلات: يتم تشفير مسارات الوكلاء التاريخية وعناصر الخريطة باستخدام مشفر أساسي (شبيه بـ PointNet للخرائط، وانتباه الجوار للوكلاء).
تدفق سياق المشهد: تقوم آلية الانتباه المتقاطع (cross-attention) بدمج ميزات المشهد الحالي مع ميزات الذاكرة التاريخية.
محسن ميزات Pangu (الابتكار الجوهري):
يتم إدراج كتلة Transformer مجمدة (تحديداً الطبقة 25) من نموذج Pangu-1B المدرب مسبقاً بعد طبقات تشفير المشهد وقبل فك التشفير.
محاذاة الأبعاد: تُضاف طبقات إسقاط خطي (Wbefore و Wafter) لمحاذاة ميزات المشهد ذات الـ 128 بُعداً مع الفضاء الخفي لـ Pangu البالغ 1536 بُعداً.
تكييف القناع (Masking): تمت إزالة أقنعة التوليد الذاتي (المستخدمة لتوليد النصوص)؛ وتم الإبقاء فقط على أقنعة الرموز (tokens) الصالحة للسماح بالمعالجة المتزامنة لجميع رموز المشهد.
التجميد: تظل جميع معاملات Pangu مجمدة أثناء التدريب للاستفادة من التمثيلات المدربة مسبقاً دون الوقوع في فخ الإفراط في التخصيص (overfitting).
التبسيط الهيكلي: على عكس تصميم التدفق المزدوج الأصلي لـ RealMotion، يقوم PanguMotion بإزالة تدفق مسار الوكيل. يفترض المؤلفون أن قدرة تعزيز الميزات في كتلة Pangu تتداخل مع وظيفة تحسين مسار الوكيل، وأن إزالة الأخيرة تقلل من التكرار.
فك التشفير: تقوم طبقة إسقاط متعددة الوسائط بتوسيع الميزات إلى 6 أنماط (modes)، يتبعها فروع انحدار المسار وتوقع الاحتمالية.
ج. التكيف مع العتاد
يتضمن الإطار تكيفاً كاملاً لـ Huawei Ascend NPU:
استبدال آليات الانتباه المعتمدة على GPU (مثل NeighborhoodAttention1D) بآلية انتباه قياسية متوافقة مع NPU.
تنفيذ التدريب المتوازي للبيانات الموزعة باستخدام PyTorch Lightning على وحدات Ascend 910B2 NPU.
3. المساهمات الرئيسية
الابتكار المنهجي: أول دمج ناجح لنموذج لغوي كبير من نوع Pangu في إطار عمل تنبؤ مستمر للقيادة، مما يثبت فعاليتها كمحسن للميزات للمهام المكانية والزمانية.
التحسين الهيكلي: اكتشاف أن إزالة تدفق مسار الوكيل بالتزامن مع إضافة كتلة Pangu يحسن دقة التنبؤ بالنمط الواحد (single-mode prediction)، مما يشير إلى وجود تكرار وظيفي بين المكونين.
الجدوى العملية: توفير حل كامل للتدريب والاستدلال من البداية إلى النهاية محسن لوحدات Ascend NPU، مع الحفاظ على زمن انتقال منخفض مع تعزيز تمثيل الميزات.
4. النتائج التجريبية
أُجريت التجارب على مجموعة بيانات Argoverse 2 باستخدام استراتيجية التسلسل المستمر.
مقاييس الأداء
مقارنة بالنموذج المرجعي RealMotion، حقق PanguMotion تحسينات ملحوظة في التنبؤ بالنمط الواحد (وهو أمر حاسم لاتخاذ القرار):
minADE1 (متوسط خطأ الإزاحة): تحسن بنسبة 1.58% (1.646 ← 1.620).
minFDE1 (خطأ الإزاحة النهائي): تحسن بنسبة 1.29% (4.100 ← 4.047).
دراسات الاستئصال والتحليل
مقارنة النماذج: تفوق PanguMotion على بنية مشابهة تستخدم LLaMA (المسمى LlamaMotion)، حيث تحسن minADE1 بنسبة 5.71%. يقترح المؤلفون أن التدريب المسبق لـ Pangu على النصوص الصينية قد يشفر الأنماط المكانية/الزمانية بشكل مختلف أو أكثر فعالية لهذه المهمة.
اختيار الطبقة: أدى استخدام الطبقة الأخيرة فقط (الطبقة 25) من Pangu إلى تحقيق أفضل النتائج. استخدام طبقات متعددة (3 أو 6) أدى إلى تدهور الأداء، مما يدعم "فرضية تصفية المعلومات" بأن الطبقات العليا توفر التمثيلات الدلالية الأكثر ملاءمة للنقل.
موضع الإدراج: كان إدراج الكتلة عند الطبقة النهائية (الطبقة 25) أفضل من الطبقات المتوسطة، مما يؤكد أن الميزات الدلالية عالية المستوى هي الأكثر فائدة لتنقية تمثيلات المشهد.
إزالة التدفق: أدت إزالة تدفق مسار الوكيل (مع الإبقاء على كتلة Pangu) إلى تحسين مقاييس النمط الواحد بنسبة ~2.6% مقارنة بالإبقاء على كلا التدفقين، مما يشير إلى أن كتلة Pangu تحل بفعالية محل دور تحسين تدفق المسار.
5. الأهمية والأثر
قابلية النقل عبر المجالات: يثبت أن النماذج اللغوية الكبيرة يمكن أن تعمم على مهام غير لغوية ومتسلسلة مثل التنبؤ بالحركة، حيث تعمل كمحسنات ميزات "عالمية" قوية.
الكفاءة مقابل الدقة: يوضح أن الوحدات القوية المدربة مسبقاً تسمح بـ تبسيط البنى المعقدة (إزالة تدفق المسار) مع تحسين الأداء فعلياً في المقياس الأكثر أهمية (التنبؤ بالنمط الواحد).
الجاهزية للنشر: من خلال توفير خط معالجة (pipeline) محسن بالكامل لـ Ascend NPU، يردم هذا العمل الفجوة بين دمج LLM النظري والنشر العملي للقيادة الذاتية في الوقت الفعلي على الأنظمة البيئية للعتاد الصيني.
المصدر المفتوح: قام المؤلفون بنشر الكود المصدري، مما وضع معياراً جديداً لأبحاث التنبؤ بالحركة المستمرة.
القيود والعمل المستقبلي
التكلفة الحسابية: تظل نماذج Pangu Transformer ثقيلة حسابياً، مما يفرض تحديات على الأجهزة ذات الموارد المحدودة.
تعقيد تعدد الوكلاء: يركز النموذج الحالي بشكل أساسي على التنبؤ بالوكيل الواحد مع نمذجة مبسطة للتفاعل بين الوكلاء المتعددين.
تحيز البيانات: قد يؤدي متن التدريب المسبق لنموذج Pangu المعتمد على اللغة الصينية إلى إدخال تحيزات ثقافية أو لغوية تؤثر على الفهم المكاني.
الفجوة مع الواقع: على الرغم من إعادة تنظيم البيانات لتكون مستمرة، إلا أنها لا تزال تختلف عن سيناريوهات القيادة المستمرة الحقيقية في العالم الواقعي.