← أحدث الأبحاث
💻 computer science

StreetForward: Perceiving Dynamic Street with Feedforward Causal Attention

يُعد StreetForward إطار عمل أمامي (feedforward) لا يتطلب وضعية محددة أو متتبعات، حيث يستفيد من آلية انتباه قناع زمني وتقنية التلعثم الغاوسي ثلاثي الأبعاد (3D Gaussian Splatting) لإعادة بناء المشاهد الشارعية الثابتة والديناميكية معاً، مما يتيح تخليق مناظر من زوايا رؤية جديدة وعالية الدقة وتقدير السرعة لكل بكسل دون الحاجة إلى تحسين لكل مشهد على حدة.

المؤلفون الأصليون: Zhongrui Yu, Zhao Wang, Yijia Xie, Yida Wang, Xueyang Zhang, Yifei Zhan, Kun Zhan

نُشر 2026-03-23
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhongrui Yu, Zhao Wang, Yijia Xie, Yida Wang, Xueyang Zhang, Yifei Zhan, Kun Zhan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تشاهد شارعاً مزدحماً في المدينة من خلال نافذة. السيارات تمر مسرعة، والمشاة يعبرون الطريق، والشمس تلقي بظلال متحركة. الآن، تخيل أنك تريد بناء توأم رقمي ثلاثي الأبعاد مثالي لهذا الشارع بحيث يمكنك:

  1. التجول حوله (تغيير وجهة نظرك).
  2. إرجاع الزمن أو تسريعه (رؤية الشارع في لحظة مختلفة).
  3. القيام بكل هذا فوراً، دون قضاء أيام أو أسées في حساب الرياضيات لكل مشهد على حدة.

هذا هو بالضبط ما يحاول بحث StreetForward حله.

إليك تفصيل الأمر باستخدام تشبيهات بسيطة:

المشكلة: "الطباخ البطيء" مقابل "الميكروويف"

معظم طرق إعادة البناء ثلاثي الأبعاد الحالية تشبه الطباخ البطيء. لإنشاء نموذج ثلاثي الأبعاد لشارع ما، يتعين عليها قضاء ساعات أو أيام في "طهي" (تحسين) البيانات لهذا المشهد المحدد. فهي تحتاج لتتبع كل سيارة، وكل شخص، وكل شجرة بشكل فردي لمعرفة كيفية حركتها. إذا أردت محاكاة شارع جديد، عليك البدء بعملية الطهي البطيء من جديد. هذا بطيء جداً بالنسبة للسيارات ذاتية القيادة، التي تحتاج لمعالجة آلاف الأميال من بيانات الطرق فوراً.

أما StreetForward فهو الميكروويف. إنه يستخدم نهج "التغذية الأمامية" (feedforward)، مما يعني أنه ينظر إلى الفيديو، ويعالجه في تمريرة واحدة سريعة، ثم يخرج نموذجاً ثلاثي الأبعاد فوراً. لا يحتاج "للتفكير" في الشارع المحدد مسبقاً؛ فهو يعرف فقط كيف يفعل ذلك بناءً على ما تعلمه من ملايين الشوارع الأخرى.

السر الخفي: "الانتباه السببي" (المحقق الذي يسافر عبر الزمن)

التحدي الأكبر في صنع شارع ثلاثي الأبعاد هو الفصل بين الأشياء الثابتة (المباني، الطرق، الأشجار) والأشياء الديناميكية (السيارات، الناس).

  • الطرق القديمة غالباً ما ترتبك. قد تظن أن سيارة مركونة تتحرك، أو قد تفقد تتبع أحد المشاة وتجعله يختفي.
  • يستخدم StreetForward خدعة خاصة تسمى الانتباه المقنع السببي (Causal Masked Attention).

التشبيه: تخيل أنك محقق يشاهد كاميرا مراقبة.

  • الذكاء الاصطناعي القديم: ينظر إلى الفيديو بأكمله دفعة واحدة، فيرتبك بشأن من تحرك ومتى. قد يخلط بين سيارة من قبل 5 ثوانٍ وسيارة موجودة الآن.
  • StreetForward: يعمل كمحقق ينظر فقط إلى السبب والنتيجة. يتساءل: "إذا نظرت إلى هذه السيارة الآن، أين كانت قبل ثانية واحدة؟ وأين ستكون بعد ثانية واحدة؟"

من خلال إجبار الذكاء الاصطناعي على النظر بدقة في ترتيب "السبب والنتيجة" (الماضي \leftarrow الحاضر \leftarrow المستقبل)، يصبح بارعاً للغاية في التنبؤ بـ السرعة المتجهة (السرعة والاتجاه). إنه يتعلم أن "السيارات تتحرك للأمام"، و"الناس يمشون"، و"المباني تظل ثابتة"، دون الحاجة لإخبار البشر أي منها هو أي نوع.

الخدعة السحرية: "اللطخات" ثلاثية الأبعاد (القصاصات الورقية الرقمية)

يستخدم البحث تقنية تسمى تشتت غاوس ثلاثي الأبعاد (3D Gaussian Splatting).

  • التشبيه: تخيل رمي حفنة من القصاصات الورقية الرقمية في الهواء. كل قطعة من هذه القصاصات هي نقطة ثلاثية الأبعاد صغيرة وضبابية لها لون، وحجم، وموقع.
  • الابتكار: في الماضي، كانت هذه النقاط ثابتة فقط. لكن StreetForward يمنح هذه النقاط قوى خارقة.
    • النقاط الثابتة (المباني) تبقى في مكانها.
    • النقاط الديناميكية (السيارات) تُمنح "متجه سرعة" (سهم يوضح السرعة والاتجاه).
    • يتعلم الذكاء الاصطناعي ربط هذه الأسهم بالنقاط. لذا، عندما تريد رؤية الشارع بعد ثانيتين، يقوم الذكاء الاصطناعي ببساطة بتحريك "نقاط السيارات" على طول أسهمها إلى مواضعها الجديدة ويقوم بمعالجة الصورة فوراً.

لماذا يعد هذا أمراً هاماً؟

  1. لا حاجة لـ "عجلات تدريب": لا تحتاج لإعطاء الذكاء الاصطناعي تسميات خاصة تخبره "هذه سيارة" أو "هذا شخص". هو يكتشف الحركة من تلقاء نفسه بمجرد مشاهدة الفيديو.
  2. السفر عبر الزمن: نظرًا لأنه يفهم سرعة كل جسم، يمكنك إيقاف الفيديو مؤقتاً، وتحريك الكاميرا إلى مكان جديد، ثم تشغيل الفيديو للأمام أو للخلف، وستظل الأجسام في مكانها الصحيح.
  3. القوة الخارقة لـ "التعميم الفوري" (Zero-Shot): قام الفريق بتدريب الذكاء الاصطناعي على بيانات من العالم الحقيقي من Waymo (مجموعة بيانات ضخمة من القيادة الواقعية). ثم اختبروه على CARLA (محاكاة لعبة فيديو). لم يسبق للذكاء الاصطناعي رؤية اللعبة من قبل، ومع ذلك عمل بشكل مثالي. الأمر يشبه تعليم شخص ما القيادة على طريق سريع حقيقي، ثم تسليمه مفاتيح سيارة في لعبة فيديو—سيعرف كيف يقود فوراً.

الملخص

StreetForward هو نظام ذكاء اصطناعي جديد يحول فيديو لشارع مزدحم إلى عالم تفاعلي ثلاثي الأبعاد يسافر عبر الزمن في split second (جزء من الثانية). يفعل ذلك من خلال تعليم الذكاء الاصطناعي فهم السبب والنتيجة في الحركة، مما يسمح له بالتنبؤ بمكان كل سيارة وشخص دون الحاجة لتتبعهم بشكل فردي. وهذا يجعله أداة مثالية لتدريب السيارات ذاتية القيادة على التعامل مع العالم الحقيقي بأمان وكفاءة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →