← أحدث الأبحاث
💻 computer science

LongStream: Long-Sequence Streaming Autoregressive Visual Geometry

يُعد LongStream نموذجاً هندسياً بصرياً مبتكراً للبث يعتمد على فك الارتباط بالمقياس، ويحقق إعادة بناء ثلاثية الأبعاد مستقرة وبمقياس متري عبر تسلسلات فائقة الطول من خلال التنبؤ بوضعيات الإطارات الرئيسية النسبية، وتوظيف تعلم المقياس المتعامد لمنع الانجراف، واستخدام تدريب متسق مع الذاكرة المخبئية للتخفيف من تحيزات الانتباه في نماذج المحولات (Transformers).

المؤلفون الأصليون: Chong Cheng, Xianda Chen, Tao Xie, Wei Yin, Weiqiang Ren, Qian Zhang, Xiaoyang Guo, Hao Wang

نُشر 2026-03-16
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Chong Cheng, Xianda Chen, Tao Xie, Wei Yin, Weiqiang Ren, Qian Zhang, Xiaoyang Guo, Hao Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول رسم خريطة ضخمة ومتصلة لمدينة أثناء السير فيها، ولكن لا يمكنك سوى النظر إلى الأرض أمامك مباشرة. عليك أن تستمر في الرسم دون أن تتوقف أبداً لتنظر إلى الخلف نحو رسمك التخطيطي بالكامل.

هذا بالضبط ما يفعله LongStream، ولكن بالنسبة للحواسيب. إنه نظام ذكاء اصطناعي جديد يساعد الروبوتات والسيارات ذاتية القيادة على بناء خريطة ثلاثية الأبعاد للعالم أثناء تحركها من خلاله، إطاراً تلو الآخر، في الوقت الفعلي.

إليك شرح بسيط لسبب أهمية هذا الأمر وكيف يعمل، باستخدام بعض التشبيهات من الحياة اليومية.

المشكلة: "فقدان الذاكرة" و"الانحراف" في الأنظمة القديمة

قبل ظهور LongStream، كانت أنظمة صنع الخرائط بالذكاء الاصطعي تعاني من عيبين رئيسيين عند محاولة السير لمسافات طويلة:

  1. فخ "الخطوة الأولى": تخيل أنك تسير في ممر. إذا قررت أن الخطوة الأولى التي اتخذتها هي مركز الكون المطلق، فإن كل خطوة بعدها تُقاس بالنسبة لتلك الخطوة الأولى. إذا تعثرت قليلاً في الخطوة رقم 100، فسيحسب عقلك أنك الآن بعيد بمقدار 100 خطوة عما ظننت أنك فيه. وبحلول الخطوة رقم 1,000، ستعتقد أنك في بلد آخر، رغم أنك مجرد في الغرفة المجاورة.

    • بمصطلحات الذكاء الاصطناعي: كانت النماذج القديمة تربط الخريطة بأول صورة تم التقاطها. ومع طول الفيديو، تتراكم الأخطاء الصغيرة، مما يؤدي إلى "انهيار" الخريطة أو تشوهها بشكل جنوني بعد بضع مئات من الأمتار فقط.
  2. "الحمل الزائد على الذاكرة": تخيل أنك تحاول تذكر كل شخص قابلته في حياتك لكي تتعرف على وجه جديد. في النهاية، سيمتلئ عقلك بالوجوه القديمة لدرجة أنه لن يستطيع التركيز على الوجه الجديد.

    • بمصطلحات الذكاء الاصطناعي: حاولت هذه النماذج تذكر كل إطار (frame) في الفيديو. كانت ذاكرة الكمبيوتر (RAM) تمتلئ، أو يصاب الذكاء الاصطناعي بالارتباك بسبب البيانات "القديمة"، مما يجعله يفقد تتبع مكانه.

الحل: "خدع LongStream الثلاث السحرية"

ابتكر الباحثون وراء LongStream ثلاث طرق ذكية لإصلاح ذلك، مما يسمح للذكاء الاصطناعي بالسير لعدة كيلومترات دون أن يتوه.

1. "سباق التتابع" بدلاً من "خط البداية"

بدلاً من قياس كل خطوة مقارنة بالخطوة الأولى من الرحلة، يغير LongStream القواعد.

  • التشبيه: تخيل سباق تتابع. بدلاً من أن يحسب العداء في نهاية السباق مسافته من خط البداية، فإنه يقيس فقط المسافة التي ركضها من العداء السابق.
  • كيف يعمل: لا يسأل LongStream: "أين أنا بالنسبة للبداية؟" بل يسأل: "أين أنا بالنسبة لآخر نقطة تفتيش رئيسية (keyframe)؟". إذا ارتكب الذكاء الاصطناعي خطأً، فإنه سيؤثر فقط على المسافة بين نقطتي تفتيش، وليس على الخريطة بأكملها. هذا يمنع الأخطاء من التراكم لتتحول إلى كارثة كبرى.

2. فصل "الشكل" عن "الحجم"

أحياناً، يرتبك الذكاء الاصطناعي بشأن حجم الشيء مقابل شكله.

  • التشبيه: تخيل أنك تنظر إلى سيارة لعبة. أنت بحاجة لمعرفة أنها تشبه السيارة (الهندسة/الشكل) وأن طولها 10 سم (المقياس). حاولت النماذج القديمة تعلم الاثنين في نفس الوقت، مما أدى إلى تداخل المعلومات.
  • كيف يعمل: يستخدم LongStream نهج "المتخصص". جزء من "الدماغ" يتعلم شكل الغرفة (متجاهلاً الحجم)، وجزء آخر صغير يسمى "رأس المقياس" (Scale Head) يتعلم الحجم الفعلي (الأمتار/الأقدام). من خلال إبقاء هذين الدورين منفصلين، لا يختلط الأمر على الذكاء الاصطناعي حول ما إذا كان الممر بطول 5 أمتار أم 500 متر.

3. "تحديث الذاكرة" (مسح السبورة)

العدو الأكبر للمشي الطويل هو "بالوعة الانتباه" (attention sink). وهذا يحدث عندما يصبح الذكاء الاصطناعي مهووساً بأول صورة رآها، متجاهلاً كل شيء آخر.

  • التشبيه: تخيل أنك تقرأ كتاباً. إذا استمررت في التحديق في الصفحة الأولى بينما تحاول قراءة الصفحة 50، فستصاب بالارتباك. يدرك LongStream ذلك ويقوم دورياً بـ "مسح السبورة".
  • كيف يعمل: يتم تدريب الذكاء الاصطناعي على نسيان التفاصيل الدقيقة للماضي البعيد والتركيز فقط على التاريخ القريب (الثواني الأخيرة). يفعل ذلك عن طريق "تحديث" ذاكرة التخزين المؤقت (cache). الأمر يشبه إنسان يأخذ نفساً عميقاً ويقول: "حسناً، انسَ تفاصيل ما حدث قبل 10 دقائق؛ دعنا نركز على مكان وجودي الآن". هذا يحافظ على نظافة الخريطة ويمنع الذكاء الاصطناعي من "التعلق" بالبيانات القديمة.

النتيجة: عداء ماراثون، وليس عداء مسافات قصعة

بفضل هذه الحيل، يمكن لـ LongStream معالجة تدفقات الفيديو لعدة كيلومترات (أكثر من 2.4 كم في اختباراتهم) دون الانهيار، ودون نفاد الذاكرة، ودون أن يتوه.

  • الذكاء الاصطناعي القديم: كان بإمكانه السير حوالي 50 متراً قبل أن تتحول الخريطة إلى فوضى ملتوية وغير قابلة للتمييز.
  • LongStream: يمكنه السير لأميال، مع الحفاظ على دقة واستقرار الخريطة، وكل ذلك أثناء العمل بسرعة 18 إطاراً في الثانية (وهي سرعة كافية للعبة فيديو في الوقت الفعلي).

لماذا يجب أن تهتم؟

هذه التكنولوجيا هي العمود الفقري لمستقبل:

  • السيارات ذاتية القيادة: فهي تحتاج للقيادة لساعات دون أن تصبح خرائطها الداخلية مشوشة.
  • الواقع المعزز (AR): تخيل ارتداء نظارات تعرض معلومات رقمية على العالم الحقيقي أثناء سيرك في مدينة كاملة. يضمن LongStream بقاء الأجسام الرقمية مثبتة في أماكنها الصحيحة فوق المباني الحقيقية، حتى بعد أن تمشي لأميال.
  • الروبوتات: الروبوتات التي يمكنها استكشاف مستودعات ضخمة أو مناطق كوارث دون الحاجة إلى تدخل بشري مستمر لإعادة ضبط نظام تحديد المواقع (GPS) الخاص بها.

باختصار، لقد علم LongStream الذكاء الاصطناعي كيف يتوقف عن الهوس بالماضي ويبدأ في التركيز على الحاضر، مما يسمح له بالتنقل في العالم للمسافة التي يحتاجها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →