← أحدث الأبحاث
💻 computer science

LookStep: Efficient Vision-Language Navigation with Linguistic Foresight and Event Driven Memory

يُعد LookStep إطار عمل فعالاً للملاحة البصرية اللغوية من طرف إلى طرف، يستفيد من نمذجة الحالة المستقبلية المتمحورة حول اللغة والذاكرة المتدحرجة القائمة على الأحداث لتحقيق أداء فائق مع تقليل متطلبات البيانات والحوسمة مقارنة بالأسالهم الحالية.

المؤلفون الأصليون: Kun-Yang Yu, Yingzhe Li, Hongyu Xu, Shi-Yu Tian, Zhi Zhou, Yang Chen, Ming Yang, Sheng Wang, Qing Yu, Lan-Zhe Guo, Yu-Feng Li

نُشر 2026-09-07
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Kun-Yang Yu, Yingzhe Li, Hongyu Xu, Shi-Yu Tian, Zhi Zhou, Yang Chen, Ming Yang, Sheng Wang, Qing Yu, Lan-Zhe Guo, Yu-Feng Li

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل روبوتًا يتنقل في منزل ليس باتباع خريطة مرسومة مسبقًا، بل بالاستماع إلى صوت بشري. هذا هو تحدي الملاحة عبر الرؤية واللغة، وهو مجال يجب فيه على وكيل اصطناعي أن يتحرك عبر مساحات حقيقية أو محاكية بناءً على تعليمات منطوقة مثل "سر بجانب الأريكة الحمراء وانعطف يسارًا عند النافذة". لسنوات، حاول الباحثون تعليم الآلات هذه المهارة باستخدام النماذج اللغوية الكبيرة، وهي أنظمة قوية قادرة على فهم الكلام البشري والمشاهد البصرية. ومع ذلك، ظل هناك عائق كبير: فهذه الأنظمة غالبًا ما تتطلب كميات هائلة من البيانات للتعلم، وتجد صعوبة في تذكر ما رأته دون أن تصبح بطيئة ومكلفة حوسبيًا. فهي تميل إما إلى نسيان التفاصيل الرئيسية لرحلتها أو تكديس الكثير من المعلومات البصرية لدرجة أنها لا تستطيع اتخاذ القرارات بالسرعة الكافية لتكون مفيدة في العالم الحقيقي.

لقد قدم فريق من الباحثين الآن نهجًا جديدًا يسمى "LookStep"، صُمم لجعل مهام الملاحة هذه أسرع، وأكثر كفاءة في استخدام الذاكرة، وأقل اعتمادًا على مجموعات البيانات الضخمة. فبدلاً من مجرد التخمين بشأن الخطوة التالية بناءً على المشهد الحالي، يتم تدريب النظام على التفكير مسبقًا. فقبل أن يقرر الانعطاف أو التوقف، يتخيل المستقبل القريب لكل إجراء محتمل. يسأل نفسه: "إذا انعطفت يسارًا الآن، كيف سيبدو المشهد في الثواني القليلة القادمة؟" و"إذا استمررت في السير للأمام، هل سأصطدم بجدار أم سأصل إلى الهدف؟". ومن خلال توليد هذه السيناريوهات المستقبلية بلغة بسيطة، يتعلم النموذج تقييم عواقب خياراته قبل الالتزام بها. تسمح هذه العملية للروبوت بفهم المسار بشكل أعمق دون الحاجة إلى حفظ كل إطار فيديو رآه على الإطلاق.

الابتكار الرئيسي الثاني في "LookStep" هو كيفية تعامله مع الذاكرة. فالطرق التقليدية غالبًا ما تخزن تدفقًا مستمرًا وطويلًا من الصور الماضية، مما يملأ ذاكرة الكمبيوتر بسرعة. لكن "LookStep" يتبع نهجًا مختلفًا، حيث يعمل بشكل يشبه الإنسان الذي يتذكر فقط اللحظات المهمة من رحلة ما. فبينما يتحرك الروبوت، يقرر باستمرار ما إذا كان المشهد الحالي يستحق الحفظ. فإذا كان الروبوت يمشي فقط في ممر طويل وفارغ، فقد يتخطى حفظ هذا المشهد. ولكن إذا وصل إلى نقطة تحول، أو رأى معلمًا محددًا ذُكر في التعليمات، أو وصل إلى وجهة ما، فإنه يحدد تلك اللحظة كلحظة حرجة ويخزنها في بنك ذاكرة صغير ومتداول. يضمن نظام الذاكرة هذا "المدفوع بالأحداث" أن يحتفظ الروبوت فقط بالمعلومات الأكثر فائدة، مستبعدًا التفاصيل غير الضرية التي قد تعيقه لولا ذلك.

النتائج التي حققتها هذه الطريقة الجديدة مذهلة. فعند اختباره على معايير ملاحة قياسية، حقق "LookStep" معدل نجاح قدره 49.7 بالمائة في بيئات غير مرئية مسبقًا، متفوقًا على العديد من الأنظمة الحالية التي تعتمد على مجموعات بيانات أكبر بكثير وأجهزة أكثر تعقيدًا. ولعل الأهم من ذلك، أنه فعل ذلك باستخدام ذاكرة أقل بكثير؛ فبينما تطلبت الطرق المتقدمة الأخرى ما يقرب من 44 جيجابايت من الذاكرة للتشغيل، تمكن "LookStep" من أداء المهام نفسها بأقل من 20 جيجابايت. وتعني هذه الكفاءة أن هذه التكنولوجيا يمكن أن تعمل في النهاية على أجهزة أصغر وأكثر بساطة، بدلاً من التطلب لمزارع خوادم ضخمة. كما اختبر الباحثون النظام في بيئة مكتبية حقيقية ذات تعليمات معقدة وأجسام متشابهة بصريًا، حيث أكمل بنجاح مهام ملاحة صعبة، مما أثبت أن تدريبه على البيانات المحاكية يمكن أن ينتقل إلى الواقع المادي.

من خلال الجمع بين استراتيجية التطلع للأمام ونظام ذاكرة ذكي وانتقائي، يوضح "LookStep" أن الروبوتات لا تحتاج إلى أن تغمرها البيانات لتتنقل بفعالية. فهي لا تحتاج إلى تذكر كل خطوة اتخذتها، ولا تحتاج إلى رؤية المستقبل بأكه لكي تتخذ قرارًا جيدًا. بدلاً من ذلك، من خلال التركيز على العواقب المباشرة لأفعالها وتذكر المعالم التي تهم حقًا، يمكن لهذه الوكلاء التحرك عبر العالم بمستوى من الكفاءة والقدرة على التكيف يقربنا من آلات مادية ذكية حقًا.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →