← أحدث الأبحاث
💻 computer science

Time-Aware Assistive Navigation

تقدم هذه الورقة معياراً واسع النطاق للملاحة المساعدة المدركة للوقت باستخدام النماذج اللغوية الكبيرة متعددة الوسائط، كاشفةً أنه في حين أن الإشراف المباشر على الاستدلال التعليمي يحسن الأداء بشكل كبير، إلا أن النماذج الحالية لا تزال تعاني في التفكير الزمني والوعي بالسلامة.

المؤلفون الأصليون: Masaki Kuribayashi, Zhongkai Shangguan, Eshed Ohn-Bar

نُشر 2026-09-09
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Masaki Kuribayashi, Zhongkai Shangguan, Eshed Ohn-Bar

البحث الأصلي مُهدى إلى الملك العام بموجب CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقف عند تقاطع طرق مزدحم في مدينة، وأنت معصوب العينين، تعتمد كلياً على صوت ليرشدك إلى الأمام. في هذا السيناريو، يكون توقيت ذلك الصوت لا يقل أهمية عن الكلمات التي ينطق بها. فإذا تحدث المرشد كثيراً، سيشعر المستمع بالارتباك والتشتت؛ وإذا تحدث قليلاً جداً، أو في اللحظة الخاطئة، فقد يخطو المستمع نحو الخطر. هذا التوازن الدقيق بين الصمت والكلام هو التحدي الجوههري لنوع جديد من الذكاء الاصطناعي المصمم لمساعدة الأشخاص ذوي الإعاقة البصرية. وبينما أصبحت الحواسيب الحديثة بارعة للغاية في وصف ما تراه في صورة ما، إلا أنها واجهت صعوبة في فهم إيقاع الحياة الواقعية؛ فهي غالباً ما تفشل في معرفة متى تتحدث ومتى تلتزم الصمت، وهي مهارة ضرورية للسلامة في عالم فوضوي.

لقد تصدى فريق من الباحثين لهذه المشكلة عبر ابتكار اختبار جديد وطريقة جديدة لتدريب الذكاء الاصطناعي ليعمل كمرشد في الوقت الفعلي. لقد بنوا نظاماً يسمى "TIMELI"، وهو اختصار لـ "معيار تعليمات اللغة المدركة للوقت". صُمم هذا النظام لتعليم الحواسيب ليس فقط ما يجب قوله، بل متى يجب قوله بالضبط. بدأ الباحثون بمراقبة كيفية مساعدة المرشدين البشر للمكفوفين أثناء التنقل. ووجدوا أن المرشدين الخبراء غالباً ما يلتزمون الصمت عند التقاطعات، مما يسمح للشخص بالاستماع إلى حركة المرور واستخدام حواسه الأخرى، وأنهم يتحدثون فقط عند ظهور عائق جديد أو عند الحاجة إلى تغيير الاتجاه. كما وجدوا أن المرشدين يتجنبون تقديم شروحات طويلة ومعقدة، ويفضلون توجيهات قصيرة وواضحة مثل "امشِ للأمام" أو "انعطف قليلاً جهة اليمين".

ولتعليم الحاسوب هذه المهارة، كان على الباحثين أولاً بناء عالم يمكنهم التدرب فيه بأمان. وبما أن الاختبار على أشخاص حقيقيين في مدن حقيقية ينطوي على مخاطر كبيرة، فقد أنشأوا محاكاة حاسوبية مفصلة لمدينة ما. وفي هذا العالم الرقمي، قاموا بتوليد آلاف المقاطع الفيديوية التي تُظهر شخصاً يمشي في الأرصفة، ويعبر الشوارع، ويتنقل حول مشاة وعوائق أخرى. وقد برمجوا المحاكاة لمحاكاة الظروف المعقدة للمدينة الحقيقية، بما في ذلك أنماط الطقس المختلفة وتدفق حركة المرور. وباستخدام هذه البيانات، أنشأوا مكتبة ضخمة من الأمثلة التي توضح اللحظة المثالية للتحدث واللحظة المثالية للصمت.

وعندما اختبر الباحثون نماذج الذكاء الاصطناعي القياسية والمتاحة، كانت النتائج مخيبة للآمال. فحتى النماذج الأكثر تقدماً، والتي عادة ما تكون بارعة جداً في الإجابة عن الأسئلة المتعلقة بالصور، فشلت في فهم التوقيت. كانت تميل إلى الكلام باستمرار، وتقديم تعليق مستمر من شأن أن يشتت المستخدم الحقيقي. وكثيراً ما تحدثت في أوقات كان ينبغي لها فيها الصمت، مثل أثناء عبور الشخص للشارع، كما فاتتها لحظات حرجة كانت تتطلب تحذيراً فعلياً. وأظهرت الدراسة أن مجرد إعطاء هذه النماذج المزيد من البيانات للقراءة لم يكن كافياً لحل المشكلة؛ إذ لم تكن هذه النماذج مبنية لتفكر في تسلسل الأحداث أو مدى إلحاح الموقف.

ولحل هذه المشكلة، غير الباحثون طريقة تدريب النماذج. فبدلاً من مجرد طلب وصف المشهد من الحاسوب، أجبروه على تحديد "سبب" حديثه أولاً. وقبل توليد أي جملة، كان على النموذج تصنيف نيته، والاختيار من بين خيارات مثل "البقاء صامتاً"، أو "التحذير من عائق"، أو "إعطاء توجيه". هذه الخطوة البسيطة المتمثلة في جعل النموذج يفكر في سبب حديثه حسنت أداءه بشكل كبير. كما أضاف الباحثون فحصاً محدداً لضمان معرفة النموذج متى يتوقف عن الكلام. ومن خلال تدريب النظام على التنبؤ بما إذا كانت التعليمات ضرورية في أي ثانية معينة، علموه أن يكون موجزاً وفي التوقيت المناسب.

كانت نتائج هذا النهج الجديد ملموسة. ففي عمليات المحاكاة الحاسوبية، تعلمت النماذج المحسنة البقاء صامتة عند الاقتضاء والتحدث فقط عند الضرورة، تماماً مثل المرشد البشري. لقد نجحت في تقليل عدد الكلمات غير الضرورية وتجنبت عادة التحدث أثناء عبور المستخدم للشارع. وعندما اختبر الباحثون هذه النماذج على مقاطع فيديو من العالم الحقيقي لم ترها من قبل، كانت الأنظمة لا تزال قادرة على نقل مهاراتها، وإن كان أداؤها أقل مثالية بقليل مما كان عليه في المحاكاة. وفي اختبار نهائي حيث استُخدمت تعليمات الحاسوب للتحكم في مشاة افتراضي يسير عبر المدينة، تمكنت أفضل النماذج من قيادة الشخص إلى وجهته في نصف الحالات دون التسبب في اصطدامات أو ضياع الطريق.

يسلط هذا العمل الضوء على قصور جوهري في الذكاء الاصطناعي الحالي: وهو أن القدرة على وصف العالم لا تعني تلقائياً القدرة على التفاعل معه بأمان. وتثبت الدراسة أنه لكي تكون التكنولوجيا المساعدة مفيدة حقاً، يجب أن تفهم تدفق الوقت وسياق اللحظة. فلا يكفي أن يكون الجهاز ذكياً؛ بل يجب أن يعرف أيضاً متى يصمت. ورغم أن هذه التكنولوجيا ليست مثالية بعد وتواجه تحديات في فهم المسافات المعقدة والعلاقات بين الأشياء، إلا أن هذا البحث يوفر مساراً واضحاً للمضي قدماً. فمن خلال تعليم الآلات التفكير في توقيت أفعالها، يمكننا الاقتراب من إنشاء مرشدين أذكياء يقدمون دعماً آمناً وموثوقاً ومفيداً حقاً للأشخاص الذين يتنقلون في العالم.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →