← أحدث الأبحاث
💻 computer science

Retrospective Open-Vocabulary Memory for Long-Term Object Search

تقدم هذه الورقة البحثية ECROM، وهي طريقة للبحث عن الأشياء طويل الأمد تستخدم ذاكرة مفتوحة المفردات استرجاعية للتفكير في فرص الكشف وتحسين كفاءة البحث، والتي تم التحقق من صحتها من خلال معيار جديد يُظهر مكاسب كبيرة في الأداء مقارنة بأنظمة الذاكرة الحالية.

المؤلفون الأصليون: Jiaming Wang, Zhiwei Xue, Chen Jizhuo, Peng Shiqi, Harold Soh

نُشر 2026-10-05
📖 6 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Jiaming Wang, Zhiwei Xue, Chen Jizhuo, Peng Shiqi, Harold Soh

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تتحسن الروبوتات التي تتحرك عبر العالم في قدرتها على الرؤية، لكنها لا تزال سيئة للغاية في تذكر أين توجد الأشياء عادةً. تخيل روبوتاً مكلفاً بالعثور على مجموعة مفاتيح مفقودة في منزل زاره مرات عديدة. إذا تذكر الروبوت فقط آخر مرة رأى فيها المفاتيح، فقد يبحث في المكان الخاطئ إذا تم نقل المفاتيح بالأمس. وإذا اكتفى ببساطة بعدّ عدد المرات التي رأى فيها المفاتيح في مكان معين، فقد يخدعه حظه السيئ: فربما مر بجانب طاولة المطبخ مائة مرة لكنه لم ينظر للأسفل إليها أبداً، بينما ألقى نظرة واحدة فقط على أريكة غرفة المعيشة وصادف رؤية المفاتيح هناك. سيجعل هذا العد البسيط الروبوت يعتقد أن الأريكة هي أفضل مكان للبحث، رغم أن الطاولة هي في الواقع المكان الذي تنتمي إليه المفاتيح في معظم الأوقات. هذه هي المشكلة الجوهرية للبحث عن الأشياء على المدى الطويل: التمييز بين مكان وجود الشيء الفعلي وبين المكان الذي نظر فيه الروبوت بمحض الصدفة.

ولحل هذه المشكلة، طور باحثون في جامعة سنغافورة الوطنية طريقة جديدة للروبوتات لبناء ذاكرة لبيئتها. أطلقوا على نظامهم اسم ECROM، وهو اختصار لـ "الذاكرة المفتوحة ذات الاسترجاع المعاير بالتعرض" (Exposure-Calibrated Retrospective Open-Vocabulary Memory). اختبر الفريق هذا النظام في سلسلة من المحاكاة المحكومة عبر عشرة منازل رقمية مختلفة، حيث نُقلت الأشياء وفقاً لأنماط خفية، وتغير مسار الروبوت بشكل متعمد بحيث شوهدت بعض الأسطح بشكل متكرر وأخرى نادراً. ووجدوا أنه من خلال وزن ما رآه الروبوت بعناية مقابل مقدار ما أتيحت له الفرصة لرؤيته فعلياً من سطح ما، يمكن للروبوت تعلم العادات الحقيقية للأشياء. وعندما طُلب منه البحث عن عناصر لم يُطلب منه البحث عنها من قبل، ساعد نظام الذاكرة الجديد هذا الروبوت في العثور على الهدف بشكل أسرع وأكثر موثوقية من الطرق السابقة.

إن التحدي الذي واجهه الباحثون متجذر في الواقع الفوضوي لحركة الروبوتات. في منزل حقيقي، لا يقوم الروبوت بمسح كل بوصة من كل غرفة بوضوح تام. قد يسير في المطبخ بينما ينظر إلى السقف، أو يمر بطاولة طعام يحجبها جزئياً كرسي. إذا قام الروبوت ببساطة بعدّ عدد المرات التي رصد فيها "قبعة قش" على طاولة مقابل جزيرة مطبخ، فقد يخطئ في الإجابة إذا قضى وقتاً أطول في النظر إلى الجزيرة. قد تكون القبعة على الطاولة نصف الوقت، ولكن إذا نظر الروبوت إلى الجزيرة فقط، فإن العد البسيط سيشير إلى أن الجزيرة هي موطن القبعة. أدرك الباحثون أنه لكي يتعلم الروبوت أين تحدث الأشياء عادةً، يجب عليه فصل دليل وجود الشيء عن الفرصة التي أتيحت له لرؤيته. فعدم الرصد لا يكون ذا معنى إلا إذا كان الروبوت ينظر بالفعل في الاتجاه الصحيح؛ أما إذا كان ينظر بعيداً، فإن غياب الرصد لا يخبرنا بشيء.

ولاختبار هذه الفكرة، أنشأ الفريق معياراً يسمى LOOP-Bench، يتكون من عشر بيئات منزلية واقعية. في هذه عمليات المحاكاة، وضعوا أشياء مثل الأكواب والمقصات والقبعات على أسطح مختلفة وفقاً لتوزيعات احتمالية خفية. كانت بعض الأشياء توجد دائماً على نفس الطاولة، بينما انتقلت أشياء أخرى بين عدة أماكن، وظهرت أشياء أخرى نادراً جداً. والأهم من ذلك، أن مسار الروبوت عبر هذه المنازل تم إنشاؤه بشكل مستقل عن مكان وضع الأشياء. وهذا يعني أن الروبوت قد يمر بجانب طاولة عشر مرات دون أن يرى السطح بوضوح أبداً، بينما قد يمر بجزيرة مطبخ مرة واحدة فقط ويحصل على رؤية مثالية لها. هذا الإعداد أجبر نظام الذاكرة على استنتاج الموقع الحقيقي للأشياء دون أن يخدعه نمط حركة الروبوت.

يعمل نظام ECROM الجديد من خلال تنظيم تاريخ الروبوت في خريطة للأسطح، أو "الدعامات"، وتسجيل مقدار ما كان كل سطح مرئياً بالضبط خلال كل جولة. عندما يطلب إنسان من الروبوت لاحقاً العثور على عنصر محدد، ينظر النظام في جميع الرحلات الماضية. هو لا يكتفي بالعد فقط؛ بل يحسب الاحتمالية بناءً على مقدار تعرض السطح للرؤية. إذا رأى الروبوت سطحاً بوضوح ولم يجد الشيء، فإن النظام يخفض بقوة الاعتقاد بوجوده هناك. ولكن إذا لمح الروبوت السطح لمحة خاطفة، أو إذا كان المنظر محجوباً، فإن النظام يعامل عدم الرصد كأمر محايد، رافضاً معاقبة ذلك المكان. هذا يسمح للروبوت بأن يتعلم أن الشيء من المرجح أن يكون على سطح لم يره كثيراً، بشرما كان ذلك السطح هو الوحيد الذي ظهر فيه الشيء عندما كان مرئياً.

كانت نتائج المحاكاة واضحة. عندما طلب الباحثون من الروبوت العثور على أشياء لم يُطلب منه البحث عنها صراحة، تفوق النظام الجديد على كل الطرق الأخرى التي اختبروها. لقد حسن دقة توقعاته بهامش كبير، والأهم من ذلك، وجد الأشياء بشكل أسرع أثناء البحث النشط. في عمليات المحاكاة، وجد الروبوت الذي يستخدم ECROM الهدف في حوالي 59 بالمائة من محاولاته، مقارنة بنحو 53 بالمائة لأفضل طريقة تالية. والأكثر إثارة، في دراسة حالة محددة وردت في الورقة البحثية، انخفضت المسافة التي تعين على الروبوت قطعها للعثور على الشيء من 17.8 متراً إلى 3.2 متراً فقط. جاءت هذه الكفاءة من معرفة الروبوت بدقة أي الأسطح تستحق الفحص أولاً، بدلاً من التسكع بلا هدف أو العلوق في إعادة زيارة الأماكن التي استبعدها بالفعل.

للتأكد من أن هذا لم يكن مجرد خدعة رقمية، اختبر الفريق النظام على روبوت حقيقي، وهو Hello Robot Stretch 3، في بيئة مكتبية حقيقية. أجروا نفس نوع مهمة البحث بأشياء حقيقية مثل كوب أحمر، ومقص، وعلبة لحم معلب. كان على الروبوت التنقل في مساحة قدرها 500 متر مربع، والتحرك بين المكاتب والأرفف، للعثور على هذه العناصر. جاءت النتائج مطابقة للمحاكاة. نجح الروبوت الذي يستخدم نظام الذاكرة الجديد في العثور على الأشياء في 14 من أصل 15 تجربة، بينما نجحت الطرق الأخرى في 10 أو 11 تجربة فقط. كما قطع الروبوت الفيزيائي مسافة أقل بكثير، حيث غطى في المتوسط 19.4 متراً مقارنة بنحو 29 متراً للطرق الأخرى. وقد أثبت هذا أن منطق فصل فرصة الملاحظة عن وجود الشيء يعمل حتى عندما يتعامل الروبوت مع الإضاءة غير المتوقعة والفوضى في العالم الحقيقي.

استكشف الباحثون أيضاً ما سيحدث إذا أزالوا الأجزاء الرئيسية من نظامهم. فعندما أجبروا الروبوت على افتراض أنه رأى كل سطح بالكامل، حتى عندما لم يكن كذلك بوضوح، انخفض أداء الروبوت. بدأ في معاملة عمليات الرصد المفقودة كدليل على عدم وجود الشيء، مما أدى به إلى تجاهل المواقع الصحيحة. وبالمثل، عندما بسطوا النظام ليقتصر فقط على معرفة ما إذا كان الشيء قد شوهد أم لا، متجاهلين قوة الدليل البصري، أصبح الروبوت أقل دقة. أكدت هذه الاختبارات أن نجاح النظام اعتمد على شيئين محددين: المحاسبة الدقيقة لمقدار ما كان مرئياً من السطح، والتفسير الدقيق لمدى قوة الدليل البصري.

يشير هذا العمل إلى مسار للمستقبل للروبوتات التي تحتاج إلى العمل في بيئات ديناميكية ومتغيرة على فترات طويلة. فبدلاً من مجرد تذكر آخر مرة رأوا فيها شيئاً ما، أو الاحتفاظ بإحصاء بسيط للمشاهدات، يمكن لهذه الروبوتات تعلم عادات العالم من حولها. يمكنهم فهم أنه لمجرد أنهم لم يروا كوب قهوة على طاولة مؤخراً، فهذا لا يعني أن الكوب ليس هناك؛ بل قد يعني فقط أنهم لم ينظروا إلى تلك الطاولة منذ فترة. ومن خلال بناء ذاكرة تحترم حدود رؤيتهم الخاصة، يمكن للروبوت أن يصبح شريكاً أكثر موثوقية في المنزل، قادراً على العثيد على الأشياء المفقودة حتى عندما يكون العالم من حوله في حالة تغير مستمر. يخطط الباحثون لإصدار الكود الخاص بهم وبيانات المعيار للجمهور، مما يسمح للآخرين بالبناء على هذا الأساس من الآلات الأكثر ذكاءً وقدرة على الملاحظة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →