← أحدث الأبحاث
💻 computer science

EgoAfford: Task-Oriented Affordance Grounding via Egocentric Referring Segmentation

تقدم الورقة البحثية EgoAfford، وهو معيار ومجموعة بيانات لتأسيس الإمكانات (affordance grounding) الموجهة نحو المهام في الرؤى من منظور الشخص الأول (egocentric views)، إلى جانب EgoLens، وهو نموذج متعدد الوسائط متخصص يقوم بشكل مشترك بعمليات التخطيط للخطوة التالية والتقسيم النوعي الخاص بالأدوار لمهام الطاولة متعددة الخطوات.

المؤلفون الأصليون: Xinyuan Guan, Feifan Chen, Xinyu Zhan, Fu-Cheng Zhang, Cewu Lu, Lixin Yang

نُشر 2026-08-06
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xinyuan Guan, Feifan Chen, Xinyu Zhan, Fu-Cheng Zhang, Cewu Lu, Lixin Yang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا كيفية صنع شطيرة. أنت لا تريد فقط أن يعرف الروبوت شكل "السكين"؛ بل تحتاجه أن يفهم كيف يستخدم هذه السكين لفرد الزبدة، وما الذي سيفرد الزبدة عليه، وأين سيضع الشريحة النهائية. هذا هو عالم "الإمكانية الوظيفية" (Affordance)، وهي كلمة منمقة تعني "ما يسمح لك به الشيء القيام به". فكر في مقبض الباب: شكله يسمح بالتدوير. والكوب يسمح بحمل السائل. لفترة طويلة، كانت الروبوتات جيدة جدًا في رصد هذه الأفعال البسيطة والمنفردة، مثل "أمسك المقبض". لكن الحياة الواقعية فوضوية ومتعددة الخطوات. فصنع الشطيرة ليس مجرد عملية إمساك واحدة؛ بل هو قصة كاملة تتضمن التخطيط، واختيار الأداة المناسبة، ومعرفة أين تضع الأشياء بدقة بعد ذلك. السؤال الكبير الذي يطرحه العلماء هو: هل يمكننا تعليم الروبوتات ألا تكتفي برؤية الأشياء فحسب، بل أن تفهم "قصة" المهمة، وتستنتج الخطوة التالية، وتحدد الأجزاء الصغيرة والمحددة من الشيء المطلوبة لهذه الخطوة؟

هنا يأتي مشروع EgoAfford، وهو مشروع جديد يحاول حل هذا اللغز عبر منح الروبوتات رؤية "من منظور الشخص الأول"، تمامًا كما نرى نحن العالم. قام الباحثون ببناء ساحة لعب رقمية ضخمة تحتوي على حوالي 15,500 صورة لمشاهد طاولة، تغطي 2,000 مهمة مختلفة متعددة الخطوات. كما أنشأوا مجموعة اختبار "من العالم الحقيقي" تضم 102 صورة التقطها بشر لمعرفة ما إذا كان بإمكان الروبوت التعامل مع الفوضى الواقعية لمطبخ حقيقي. والهدف؟ معرفة ما إذا كان بإمكان الكمبيوتر النظر إلى صورة، وقراءة هدف مثل "صنع الشاي"، ثم القيام بشيئين في آن واحد: 1) كتابة بقية الوصفة (الخطة)، و2) رسم قناع (mask) فوق الجزء المحدد بالضبط من إبريق الشاي الذي تحتاج للصب منه، والملعقة التي تحتاج للتحريك بها، والكوب الذي تحتاج للصب فيه.

ولمعالجة ذلك، قدم الفريق EgoLens، وهو نموذج ذكاء اصطناعي ذكي مصمم خصيصًا لهذه المهمة. فكر في EgoLens كمتدرب طباخ آلي يتعلم كيفية "قراءة" المشهد. وخلافًا للنماذج الأخرى التي قد تخمن الشيء بأكمله أو ترتبك أمام التعليمات المعقدة، تم تدريب EgoLens على تفكيك المهمة إلى أصغر قطعها الوظيفية. فهو لا يكتفي بالقول "هذا قدر"؛ بل يقول "أحتاج للإمساك بـ فوهة ذلك القدر لأصب، وأحتاج للإمساك بـ يد الملعقة لأحرك". وتظهر الورقة البحثية أن EgoLens هو الأفضل حاليًا في هذا النوع المحدد من التفكير، حيث يتفوق على نماذج الذكاء الاصطناعي الكبيرة الأخرى والأدوات التجارية التي تحاول الجمع بين التخطيط والرؤية.

ومع ذلك، يحرص الباحثون على الإشارة إلى أن هذا ليس حلاً سحريًا بعد. فبينما يعد EgoLens ممتازًا بالنسبة للصور "الرقمية" التي أنشأوها، لا تزال هناك فجوة عندما يتعلق الأمر بالصور الحقيقية، مما يشير إلى أن الروبوت لا يزال بحاجة إلى مزيد من التدريب على الطبيعة غير المتوقعة للحياة الواقعية. وتقترح الدراسة أنه من خلال الجمع بين القدرة على التخطيط للخطوات التالية والقدرة على تحديد الجزء الوظيفي الدقيق من الشيء، يمكننا تقريب الروبوتات كثيرًا من أن تصبح مساعدين مفيدين في حياتنا اليومية. إنها خطوة مهمة للأمام في تعليم الآلات ليس فقط ما هي الأشياء، بل كيفية استخدامها لإنجاز مهمة ما.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →