← أحدث الأبحاث
💻 computer science

EgoAVFlow: Robot Policy Learning with Active Vision from Human Egocentric Videos via 3D Flow

يعد EgoAVFlow إطار عمل لتعلم سياسات الروبوت يستفيد من تمثيل تدفق ثلاثي الأبعاد مشترك من فيديوهات بشرية بمنظور الشخص الأول، وذلك لتعلم التحكم في المناولة والتحكم في زاوية الرؤية النشطة في آن واحد، مما يتيح تنفيذ المهام بمتانة دون الحاجة إلى عروض توضيحية من الروبوت.

المؤلفون الأصليون: Daesol Cho, Youngseok Jang, Danfei Xu, Sehoon Ha

نُشر 2026-02-27
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Daesol Cho, Youngseok Jang, Danfei Xu, Sehoon Ha

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت كيفية القيام بمهمة ما، مثل طي منشفة أو رش زجاجة، ولكن ليس لديك سوى فيديوهات لإنسان يقوم بذلك.

المشكلة هي أن البشر والروبوتات مُصممون بشكل مختلف. الإنسان يرتدي كاميرا على رأسه (عينيه) ويحرك رأسه بشكل غريزي. أما الروبوت، فيمتلك كاميرا مثبتة على ذراع ثابتة. إذا قلت للروبوت ببساً: "انسخ تماماً ما فعله رأس الإنسان"، فقد ينتهي الأمر بالروبوت وهو ينظر إلى السقف، أو يحجب الرؤية بذراعه، أو يفقد رؤية الشيء تماماً.

EgoAVFlow هو "عقل" جديد للروبوتات يحل هذه المشكلة. وإليك كيف يعمل، مشروحاً عبر تشبيهات بسيطة:

1. المشكلة: "المُقلد السيئ"

فكر في إنسان يقوم بمهمة ما مثل الساحر. إنه يحرك عينيه ورأسه بسرعة للحصول على أفضل زاوية لرؤية الخدعة. إذا حاولت تعليم روبوت نسخ حركات رأس الساحر بدقة، فقد يبدو الروبوت مثيراً للسخرية أو يفقد الهدف الأساسي لأن "جسم" الروبوت مختلف. هو لا يحتاج لتحريك رأسه مثل الإنسان؛ بل يحتاج فقط لرؤية الشيء بوضوح لأداء المهمة.

2. الحل: "خريطة التدفق ثلاثية الأبعاد"

بدلاً من محاولة نسخ حركات رأس الإنسان، يتعلم EgoAVFlow فيزياء الحركة.

تخيل أن فيديو الإنسان هو فيلم ثنائي الأبعاد (2D). يأخذ EgoAVFlow هذا الفيلم ويحوله إلى هولوغرام ثلاثي الأبعاد (هذا هو "التدفق ثلاثي الأبعاد" أو 3D Flow).

  • هو يتجاهل شكل الشيء (اللون، الملمس).
  • ويركز تماماً على أين يتحرك الشيء في الفضاء ثلاثي الأبعاد.
  • الأمر يشبه مشاهدة رقصة وتتبع أقدام الراقصين والمسار الذي يسلكونه فقط، مع تجاهل ملابسهم. هذا يسمح للروبوت بفهم الحركة دون أن يرتبك بسبب شكل جسم الإنسان المحدد.

3. السر الخفي: "الكاميرا الذكية"

هذا هو الجزء الأروع. الروبوت لا يكتفي بالمشاهدة فحسب؛ بل يحرك كاميرته بنشاط لإبقاء الشيء في مجال رؤيته.

  • الطريقة القديمة: يتبع الروبوت مسار رأس الإنسان بشكل أعمى.
  • طريقة EgoAVFlow: يمتلك الروبوت "كرة بلورية". قبل أن يتحرك، يتنبأ بـ:
    1. أين سيكون الشيء في الثواني القليلة القادمة.
    2. أين ستكون ذراعه الخاصة.
    3. هل ستحجب ذراعي الرؤية؟

إذا تنبأ الروبوت: "أوه لا، إذا حركت ذراعي بهذا الاتجاه، فسأحجب الرؤية عن الشيء"، فإنه يعدل زاوية الكاميرا فوراً ليلقي نظرة من حول ذراعه. الأمر يشبه حارس الأمن الذي يغير موقعه باستمرار ليتأكد من أنه لن يفقد رؤية الشخص المهم (VIP) أبداً، حتى لو تحرك ذلك الشخص خلف عمود.

4. كيف يتعلم: "جولة التدريب"

يتعلم الروبوت هذه المهارة باستخدام تقنية تسمى نماذج الانتشار (Diffusion Models) (فكر فيها كعملية "إزالة الضجيج").

  • تخيل أن الروبوت يحاول رسم صورة لزاوية الكاميرا المثالية. في البداية، تكون الصورة مجرد ضجيج عشوائي (تخمينات عشوائية).
  • لديه "معلم" (فيديو الإنسان) يعطيه فكرة عامة عن الأسلوب.
  • ولكن، قبل أن ينهي الرسم، يقوم بإجراء محاكاة: "إذا اخترت هذه الزاوية، هل سأرى الشيء؟"
  • إذا كانت الإجابة "لا"، فإنه يعدل الرسم. إذا كانت الإجابة "نعم"، فإنه يحتفظ به.
  • يقوم بذلك آلاف المرات في جزء من الثانية ليجد الزاوية المثالية التي تزيد من وضوح الرؤية لأقصى حد.

لماذا هذا مهم؟

في العالم الحقيقي، غالباً ما تفشل الروبوتات لأنها تفقد رؤية الشيء الذي تحاول التقاطه.

  • الطرق السابقة حاولت نسخ حركات رأس الإنسان، وهو ما فشل غالباً لأن رؤوس البشر تتحرك بشكل مختلف عن أذرونات الروبوت.
  • EgoAVFlow يتعلم الهدف (إبقاء الشيء مرئياً) بدلاً من الطريقة (تحريك الرأس مثل الإنسان).

النتيجة: يمكن للروبوت التقاط الأشياء، طي المناشف، ورش الزجاجات بموثوقية أكبر بكثير، حتى لو تغيرت زاوية الكاميرا باستمرار، وكل ذلك دون الحاجة لأن يتم تعليمه بواسطة إنسان يمسك بجهاز تحكم للروبوت. لقد تعلم من خلال مشاهدة الفيديوهات واكتشاف أفضل طريقة لـ "النظر" بمفرده.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →