← أحدث الأبحاث
💻 computer science

DeVI: Physics-based Dexterous Human-Object Interaction via Synthetic Video Imitation

تُعد DeVI إطار عمل مبتكر يُمكّن من التحكم في التفاعل البشري مع الأشياء ببراعة ومحاكاة الواقع الفيزيائي عبر الاستفادة من الفيديوهات الاصطناعية المشروطة بالنصوص ومكافأة تتبع هجينة بين الثلاثية والأبعاد، مما يحقق تعميماً صفرياً (zero-shot generalization) على أشياء غير مرئية دون الحاجة إلى عروض توضيحية حركية ثلاثية الأبعاد عالية الجودة.

المؤلفون الأصليون: Hyeonwoo Kim, Jeonghwan Kim, Kyungwon Cho, Hanbyul Joo

نُشر 2026-04-23
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Hyeonwoo Kim, Jeonghwan Kim, Kyungwon Cho, Hanbyul Joo

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تريد تعليم روبوت كيفية التقاط حبة فراولة رقيقة، أو فك غطاء زجاجة مياه، أو وضع قبعة على رأسه دون سحقها. تقليديًا، لتعليم الروبوت هذه المهارات "الماهرة" (حركات الأصابع الدقيقة)، ستحتاج إلى ممثل بشري يرتدي بدلة عالية التقنية ومكلفة للغاية مغطاة بالمستشعرات (التقاط الحركة) لتسجيل كل حركة صغيرة. ثم تقوم بتغذية هذه البيانات ثلاثية الأبعاد المثالية إلى الروبوت.

المشكلة: هذا الأمر مكلف، بطيء، ومحدود. لا يمكنك تسجيل كل شيء في العالم بهذه الطريقة.

الحل: DeVI (محاكاة الفيديو الماهرة)
ابتكر الباحثون في جامعة سيول الوطنية اختصارًا ذكيًا يسمى DeVI. فبدلاً من الحاجة إلى بدلة التقاط حركة، يستخدمون فيديوهات مولدة بواسطة الذكاء الاصطناعي لتعليم الروبوت.

إليك كيف يعمل الأمر، مقسمًا إلى تشبيهات بسيطة:

1. "مخرج الفيلم" (مولد الفيديو)

تخيل أن لديك مخرج أفلام سحري (نموذج انتشار فيديو - Video Diffusion Model) يمكنه إنشاء فيديوهات واقعية من مجرد نص بسيط.

  • أنت تقول: "شخص يلتقط تفاحة حمراء بيده اليسرى."
  • المخرج: ينشئ فيديو ثنائي الأبعاد (2D) لحدوث ذلك.

المشكلة هي أن هذا الفيديو مجرد صورة مسطحة (2D). هو لا يعرف شيئًا عن الجاذبية، أو الوزن، أو كيف تعمل مفاصل الروبوت فعليًا. إذا طلبت من الروبوت فقط أن "يقلد الفيديو"، فقد يحاول المشي عبر الطاولة أو الطفو في الهواء لأن الفيديو لا يحتوي على قواعد الفيزياء.

2. "المترجم الهجين" (السر وراء النجاح)

هنا يصبح DeVI ذكيًا. فهو يدرك أن نسخ فيديو مسطح بدقة هو أمر مستحيل لروبوت ثلاثي الأبعاد (3D). لذا، يقوم بتقسيم المهمة إلى جزأين، مثل مترجم ومتتبع:

  • المترجم البشري (ثلاثي الأبعاد): بالنسبة لجسم الشخص، يستخدم النظام الذكاء الاصطناعي لتخمين الهيكل العظمي ثلاثي الأبعاد الذي يتحرك خلف الفيديو المسطح. الأمر يشبه النظر إلى عرض خيال الظل وتخمين كيف تتحرك عظام الشخص بالضبط في الفضاء ثلاثي الأبعاد.
  • متتبع الأشياء (ثنائي الأبعاد): بالنسبة للشيء (التفاحة)، فإن تخمين الموقع ثلاثي الأبعاد أمر صعب جدًا وغالبًا ما يكون خاطئًا. لذا يقول DeVI: "انسوا تخمين موقع التفاحة ثلاثي الأبعاد. فقط راقبوا أين تتحرك بكسلات التفاحة على الشاشة." إنه يتتبع المسار ثنائي الأبعاد للتفاحة.

التشبيه: تخيل أنك تحاول تعلم رقصة من خلال مشاهدة فيديو.

  • يمكنك بسهون رؤية أين تقع أقدام الراقص في الفضاء ثلاثي الأبعاد (أنت تعرف أنها على الأرض).
  • لكن إذا كان الراقص يمسك بالونًا، فمن الصعب معرفة مدى ارتفاع البالون بدقة في الفضاء ثلاثي الأبعاد بمجرد النظر إلى الشاشة المسطحة.
  • خدعة DeVI: يتعلم حركات أقدام الراقص في الفضاء ثلاثي الأبعاد، ولكن بالنسبة للبالون، فإنه يكتفي بالقول: "تأكد من أن يد الروبوت تتحرك بحيث يبقى البالون في نفس المكان على شاشة التلفاز."

3. "مدرب الفيزياء" (نظام المكافأة)

بمجرد حصول DeVI على هذا "الهدف الهجين" (جسم ثلاثي الأبعاد + مسار جسم ثنائي الأبعاد)، فإنه يرسله إلى عقل الروبوت (وكيل التعلم المعزز).

يحاول الروبوت التحرك في محاكاة فيزيائية (صندوق رمال رقمي).

  • إذا حرك الروبوت جسمه مثل التخمين ثلاثي الأبعاد: يحصل على نقطة.
  • إذا حرك الروبوت يده بحيث يبقى الجسم على المسار ثنائي الأبعاد: يحصل على نقطة.
  • إذا لمس الروبوت الجسم بالفعل: يحصل على نقطة إضافية (بونص).

يحاول الروبوت ملايين المرات، يفشل ويعدل مساره، حتى يكتشف الطريقة المثالية القائمة على الفيزياء لتحريك أصابعه لتطابق الفيديو.

لماذا يعد هذا أمرًا مهمًا؟

  • التعلم من الصفر (Zero-Shot Learning): لا تحتاج لتسجيل الروبوت وهو يؤدي المهمة أولاً. أنت فقط تكتب نصًا، تولد فيديو، ويتعلم الروبوت فورًا.
  • يعمل مع أشياء غريبة: يمكنك أن تطلب منه التفاعل مع "ملعقة"، أو "كوب"، أو "قبعة قش" (أشياء لم يرها من قبل) بمجرد توليد فيديو لها.
  • واقعي فيزيائيًا: على عكس أنواع الذكاء الاصطناعي الأخرى التي تجعل الفيديوهات تبدو رائعة فحسب، يضمن DeVI أن يلتزم الروبوت فعليًا بقوانين الفيزياء (الجاذبية، الاحتكاك، التصادم).

الملخص

DeVI يشبه روبوتًا يتعلم من خلال مشاهدة فيلم.
بدلاً من الحاجة إلى مخطط ثلاثي الأبعاد مثالي لكل حركة، فإنه يشاهد فيلمًا ثنائي الأبعاد مولدًا بالذكاء الاصطعي، ويكتشف كيف تتحرك جسم الإنسان في الفضاء ثلاثي الأبعاد، ويراقب فقط "ظل" الشيء على الشاشة ليعرف أين يضع يديه. ثم يتدرب في صالة ألعاب رياضية افتراضية حتى يتمكن من أداء الخدعة في العالم الحقيقي، وكل ذلك دون الحاجة أبدًا إلى إنسان يرتدي بدلة التقاط حركة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →