← أحدث الأبحاث
💻 computer science

WHOLE: World-Grounded Hand-Object Lifted from Egocentric Videos

تُعد WHOLE طريقة مبتكرة تعيد بناء حركة اليد والجسم بشكل شمولي في فضاء العالم من فيديوهات المنظور الشخصي الصعبة، وذلك عبر الاستفضاء من نموذج توليدي مُتعلم للاستدلال المشترك حول تفاعلاتهما، مما يحقق أداءً رائدًا في التعامل مع حالات الحجب وضمان اتساق العلاقات بين اليد والجسم.

المؤلفون الأصليون: Yufei Ye, Jiaman Li, Ryan Rong, C. Karen Liu

نُشر 2026-02-26
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yufei Ye, Jiaman Li, Ryan Rong, C. Karen Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح للورقة البحثية بأكملها، مترجماً إلى لغة يومية مع بعض التشبيهات الإبداعية.

المشكلة الكبرى: "الساحر معصوب العينين"

تخيل أنك ترتدي كاميرا "GoPro" على رأسك. تتجول في مطبخك، تمسك كوب قهوة، تضعه، ثم تلتقط موزة، وتخرج من الباب.

بالنسبة للكمبيوتر الذي يحاول فهم هذا الفيديو، الأمر بمثابة كابوس:

  1. الكاميرا تتحرك: العالم يدور لأن رأسك يتحرك، وليس فقط الأجياء.
  2. "النقاط العمياء": غالباً ما تحجب يداك الرؤية عن الأشياء. أحياناً يختفي الشيء خلف ظهرك أو يغادر الغرفة تماماً.
  3. الانفصال: تحاول معظم برامج الذكاء الاصطناعي الحالية تخمين مكان يديك أو مكان الشيء، لكنها تفعل ذلك بشكل منفصل. الأمر يشبه محاولة حل لغز عبر النظر إلى قطع الحواف وقطع المنتصف في غرفتين مختلفتين ثم الأمل في أن يتطابقا. غالباً ما يعتقد الذكاء الاصطناعي أن يدك تطفو في الهواء أو أن كوب القهوة يمر عبر يدك مثل الشبح.

الحل: WHOLE (المُنسق الموهوب بالفطرة)

يقدم المؤلفون نظام WHOLE (رفع اليد والشيء من فيديوهات منظور الشخص الأول - World-Grounded Hand-Object Lifted from Egocentric Videos). فكر في WHOLE ليس كآلة حاسبة، بل كـ مُنسق رقص موهوب بالفطرة شاهد ملايين الفيديوهات لأشخاص يتفاعلون مع الأشياء.

بدلاً من حساب كل حركة رياضياً من الصفر، يستخدم WHOLE ما يسمى بـ "الأساس التوليدي" (Generative Prior).

  • التشبيه: تخيل أنك تحاول تخمين نهاية مشهد سينمائي حيث يلتقط شخص ما كوباً. حتى لو كانت الكاميرا مهتزة أو اختفى الكوب لثانية، فأنت (كإنسان) تعرف أن الكوب يجب أن يكون في اليد، وليس طافياً على بعد ثلاثة أقدام. لديك "سيناريو فيلم" داخلي حول كيفية عمل الفيزياء والأيدي البشرية.
  • قوة WHOLE الخارقة: تعلم WHOLE هذا "السيناريو السينمائي" (الأساس التوليدي) خصيصاً للأيدي والأشياء. هو يعرف أنه إذا كانت اليد قريبة من صندوق، فإن الصندوق عادة ما يتحرك مع اليد. وإذا تركت اليد الشيء، فإن الصندوق يتوقف أو يسقط. إنه يفهم العلاقة بين الاثنين، وليس فقط مواقعهما الفردية.

كيف يعمل: "الارتجال الموجه"

لا يقوم WHOLE بالتخمين فحسب؛ بل يؤدي جلسة "ارتجال موجه".

  1. المسودة الأولية: يبدأ بتخمين أساسي غير دقيق لمكان الأيدي والأشياء (مثل رسم تخطيطي أولي).
  2. "ملاحظات المخرج" (التوجيه): ينظر إلى الفيديو الفعلي الذي قدمته له.
    • الإشارات البصرية: "مهلاً، الفيديو يظهر أن اليد تغطي الصندوق الآن."
    • إشارات التلامس: يستخدم مساعد ذكاء اصطناعي ذكي (نموذج رؤية ولغة) للنظر في الفيديو وقول: "أعتقد أن الأصابع تلمس المقبض."
  3. التحسين: يأخذ WHOLE مسودته الأولية ويقوم بتعديلها لتتطابق مع ملاحظات المخرج، مع الالتزام الصارم بقوانين الفيزياء التي تعلمها سابقاً. إنه يضمن عدم اختراق اليد للطاولة وعدم انتقال الشيء من مكان لآخر فجأة.

لماذا يعد هذا تغييراً لقواعد اللعبة

كانت الطرق السابقة تشبه ممثلين منفصلين يحاولان حفظ نصوصهما دون التحدث مع بعضهما البعض.

  • الطريقة القديمة: الممثل (أ) -اليد- يقول: "أنا هنا!" والممثل (ب) -الشيء- يقول: "أنا هناك!" لا يدركان أنهما يمسكان ببعضهما، لذا يبدو الفيديو غريباً ومتقطعاً.
  • WHOLE: المخرج (WHOLE) يخبرهما: "أنتما تمسكان بالصندوق. تحركا معاً." النتيجة هي فيلم ثلاثي الأبعاد سلس وواقعي حيث تتحرك اليد والشيء كوحدة واحدة منطقية.

"خدعة السحر" للمستقبل

تظهر الورقة أيضاً تطبيقاً رائعاً: التخطيط الموجه باليد (Hand-Guided Planning).
لأن WHOLE يفهم "قواعد" كيفية تفاعل الأيدي والأشياء، يمكنك إعطاؤه فكرة تقريبية عن حركة اليد (مثلاً: "مد يدك نحو الرف") وتعليمة تلامس ("التقط العلبة")، ويمكنه ابتكار رسوم متحركة ثلاثية الأبعاد واقعية للعملية بأكملها.

هذا أمر ضخم للروبوتات. بدلاً من برمجة الروبوت بآلاف القواعد الجامدة، يمكننا إعطاؤه "إحساساً عاماً" (مسار يد تقريبي)، ويمكن لـ WHOLE ملء التفاصيل الواقعية لكيفية إمساك الروبوت للشيء وتحريكه.

الملخص

WHOLE هو ذكاء اصطناعي يتوقف عن النظر إلى الأيدي والأشياء كأشياء منفصلة. بدلاً من ذلك، يعاملها كفريق واحد. من خلال تعلم "رقصة" التفاعل البشري، يمكنه إعادة بناء فيديوهات ثلاثية الأبعاد من لقطات كاميرا منظور الشخص الأول المهتزة بدقة مذهلة، وملء الفراغات عندما تختفي الأشياء عن الأنظار أو تُحجب عن الرؤية. إنه يحول فيديو فوضوياً وضبابياً إلى قصة ثلاثية الأبعاد واضحة وممكنة فيزيائياً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →