← أحدث الأبحاث
💻 computer science

PAWS: Perception of Articulation in the Wild at Scale from Egocentric Videos

تُعد PAWS طريقة مبتكرة تعالج قيود القابلية للتوسع في تقنيات إدراك التمفصل الحالية من خلال الاستخراج المباشر لحركة الأجسام وبنيتها من فيديوهات المنظور الشخصي واسعة النطاق والواقعية عبر تفاعلات اليد مع الأشياء، مما يُظهر تحسينات ملحوظة في مجموعات البيانات العامة وفوائد لمهام الروبوتات والتنبؤ ثلاثي الأبعاد اللاحقة.

المؤلفون الأصليون: Yihao Wang, Yang Miao, Wenshuai Zhao, Wenyan Yang, Zihan Wang, Joni Pajarinen, Luc Van Gool, Danda Pani Paudel, Juho Kannala, Xi Wang, Arno Solin

نُشر 2026-03-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yihao Wang, Yang Miao, Wenshuai Zhao, Wenyan Yang, Zihan Wang, Joni Pajarinen, Luc Van Gool, Danda Pani Paudel, Juho Kannala, Xi Wang, Arno Solin

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك ترتدي كاميرا ذكية على رأسك، تسجل يومك وأنت تمارس حياتك المعتادة. تفتح الثلاجة، تسحب درجاً، وتغلق باب خزانة. بالنسبة للإنسان، هذه الأفعال واضحة: "هذا باب يتأرجح"، أو "هذا درج ينزلق".

لكن بالنسبة للكمبيوتر، فإن الفيديو ليس سوى تدفق فوضوي من البكسلات. هو لا يعرف أن الشيء الذي تلمسه هو "خزانة" أو أنه يتحرك على "مفصلة". هو فقط يرى شكلاً ضبابياً يتحرك.

نظام PAWS (إدراك الحركة في البيئات الواقعية على نطاق واسع) هو نظام ذكاء اصطناعي جديد مصمم لحل هذه المشكلة. إنه يعلم الحواسيب كيف تشاهد فيديوهاتك "الواقعية" (غير المخطط لها، الفوضوية، والحقيقية) وتكتشف بالضبط كيف تتحرك قطع الأثاث في منزلك، دون الحاجة إلى مختبر أو فريق من البشر لتسمية كل إطار فيديو.

إليك كيف يعمل، باستخدام بعض التشبيهات من الحياة اليومية:

1. المشكلة: الروبوت "الأعمى"

حالياً، إذا أردت من روبوت أن يفتح ثلاجتك، فعليك عادةً تزويده بخريطة ثلاثية الأبعاد مثالية للثلاجة وإخباره بمكان المقبض بدقة. هذا يشبه إعطاء الروبوت مخططاً للمنزل قبل بنائه. إنه أمر مكلف، بطيء، ولا يعمل بشكل جيد في العالم الحقيقي حيث تكون الأشياء فوضوية، مظلمة، أو مخفية جزئياً.

تحاول طرق الذكاء الاصطناعي الحالية تخمين كيفية تحرك الأشياء من خلال النظر إلى صور ثابتة، لكنها غالباً ما تخطئ لأنها تفتقر إلى السياق. إنهم مثل شخص يحاول تخمين كيف يفتح الباب من خلال النظر إلى صورة واحدة لباب مغلق؛ قد يخمن أنه ينزلق، بينما هو في الواقع يتأرجح.

2. الحل: PAWS (شيرلوك هولمز الحركة)

يتبع PAWS نهجاً مختلفاً. بدلاً من النظر إلى الصور الثابتة، فإنه يشاهد تفاعلك مع الشيء. وهو يستخدم دليلين رئيسيين:

  • اليد كـ "محقق": عندما تفتح درجاً، تتحرك يدك في خط مستقيم. وعندما تفتح باباً، تتحرك يدك في دائرة. يتتبع PAWS يدك مثل محقق يتبع أثر فتات الخبز. إنه يتجاهل الخلفية الفوضوية ويركز تماماً على كيفية تحرك أصابعك بالنسبة للشيء.
  • "العقل" (نموذج الرؤية واللغة - VLM): يستخدم PAWS "نموذج رؤية ولغة" (وهو ذكاء اصطناعي فائق الذكاء يفهم الصور والنصوص معاً). فكر في هذا كأمين مكتبة واسع المعرفة. إذا أظهر الفيديو يداً تسحب مقبضاً والنص يقول "افتح الخزانة"، سيقول أمين المكتبة: "آه! الخزانات عادة تتأرجح على مفصلات، ولا تنزلق!". هذا يساعد الذكاء الاصطناعي على اتخاذ التخمين الصحيح حتى لو كان الفيديو ضبابياً.

3. كيف يعمل: الرقصة ذات الخطوات الثلاث

الخطوة 1: "رقصة اليد" (التفاعل الديناميكي)
يبحث PAWS في الفيديو عن الأجزاء التي تلمس فيها شيئاً ما. ثم يعيد بناء يدك في فضاء ثلاثي الأبعاد.

  • التشبيه: تخيل أن يدك هي راقصة. إذا تحركت الراقصة في خط مستقيم، يعرف PAWS أن الشيء عبارة عن درج منزلق. أما إذا تحركت الراقصة في منحنى، فيعرف PAWS أنه باب يتأرجح.

الخطوة 2: "مسح الغرفة" (الهندسة الثابتة)
بينما ترقص يدك، يقوم PAS أيضاً بمسح الغرفة من حولك لبناء خريطة ثلاثية الأبعاد للأثاث. يبحث عن الخطوط المستقيمة والزوايا (مثل حواف الخزانة).

  • التشبيه: هذا يشبه نجاراً ينظر إلى عروق الخشب وزوايا الطاولة ليفهم كيف صُنعت. هذا يساعد PAWS على معرفة: "حسناً، هذا الجسم محاذٍ للجدار، لذا فمن المحتمل أنه ينزلق على طول ذلك الجدار".

الخطوة 3: "الاستشارة" (استنتاج نموذج الرؤية واللغة)
أحياناً، تكون حركة اليد مربكة (ربما انزلقت يدك، أو الفيديو مظلم). هنا يأتي دور "أمين المكتبة" (VLM).

  • التشبيه: يسأل PAWS الذكاء الاصطناعي: "أرى يداً بالقرب من صندوق أبيض. اليد تحركت في دائرة. هل هذا ميكروويف أم خزانة؟". يجيب الذكاء الاصطناعي: "الميكروويف عادة له أبواب تتأرجح، لكنه صغير. هذا يبدو كخزانة كبيرة. لنفترض أنه باب يتأرجح".

4. لماذا يهم هذا: من "المشاهدة" إلى "الفعل"

الجزء الأكثر روعة هو ما يحدث بعد أن يفهم PAWS الأمر.

  • تعليم الروبوتات: بمجرد أن يفهم PAWS كيف تعمل خزانة معينة في مطبخ معين، يمكنه تعليم روبوت حقيقي (مثل روبوت Boston Dynamics Spot المذكور في الورقة البحثية) كيفية فتحها. يمكن للروبوت بعد ذلك الذهاب إلى منزل جديد وفتح الأبواب دون الحاجة إلى دليل تعليمات.
  • محاكاة أفضل: يساعد مطوري ألعاب الفيديو ومحركي الأفلام على إنشاء عوالم ثلاثية الأبعاد واقعية حيث تتحرك الأشياء تماماً كما تفعل في الحياة الواقعية.

الصورة الكبيرة

قبل PAWS، كان تعليم الكمبيوتر كيفية تحرك العالم يتطلب ماسحات ضوئية ثلاثية الأبعاد باهظة الثمن وإضاءة مثالية. PAWS يشبه منح الكمبيوتر عينين وعقلاً يمكنه التعلم من مليارات الساعات من فيديوهات الناس الحقيقية في منازلهم.

إنه يحول فوضى الفيديوهات "الواقعية" (حيث يكون الناس فوضويين، والإضاءة سيئة، والكاميرات تهتز) إلى فهم رياضي نظيف لكيفية تركيب عالمنا. إنه الفرق بين روبوت يحتاج إلى دليل لكل باب يواجهه، وروبوت يشاهدك تفتح باباً مرة واحدة ثم يعرف كيف يفعل ذلك للأبد.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →