← أحدث الأبحاث
💻 computer science

HAMMER: Harnessing MLLM via Cross-Modal Integration for Intention-Driven 3D Affordance Grounding

يُعد HAMMER إطار عمل مبتكر يستفيد من النماذج اللغوية الكبيرة متعددة الوسائط لتحقيق تجذير الإمكانيات ثلاثية الأبعاد القائم على النوايا، وذلك عبر تجميع نوايا التفاعل في تضمينات مدركة للاتصال وتوظيف التكامل عبر الوسائط الهرمي مع رفع هندسي متعدد الحبيبات لتحديد المواقع ثلاثية الأبعاد بدقة.

المؤلفون الأصليون: Lei Yao, Yong Chen, Yuejiao Su, Yi Wang, Moyun Liu, Lap-Pui Chau

نُشر 2026-03-04
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Lei Yao, Yong Chen, Yuejiao Su, Yi Wang, Moyun Liu, Lap-Pui Chau

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا كيفية استخدام جسم جديد لم يره من قبل، مثل محمصة خبز غريبة الشكل أو كرسي مستقبلي. أنت لا تريد فقط من الروبوت أن "يرى" الجسم فحسب؛ بل تريده أن يفهم "كيفية التفاعل معه". أين يجب أن يمسك بالمقبض؟ أين يجب أن يضغط على الزر؟ هذه القدرة على فهم "كيفية استخدام جسم ما" تسمى الإمكانية الوظيفية (Affordance).

تقدم هذه الورقة البحثية نظام ذكاء اصطراعي جديد يسمى HAMMER، وهو بارع حقًا في هذه المهمة. إليك كيف يعمل، مشروحًا عبر تشبيهات بسيطة.

المشكلة: الروبوت "الأعمى"

واجهت الروبوتات السابقة التي تحاول القيام بهذا الأمر مشكلتين رئيسيتين:

  1. كانت حرفية للغاية: كانت تحاول وصف الجسم بالكلمات أولاً (مثل "هذا كوب أحمر بمقبض") ثم تخمن مكان الإمساك به. هذا يشبه قراءة دليل التعليمات قبل محاولة فتح برطمان؛ الأمر بطيء وغالبًا ما يفتقد للجوهر.
  2. كانت ذات تفكير ثنائي الأبعاد: كانت تنظر إلى صورة ثنائية الأبعاد لجسم ما، وترسم قناعًا (Mask) على الشاشة، ثم تحاول "إسقاط" ذلك الرسم المسطح على جسم ثلاثي الأبعاد. هذا يشبه محاولة لف قطعة ورق مسطحة حول كرة سلة؛ ستتجعد الورقة، وتتمزق، ولن تتناسب مع الشكل.

الحل: HAMMER (الروبوت "الحدسي")

بنى المؤلفون HAMMER ليحاكي طريقة تعلم البشر. عندما ترى صورة لشخص يمسك بمطرقة، فأنت لا تحتاج إلى دليل لتعرف أين تمسك بها. أنت "تفهمها" ببساالة. يقوم HAMMER بنفس الشيء باستخدام نموذج لغوي كبير متعدد الوسائط (MLLM) — فكر في هذا كدماغ فائق الذكاء قرأ الإنترنت بأكمله ورأى ملايين الصور.

إليك الخطوات الثلاث "السحرية" التي يستخدمها HAMMER:

1. الحدس "المدرك للتلامس" (الشرارة)

بدلاً من كتابة وصف طويل، ينظر HAMMRE إلى الصورة ويسأل: "لو كان إنسان يفعل هذا، فأين ستلمس يده؟"

  • التشبيه: تخيل أنك تنظر إلى صورة لشخص يفتح بابًا. لا يقول HAMMER "الشخص يمسك بمقبض نحاسي"، بل يقوم فورًا بإنشاء "توهج" ذهني أو تمييز (Highlight) على النقطة الدقيقة التي تلمسها اليد للمقبض. إنه يلتقط النية من الفعل في إشارة واحدة قوية.

2. "المصافحة عبر الوسائط" (الدمج)

يأخذ HAMMER تلك "اللمعة" (النية) ويجعلها تصافح الشكل ثلاثي الأبعاد للجسم.

  • التشبيه: تخيل أن الجسم ثلاثي الأبعاد هو منحوتة من الطين. يأخذ HAMMER "إشارة النية" من الصورة ويصبها داخل الطين. الأمر يشبه الطلاء الذكي الذي يعرف بالضبط أي أجزاء المنحوتة "قابلة للمس" بناءً على الصورة. هو لا يخمن فحسب؛ بل يستخدم معرفة الدماغ الفائق لتدقيق الشكل، مما يضمن أن الروبوت يفهم أن المقبض مخصص للإمساك، بينما الجسم ليس كذلك.

3. "الرافعة الهندسية" (الترقية إلى ثلاثية الأبعاد)

هذا هو الجزء الأكثر ذكاءً. تأتي "إشارة النية" من صورة ثنائية الأبعاد مسطحة، لذا فهي تفتقر إلى العمق. يمتلك HAMMER وحدة خاصة تعمل مثل الطابعة ثلاثية الأبعاد.

  • التشبيه: تخيل أن لديك ظل شخص على الحائط (النية ثنائية الأبعاد). أنت تعرف أن الظل لشخص ما، لكنك لا تعرف ما إذا كان طويلاً أم قصيرًا. ينظر HAMMER إلى الجسم ثلاثي الأبعاد الفعلي (المنحوتة الطينية) ويقول: "حسنًا، الظل يقول 'اليد هنا'، والشكل ثلاثي الأبعاد يقول 'هذا مقبض'. دعونا نجمع بينهما". إنه يرفع الفكرة المسطحة إلى الفضاء ثلاثي الأبعاد، مضيفًا العمق والبنية بحيث يعرف الروبوت بالضبط إلى أي مدى يمد يده وبأي زاوية.

لماذا HAMMER أفضل؟

اختبرت الورقة البحثية HAMMER مقابل طرق أخرى باستخدام اختبار مرجعي "مُفسد". وهذا يعني أنهم أخذوا الأجسام ثلاثية الأبعاد وأضافوا إليها "ضجيجًا" — مثل التشويش في التلفاز، أو قطع مفقودة، أو اهتزاز الكاميرا.

  • النتيجة: عندما كانت البيانات غير منظمة، ارتبكت الروبوتات الأخرى وأشارت إلى أماكن خاطئة. ومع ذلك، كان HAMMER مثل محقق متمرس. حتى مع وجود صورة ضبابية أو نموذج ثلاثي الأبعاد مكسور، استطاع أن يستنتج: "آه، رغم الضجيج، فإن النية واضحة وهي الإمساك بالمقبض".

الملخص

HAMMER هو دماغ روبوت يمكنه:

  1. يرى صورة ويفهم فورًا النية (أين يلمس).
  2. يدمج تلك النية مع الشكل ثلاثي الأبعاد للجسم باستخدام ذكاء اصطناعي فائق.
  3. يرفع الفكرة المسطحة إلى الفضاء ثلاثي الأبعاد ليعرف الروبوت بالضبط أين يمد يده.

إنه يشبه منح الروبوت "الحس السليم" لينظر إلى صورة لإنسان يستخدم جسمًا ما، ويعرف فورًا كيفية التقاطه، حتى لو كان الجسم غريبًا، أو مكسورًا، أو كانت الصورة ضبابية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →