← أحدث الأبحاث
🤖 machine learning

ViTaPEs: Visuotactile Position Encodings for Cross-Modal Alignment in Multimodal Transformers

تقدم الورقة البحثية ViTaPEs، وهي بنية قائمة على المحولات (transformer) تستخدم استراتيجية ترميز موضعي مبتكرة ثنائية المرحلة لدمج الوسائط البصرية واللمسية بفعالية، محققةً أداءً هو الأفضل في فئتها وقدرة على التعميم الصفري عبر مهام التعرف والإمساك الروبوتي المتنوعة دون الاعتماد على نماذج الرؤية واللغة سابقة التدريب.

المؤلفون الأصليون: Fotios Lygerakis, Ozan Özdenizci, Elmar Rückert

نُشر 2026-03-10
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Fotios Lygerakis, Ozan Özdenizci, Elmar Rückert

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول التعرف على جسم غامض في غرفة مظلمة. لديك قوتان خارقتان: البصر (الذي يمنحك رؤية شاملة وشاملة لشكل الجسم ولونه) واللمس (الذي يمنحك تفاصيل محلية دقيقة مثل الملمس، والصلابة، ودرجة الحرارة).

لفترة طويلة، حاول علماء الكمبيوتر تعليم الروبوتات كيفية استخدام هاتين القوتين معاً. لكنهم واجهوا مشكلة كبيرة: كيف تعلم الروبوت أن بقعة معينة من "الوبر" على الشاشة تتطابق مع ملمس "الوبر" على إصبعه؟

يقدم البحث نموذج ذكاء اصطناعي جديد يسمى ViTaPEs (ترميزات الموضع البصرية اللمسية). فكر في ViTaPEs كأنه مترجم ذكي للغاية لا يترجم الكلمات فحسب، بل يفهم أيضاً أين تحدث الأشياء في الفضاء.

إليك شرح بسيط لكيفية عمله، باستخدام بعض التشبيهات الممتعة:

1. المشكلة: قضية "الضياع في الترجمة"

تخيل أن لديك شخصين يحاولان حل لغز.

  • الشخص (أ) (الرؤية): يرى صورة قطة.
  • الشخص (ب) (اللمس): يشعر بفراء القطة.

إذا ألقيت بملاحظاتهما في كومة واحدة، فقد يصابان بالارتباك. الشخص (أ) يقول: "إنها ناعمة"، والشخص (ب) يقول: "إنها طرية". لكنهما لا يعرفان أين يتحدثان عن القطة بالضبط. هل الوبر موجود على الذيل أم على الأذن؟

حاولت نماذج الذكاء الاصطناعي السابقة إجبار هذين الاثنين على التحدث، لكنها غالباً ما كانت تخطئ في "الخريطة المكانية". لقد كانوا مثل شخصين يحاولان الالتقاء في مدينة دون الاتفاق على خريطة أو عنوان شارع.

2. الحل: "نظام GPS ذو مرحلتين" (ViTaPEs)

يعالج ViTaPEs هذه المشكلة من خلال تزويد الذكاء الاصطعي بـ نظام GPS مكون من خطوتين.

الخطوة 1: "الخريطة المحلية" (الترميزات الخاصة بكل وسيلة)

أولاً، يمنح ViTaPEs كل حاسة خريطتها الخاصة.

  • بالنسبة للرؤية: يضيف "GPS محلي" يقول: "هذه البكسل تقع في الزاوية العلوية اليسرى من الصورة".
  • بالنسبة للمس: يضيف "GPS محلي" يقول: "هذا النتوء في المستشعر يقع في الجزء السفلي الأيمن من الإصبع".

تشبيه: تخيل إعطاء الشخص (أ) خريطة للمدينة، والشخص (ب) خريطة ليده الخاصة. كلاهما يعرف تماماً أين هو داخل عالمه الخاص. هذا يمنعهما من الارتباك بشأن تخطيطهما الداخلي.

الخطوة 2: "نقطة الالتقاء العالمية" (الترميز الموضعي العالمي)

بعد ذلك، وقبل أن يبدأ الشخصان في التحدث معاً، يضعهما ViTaPEs في غرفة مشتركة مع خريطة حائط ضخمة ومشتركة.

  • يأخذ ملاحظات الرؤية واللمس ويصطف بها جنباً إلى جنب.
  • يضيف GPS مشتركاً يقول: "حسناً، (أعلى يسار) الرؤية و(أسفل يمين) اللمس يقفان الآن بجانب بعضهما البعض في هذه الغرفة المشتركة".

تشبيه: هذا يشبه مترجماً يقول: "حسناً، أنت يا شخص (أ) تقف عند القطب الشمالي للغرفة. وأنت يا شخص (ب)، تقف عند القطب الجنوبي. الآن، عندما تتحدثان، ستعرفان تماماً أين يقع كل منكما بالنسبة للآخر".

هذه "الغرفة المشتركة" حاسمة لأنها تسمح للذكاء الاصطناعي بتعلم أن نسيجاً بصرياً معيناً (مثل جدار من الطوب) يتوافق مع شعور لمسي معين (مثل الخشونة) دون الحاجة لأن يُقال له بالضبط كيف تم محاذاة الكاميرا وإصبع الروبوت فيزيائياً.

3. لماذا يعد هذا أمراً هاماً؟

يظهر البحث أن ViTaPEs هو متلون (حرباء).

  • يتعلم بسرعة: يمكن تدريبه على مجموعة من الأشياء (مثل مجموعة بيانات للألعاب) ثم يمكنه فوراً التعرف على أشياء مختلفة تماماً (مثل الأدوات المنزلية الحقيقية) دون الحاجة لإعادة تعلم كل شيء. وهذا ما يسمى التعميم الصفري (Zero-Shot Generalization).
    • تشبيه: تخيل أنك تتعلم قيادة سيارة في موقف للسيارات، ثم تصبح فجأة قادراً على قيادة شاحنة على طريق سريع دون الحاجة لاختبار قيادة جديد.
  • إنه قوي (متين): إذا أصبحت كاميرا الروبوت ضبابية أو اتسخ مستشعر إصبعه، فلا يزال بإمكان ViTaPEs تخمين ما يحدث لأنه يفهم العلاقة بين الحاستين جيداً.
    • تشبيه: إذا فقدت نظاراتك، لا يزال بإمكانك التعرف على صديقك من خلال صوته وطريقة مشيته. ViTaPEs يفعل الشيء نفسه للروبوتات.
  • يساعد الروبوتات على الإمساك بالأشياء: في الاختبارات، كان ViTaPEs أفضل في التنبؤ بما إذا كان الروبوت سينجح في الإمساك بجسم ما مقارنة بنماذج الذكاء الاصطنا_ي الرائدة الأخرى.

الخلاصة

قبل ViTaPEs، كانت الروبوتات التي تحاول "الرؤية واللمس" تشبه شخصين يحاولان الرقص دون إيقاع أو فهم مشترك لأرضية الرقص. غالباً ما كانا يدوسان على أقدام بعضهما البعض.

ViTaPEs هو مدرب الرقص الذي يمنحهما:

  1. إيقاعاً شخصياً (الخرائط المحلية).
  2. أرضية رقص مشتركة ذات علامات واضحة (الخريطة العالمية).

النتيجة؟ يمكن للروبوت أخيراً أن يرقص ببراعة، مدركاً تماماً كيف يتطابق ما يراه مع ما يشعر به، مما يؤدي إلى روبوتات أكثر ذكاءً، وقدرة على التكيف، وأكثر شبهاً بالبشر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →