← أحدث الأبحاث
🤖 AI

SoPE: Spherical Coordinate-Based Positional Embedding for Enhancing Spatial Perception of 3D LVLMs

تقدم هذه الورقة البحثية SoPE، وهو تضمين موضعي جديد يعتمد على الإحداثيات الكروية يستبدل تضمين الموضع الدوراني (Rotary Position Embedding) غير الأمثل في النماذج اللغوية الرؤية الضخمة ثلاثية الأبعاد للحفاظ بشكل أفضل على الهياكل الهندسية ثلاثية الأبعاد والاعتمادات الاتجاهية، مما يعزز بشكل كبير الإدراك المكاني والقدرة على التعميم عبر مختلف المعايير المرجعية.

المؤلفون الأصليون: Guanting Ye, Qiyan Zhao, Wenhao Yu, Liangyu Yuan, Mingkai Li, Xiaofeng Zhang, Jianmin Ji, Yanyong Zhang, Qing Jiang, Ka-Veng Yuen

نُشر 2026-02-27
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Guanting Ye, Qiyan Zhao, Wenhao Yu, Liangyu Yuan, Mingkai Li, Xiaofeng Zhang, Jianmin Ji, Yanyong Zhang, Qing Jiang, Ka-Veng Yuen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت فائق الذكاء (نموذج لغوي بصري ضخم أو "LVLM") كيف يفهم غرفة معيشة فوضوية. الروبوت لديه عقل (نموذج لغوي ضخم) بارع في القراءة والتحدث، لكنه سيئ في فهم المساحات.

لمساعدة الروبوت على رؤية الغرفة، نعطيه مسحاً ثلاثي الأبعاد للأثاث (سحابة نقاط). ومع ذلك، فإن الطريقة التي نصف بها الأشياء للروبوت حالياً تشبه محاولة وصف غرفة ثلاثية الأبعاد باستخدام قائمة مسطحة من الأرقام أحادية البعد.

المشكلة: ارتباك "القائمة المسطحة"

حالياً، ينظر الروبوت إلى المسح ثلاثي الأبعاد ويقوم بتسطيحه إلى سلسلة طويلة من الرموز (tokens)، مثل الخرز في خيط. وهو يستخدم قاعدة قياسية تسمى RoPE (تضمين الموضع الدوراني) ليتذكر مكان كل خرزة.

فكر في RoPE كأنه حزام ناقل في مصنع.

  • المشكلة: في الحزام الناقل، الشيء الوحيد الذي يهم هو "كم تبعد المسافة على طول الحزام".
  • النتي نتيجة لذلك: إذا وضعنا مصباحاً وكرسياً بجانب بعضهما البعض تماماً في الغرفة، ولكنهما بالصدفة بعيدان عن بعضهما في قائمة الحزام الناقل، فسيعتقد الروبوت أنهما غير مرتبطين تماماً. وبالعكس، إذا كان هناك شيئان بعيدان عن بعضهما في الغرفة، ولكنهما قريبان من بعضهما في القائمة، فسيعتقد الروبوت أنهما جيران.
  • العاقبة: يصاب الروبوت بـ "ارتباك مكاني". قد يركز كل انتباهه على زاوية صغيرة واحدة في الغرفة (بقعة ساخنة) ويتجاهل بقية الغرفة، أو قد يعتقد أن الباب هو في الواقع حائط لأنه فقد تتبع الزوايا ثلاثية الأبعاد.

الحل: SoPE (نهج "الكرة الأرضية")

يقول مؤلفو هذه الورقة البحثية، SoPE: *"توقفوا عن استخدام الحزام الناقل المسطح! دعونا نستخدم *كرة أرضية".

هم يقترحون طريقة جديدة لتوسيم النقاط ثلاثية الأبعاد تسمى تضمين الموضع القائم على الإحداثيات الكروية (SoPE).

إليك التشبيه:
بدلاً من إعطاء الروبوت قائمة مسطحة من الأرقار، هم يعطون كل جسم في الغرفة إحداثيات GPS على كرة.

  1. المسافة (نصف القطر): ما مدى بعد الجسم عن مركز الغرفة؟
  2. الأعلى/الأسفل (الزاوية القطبية): هل الجسم عند السقف، أم الأرض، أم في المنتصف؟
  3. اليمين/اليسار (الزاوية السمتية): هل الجسم جهة الشمال، أم الجنوب، أم الشرق، أم الغرب؟

باستخدام نظام "الكرة الأرضية" هذا، يفهم الروبوت أخيراً أن المصباح الموجود على الطاولة هو قريب فيزيائياً من الطاولة، حتى لو كانا بعيدين في قائمة البيانات. كما يدرك أيضاً أن باباً يواجه الشمال يختلف عن باب يواجه الجنوب.

السر الخفي: "ضبط الراديو" (الخلط متعدد المقاييس)

مجرد إعطاء الروبوت إحداثيات GPS ليس كافياً. فالغرفة تحتوي على أشياء كبيرة (الجدران) وأشياء صغيرة (مفاتيح على الطاولة).

أضاف المؤلفون استراتيجية الخلط الترددي متعدد المقاييس. تخيل أن الروبوت لديه راديو بأجهزة ضبط (tuners) متعددة:

  • جهاز ضبط التردد المنخفض: يستمع إلى "الصورة الكبيرة" (تخطيط الغرفة، الجدران، التدفق العام).
  • جهاز ضبط التردد العالي: يستمع إلى "التفاصيل الدقيقة" (الحواف الحادة لكتاب، الزاوية المحددة لكوب).

يقوم SoPE بخلط هذه الإشارات معاً. وهذا يسمح للروبوت برؤية الغرفة بأكملها و التفاصيل الصغيرة في آن واحد، دون أن يشعر بالارتباك.

لماذا يهم هذا؟ (الاختبار في العالم الحقيقي)

لم يتوقف الباحثون عند مجرد النظرية. لقد وضعوا "عقل SoPE" الجديد في روبوت حقيقي واختبروه في منزل حقيقي.

  • قبل SoPE: قد يحاول الروبوت الاصطدام بحائط أو يفشل في التقاط جسم صغير لأنه لم يستطع "رؤية" العلاقة المكانية بشكل صحيح.
  • بعد SoPE: نجح الروبوت في التنقل في الغرفة، والعثور على أشياء محددة (مثل كتاب على رف)، وتحريكها من مكانها. لقد فهم شكل الغرفة واتجاه الأشياء.

الملخص

SoPE يشبه ترقية عقل الروبوت من خريطة ثنائية الأبعاد (التي تسطح كل شيء وتفقد العمق) إلى هولوغرام ثلاثي الأبعاد (الذي يفهم المسافة، والارتفاع، والاتجاه). وهذا يسمح للذكاء الاصطناعي أخيراً بأن "يرى" العالم كما يفعل البشر: في ثلاثة أبعاد، مع إدراك واضح لمكان وجود كل شيء وكيفية توجيهه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →