← أحدث الأبحاث
🤖 AI

C^2ROPE: Causal Continuous Rotary Positional Encoding for 3D Large Multimodal-Models Reasoning

تقترح هذه الورقة البحثية C2ROPEC^2ROPE، وهي طريقة جديدة للترميز الموضعي تدمج الإحداثيات المكانية الديكارتية مع المؤشرات الزمنية وتستخدم قناع تشيبيشيف السببي للتغلب على فقدان الموضعية المكانية ومحدودية التلاشي طويل الأمد لترميز الموضع الدوراني القياسي في النماذج اللغوية الكبيرة متعددة الوسائط ثلاثية الأبعاد.

المؤلفون الأصليون: Guanting Ye, Qiyan Zhao, Wenhao Yu, Xiaofeng Zhang, Jianmin Ji, Yanyong Zhang, Ka-Veng Yuen

نُشر 2026-02-17
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Guanting Ye, Qiyan Zhao, Wenhao Yu, Xiaofeng Zhang, Jianmin Ji, Yanyong Zhang, Ka-Veng Yuen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

الصورة الكبيرة: تعليم روبوت كيف "يرى" في الأبعاد الثلاثية

تخيل أنك تحاول تعليم روبوت ذكي جدًا (ذكاء اصطناعي) كيف يتنقل في منزل، أو يجد مفتاحًا مفقودًا، أو يجيب على أسئلة حول غرفة ثلاثية الأبعاد. للقيام بذلك، تمنح الروبوت دماغًا يعتمد على نموذج لغوي كبير (LLM) — وهو ببساء عملية معالجة نصوص فائقة الذكاء تعرف كيف تكتب القصص وتدردش.

المشكلة؟ النصوص عبارة عن خط مستقيم. الجمل تتدفق من اليسار إلى اليمين، كلمة تلو الأخرى. لكن الفضاء ثلاثي الأبعاد هو شبكة. الغرفة لها ارتفاع وعرض وعمق.

تجادل الورقة البحثية بأن الطريقة الحالية التي نُجبر بها الصور ثلاثية الأبعاد على الدخول في هذه "الأدمغة النصية" معطلة. يقترح المؤلفون حلاً جديدًا يسمى C2RoPE لجعل الروبوت يفهم الفضاء بشكل أفضل.


المشكلة: خطأ "سير الناقل"

لتغذية ذكاء اصطناعي قائم على النصوص بصورة ثلاثية الأبعاد، يجب على الكمبيوتر تحويل الصورة إلى قائمة طويلة من المربعات الصغيرة (الرموز/tokens)، مثل تحويل صورة إلى شريط سينمائي.

الطريقة الحالية (المسماة RoPE) تعامل هذا الشريط كأنه سير ناقل (Conveyor Belt). تقوم بترقيم المربعات 1، 2، 3، 4... صفًا تلو الآخر (من اليسار إلى اليمين، ثم من الأعلى إلى الأسفل).

التشبيه 1: مشكلة "الجار" (فقدان التجاور المكاني)

تخيل أنك جالس في مسرح.

  • في العالم الحقيقي (الفضاء ثلاثي الأبعاد): الشخص الجالس عن يمينك مباشرة هو جارك. والشخص الجالس خلفك مباشرة هو أيضًا جارك.
  • في طريقة الذكاء الاصطناعي الحالية (RoPE): يقوم الذكاء الاصطناعي بترقيم المقاعد مثل السير الناقل.
    • أنت المقعد رقم 10.
    • الشخص الذي عن يمينك هو المقعد رقم 11. (رائع، أنتما جيران).
    • لكن الشخص الذي خلفك؟ لأن السير أنهى الصف وبدأ الصف التالي، فهو المقعد رقم 100.
    • النتيجة: بالنسبة للذكاء الاصطناعي، الشخص الذي خلفك هو غريب من جزء مختلف تمامًا من الفيلم، رغم أنكما تجلسان بجانب بعضكما البعض في الفضاء ثلاثي الأبعاد. يفقد الذكاء الاصطناعي الاتصال "الجيراني" للعمود الرأسي.

التشبيه 2: "البداية المنسية" (إهمال الرموز البصرية)

الذكاء الاصطناعي مُدرب على القصص. في القصة، عادة ما تكون البداية أقل أهمية من النهاية لأن النهاية تحمل الخاتمة أو المفاجأة. يتم تعليم الذكاء الاصطناعي أن يولي أكبر قدر من الاهتمام لآخر الكلمات التي وردت، ويتجاهل الكلمات القديمة.

عندما ينظر الذكاء الاصطناعي إلى غرفة ثلاثية الأبعاد، فإنه يرى آلاف الرموز الصورية.

  • ولأن الذكاء الاصطناعي يعتقد أن "الأحدث = الأكثر أهمية"، فإنه يهتم فقط بآخر بضعة مربعات من شريط الصورة.
  • إنه يتجاهل تمامًا أول 90% من الصورة (بداية الشريط)، رغم أن ذلك الجزء قد يحتوي على الباب الذي تحتاج لفتحه أو الكرسي الذي تحتاج للجلوس عليه.
  • النتيجة: يصاب الروبوت بـ "فقدان ذاكرة" تجاه معظم الغرفة التي ينظر إليها.

الحل: C2RoPE

قام المؤلفان، غوانتينغ يي وفريقه، ببناء نظام جديد يسمى C2RoPE (التشفير الموضعي الدوار المستمر والسببي). اعتبره بمثابة إعطاء الروبوت خريطة أفضل.

الإصلاح رقم 1: "بطاقة الهوية ثلاثية الأبعاد" (الاستمرارية المكانية-الزمانية)

بدلاً من مجرد إعطاء كل مربع صورة رقمًا واحدًا (1، 2، 3...)، يمنح C2RoPE كل مربع بطاقة هوية مكونة من 3 أجزاء:

  1. الزمن: موقعه في القائمة (مثل النظام القديم).
  2. الإحداثي السيني (X): مدى بعده يسارًا أو يمينًا.
  3. الإحداثي الصادي (Y): مدى بعده أعلى أو أسفل.

التشبيه: تخيل بدلاً من السير الناقل، لديك شبكة مدينة.

  • إذا كنت عند "الشارع الأول والشارع الثاني"، فإن الذكاء الاصطناعي يعرف أنك بجوار "الشارع الأول والشارع الثالث" مباشرة.
  • كما يعرف أنك بجوار "الشارع الثاني والشارع الأول" مباشرة.
  • من خلال الاحتفاظ بالإحداثيات X و Y، لا يفقد الذكاء الاصطناعي أبدًا تتبع من هو "الجار" في العالم ثلاثي الأبعاد الحقيقي، حتى لو كانوا بعيدين في القائمة.

الإصلاح رقم 2: قاعدة "مسافة تشيبيشيف" (القناع السببي)

افترض النظام القديم أن "ما يأتي لاحقًا في القائمة هو الأكثر أهمية". النظام الجديد يقول: "ما هو أقرب جسديًا في الغرفة هو الأكثر أهمية."

لقد استخدموا مفهومًا رياضيًا يسمى مسافة تشيبيشيف (تخيلها مثل حركة "الملك" في الشطرنج الذي يتحرك مربعًا واحدًا في أي اتجاه، بما في ذلك القطري).

  • القاعدة: يُطلب من الذكاء الاصطناعي الانتباه لقطع الصورة بناءً على مدى قربها من مركز الصورة، وليس فقط بناءً على مدى تأخرها في القائمة.
  • النتيجة: يتوقف الذكاء الاصطناعي عن تجاهل بداية الصورة. يدرك أن "بداية" الصورة (الجانب الأيسر من الغرفة) هي بنفس القدر من الأهمية السببية مثل "نهاية" الصورة (الجانب الأيمن). يتوقف عن نسيان الباب لمجرد أنه تم مسحه أولاً.

النتيجة: روبوت أكثر ذكاءً

اختبر المؤلفون هذا على اختبارات معيارية شهيرة ثلاثية الأبعاد (مثل ScanQA و SQA3D)، وهي بمثابة امتحانات للروبوتات لمعرفة ما إذا كان بإمكانها الإجابة على أسئلة حول الغرف ثلاثية الأبعاد.

  • قبل C2RoPE: كان الروبوت ينظر إلى الغرفة، ينسى نصفها، ويخمن بشكل خاطئ. (مث. "هل المغسلة على اليسار؟" -> "لا أعرف، ربما على اليمين؟").
  • بعد C2RoPE: يتذكر الروبوت الغرفة بأكملها، ويفهم التخطيط، ويجيب بشكل صحيح.

باختصار:
تعالج هذه الورقة البحثية خللاً حيث كانت روبوتات الذكاء الاصطناعي تعامل الغرف ثلاثية الأبعاد كأنها شرائط ورقية طويلة ومسطحة، مما يؤدي لفقدان تتبع الجيران ونسيان بداية المشهد. يوفر C2RoPE للذكاء الاصطناعي خريطة حقيقية ثلاثية الأبعاد، مما يضمن فهمه أن "الأعلى" بجانب "الأسفل" وأن بداية الغرفة لا تقل أهمية عن نهايتها. وهذا يجعل الروبوت أفضل بكثير في التنقل والاستنتاج في العالم الحقيقي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →