← أحدث الأبحاث
💻 computer science

Multi-View Aggregation Transformer with Contrastive Learning for 3D Shape Retrieval

تقترح هذه الورقة البحثية "محول تجميع الرؤى المتعددة" (MVAT)، وهو إطار عمل متوافق هندسياً يدمج الانتباه متعدد الرؤى الهرمي، ووحدات تعديل القنوات المتخصصة، ومقياس تشابه جيب التمام المطلق لتحقيق أداء رائد في استرجاع الأشكال ثلاثية الأبعاد عبر معايير قياسية متعددة.

المؤلفون الأصليون: Ze Zhang, Xiaojun Wu, Chenxi Wu, Guoyuan Liang

نُشر 2026-09-04
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ze Zhang, Xiaojun Wu, Chenxi Wu, Guoyuan Liang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في العالم الرقمي، توجد الأجسام ثلاثية الأبعاد في كل مكان، من التروس داخل الآلة إلى القطع الأثرية القدبية المحفوظة في المتاحف. وللعثور على جسم محدد من بين آلاف النماذج الرقمية، تحتاج الحواسيب إلى وسيلة لفهم شكل الجسم من جميع الزوايا الممكنة. لعقود من الزمن، حاول الباحثون تعليم الآلات التعرف على هذه الأشكال عبر التقاط صور لها من جوانب متعددة، تماماً مثل مصور يطوف حول تمثال لالتقاط هيئته الكاملة. اعتمدت المحاولات المبكرة على قواعد بسيطة كتبها البشر لوصف الأشكال، لكنها غالباً ما فشلت في استيعاب التفاصيل المعقدة للتصاميم الحديثة. وفي الآونة الأخيرة، تعلمت أنظمة حاسوبية قوية التعرف على الأنماط في الصور من تلقاء نفسها، ومع ذلك لا تزال تعاني عند محاولة دمج عشرات الصور المختلفة في فهم واحد واضح للجسم. يكمن التحدي في مساعدة الحاسوب ليس فقط على رؤية الصور الفردية، بل في فهم العلاقة الهندسية بينها، لضمان أن يبدو الكرسي ككرسي سواء تمت رؤيته من الأمام، أو الجانب، أو حتى مقلوباً رأساً على عقب.

قام فريق من الباحثين في معهد هاربين للتكنولوجيا والأكاديمية الصينية للعلوم بتطوير نظام جديد لحل هذه المشكلة، يسمى "محول تجميع الرؤى المتعددة" (Multi-View Aggregation Transformer). يعامل نهجهم مهمة التعرف على شكل ثلاثي الأبعاد كأنها محادثة بين زوايا كاميرا مختلفة. وبدلاً من مجرد تكديس الصور فوق بعضها البعض، يستخدم نظامهم إعداد كاميرا خاص يعتمد على شكل "اثنا عشري الوجوه" (dodecahedron)، وهو جسم صلب له اثنا عشر وجهاً مسطحاً وعشرون ركناً. ومن خلال وضع كاميرات افتراضية عند كل ركن وتوجيهها نحو المركز، يلتقطون ستين رؤية متميزة للجسم. يضمن هذا الترتيب المحدد تغطية السطح بالكامل بشكل متساوٍ، مما يوفر خريطة كاملة لهندسة الجسم. ثم يستخدم النظام نوعاً متطوراً من الذكاء الاصطناعي، يُعرف باسم "محول الرؤية" (Vision Transformer)، لتحليل هذه الصور الستين. وخلافاً للطرق القديمة التي قد تغفل الروابط بين الرؤى البعيدة، يولي هذا النظام الجديد اهتماماً لكيفية ارتباط كل رؤية بكل رؤية أخرى، مما يبني صورة موحدة لبنية الجسم.

وجد الباحثون أن مجرد جمع هذه الرؤى لم يكن كافياً؛ إذ كان الحاسوب بحاجة إلى وسيلة لفهم العلاقات المحددة التي يخلقها تخطيط الكاميرا الخاص بهم. ولتحقيق ذلك، صمموا نظام انتباه هرمي يعمل في ثلاث طبقات. أولاً، ينظر النظام إلى الصورة الكبيرة، ويفهم كيف ترتبط جميع الرؤى لتشكل الجسم بأكمله. ثانياً، يركز على مجموعات من الرؤى التي تقع على نفس الوجه المسطح للاثنا عشري الوجوه الخيالي، مما يساعد في التعرف على الأنماط المحلية. وأخيراً، يفحص الاختلافات الدقيقة بين الرؤى المأخوذة من نفس الموقع بالضبط ولكن مع دوران طفيف، مما يساعد في التمييز بين الأجسام التي تبدو متشابهة جداً. هذا التركيز التدريجي يسمح للنظام بتعلم هندسة الشكل بفعالية أكبر بكثير من الطرق السابقة. ولزيادة صقل الوصف النهائي للجسم، أضافوا وحدات خاصة تعدل أهمية الميزات المختلفة، مما يضمن تسليط الضوء على التفاصيل الأكثر أهمية مع تصفية المعلومات الأقل فائدة.

يعد الابتكار الرئيسي في عملهم طريقة جديدة لقياس مدى تشابه جسمين. فغالباً ما تعامل الطرق التقليدية الجسم وصورته المرآتية كأشياء مختلفة تماماً لأن الاتجاه الرياضي لنقاط بياناتهما يكون متعاكساً. ومع ذلك، لأغراض البحث عن جزء أو تصميم معين، فإن اتجاه البيانات لا يهم بقدر ما يهم الشكل نفسه. قدم الباحثون مقياساً يعامل الاتجاهات المتعاكسة كقيم متكافئة، مما يسمح للنظام بالتعرف على أن جسمين هما الشيء نفسه حتى لو كانت نقاط بياناتهما الداخلية تواجه اتجاهات متعاكسة. هذه المرونة تجعل النظام أفضل بكثير في العثور على المطابقات في قواعد البيانات الكبيرة. وعند اختباره على مجموعات قياسية من النماذج ثلاثية الأبعاد، بما في ذلك الأجسام العامة مثل الكراسي والطاولات، وكذلك الأجزاء الميكانيكية المعقدة، حقق النظام الجديد دقة مذهلة؛ حيث حدد الأجسام بنسبة نجاح بلغت 93.2% في مجموعات البيانات العامة و95.4% في المكونات الميكانيكية، متفوقاً بذلك على جميع الطرق السابقة.

اكتشف الفريق أيضاً أن الطريقة التي دربوا بها النظام كانت لا تقل أهمية عن النظام نفسه. فقد استخدموا عملية تدريب مكونة من ثلاث مراحل لتعليم الحاسوب. أولاً، علموه كيفية التعرف على الأشكال من صور فردية. بعد ذلك، قاموا بتجميد تلك المعرفة وعلموه كيفية دمج رؤى متعددة دون نسيان ما تعلمه بالفعل. وأخيراً، تركوا النظام بأكمله يتعلم معاً لضبط فهمه بدقة. حالت استراتيجية التدريب الدقيقة هذه دون إصابة النظام بالارتباك بسبب تعقيد المهمة. وأظهرت النتائج أن النظام ظل قوماً حتى عندما تم تدوير الأجسام في اتجاهات عشوائية، وهو تحدٍ شائع في التطبيقات الواقعية. ومن خلال الجمع بين تخطيط كاميرا ذكي هندسياً، ونظام انتباه متعدد الطبقات، وطريقة مرنة لقياس التشابه، يقدم هذا البحث أداة قوية للتصميم الرقمي، والتصنيع، والحفاظ على التراث الثقافي، مما يثبت أن مفتاح فهم الأشكال ثلاثية الأبعاد يكمن في كيفية تعليم الآلات رؤية الصورة الكاملة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →