CAFM: A Cross-Modal Local Alignment Fusion Method for RGB-3D Industrial Anomaly Detection
تقترح هذه الورقة البحثية طريقة CAFM، وهي طريقة دمج محاذاة محلية عابرة للأنماط تستخدم انتباه النافذة المحلية، وضغط عنق الزجاجة، والتعلم التبايني المتماثل لدمج ميزات RGB والسحابة النقطية ثلاثية الأبعاد بفعالية من أجل كشف وتحديد الشذوذ الصناعي بشكل فائق، محققةً أداءً هو الأفضل في حالته (state-of-the-art) على مجموعة بيانات MVTec 3D-AD.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في عالم التصنيع عالي المخاطر، يمثل ضمان خروج كل منتج من خط التجميع دون أي عيوب معركة مستمرة. لعقود من الزمن، اعتمدت أنظمة الفحص الآلي على الكاميرات لرصد العيوب، تماماً مثل موظف مراقبة الجودة البشري الذي يمسح القطعة بحثاً عن خدوش أو تغير في اللون. هذه الصور ثنائية الأبعاد ممتارة في قراءة الأنسجة والألوان السطحية، لكنها تعاني في رؤية شكل الأشياء؛ فالاختلافات مثل الانبعاج، أو البروز، أو التغير الطفيف في الارتفاع غالباً ما تختفي في صورة مسطحة، خاصة إذا تغيرت الإضاءة أو كان السطح غير مستوٍ بطبيعته. وعلى العكس من ذلك، يمكن للماسحات الضوئية ثلاثية الأبعاد رسم الخرائط الدقيقة لهندسة الجسم وعمقه، مما يكشف عن التشوهات الهيكلية التي قد تغفل عنها الكاميرا، ومع ذلك فهي عمياء عن تفاصيل اللون والنسيج الغنية التي تحدد أنواعاً أخرى من الأضرار. لطالما كان التحدي الذي يواجه المهندسين هو كيفية دمج هاتين الطريقتين المختلفتين لرؤية العالم في نظام واحد موثوق يمكنه رصد أي خلل، سواء كان خدشاً على السطح أو انبعاجاً في الهيكل.
لقد طور فريق من الباحثين من جامعة بهيانغ وأكاديمية العلوم العسكرية التابعة لجيش التحرير طريقة جديدة لحل هذه المشكلة، حيث ابتكروا نظاماً يدمج هذين المنظورين دون أن يلغي أحدهما الآخر. نهجهم، المسمى CAFM، يعالج خللاً محدداً في المحاولات السابقة: فعندما تحاول الحواسيب دمج البيانات ثنائية وثلاثية الأبعاد، فإنها غالباً ما تقوم بتنعيم (تلطيف) التعرجات ذاتها التي يُفترض بها اكتشافها. إذا كانت القطعة تحتوي على عيب يظهر في المسح ثلاثي الأبعاد ولكنه يبدو طبيعياً في الصورة، فقد تستخدم الأنظمة القديمة الصورة "الطبيعية" لملء التفاصيل المفقودة، مما يؤدي فعلياً إلى محو دليل وجود العيب. وجد الباحثون أنه لاكتشاف هذه الشذوذات، يجب منع النظام من أن يكون "متعاوناً للغاية"؛ إذ يجب تقييده بحيث لا يمكنه ببساطة ابتكار نسخة مثالية لقطعة مكسورة. ومن خلال إجبار الكمبيوتر على التركيز على المناطق المحلية حيث يتداخل المنظوران، ومن خلال تحديد مقدار المعلومات التي يمكنه "تخمينها" بعناً، أنشأوا طريقة كشف أكثر دقة بكثير من المعايير الحالية.
يكمن جوهر هذا النظام الجديد في كيفية معالجة البيانات قبل اتخاذ القرار. يأخذ الباحثون أولاً بيانات الصورة ثنائية الأبعاد ويمررونها عبر عملية ضغط تعمل بمثابة مرشح صارم. تم تصميم هذا المرشح ليتعلم أنماط القطع المثالية والطبيعية بدقة شديدة بحيث عندما يواجه قطعة معيبة، لا يستطيع إعادة بنائها بشكل صحيح. هذا الفشل في إعادة بناء العيب يخلق إشارة واضحة تشير إلى وجود خطأ ما. ومن الأهمية بمكان أن عملية الضغط هذه تُطبق فقط على بيانات الصورة، مما يترك البيانات الهندسية ثلاثية الأبعاد دون مساس، ويضمن بقاء الحقيقة الهيكلية للجسم حادة وواضحة. يقوم النظام بعد ذلك بمحاذاة هذين التدفقين من المعلومات، ولكن بدلاً من دمج الصورة بأكملة مع المسح ثلاثي الأبعاد بالكامل دفعة واحدة، فإنه ينظر إليهما في نوافذ محلية صغيرة. يضمن ذلك أن نسيجاً ما على الجانب الأيسف من الجسم يتم مقارنته فقط بالهندسة الموجودة في الجانب الأيسر، مما يمنع الكمبيوتر من الارتباك بسبب تفاصيل غير ذات صلة من أجزاء أخرى من الجسم.
ولضمان عدم تفضيل النظام لنوع واحد من البيانات على الآخر، استخدم الباحثون تقنية تدريب تجبر المعلومات المدمجة على البقاء وفية لكل من الصورة الأصلية والمسح ثلاثي الأبعاد الأصلي. إذا بدأ النظام في الميل بشدة نحو الألوان ثنائية الأبعاد أو الأشكال ثلاثية الأبعاد، فإن هذه التقنية تسحبه مجدداً، مما يضمن رؤية متوازنة. أخيراً، يقوم النظام بتخزين أمثلة لما يبدو عليه الشكل "الطبيعي" في ثلاث مكتبات منفصلة: واحدة للصور ثنائية الأبعاد، وواحدة للمسوحات ثلاثية الأبعاد، وواحدة للبيانات المدمجة. وعند فحص قطعة جديدة، يتحقق النظام منها مقابل المكتبات الثلاث جميعها. وإذا بدت القطعة مختلفة عن الأمثلة الطبيعية في أي من هذه المكتبات، يتم تصنيفها كقطعة معيبة. يسمح هذا النهج متعدد الطبقات للنظام برصد مجموعة أوسع من العيوب مقارنة بالطرق التي تعتمد على منظور واحد أو دمج بسيط للبيانات.
تُظهر نتائج اختبار هذه الطريقة على مجموعتين رئيسيتين من البيانات الصناعية، MVTec 3D-AD وEyecandies، مدى فعاليتها. ففي مجموعة بيانات MVTec 3D-AD، التي تحتوي على مجموعة متنوعة من الأجسام والعيوب الصناعية، حققت الطريقة الجديدة درجة كشف على مستوى الصورة بلغت 0.981. ويمثل هذا تحسناً بنسبة 3.6 نقطة مئوية عن الطريقة الرائدة السابقة، M3DM، والتي استخدمت نهج المكتبات المتعددة المماثل ولكنها افتقرت إلى تقنيات المحاذاة والضغط المحددة. ومن حيث تحديد مكان العيب بالضبط على سطح الجسم، سجلت الطريقة الجديدة 0.977، وبالنسبة للتمييز بين البكسلات الطبيعية والمعيبة، وصلت إلى 0.998. تشير هذه الأرقام إلى أن النظام ليس بارعاً فقط في قول "هذه القطعة مكسورة"، بل وأيضاً في إظهار مكان الكسر بدقة. وأشار الباحثون إلى أنه بينما تتفوق الطريقة في اكتشاف التغيرات النسيجية المحلية والتشوهات الهيكلية، فإنها لا تزال تواجه تحديات مع التشوهات الهندسية الطفيفة جداً أو العيوب التي تظهر بشكل مختلف عبر نوعي البيانات، مما يشير إلى أن العمل المستقبلي يمكن أن يركز على جعل المحاذاة المحلية أكثر مرونة.
تكمن أهمية هذا العمل في قدرته على التعامل مع تعقيدات التصنيع في العالم الحقيقي دون الحاجة إلى أمثلة مصنفة لكل عيب محتمل. فباستخدام نهج غير خاضع للإشراف، يتعلم النظام كيف يبدو الجزء المثالي ويقوم بتمييز أي شيء ينحرف عن هذا المعيار. وقد استبعد الباحثون صراحةً فكرة أن مجرد إضافة المزيد من البيانات أو استخدام كمبيوتر أقوى سيحل المشكلة؛ وبدلاً من ذلك، أظهروا أن الطريقة التي يتم بها دمج البيانات هي العامل الحاسم. لقد أثبتوا أن السماح للنظام بدمج المعلومات بحرية يؤدي غالباً إلى أخطاء حيث يتم إخفاء العيوب، وأن تقييد قدرة النظام على "ملء الفراغات" هو في الواقع ما يجعله أكثر حساسية للعيوب. ويتحدى هذا الاكتشاف الافتراض الشائع بأن القوة التمثيلية الأكبر هي دائماً الأفضل، مبيناً بدلاً من ذلك أن القيود المدروسة يمكن أن تؤدي إلى كشف فائق في التطبيقات الحرجة للسلامة.
وفي السياق الأوسع للأتمتة الصناعية، يوفر هذا الأسلوب مساراً نحو أنظمة مراقبة جودة أكثر قوة يمكنها التكيف مع أنواع مختلفة من المنتجات والعيوب دون الحاجة إلى إعادة تدريب مكثفة. إن القدرة على اكتشاف كل من المشكلات السطحية مثل الخدوش والمشكلات الهيكلية مثل الانبعاجات في تمريرة واحدة تقلل من الحاجة إلى محطات تفتيش متعددة وتخفض خطر وصول المنتجات المعيبة إلى المستهلكين. وبينما يستخدم النظام الحالي أحجام نوافذ ثابتة للمحاذاة، مما قد يحد من أدائه في العيوب الصغيرة جداً أو غير المنتظمة، فإن الإطار يوفر أساساً متيناً للتحسينات المستقبلية. يخطط الباحثون لاستكشاف آليات محاذاة ديناميكية يمكنها التكيف مع الخصائص المحددة للعيب، مما قد يجعل النظام أكثر تنوعاً. وفي الوقت الحالي، تعد هذه الطريقة تقدماً مثبتًا في هذا المجال، حيث تقدم تحسناً واضحاً وقابلاً للقياس في موثوقية الفحص البصني الآلي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.