VMAD: Visual-enhanced Multimodal Large Language Model for Zero-Shot Anomaly Detection
تقترح هذه الورقة البحثية إطار عمل VMAD، وهو إطار عمل للنماذج اللغوية الكبيرة متعددة الوسائط المعززة بصرياً، والذي يعالج أوجه القصور في طرق اكتشاف الشذوذ الحالية بنمط الصفر (zero-shot) من خلال تقديم مخطط تعلم هيكلي حساس للعيوب وضغط الرموز المعزز محلياً لتحقيق التعرف على الشذوذ والتحليل الدقيق والمفتوح، مدعوماً بمجموعة بيانات اكتشاف الشذوذ الصناعي الحقيقي (RIAD) المستحدثة.