💻 computer science

VMAD: Visual-enhanced Multimodal Large Language Model for Zero-Shot Anomaly Detection

تقترح هذه الورقة البحثية إطار عمل VMAD، وهو إطار عمل للنماذج اللغوية الكبيرة متعددة الوسائط المعززة بصرياً، والذي يعالج أوجه القصور في طرق اكتشاف الشذوذ الحالية بنمط الصفر (zero-shot) من خلال تقديم مخطط تعلم هيكلي حساس للعيوب وضغط الرموز المعزز محلياً لتحقيق التعرف على الشذوذ والتحليل الدقيق والمفتوح، مدعوماً بمجموعة بيانات اكتشاف الشذوذ الصناعي الحقيقي (RIAD) المستحدثة.

Huilin Deng, Hongchen Luo, Wei Zhai, Yang Cao, Yu Kang2026-04-02
🤖 AI

Zero-TIG: Temporal Consistency-Aware Zero-Shot Illumination-Guided Low-light Video Enhancement

تقدم هذه الورقة البحثية Zero-TIG، وهو إطار عمل جديد للتعلم من دون عينات (zero-shot learning) يستفيد من نظرية Retinex والتغذية الراجعة الزمنية القائمة على التدفق البصري لتعزيز مقاطع الفيديو ذات الإضاءة المنخفضة وتحت الماء بجودة بصرية محسنة، واتساق زمني، ودقة ألوان، دون الحاجة إلى بيانات حقيقية مقترنة.

Yini Li, Nantheera Anantrasirichai2026-04-02
⚡ electrical engineering

Bronchovascular Tree-Guided Weakly Supervised Learning Method for Pulmonary Segment Segmentation

تقترح هذه الورقة البحثية "التعلم الخاضع للإشراف القائم على التسلسل الهرمي للتشريح" (AHSL)، وهو أسلوب تعلم خاضع للإشراف الضعيف يستفيد من الأولويات المسبقة للشجرة القصيبية الوعائية واستراتيجية مكونة من مرحلتين مع دوال فقدان هرمية لتحقيق تقسيم دقيق للفصوص الرئوية دون الحاجة إلى تعليقات توضيحية دقيقة لكل بكسل.

Ruijie Zhao, Zuopeng Tan, Xiao Xue, Longfei Zhao, Bing Li, Zicheng Liao, Ying Ming, Jiaru Wang, Ran Xiao, Sirong Piao, R (…)2026-04-02
⚡ electrical engineering

Unified Medical Image Tokenizer for Autoregressive Synthesis and Understanding

تقدم هذه الورقة MedITok، وهو مُرمِّز صور طبية موحد تم تدريبه على أكثر من 33 مليون صورة عبر تسع أنماط باستخدام إطار عمل مبتكر ثنائي المراحل يستفيد من البيانات غير المزدوجة لضمان دقة إعادة البناء قبل حقن الدلالات النصية، مما يُمكِّن من عمليات التوليد والفهم ذاتية الانحدار (autoregressive) التي تبلغ أحدث المستويات في مختلف التطبيقات التشخيصية والتوليدية المتنوعة.

Chenglong Ma, Yuanfeng Ji, Jin Ye, Zilong Li, Chenhui Wang, Junzhi Ning, Wei Li, Lihao Liu, Qiushan Guo, Tianbin Li, Jun (…)2026-04-02
🤖 AI

Two-stage Vision Transformers and Hard Masking offer Robust Object Representations

تقترح هذه الورقة إطار عمل "ترانسفورمر رؤية" (Vision Transformer) مكوناً من مرحلتين ومدرباً بشكل مشترك، يستخدم أقنعة انتباه ثنائية متعلمة لتحديد المناطق ذات الصلة بالمهمة أولاً، ثم تقييد تركيز المرحلة الثانية عليها، مما يعزز المتانة ضد الارتباطات الزائفة والخلفيات الخارجة عن التوزيع، مع تمكين الاستدلال القابل للتدقيق والتدخلات في وقت الاختبار.

Ananthu Aniraj, Cassio F. Dantas, Dino Ienco, Diego Marcos2026-04-02
💻 computer science

A 3D Cross-modal Keypoint Descriptor for MR-US Matching and Registration

تقترح هذه الورقة واصفاً جديداً لنقاط العلامات ثلاثي الأبعاد متعدد الوسائط يستفيد من توليد الموجات فوق الصوتية الاصطناعية الخاصة بالمريض والتعلم التبايني لتحقيق تسجيل قوي وخالٍ من التهيئة بين التصوير بالرنين المغناطيسي والموجات فوق الصوتية أثناء الجراحة، متفوقةً بذلك على أحدث الأساليب بمتوسط خطأ في استهداف التسجيل يبلغ 2.39 ملم على مجموعة بيانات ReMIND.

Daniil Morozov, Reuben Dorent, Nazim Haouchine2026-04-02
💻 computer science

Processing and acquisition traces in visual encoders: What does CLIP know about your camera?

تكشف هذه الورقة أن المشفرات البصرية مثل CLIP تقوم بتشفير معلمات الحصول على الصور ومعالجتها بشكل منهجي، وهي معلمات غالباً ما تكون دقيقة وغير محسوسة، والتي يمكن أن تؤثر بشكل كبير على التنبؤات الدلالية اعتماداً على ارتباطها بالعلامات المستهدفة.

Ryan Ramos, Vladan Stojnić, Giorgos Kordopatis-Zilos, Yuta Nakashima, Giorgos Tolias, Noa Garcia2026-04-02
⚡ electrical engineering

Robust Residual Finite Scalar Quantization for Neural Compression

تقدم هذه الورقة البحثية "التكميم القياسي المتبقي القوي" (RFSQ)، وهي طريقة مبتكرة تتغلب على مشكلة اضمحلال مقدار المتبقي في التكميم متعدد المراحل عبر توظيف عوامل قياس قابلة للتعلم وتطبيع طبقة قابل للعكس، مما يحقق أداءً هو الأفضل في فئته في كل من مهام ضغط الصوت والصور.

Xiaoxu Zhu, Xiaojie Yu, Guangchao Yao, Yiming Ren, Baoxiang Li2026-04-02
💻 computer science

Resolving the Identity Crisis in Text-to-Image Generation

تقدم هذه الورقة DisCo، وهو إطار عمل للتعلم التعزيزي يعالج مشكلة انهيار الهوية في توليد الصور من النصوص لعدة بشر عبر التحسين من أجل التنوع الوجهي ودقة عدد الأشخاص من خلال تحسين السياسة النسبي للمجموعات، محققاً أداءً هو الأفضل في فئته دون الحاجة إلى بيانات تدريب من العالم الحقيقي.

Shubhankar Borse, Farzad Farhadzadeh, Munawar Hayat, Fatih Porikli2026-04-02
🤖 AI

TempoControl: Temporal Attention Guidance for Text-to-Video Models

يُعد TempoControl طريقة مبتكرة لا تتطلب تدريباً، حيث تستفيد من تحسين خرائط الانتباه المتقاطع لتوفير تحكم زمني دقيق في المفاهيم البصرية في توليد الفيديو من النصوص، مما يتيح محاذاة دقيقة لمظهر الأشياء، وتوقيت الأفعال، والمزامنة الصوتية دون المساس بجودة الفيديو.

Shira Schiber, Ofir Lindenbaum, Idan Schwartz2026-04-02