🤖 machine learning

ViTaPEs: Visuotactile Position Encodings for Cross-Modal Alignment in Multimodal Transformers

تقدم الورقة البحثية ViTaPEs، وهي بنية قائمة على المحولات (transformer) تستخدم استراتيجية ترميز موضعي مبتكرة ثنائية المرحلة لدمج الوسائط البصرية واللمسية بفعالية، محققةً أداءً هو الأفضل في فئتها وقدرة على التعميم الصفري عبر مهام التعرف والإمساك الروبوتي المتنوعة دون الاعتماد على نماذج الرؤية واللغة سابقة التدريب.

Fotios Lygerakis, Ozan Özdenizci, Elmar Rückert2026-03-10
💻 computer science

Elytra: A Flexible Framework for Securing Large Vision Systems

تقدم الورقة البحثية ELYTRA، وهو إطار عمل مرن يستخدم التكيف منخفض الرتبة (LoRA) لتوليد رقع أمنية خفيفة الوزن ديناميكيًا للأنظمة البصرية الضخمة، مما يحسن متانتها بشكل كبير ضد الهجمات العدائية دون الحاجة إلى إعادة تدريب كاملة أو معرفة مسبقة بتهديدات محددة.

Richard E. Neddo, Emmanuel Atindama, Zander W. Blasingame, Chen Liu2026-03-10
🤖 machine learning

From Semantic To Instance: A Semi-Self-Supervised Learning Approach

تقترح هذه الورقة نهجاً للتعلم شبه الموجه ذاتياً يتميز بتمثيل GLMask مبتكر ومسار من الدلالي إلى المثالي يحقق أداءً رائداً في تقسيم المثيل بأقل قدر من التوسيم اليدوي، مما يظهر نتائج متفوقة في كل من صور رؤوس القمح الزراعية الكثيفة ومجموعة بيانات COCO للأغراض العامة.

Keyhan Najafian, Farhad Maleki, Lingling Jin, Ian Stavness2026-03-10
💻 computer science

Transforming H&E images into IHC: A Variance-Penalized GAN for Precision Oncology

تقدم هذه الدراسة نموذج GAN يعتمد على تقنية الهرم (pyramid pix2pix) مع معاقبة التباين، والذي يقوم بتوليد صور كيمياء نسيجية مناعية (IHC) عالية الدقة وخاصة ببروتين HER2 من شرائح الهيماتوكسيلين والإيوسين (H&E) الروتينية، مما يقلل بفعالية من انهيار النمط ويتفوق على النماذج المرجعية لتمكين تشخيصات دقيقة في مجال الأورام تتسم بالتكلفة المنخفضة والقابلية للتوسع.

Sara Rehmat, Hafeez Ur Rehman, Byeong-Gwon Kang, Sarra Ayouni, Yunyoung Nam2026-03-10
💻 computer science

Open-Vocabulary Camouflaged Object Segmentation with Cascaded Vision Language Models

تقترح هذه الورقة إطار عمل متتالٍ مبتكرًا موجهًا بنماذج الرؤية واللغة (VLM) لتقسيم الأجسام المموهة ذات المفردات المفتوحة، والذي يستفيد من ميزات نماذج الرؤية واللغة لتوجيه نموذج "Segment Anything" صراحةً من أجل تحديد المواقع بدقة، ويستخدم أولويات مكانية ناعمة للحفاظ على سياق الصورة الكامل، مما يؤدي إلى التغلب على الفجوات النطاقية وتحسين كل من التقسيم والتصنيف للأجسام المموهة عبر فئات عشوائية.

Kai Zhao, Wubang Yuan, Zheng Wang, Guanyi Li, Xiaoqiang Zhu, Deng-ping Fan, Dan Zeng2026-03-10
💻 computer science

LD-RPS: Zero-Shot Unified Image Restoration via Latent Diffusion Recurrent Posterior Sampling

يقترح LD-RPS إطار عمل موحداً وجديداً لاستعادة الصور، خالياً من الاعتماد على مجموعات البيانات، يستفيد من أخذ عينات لاحق متكرر على نموذج انتشار كامن مسبق التدريب، معزز ببوادر دلالية متعددة الوسائط ووحدة محاذاة خفيفة الوزن، لتحقيق أداء فائق عبر أنواع مختلفة من التدهور دون تدريب خاص بكل مهمة.

Huaqiu Li, Yong Wang, Tongwen Huang, Hailang Huang, Haoqian Wang, Xiangxiang Chu2026-03-10
🤖 machine learning

Adopting a human developmental visual diet yields robust, shape-based AI vision

من خلال تنفيذ "حمية بصرية تنموية" مبتكرة مستوحاة من النضج البصري البشري، تُثبت هذه الدراسة أن توجيه عمليات تعلم الذكاء الاصطناعي بدلاً من مجرد توسيع نطاق البيانات يُنتج نماذج ذات قدرة فائقة على التعرف القائم على الأشكال، ومتانة تجاه التشوهات، وتوافق مع الرؤية البشرية.

Zejin Lu, Sushrut Thorat, Radoslaw M Cichy, Tim C Kietzmann2026-03-10
💻 computer science

Query-Based Adaptive Aggregation for Multi-Dataset Joint Training Toward Universal Visual Place Recognition

تقترح هذه الورقة تقنية التجميع التكيفي القائم على الاستعلام (QAA)، وهي تقنية مبتكرة لتجميع الميزات تستخدم استعلامات متعلمة ككتب رموز مرجعية لمعالجة التباينات في مجموعات البيانات بفعالية في التدريب المشترك متعدد المجموعات، مما يحقق التعرف البصري العالمي القوي على الأماكن مع توازن في التعميم وأداء يضاهي أحدث ما توصل إليه العلم.

Jiuhong Xiao, Yang Zhou, Giuseppe Loianno2026-03-10
💻 computer science

A Robust Incomplete Multimodal Low-Rank Adaptation Approach for Emotion Recognition

تقترح هذه الورقة البحثية MCULoRA، وهو إطار عمل جديد فعال في كفاءة المعلمات يتميز بالتكيف منخفض الرتبة المدرك لدمج الأنماط والضبط الدقيق الديناميكي للمعلمات لحل صراعات التدرج وتحسين الأداء في التعرف على العواطف متعدد الوسائط غير المكتمل.

Xinkui Zhao, Jinsong Shu, Yangyang Wu, Guanjie Cheng, Zihe Liu, Naibo Wang, Shuiguang Deng, Zhongle Xie, Jianwei Yin2026-03-10
💻 computer science

π3\pi^3: Permutation-Equivariant Visual Geometry Learning

تقدم الورقة البحثية π3\pi^3، وهي شبكة عصبية أمامية (feed-forward) مبتكرة تحقق أداءً هو الأفضل في حالته (state-of-the-art) في مهام إعادة بناء الهندسة البصرية من خلال توظيف بنية متوافقة تماماً مع التبديل (fully permutation-equivariant) للتنبؤ بوضعيات الكاميرا وخرائط النقاط دون الاعتماد على منظور مرجعي ثابت.

Yifan Wang, Jianjun Zhou, Haoyi Zhu, Wenzheng Chang, Yang Zhou, Zizun Li, Junyi Chen, Jiangmiao Pang, Chunhua Shen, Tong (…)2026-03-10