💻 computer science

Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing

تقترح الورقة البحثية RVEDiT، وهو إطار عمل جديد لنموذج "Diffusion Transformer" لتحرير الفيديو القائم على التعليمات، والذي يعزز الأداء من خلال تنفيذ تكييف الرموز الموجه بالتجزئة (granularity-routed token conditioning) للمعالجة من الخشن إلى الناعم، ومحاذاة الانتباه المرتكز على المرجع (reference-anchored attention alignment) لضبط الاستدلال الضمني دون زيادة تكاليف الاستدلال.

Yan Li, Lin Liu, Xiaopeng Zhang, Qi Tian2026-05-26
💻 computer science

VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation

تُعد VaaWIT إطار عمل متكاملًا يعزز ترجمة صور الويب متعددة اللغات من خلال دمج وحدة انتباه ثنائية المسار ومهايئ مدرك بصريًا لسد الفجوة في التمثيل البصري لدى النماذج اللغوية الكبيرة، محققةً أداءً هو الأفضل في فئته باستخدام الضبط الدقيق الموفر للمعلمات.

Bo Li, Ronghao Chen, Ningyuan Deng, Huacan Wang, Shaolin Zhu, Lijie Wen2026-05-26
💻 computer science

AdaFuse-Det: Adaptive Cross-Modal Fusion of Event Cameras for Robust Object Detection in Low-Light RGB Imagery

يُعد AdaFuse-Det إطار عمل ثنائي المسار يقوم بدمج إطارات RGB المعززة بتقنية CLAHE تكيفياً مع بيانات كاميرا الأحداث المكسلة (voxelized) باستخدام وحدة ذات أساس نظري لتحقيق كشف قوي للأجسام في ظروف الإضاءة المنخفضة للغاية، متفوقاً بشكل كبير على النهج أحادي الوسيط في معيار LLE-VOS.

Raju Imandi, Chethana B, Bharatesh Chakravarthi, Yong-Guk Kim, Manipriya S, Pavan Kumar B N2026-05-26
💻 computer science

SRUG: Shadow-Guided Relightable Urban Scene with Generation Model

تقدم هذه الورقة SRUG، وهو إطار عمل مبتكر يعالج تحديات إعادة الإضاءة للمشاهد الحضرية غير المحدودة من خلال الاستفادة من الظلال لتوجيه استكمال الهندسة ثلاثية الأبعاد وتوظيف نموذج مواد ضخم تكراري لتفكيك المواد بشكل قوي، مما يتيح في النهاية إعادة إضاءة معقولة فيزيائياً وتوليد مناظر جديدة.

Yonghao Zhao, Zexin Yin, Jian Yang, Beibei Wang, Jin Xie2026-05-26
💻 computer science

Do Image-Text Metrics Respect Semantic Invariances?

تكشف هذه الورقة أن مقيمات تحويل الصور إلى نصوص الشائعة التي لا تعتمد على مرجع تفتقر إلى الثبات الدلالي، حيث تُظهر تقلبات كبيرة في الدرجات وعدم استقرار في التصنيف تحت تأثير اضطرابات مكانية وصياغية حميدة يدركها البشر كمتكافئة، وتقترح طريقة معايرة لاحقة للتخفيف من هذه الحساسيات غير الدلالية.

Amit Agarwal, Hitesh Laxmichand Patel, Meizhu Liu, Jyotika Singh, Karan Dua, Hansa Meghwani, Matthew Rowe, Michael Avend (…)2026-05-26
💻 computer science

From Full Boards to Tiny Defects: Scale-Aware Tile Inference with Topology-Aware Merging for High-Resolution PCB Defect Detection

تعالج هذه الورقة مشكلة انهيار الدقة والآثار الحدودية في كشف عيوب لوحات الدوائر المطبوعة (PCB) عالية الدقة من خلال إثبات أن تدريب أجهزة الكشف على قصاصات بلاطية وتطبيق طريقة معالجة لاحقة جديدة لدمج البلاط الواعي بالطوبولوجيا (TA-TM) خالية من التدريب، يحسن بشكل كبير من استدعاء العيوب الصغيرة ودقة الكشف الإجمالية مقارنة باستراتيجيات الاستدلال التقليدية للصورة الكاملة أو البلاط القياسي.

Mohammad Alijanpour Shalmani, Alale Rezvani Boroujeni, Ali Amini, Jiann Shiun Yuan2026-05-26
💻 computer science

Ghosts in the Point Clouds: De-glaring LiDAR in the Transient Domain

تتناول هذه الورقة القضية الحرجة المتمثلة في وهج تعدد المسارات الداخلي في أجهزة ليدار (LiDAR) ذات الحالة الصلبة المدمجة، وذلك عبر تقديم نموذج استشعار قائم على أسس فيزيائية وخوارزمية لا تتطلب تدريباً تعمل على القياسات العابرة لتخميد الآثار "الشبحية" مع الحفاظ على بنية المشهد الحقيقية.

Avery Gump, Connor Henley, Sungjin Cheong, Akarsh Prabhakara, Mohit Gupta2026-05-26
💻 computer science

Drift-Resistant Navigation World Model with Anchored Epipolar Guidance

تقترح هذه الورقة نموذج عالم للملاحة مقاوم للانجراف، يعمل على التخفيف من الانجراف الإدراكي والهندسي في الملاحة طويلة المدى عبر توظيف استراتيجية تدحرج موجهة بالمرساة مع أهداف مستقبلية متفرقة وقيود قطبية ثنائية لضمان الجودة البصرية، والاتساق الهندسي، وتحسين التخطيط اللاحق.

Po-Chien Luan, Zimin Xia, Wuyang Li, Yang Gao, Alexandre Alahi2026-05-26
💻 computer science

4KLSDB: A Large-Scale Dataset for 4K Image Restoration and Generation

تقدم الورقة البحثية 4KLSDB، وهي مجموعة بيانات ضخمة وعالية الجودة تتكون من 129,484 صورة بدقة 4K منسقة مع عمليات تصفية وتوسيم صارمة، صُممت لتعزيز أبحاث استعادة وتوليد الصور المتطورة من خلال إثبات أن التدريب على بيانات 4K أصلية يحسن دقة النموذج بشكل كبير.

Zihao Zhu, Kuan-Ru Huang, Zhaoming Xu, Renjie Li, Bo Wu, Ruizheng Bai, Mingyang Wu, Sayak Paul, Zhengzhong Tu2026-05-26
⚡ electrical engineering

Self-Supervised Contrastive Learning for Cardiac MR Sequence Classification

تقترح هذه الورقة استراتيجية تكييف للتعلم التبايني ذاتي الإشراف لنماذج محولات الرؤية (Vision Transformer) للتغلب على قيود الميزات مسبقة التدريب العامة في تصنيف صور الرنين المغناطيسي للقلب، مما يحقق أداءً فائقاً وتعميماً قوياً عبر مجموعات بيانات متعددة مقارنة بالنهجات التقليدية الخاضعة للإشراف.

Yuli Wang, Hyewon Jung, Dongshen Peng, Yuwei Dai, Jing Wu, Haoyue Guan, Yoko Kato, Zhicheng Jiao, Yu Sun, Ihab Kamel, Jo (…)2026-05-26