💬 NLP

Attend to Evidence: Evidence-Anchored Spatial Attention Supervision for Multimodal RLVR

تقدم الورقة البحثية طريقة EASE (الانتباه المكاني المرتكز على الأدلة)، التي تعزز التعلم المعزز بالمكافآت القابلة للتحقق (RLVR) لنماذج الرؤية واللغة من خلال استخدام أدلة بصرية مشروحة لتوجيه الانتباه المكاني أثناء مسارات التدريب ذات المكافأة العالية، مما يؤدي إلى تحسين الأداء في معايير الإدراك والاستدلال والهلوسة دون الحاجة إلى مدخلات إضافية أثناء الاستنتاج.

Ruina Hu, Chen Wang, Lai Wei, Jionghao Bai, Bin Yu, Weiran Huang, Kai Wang, Yue Wang2026-06-01
💻 computer science

IAF-Net: Illumination-Adaptive Fusion for Low-Light Urban Road Segmentation

تقترح الورقة البحثية شبكة IAF-Net، وهي شبكة دمج متكيفة مع الإضاءة تعمل على ضبط أوزان الميزات اللونية (RGB) والهندسية ديناميكيًا لتحقيق أداء رائد في تقسيم الطرق في ظروف الإضاءة المنخفضة والطقس السيئ، مدعومة بمجموعتي بيانات تم إنشاؤهما حديثًا.

Bingtao Wang, Daojie Peng, Fulong Ma, Jun Ma, Liang Zhang2026-06-01
💻 computer science

PRISM: Progressive Reasoning through Iterative Slot Memory for Vision

تُعد PRISM بنية رؤية هرمية مبتكرة تعزز متانة النموذج وأدائه في ظل الملاحظات غير المكتملة من خلال محاكاة الإدراك البشري عبر عملية تكرارية متعددة المقاييس لتنظيم الميزات في فتحات متمحورة حول الأشياء، واستدعاء الأنماط ذات الصلال من الذاكرة، وتكرير التمثيلات تدريجياً.

Ziyu Wang, Shuangpeng Han, Mengmi Zhang2026-06-01
🤖 AI

Variational Adapter for Cross-modal Similarity Representation

تقترح هذه الورقة البحثية "المُكيِّف التبايني لتمثيل التشابه عبر الوسائط" (VACSR)، وهي طريقة تعيد صياغة مطابقة الصور والنصوص كمسألة استدلال تبايني لبناء فضاء تشابه كامن يخفف من الآثار السلبية لندرة التوصيفات دقيقة التفاصيل وحدود التصنيف الثنائي، مما يعزز التعميم عبر مهام الاسترجاع وتكيف النطاق.

WenZhang Wei, Zhipeng Gui, Dehua Peng, Tiandi Ye, Huayi Wu2026-06-01
🤖 AI

Generating Reports or Repeating Templates? Measuring and Mitigating Template Collapse in 3D CT Report Generation

تحدد هذه الورقة مشكلة "انهيار القالب" (Template Collapse) في توليد تقارير الأشعة المقطعية ثلاثية الأبعاد، حيث تنتج النماذج نصوصاً عامة بليغة ولكنها غير دقيقة سريرياً، وذلك عبر اقتراح CLarGen، وهو إطار عمل مفكك يحسن دقة التشخيص وتنوع المخرجات بشكل كبير من خلال مكونات منفصلة للكشف عن الاعتلالات وتوليد اللغة.

Tom Maye-Lasserre, Yitong Li, Bailiang Jian, Morteza Ghahremani, Benedikt Wiestler, Christian Wachinger2026-06-01
💻 computer science

Iterative Framework For Data Augmentation Of Segmented Fingerprints

تقترح هذه الورقة إطار عمل جديداً لتعزيز البيانات بشكل تكراري يقوم بتوليد متغيرات متنوعة لبصمات أصابع الرضع من خلال إحداث أخطاء في شبكة عصبية لاستخراج التعرجات والأخاديد، مما يعمل بفعالية على توسيع تنوع مجموعة البيانات مع الحفاظ على التشابه البصري لمعالجة ندرة البيانات البيومترية للرضع.

João Leonardo H. D. Agnol, Wesley Augusto de Bona, Erick Oliveira Rodrigues, Luiz Fernando Puttow Southier, Jefferson Ol (…)2026-06-01
🤖 machine learning

LVSA: Training-Free Sparse Attention for Long Video Diffusion

تُعد LVSA آلية انتباه ذات تخلخل كتل (block-sparse attention) لا تعتمد على نموذج محدد ولا تتطلب تدريباً، حيث تجمع بين النوافذ المهيكلة والمرتكزات العالمية الدوارة لتسريع استنتاج نماذج الانتشار للفيديوهات الطويلة بشكل كبير وتوسيع آفاق التوليد مع الحفاظ على جودة الفيديو أو تحسينها، إلى جانب تقديم VQeval لتقييم أكثر دقة للجودة.

Gael Glorian, Ioannis Lamprou, Zhen Zhang, Yujie Yuan, Hongsheng Liu2026-06-01
💻 computer science

Cross-Modal Clinical Knowledge Integration for Mammography Report Generation

تقترح الورقة البحثية MammoRG، وهو إطار عمل ثنائي المراحل يدمج المعرفة السريرية المهيكلة وإرشادات BI-RADS لتوليد تقارير تصوير الثدي الشعاعي ذات اتساق تشخيصي فائق، مصحوباً بأداة تحليل مخصصة (MammoRGTool) لتقييم الفعالية السريرية.

Jiayi Zhu, Fuxiang Huang, Yu Xie, Xi Wang, Zhixuan Chen, Yuan Guo, Qingcong Kong, Zhenhui Li, Qiong Luo, Hao Chen2026-06-01
💻 computer science

iVGR: Internalizing Visually Grounded Reasoning for MLLMs with Reinforcement Learning

تقدم هذه الورقة إطار عمل iVGR، وهو إطار للتعلم التعزيزي يعمل على استيعاب قدرات التحديد البصري للمواقع ضمن الاستدلال النصي عبر استراتيجية تدريب ثنائية المسار، مما يمكّن النماذج اللغوية الكبيرة متعددة الوسائط من تحقيق إدراك فائق الدقة دون تدهور في الأداء ناتج عن ضرورة التحديد البصري الصريح أثناء الاستدلال.

Chang-Bin Zhang, Yujie Zhong, Qiang Zhang, Kai Han2026-06-01
🤖 machine learning

Remembering by Reconstructing: Domain Incremental Learning With Test-Time Training on Video Streams

تقترح هذه الورقة إطار عمل جديد للتعلم التزايدي للمجالات يستفيد عمدًا من النسيان الكارثي عبر محولات "LoRA" متخصصة، ويستعيد معرفة المجال عبر التدريب في وقت الاختبار عبر الإنترنت على مشفر تلقائي مقنع ذاتي الإشراف، مما يجعله فعالًا بشكل خاص لتدفقات الفيديو غير المستقرة في العالم الحقيقي.

Jonathan Swinnen, Tinne Tuytelaars2026-06-01