💻 computer science

Infrastructure-Centric World Models: Bridging Temporal Depth and Spatial Breadth for Roadside Perception

تقترح هذه الورقة نماذج العالم المتمحورة حول البنية التحتية (I-WM)، وهو إطار عمل مبتكر يستفيد من نقاط القوة المكانية والزمانية المتكاملة للمستشعرات الثابتة على جانب الطريق لسد الفجوة بين منظور المركبة ذاتية القيادة والتوقع الشامل لحركة المرور من خلال رؤية ثلاثية المراحل تتمثل في الفهم التوليدي، والتنبؤ القائم على الفيزياء، والاتصال التعاوني بين المركبة وكل شيء (V2X).

Siyuan Meng, Chengbo Ai2026-04-21
💻 computer science

Self-Supervised Super-Resolution for Sentinel-5P Hyperspectral Images

تقترح هذه الورقة إطار عمل للتعلم الذاتي لرفع دقة الصور فائقة الطيف لبيانات سنتينل-5P (Sentinel-5P)، يعتمد على مُقدّر شتاين غير المنحاز للمخاطر (SURE) وقيود التصوير المتكافئ للتغلب على نقص البيانات المرجعية عالية الدقة، محققاً أداءً يضاهي الأساليب الخاضعة للإشراف مع إنتاج صور غلاف جوي عالية التفاصيل وذات دلالة فيزيائية.

Hyam Omar Ali, Antoine Crosnier, Romain Abraham, Baptiste Combelles, Fabrice Jégou, Bruno Galerne2026-04-21
💬 NLP

Video-Robin: Autoregressive Diffusion Planning for Intent-Grounded Video-to-Music Generation

يُعد Video-Robin نموذجاً مبتكراً لتوليد الموس see من النصوص والتحويل من الفيديو إلى الموسيقى، يجمع بين التخطيط ذاتي الانحدار والتركيب القائم على الانتشار لإنتاج موسيقى عالية الدقة ومتوافقة دلالياً مع قدرة تحكم دقيقة وسرعة استنتاج أكبر بكثير من الأساليب الرائدة.

Vaibhavi Lokegaonkar, Aryan Vijay Bhosale, Vishnu Raj, Gouthaman KV, Ramani Duraiswami, Lie Lu, Sreyan Ghosh, Dinesh Man (…)2026-04-21
💻 computer science

Low Light Image Enhancement Challenge at NTIRE 2026

تستعرض هذه الورقة تحدي NTIRE 2026 لتحسين الصور في ظروف الإضاءة المنخفضة، حيث تفصل مشاركة 22 فريقاً، والحلول المقترحة، والنتائج النهائية لإظهار التقدم الكبير في أحدث التقنيات في مجال استعادة الصور منخفضة التباين والمشوبة بالضجيج.

George Ciubotariu, Sharif S M A, Abdur Rehman, Fayaz Ali Dharejo, Rizwan Ali Naqvi, Marcos V. Conde, Radu Timofte, Zhi J (…)2026-04-21
💻 computer science

Voronoi-guided Bilateral 2D Gaussian Splatting for Arbitrary-Scale Hyperspectral Image Super-Resolution

تقترح هذه الورقة البحثية GaussianHSI، وهو إطار عمل مبتكر يستفيد من تقنية التلطيخ الغاوسي ثنائي الأبعاد ثنائي الجانب الموجه بـ Voronoi ووحدة تعزيز التفاصيل الطيفية لتحقيق دقة فائقة للصور فائقة الطيف بمقاييس عشوائية ومرنة مع الحفاظ على كل من التكيف المكاني والأمانة الطيفية.

Jie Zhang, Jinkun You, Shi Chen, Yicong Zhou2026-04-21
💻 computer science

Score-Based Matching with Target Guidance for Cryo-EM Denoising

تقترح هذه الورقة إطار عمل لإزالة الضجيج قائمًا على الدرجة (score-based) مع توجيه مستهدف لتقنية المجهر الإلكتروني بردّي الحرارة (cryo-EM)، حيث يتعلم درجة البيانات النظيفة للحفاظ بشكل أفضل على المعلومات الهيكلية وكبح ضجيج الخلفية، مما يؤدي إلى تحسين عمليات اختيار الجسيمات وإعادة البناء ثلاثي الأبعاد مقارنة بالطرق الحالية.

Xiaoqi Wu, Xueying Zhan, Wen Li, Junhao Wu, Xin Huang, Min Xu2026-04-21
💻 computer science

IncreFA: Breaking the Static Wall of Generative Model Attribution

يُعدّ IncreFA إطار عمل مبتكر يعيد تعريف عزو النماذج التوليدية كمسألة تعلم تراكمي مهيكلة من خلال الاستفادة من القيود الهيكلية الهرمية ومخزن ذاكرة كامن للتكيف باستمرار مع النماذج الناشئة، محققاً أداءً هو الأفضل في فئته ومعدلات كشف عالية للنماذج غير المرئية على مقياس IABench الجديد لعزو النماذج.

Haotian Qin, Dongliang Chang, Yueying Gao, Lei Chen, Zhanyu Ma2026-04-21
💻 computer science

Ego-InBetween: Generating Object State Transitions in Ego-Centric Videos

تقترح الورقة البحثية إطار عمل EgoIn، وهو إطار عمل مبتكر يقوم بتوليد إطارات وسيطة ذات دلالة دلالية وتماسك بصري تصور انتقالات حالة الأشياء في فيديوهات المنظور الشخصي (egocentric) من خلال الاستفادة من نموذج TransitionVLM مضبوط بدقة للقيام بالاستدلال متعدد الخطوات وآلية إشراف مساعدة مدركة للأجسام لضمان اتساق المظهر.

Mengmeng Ge, Takashi Isobe, Xu Jia, Yanan Sun, Zetong Yang, Weinong Wang, Dong Zhou, Dong Li, Huchuan Lu, Emad Barsoum2026-04-21
💻 computer science

Weakly-Supervised Referring Video Object Segmentation through Text Supervision

تقدم هذه الورقة البحثية WSRVOS، وهي طريقة جديدة لتقسيم الكائنات المرجعية في الفيديو تحت إشراف ضعيف، تلغي الحاجة إلى التسميات التوضيحية المكلفة على مستوى البكسل أو حتى الصناديق من خلال التدريب حصرياً على التعبيرات النصية عبر تعزيز التعبير التبايني، والتفاعل الميزاتي ثنائي الاتجاه، وقيود التصنيف الزمني لتوليد أقنعة وهمية عالية الجودة.

Miaojing Shi, Jun Huang, Zijie Yue, Hanli Wang2026-04-21
💻 computer science

PlankFormer: Robust Plankton Instance Segmentation via MAE-Pretrained Vision Transformers and Pseudo Community Image Generation

تقدم الورقة البحثية PlankFormer، وهو إطار عمل قوي لتجزئة مثيلات العوالق يجمع بين نماذج Vision Transformers المدربة مسبقاً باستخدام MAE مع استراتيجية مبتكرة لتوليد صور المجتمع الزائف (Pseudo Community Image) للتغلب على ندرة البيانات وتحسين الدقة في البيئات المزدحمة والمليئة بالحطام.

Masaharu Miyazaki, Yurie Otake, Koichi Ito, Wataru Makino, Jotaro Urabe, Takafumi Aoki2026-04-21