💻 computer science

ABRA: Agent Benchmark for Radiology Applications

تقدم الورقة البحثية ABRA، وهو معيار مرجعي جديد لوكلاء الأشعة، يضم 655 مهمة تم إنشاؤها برمجياً ضمن بيئة DICOM واقعية، والتي تكشف عن قدرات النماذج الحالية القوية في تنسيق الأدوات ولكنها تظهر أيضاً قصوراً كبيراً في الإدراك الصوري الطبي وتحديد مواقع النتائج.

Bulat Maksudov, Vladislav Kurenkov, Kathleen M. Curran, Alessandra Mileo2026-05-13
💻 computer science

Can Graphs Help Vision SSMs See Better?

تقدم الورقة البحثية GraphScan، وهو عامل مسح ديناميكي مستحث بالرسم البياني يعزز نماذج حالة الفضاء الرؤيوي عبر استبدال التسلسل الهندسي بالتوجيه الدلالي المشروط بالميزات، محققاً أداءً هو الأفضل في فئته عبر مختلف المهام الرؤيوية مع الحفاظ على التوسع الحسابي الخطي.

Dhruv Parikh, Anvitha Ramachandran, Haoyang Fan, Mustafa Munir, Rajgopal Kannan, Viktor Prasanna2026-05-13
🤖 AI

LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer?

تقدم الورقة البحثية LatentRouter، وهو إطار عمل مبتكر يحسن عملية اختيار النماذج متعددة الوسائط من خلال صياغة التوجيه كأداة للتنبؤ بالمنفعة المضادة للواقع، حيث تتواصل الكبسولات المتعلمة ورموز قدرة النموذج في تواصل كامن لتقدير ومطابقة نقاط القوة المحددة للنماذج المرشحة مع مدخلات الصور والأسئلة، مما يتفوق على النماذج المرجعية الحالية في كل من الأداء وكفاءة التكلفة.

Xueqi Cheng, Yushun Dong2026-05-13
💻 computer science

Vision2Code: A Multi-Domain Benchmark for Evaluating Image-to-Code Generation

تقدم الورقة البحثية Vision2Code، وهو معيار وإطار تقييم متعدد المجالات وخالٍ من الكود المرجعي، يقيم توليد الكود من الصور عبر رندرة مخرجات النماذج وتقييمها باستخدام معايير محددة لكل مجال، مما يكشف عن فجوات كبيرة في الأداء في المجالات البصرية المكانية والمعقدة، بينما يثبت أن المخرجات المفلترة يمكن أن تحسن تدريب النماذج بشكل فعال.

Ajay Vikram Periasami, Junlin Wang, Bhuwan Dhingra2026-05-13
📊 statistics

Couple to Control: Joint Initial Noise Design in Diffusion Models

تقترح هذه الورقة إطار عمل لتصميم اقترانات ضوضاء أولية مشتركة في نماذج الانتشار، حيث تُظهر أن إدخال تبعيات محكومة بين العينات — مثل الاقترانات التنافرية أو اقترانات الفضاء الجزئي — يعزز تنوع الدفعات ويُمكّن من مهام التوليد المهيكلة مثل إنشاء خلفيات لأجسام ثابتة دون المساس بمطابقة المطالبة، أو جودة الصورة، أو كفاءة أخذ العينات.

Jing Jia, Liyue Shen, Guanyang Wang2026-05-13
🤖 machine learning

Gradient-Free Noise Optimization for Reward Alignment in Generative Models

تقدم هذه الورقة البحثية ZeNO، وهو إطار عمل خالٍ من التدرج (gradient-free) يعمل على تحسين الضجيج في النماذج التوليدية عبر صياغته كمسألة تحكم بالتكامل المساري (path-integral control)، مما يتيح محاذاة فعالة للمكافأة لكل من المولدات العشوائية والحتمية دون الحاجة إلى الانتشار العكسي (backpropagation).

Jeongsol Kim, Hongeun Kim, Jian Wang, Jong Chul Ye2026-05-13
💻 computer science

VidSplat: Gaussian Splatting Reconstruction with Geometry-Guided Video Diffusion Priors

إن VidSplat هو إطار عمل توليدي لا يتطلب تدريباً يستفيد من مسبقات الانتشار بالفيديو لتوليد مناظر جديدة بشكل تكراري وتوجيه عملية إزالة الضجيج الواعية بالهندسة، مما يتيح إعادة بناء مشهد ثلاثي الأبعاد بشكل قوي من مدخلات شحيحة أو حتى من صورة واحدة.

Jimin Tang, Wenyuan Zhang, Junsheng Zhou, Zian Huang, Kanle Shi, Shenkun Xu, Yu-Shen Liu, Zhizhong Han2026-05-13
💻 computer science

PD-4DGS:Progressive Decomposition of 4D Gaussian Splatting for Bandwidth-Adaptive Dynamic Scene Streaming

يقدم PD-4DGS أول إطار عمل للبث التدريجي لتقنية Gaussian Splatting رباعية الأبعاد المتكيفة مع عرض النطاق الترددي عبر تفكيك المشاهد الديناميكية إلى طبقات هرمية قابلة للنقل بشكل مستقل، مما يقلل بشكل جذري من زمن الاستجابة الأولي وحجم تدفق البيانات مع تمكين الرندرة عند الطلب عبر شبكات الهاتف المحمول.

Jiachen Li, Guangzhi Han, Jin Wan, Delong Han, Yuan Gao, Min Li, Mingle Zhou, Gang Li2026-05-13
🤖 AI

Diabetic Retinopathy Classification using Downscaling Algorithms and Deep Learning

تقترح هذه الورقة نهجاً مبتكراً لتصنيف اعتلال الشبكية السكري إلى خمس مراحل من حيث الشدة عبر الجمع بين مجموعات بيانات "كاجل" (Kaggle) والمجموعات الهندية، وتطبيق خوارزميات تقليل الحجم لمعالجة تباين أحجام الصور، واستخدام بنية "إنسبشن في 3" (Inception V3) متعددة القنوات مخصصة مع معالجة مسبقة فريدة لتحقيق دقة ونوعية وحساسية رائدة.

Nishi Doshi, Urvi Oza, Pankaj Kumar2026-05-13
💻 computer science

Leveraging Multimodal Large Language Models for All-in-One Image Restoration via a Mixture of Frequency Experts

تقترح هذه الورقة إطار عمل مبتكر لترميم الصور بتوجيه من النماذج اللغوية الكبيرة متعددة الوسائط (MLLM)، والذي يستخدم ميزات مستمدة من هذه النماذج ووحدة خليط من خبراء التردد (MoFE) مع محاذاة علاقاتية للتعامل بفعالية مع التدهورات المستمرة والمركبة، محققةً أداءً هو الأفضل في فئته على معايير قياسية مثل CDD11.

Eunho Lee, Youngbae Hwang, Rei Kawakami2026-05-13