💻 computer science

M3^3-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering

تقدم هذه الورقة البحثية M3^3-VQA، وهو معيار مرجعي مبتكر مصمم لتقييم النماذج اللغوية الكبيرة متعددة الوسائط في الفهم الدقيق للكيانات والاستدلال المعقد متعدد الخطوات من خلال مطالبتها بتوليف المعلومات من مصادر بصرية ونصية متعددة، مما يكشف عن قيود حالية كبيرة في اكتساب المعرفة ويسلط الضوء على تفوق طرق الاسترجاع المدركة للاستدلال.

Jiatong Ma, Longteng Guo, Yuchen Liu, Zijia Zhao, Dongze Hao, Xuanxu Lin, Jing Liu2026-04-29
💻 computer science

8DNA: 8D Neural Asset Light Transport by Distribution Learning

تقدم الورقة البحثية 8DNA، وهو تمثيل عصبي مبتكر يقوم بدمج تأثيرات انتقال الضوء ثمانية الأبعاد بالكامل في الأصول ثلاثية الأبعاد باستخدام صيغة تعلم التوزيع، مما يتيح رندرة عالية الدقة تحت إضاءة قريبة المدى مع تقليل تباين التدريب وسرعة الاستدلال مقارنة بالطرق السابقة سداسية الأبعاد.

Liwen Wu, Haolin Lu, Bing Xu, Miloš Hašan, Ravi Ramamoorthi2026-04-29
💻 computer science

Towards Seamless Lunar Mosaics: Deep Radiometric Normalization for Cross-Sensor Orbital Imagery Using Chandrayaan-2 TMC Data

تقدم هذه الورقة إطار عمل للتطبيع الإشعاعي القائم على التعلم العميق باستخدام شبكة خصومية توليدية شرطية (cGAN) للقضاء بفعالية على التناقضات وإنشاء صور فسيفسائية قمرية سلسة وعالية الدقة من صور مدارية متباينة من مهام متعددة، وبشكل أساسي من بيانات أداة التصوير الحراري لبعثة تشاندرايان-2 (TMC).

Pratincha Singh, Jai Gopal Singla, Prashant Hemrajani, Nitant Dube, Amithabh, Hinal Patel2026-04-29
💬 NLP

DRAGON: A Benchmark for Evidence-Grounded Visual Reasoning over Diagrams

تقدم الورقة البحثية DRAGON، وهي مجموعة بيانات معيارية وإطار تقييم مصمم لتقييم قدرة نماذج الرؤية واللغة على ربط إجاباتها بأدلة بصرية محددة داخل المخططات، مما يعالج قصور الدقة العالية دون تبرير استدلالي موثوق.

Anirudh Iyengar Kaniyar Narayana Iyengar, Tampu Ravi Kumar, Gaurav Najpande, Manan Suri, Dinesh Manocha, Puneet Mathur (…)2026-04-29
📊 statistics

VLM Judges Can Rank but Cannot Score: Task-Dependent Uncertainty in Multimodal Evaluation

تقدم هذه المساهمة إطار عمل للتنبؤ المطابق لقياس موثوقية أحكام نماذج الرؤية واللغة عبر تحويل التقديرات النقطية إلى فترات مُعايرة، وتُظهر أن عدم اليقين في التقييم يعتمد بشكل كبير على المهمة، وتكشف عن نمط فشل حرج يتمثل في "انفصال التصنيف عن التقييم"، حيث يمكن للنماذج ترتيب الاستجابات بشكل صحيح ولكنها تفشل في تقديم درجات مطلقة موثوقة.

Divake Kumar, Sina Tayebati, Devashri Naik, Ranganath Krishnan, Amit Ranjan Trivedi2026-04-29
💻 computer science

Combating Visual Neglect and Semantic Drift in Large Multimodal Models for Enhanced Cross-Modal Retrieval

تقترح هذه الورقة البحثية إطار عمل "التضمين متعدد الوسائط الواعي بالموضوع البارز" (SSA-ME)، وهو إطار مبتكر يعزز استرجاع المعلومات عبر الوسائط من خلال معالجة الإهمال البصري والانجراف الدلالي عبر النمذجة الواعية بالبروز وإعادة توليد الميزات، وذلك لتعزيز محاذاة النص مع المناطق البصرية ذات المعنى الدلالي بشكل أفضل.

Guosheng Zhang, Linkai Liu, Keyao Wang, Haixiao Yue, Zhiwen Tan, Xiao Tan2026-04-29
💻 computer science

OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding

تقدم الورقة البحثية OmniVTG، وهي مجموعة بيانات ضخمة لتحديد زمن الفيديو في العالم المفتوح تم إنشاؤها عبر عملية توسيع التغطية الدلالية وسلسلة تعليقات توضيحية متمحورة حول الوصف، إلى جانب نموذج تدريب يعتمد على "سلسلة أفكار التصحيح الذاتي" يستفيد من قدرات الفهم المتفوقة للنماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) لتحسين التنبؤات، محققاً أداءً هو الأفضل حالياً على هذه المجموعة الجديدة والمنصات المرجعية القائمة.

Minghang Zheng, Zihao Yin, Yi Yang, Yuxin Peng, Yang Liu2026-04-29
💻 computer science

The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents

تقترح هذه الورقة إطار عمل لخليط خبراء متناثر وتكراري مدمج في نماذج الانتشار، يستخدم شبكة بوابية لتنقيح الرموز المرئية بشكل تكراري، مما يعزز قدرات الاستدلال الهيكلي واتباع النصوص في توليد الصور متعدد الوسائط.

Yuwei Sun, Yuxuan Yao, Hui Li, Siyu Zhu2026-04-29
💻 computer science

Towards Robust Deep Learning-based Rumex Obtusifolius Detection from Drone Images

تتناول هذه الورقة تحدي اكتشاف نبات *Rumex obtusifolius* عبر نطاقات بيانات مختلفة من خلال إثبات أنه في حين تعاني الشبكات العصبية التلافيفية (CNNs) التقليدية من صعوبة في التعامل مع التحولات بين نطاقات الصور الأرضية وصور الطائرات بدون طيار، فإن نماذج المحولات الرؤيوية (ViTs) ذات التعلم الذاتي تحقق متانة وأداءً فائقين، وهو ما يدعمه إصدار مجموعة بيانات جديدة تعتمد على الطائرات بدون طيار تسمى AGSMultiRumex.

Fabian Dionys Schrag, Mehmet Ozgur Turkoglu, Konrad Schindler, Ralph Lukas Stoop2026-04-29
💻 computer science

Benchmarking Layout-Guided Diffusion Models through Unified Semantic-Spatial Evaluation in Closed and Open Settings

تقدم هذه الورقة إطار تقييم موحد يتألف من معايير اختبار للمجموعات المغلقة (C-Bench) والمجموعات المفتوحة (O-Bench) لتقييم المحاذاة الدلالية والمكانية لنماذج انتشار توليد الصور من النصوص الموجهة بالتخطيط بشكل شامل، مما يسهل مقارنة واسعة النطاق لستة نهج رائدة من خلال بروتوكول تسجيل جديد.

Luca Parolari, Nicla Faccioli, Lamberto Ballan2026-04-29