🤖 AI

Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models

تقدم هذه الورقة STEMO-Bench، وهو معيار مصمم لتقييم المراقبة المكانية والزمانية في نماذج اللغة الكبيرة للفيديو بصرامة من خلال تفكيك الاستعلامات إلى أسئلة فرعية، وتقترح STEMO-Track، وهو إطار عمل متمحور حول الكائنات يقلل بشكل كبير من الهلوسة ويحسن اتساق الاستدلال من خلال بناء المسار الصريح والتجميع الزمني.

Tri Cao, Khoi Le, Thong Nguyen, Cong-Duy Nguyen, Quynh Vo, Anh Tuan Luu, Chunyan Miao, See-Kiong Ng, Shuicheng Yan, Brya (…)2026-05-12
💻 computer science

LLaVA-UHD v4: What Makes Efficient Visual Encoding in MLLMs?

يقدم LLaVA-UHD v4 مخطط ترميز بصري عالي الدقة يجمع بين الترميز القائم على الشرائح والضغط المبكر داخل نموذج ViT لتقليل عمليات الحساب العائمة (FLOPs) للترميز البصري بنسبة 55.8% مع الحفاظ على أداء النماذج اللغوية الكبيرة متعددة الوسائط الحالية أو تجاوزه.

Kechen Fang, Yihua Qin, Chongyi Wang, Wenshuo Ma, Tianyu Yu, Yuan Yao2026-05-12
🤖 AI

CT-IDP: Segmentation-Derived Quantitative Phenotypes for Interpretable Abdominal CT Disease Classification

تقدم هذه الدراسة إطار العمل CT-IDP، وهو إطار عمل قابل للتفسير يستفيد من أكثر من 900 نمط ظاهري كمي مستمد من التجزئة من صور الأشعة المقطعية للبطن لتحقيق أداء فائق في تصنيف الأمراض مقارنة بنموذج "محول الرؤية" (vision-transformer) المرجعي عبر مجموعات بيانات متعددة من مؤسسات مختلفة.

Lavsen Dahal, Joseph Y. Lo2026-05-12
⚡ electrical engineering

Relightable Gaussian Splatting for Virtual Production Using Image-Based Illumination

تقترح هذه الورقة إطار عمل للإنتاج الافتراضي يستفيد من تقنية "Gaussian Splatting" وصور الخلفية المعروفة لتفكيك المشاهد ثلاثية الأبعاد إلى مكونات ذات مظهر ثابت وإضاءة متغيرة، مما يتيح إعادة إضاءة ودمجاً عالي الجودة وفعالاً دون الاعتماد على خرائط بيئية منخفضة الدقة أو رندرة معقدة قائمة على الفيزياء.

Adrian Azzarelli, Nantheera Anantrasirichai, James Pollock, David R. Bull2026-05-12
💻 computer science

SeasonScapes: Learning Large-scale Re-lightable 3D Landscapes with Seasonal Variation from Sparse Webcams

يقدم البحث SeasonScapes، وهو إطار عمل ومجموعة بيانات تعمل على إنشاء مناظر طبيعية جبلية ثلاثية الأبعاد واسعة النطاق وقابلة لإعادة الإضاءة مع تغيرات موسمية، وذلك عن طريق إسقاط أكثر من 85,000 صورة كاميرا ويب متفرقة على شبكة (mesh) واستخدام نماذج الانتشار الشرطية لملء الفجوات الناتجة عن الحجب.

Timo Kleger, Qi Ma, Deheng Zhang, Luc Van Gool, Danda Pani Paudel2026-05-12
💻 computer science

Automated Robotic Moisture Monitoring in Agricultural Fields

تقدم هذه الورقة نموذجاً أولياً لنظام آلي لمراقبة الرطوبة الزراعية يستخدم روبوتاً مجهزاً بمستشعرات ومعالجة صور للتنقل عبر حقل قائم على شبكة باستخدام خوارزمية ديكسترا وحساب إجمالي محتوى الرطوبة عند اكتشاف تربة جافة.

Senthil Palanisamy, Akila I. S2026-05-12
🤖 machine learning

Dependency-Aware Discrete Diffusion for Scene Graph Generation

تقدم هذه الورقة نموذج انتشار منفصل يعتمد على التبعية ومقيد هرمياً، يقوم بتوليد رسوم بيانية للمشاهد مهيكلة من اللغة الطبيعية عبر فصل البنية عن الدلالات، مما يؤدي إلى تحسين الدقة التركيبية في مهام توليد الصور اللاحقة مقارنة بالنماذج المرجعية الحالية لتحويل النص إلى صورة وتوليد الرسوم البيانية.

Rajalaxmi Rajagopalan, Romit Roy Choudhury2026-05-12
💻 computer science

Reducing Annotation Burden for Femoral Cartilage Segmentation in Knee MRI via Cross-Sequence Transfer Learning

تُظهر هذه الدراسة أن التعلم بنقل المعرفة عبر المتواليات بين تسلسلات DESS وCube MRI يمكن أن يقلل بشكل كبير من متطلبات التوسيم لتقسيم غضروف الفخذ، على الرغم من تباين مكاسب الأداء ومعدلات التقارب اعتماداً على اتجاه النقل ووجود آفات غضروفية.

Francesco Chiumento, Gianluigi Crimi, Elisa Moretta, Rocco Milieri, Alberto Bazzocchi, Giulio Vara, Giacomo Dal Fabbro (…)2026-05-12
🤖 AI

Field-Localized Forgery Detection for Digital Identity Documents

تقترح الورقة البحثية إطار عمل FLiD، وهو إطار عمل خفيف الوزن ومحدد المجال يكتشف التزوير في وثائق الهوية الرقمية من خلال استهداف مناطق محددة للوجه والنصوص، محققاً دقة فائقة وتكاليف حوسبة أقل بكثير مقارنة بكواشف التلاعب الحالية التي تعتمد على الوثيقة الكاملة أو الكواشف العامة.

Abhishek Kumar, Riya Tapwal, Carsten Maple, Mark Hooper2026-05-12
💻 computer science

Beyond Thinking: Imagining in 360^\circ for Humanoid Visual Search

تقترح هذه الورقة "التخيل بـ 360 درجة"، وهو إطار عمل مبتكر يفصل بين البحث البصري للروبوتات البشرية وبين "المتخيل" الاحتمالي و"المؤدي" لاستنتاج الأولويات المكانية الدلالية في خطوة واحدة، مما يلغي الحاجة إلى التوصيفات المكلفة على مستوى المسار مع تحسين كفاءة البحث ومعدلات النجاح بشكل كبير في البيئات المعقدة ذات زاوية 360 درجة.

Jingdong Zhang, Yizhou Wang, Zhengzhong Tu, Xin Li, Wenping Wang, Xiaohang Zhan2026-05-12