🔬 physics

Global monitoring of methane point sources using deep learning on hyperspectral radiance measurements from EMIT

تقدم الورقة البحثية نموذج MAPL-EMIT، وهو نموذج محول رؤية (vision transformer) متكامل من طرف إلى طرف يستفيد من بيانات EMIT فائقة الطيف كاملة الطيف لأتمتة الكشف عالي الإنتاجية، والتقدير الكمي، وتحديد المواقع لمصادر الميثان النقطية العالمية بحساسية وقابلية للتوسع أكبر بكثير مقارنة بالنهج اليدوية أو نهج المرشح المطابق الحالية.

Vishal V. Batchu, Michelangelo Conserva, Alex Wilson, Anna M. Michalak, Varun Gulshan, Philip G. Brodrick, Andrew K. Tho (…)2026-04-14
🤖 AI

VGA-Bench: A Unified Benchmark and Multi-Model Framework for Video Aesthetics and Generation Quality Evaluation

تقدم هذه الورقة VGA-Bench، وهو معيار موحد وإطار عمل متعدد النماذج مصمم لتقييم كل من جودة التوليد التقني والجاذبية الجمالية لفيديوهات الذكاء الاصطناً التوليدي (AIGC) بشكل شامل من خلال تصنيف ثلاثي المستويات، ومجموعة بيانات واسعة النطاق تضم 60,000 فيديو، ومقيمين عصبيين مخصصين يتوافقون وثيقاً مع الأحكام البشرية.

Longteng Jiang, DanDan Zheng, Qianqian Qiao, Heng Huang, Huaye Wang, Yihang Bo, Bao Peng, Jingdong Chen, Jun Zhou, Xin J (…)2026-04-14
🤖 AI

Semantic Manipulation Localization

تقدم هذه الورقة البحثية "تحديد موقع التلاعب الدلالي" (SML)، وهي مهمة ومعيار مرجعي جديدان للكشف عن تعديلات الصور الدقيقة التي تغير المعنى وتتجنب الطرق التقليدية القائمة على كشف الآثار، وتقترح إطار عمل "TRACE"، الذي يستفيد من الارتكاز الدلالي، واستشعار الاضطراب، والاستدلال المقيد لتحقيق تحديد موقع متفوق لمثل هذه التلاعبات الدلالية.

Zhenshan Tan, Chenhan Lu, Yuxiang Huang, Ziwen He, Xiang Zhang, Yuzhe Sha, Xianyi Chen, Tianrun Chen, Zhangjie Fu2026-04-14
🤖 AI

Edu-MMBias: A Three-Tier Multimodal Benchmark for Auditing Social Bias in Vision-Language Models under Educational Contexts

تقدم الورقة البحثية Edu-MMBias، وهو معيار تقييم متعدد الوسائط ثلاثي المستويات يرتكز على علم النفس الاجتماعي لتدقيق نماذج الرؤية واللغة في السياقات التعليمية، كاشفةً أن المدخلات البصرية يمكن أن تتجاوز محاذاة السلامة القائمة على النصوص لتنشيط الصور النمطية العرقية والصحية المتجذرة، مع إظهار تحيزات طبقية تعويضية غير متوقعة.

Ruijia Li, Mingzi Zhang, Zengyi Yu, Yuang Wei, Bo Jiang2026-04-14
🤖 AI

Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis

تقترح هذه الورقة طريقة لتكييف النماذج اللغوية الكبيرة متعددة الوسائط ثنائية الأبعاد لتحليل صور الأشعة المقطعية ثلاثية الأبعاد من خلال إعادة استخدام المعلمات المدربة مسبقاً وتقديم إطار عمل "خليط الخبراء" (MoE) هرمي موجه بالنص مع استراتيجية تدريب ثنائية المراحل للتعامل بفعالية مع المهام الطبية ثلاثية الأبعاد مثل توليد التقارير والإجابة على الأسئلة البصرية.

Yang Yu, Dunyuan Xu, Yaoqian Li, Xiaomeng Li, Jinpeng Li, Pheng-Ann Heng2026-04-14
🤖 AI

FashionMV: Product-Level Composed Image Retrieval with Multi-View Fashion Data

تقدم هذه الورقة البحثية FashionMV، وهي أول مجموعة بيانات للأزياء متعددة المشاهد واسعة النطاق، وProCIR، وهو إطار عمل متعدد الوسائط يعالج مشكلة "عدم اكتمال المشهد" في أنظمة استرجاع الصور المركبة الحالية من خلال تمكين الاسترجاء على مستوى المنتج عبر آليات مثل الحوار ثنائي المراحل والمحاذاة القائمة على الوصف.

Peng Yuan, Bingyin Mei, Hui Zhang2026-04-14
🤖 AI

Class-Adaptive Cooperative Perception for Multi-Class LiDAR-based 3D Object Detection in V2X Systems

تقترح هذه الورقة بنية إدراك تعاوني متكيفة مع الفئات لأنظمة الاتصال بين المركبة وكل شيء (V2X)، تستخدم مسارات دمج خاصة بكل فئة وانتباه متعدد المقاييس للتغلب على قيود استراتيجيات الدمج الموحدة، مما يؤدي إلى تحسين أداء كشف الأجسام ثلاثية الأبعاد متعددة الفئات بشكل كبير عبر سيناريوهات متنوعة للاتصال بين المركبة وكل شيء.

Blessing Agyei Kyem, Joshua Kofi Asamoah, Armstrong Aboah2026-04-14
🤖 AI

Zero-shot World Models Are Developmentally Efficient Learners

تقدم هذه الورقة نموذج العالم البصري صفري المعرفة (ZWM)، وهو إطار حوسبي مبتكر قائم على التنبؤ المتناثر، والاستدلال السببي صفري المعرفة، والاستدلال التركيبي، والذي يتيح التعلم الفعال من تجربة طفل واحدة من منظور الشخص الأول لتحقيق فهم فيزيائي قوي واستعادة السمات النمائية بسرعة.

Khai Loong Aw, Klemen Kotar, Wanhee Lee, Seungwoo Kim, Khaled Jedoui, Rahul Venkatesh, Lilian Naing Chen, Michael C. Fra (…)2026-04-14
🤖 AI

FishRoPE: Projective Rotary Position Embeddings for Omnidirectional Visual Perception

تُعد FishRoPE إطار عمل خفيف الوزن يعمل على تكييف نماذج الرؤية التأسيسية المجمدة مع كاميرات عين السمكة من خلال تقديم تضمين موضعي دوار قائم على الإحداثيات الكروية وتكيف منخفض الرتبة، مما يتيح إدراكاً فائقاً في جميع الاتجاهات دون الحاجة إلى تسميات توضيحية واسعة النطاق لعين السمكة أو إعادة تدريب النموذج بالكامل.

Rahul Ahuja, Mudit Jain, Bala Murali Manoghar Sai Sudhakar, Venkatraman Narayanan, Pratik Likhar, Varun Ravi Kumar, Sent (…)2026-04-14
🤖 AI

Rethinking Video Human-Object Interaction: Set Prediction over Time for Unified Detection and Anticipation

تقدم الورقة البحثية HOI-DA، وهو إطار عمل موحد يقوم بشكل مشترك بعمليات كشف التفاعل بين الإنسان والأشياء وتوقع التفاعلات المستقبلية من خلال نمذجة الحالات المستقبلية كتحولات متبقية، إلى جانب معيار DETAnt-HOI الذي يصحح عدم المحاذاة الزمنية في مجموعات البيانات الحالية لتمكين تقييم أكثر موثوقية متعدد الآفاق.

Yuanhao Luo, Di Wen, Kunyu Peng, Ruiping Liu, Junwei Zheng, Yufan Chen, Jiale Wei, Rainer Stiefelhage2026-04-14