💻 computer science

Geometric Context Transformer for Streaming 3D Reconstruction

تقدم الورقة البحثية LingBot-Map، وهو نموذج تأسيسي ثلاثي الأبعاد ذو تغذية أمامية يتميز بمحول سياق هندسي مع آليات انتباه متخصصة لتأريض الإحداثيات، والإشارات الكثيفة، وتصحيح الانجراف، والذي يحقق أداءً فائقاً في إعادة البناء ثلاثي الأبعاد المتدفق مع اتساق زمني وكفاءة عالية عند حوالي 20 إطاراً في الثانية.

Lin-Zhuo Chen, Jian Gao, Yihang Chen, Ka Leong Cheng, Yipengjing Sun, Liangxiao Hu, Nan Xue, Xing Zhu, Yujun Shen, Yao Y (…)2026-04-16
💬 NLP

SpatialEvo: Self-Evolving Spatial Intelligence via Deterministic Geometric Environments

إن SpatialEvo هو إطار عمل ذاتي التطور للاستدلال المكاني ثلاثي الأبعاد يستفيد من البيئات الهندسية الحتمية لتوليد حقائق أرضية خالية من الضجيج من مشاهد غير مصنفة، مما يُمكّن سياسة مشتركة بين السائل والمحلل تتطور ديناميكيًا من خلال التغذية الراجعة الفيزيائية الموضوعية بدلاً من الإجماع النمذجي المعرض للخطأ.

Dinging Li, Yingxiu Zhao, Xinrui Cheng, Kangheng Lin, Hongbo Peng, Hongxing Li, Zixuan Wang, Yuhong Dai, Haodong Li, Jia (…)2026-04-16
💻 computer science

One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding

تقدم هذه الورقة البحثية \name، وهو إطار عمل لضغط الفيديو الفائق يجمع بين الضغط القابل للتعلم على مستوى الرموز (token-level) والضغط المشروط بالأسئلة على مستوى الإطارات (frame-level) مع آليات الانتباه المحلي لتمكين نماذج الرؤية واللغة من معالجة عدد أكبر بكثير من الإطارات مع تحسين الدقة مع استخدام الحد الأدنى من بيانات الضبط الدقيق الخاضعة للإشراف.

Zheyu Zhang, Ziqi Pang, Shixing Chen, Xiang Hao, Vimal Bhat, Yu-Xiong Wang2026-04-16
🤖 AI

Label Dropout: Improved Deep Learning Echocardiography Segmentation Using Multiple Datasets With Domain Shift and Partial Labelling

تقترح هذه الورقة مخطط "إسقاط التسمية" (label dropout) مبتكرًا لمنع التعلم المختصر الناتج عن تحولات النطاق والتسمية الجزئية في تقسيم صور صدى القلب متعددة المجموعات، مما يحسن بشكل كبير من متانة النموذج ودرجات "دايس" (Dice scores) مقارنة بالتدريب الساذج باستخدام دالات الفقد المعدلة.

Iman Islam, Esther Puyol-Antón, Bram Ruijsink, Andrew J. Reader, Andrew P. King2026-04-15
💻 computer science

GaNI: Global and Near Field Illumination Aware Neural Inverse Rendering

تقدم الورقة البحثية GaNI، وهو إطار عمل عصبي للرندرة العكسية ثنائي المراحل يعيد بناء الهندسة، والوضاءة (albedo)، والخشونة من صور الضوء والكاميرا المتزامنة عبر تقديم تقنيات محددة للتعامل مع الإضاءة القريبة من المجال، والانعكاسات المرآتية القوية، ومصادر الضوء المتحركة في المشاهد متعددة الأجسام.

Jiaye Wu, Saeed Hadadan, Geng Lin, Matthias Zwicker, David Jacobs, Roni Sengupta2026-04-15
💻 computer science

Uncertainty-Based Ensemble Learning in CMR Semantic Segmentation

تقترح هذه الورقة إطار عمل لتعلم التجميع القائم على عدم اليقين يسمى "Streaming"، والذي يستفيد من تباين التجزئة لوزن المصنفات ويقدم مقياس "معامل النهاية" (End Coefficient)، محققاً أداءً عاماً هو الأفضل في فئته مع تحسين دقة تجزئة الرنين المغناطيسي للقلب بشكل كبير عند شرائح النهايات الصعبة في مجموعتي بيانات ACDC وM&Ms.

Yiwei Liu, Liang Zhong, Lingyi Wen, Yuankai Wu2026-04-15
💻 computer science

Intelligent bear deterrence system based on computer vision: Reducing human-bear conflicts in remote areas

تقدم هذه الورقة نظاماً ذكياً منخفض استهلاك الطاقة ومستقلاً عن الشبكة يجمع بين الرؤية الحاسوبية YOLOv5-MobileNet ورذاذ الدببة الذي يعمل بالطاقة الشمسية للتخفيف بفعالية واستدامة من الصراعات بين البشر والدببة في هضبة التبت، محققاً دقة كشف عالية وردعاً ميدانياً ناجحاً دون إنذارات كاذبة.

Pengyu Chen, Teng Fei, John A. Kupfer, Yunyan Du, Jiawei Yi, Yi Li2026-04-15
💻 computer science

Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation

تقدم هذه الورقة البحثية FG-BMK، وهو معيار مرجعي شامل يتكون من 1.01 مليون سؤال و0.33 مليون صورة، لتقييم قدرات فهم الصور دقيقة التفاصيل لاثني عشر نموذجاً من نماذج الرؤية واللغة الكبيرة بشكل منهجي، مما يكشف عن قيود حرجة في التعرف الدلالي والتمثيل الميزاتي مع تقديم توجيهات لتطوير النماذج في المستقبل.

Hong-Tao Yu, Yuxin Peng, Serge Belongie, Xiu-Shen Wei2026-04-15
📊 statistics

Variational Autoencoding Discrete Diffusion with Enhanced Dimensional Correlations Modeling

تقدم هذه الورقة البحثية نموذج التشفير التلقائي المتغير للانتشار المنفصل (VADD)، وهو إطار عمل مبتكر يعزز نماذج الانتشار المقنع من خلال دمج نمذجة المتغيرات الكامنة لالتقاط الارتباطات بين الأبعاد، مما يحسن جودة العينات بشكل كبير مع عدد قليل من خطوات إزالة الضجيج عبر مهام توليد الصور والنصوص.

Tianyu Xie, Shuchen Xue, Zijin Feng, Tianyang Hu, Jiacheng Sun, Zhenguo Li, Cheng Zhang2026-04-15
💻 computer science

Navigating the Accuracy-Size Trade-Off with Flexible Model Merging

تقدم هذه الورقة البحثية FlexMerge، وهو إطار عمل جديد يعتمد على عدم استخدام البيانات لتوحيد خوارزميات دمج متعددة لتوليد نماذج ذات أحجام متفاوتة بمرونة، مما يكشف أن النماذج المدمجة الأكبر حجمًا بشكل متواضع تحسن الدقة بشكل ملحوظ، وأن ترتيب أداء الخوارزميات يتغير مع زيادة حجم النموذج، مما يؤسس بُعدًا تصميميًا جديدًا للتنقل في المفاضلة بين الدقة والحجم.

Akash Dhasade, Divyansh Jhunjhunwala, Milos Vujasinovic, Gauri Joshi, Anne-Marie Kermarrec2026-04-15