💻 computer science

ResAF-Net: An Anchor-Free Attention-Based Network for Tree Detection and Agricultural Mapping in Palestine

تقدم هذه الورقة ResAF-Net، وهو إطار عمل للتعلم العميق يعتمد على الانتباه وغير مرتبط بالمرتكزات (anchor-free)، يستفيد من صور الأقمار الصناعية ويتكامل مع البيانات العقارية المحلية لتمكين الكشف عن الأشجار والمراقبة الزراعية بشكل قابل للتوسع ودقيق في المناظر الطبيعية المحدودة الموارد والمجزأة في فلسطين.

Rabee Al-Qasem2026-04-28
💻 computer science

BVI-Mamba: Video Enhancement Using a Visual State-Space Model for Low-Light and Underwater Environments

تقدم هذه الورقة البحثية BVI-Mamba، وهو إطار عمل مبتكر لتحسين الفيديو يستفيد من نموذج الحالة البصرية (VSS) لمعالجة الضجيج، وانخفاض التباين، وعدم توازن الألوان في مقاطع الفيديو ذات الإضاءة المنخفضة وتحت الماء بكفاءة، مع تقليل الموارد الحسابية بشكل كبير مقارنة بالأساليب القائمة على المحولات (Transformer) والالتفاف (convolution).

Guoxi Huang, Ruirui Lin, Yini Li, David R. Bull, Nantheera Anantrasirichai2026-04-28
💻 computer science

Reading in the Dark: Low-light Scene Text Recognition

تقدم هذه الورقة البحثية LSTR، وهي مجموعة بيانات لتعرف النصوص في المشاهد ذات الإضاءة المنخفضة واسعة النطاق، وتقترح نهجاً جديداً للتدريب المشترك يتميز بوحدة تحسين صور إعادة التصيير للمشاهد ذات الإضاءة المنخفضة لمعالجة أوجه القصور في نماذج التعرف الضوئي على الحروف أو نماذج التحسين المستقلة في البيئات المظلمة.

Xuanshuo Fu, Lei Kang, Ernest Valveny, Dimosthenis Karatzas, Javier Vazquez-Corral2026-04-28
💻 computer science

Personalizing Causal Audio-Driven Facial Motion via Dynamic Multi-modal Retrieval

تقدم هذه الورقة إطار عمل سببي متكامل (end-to-end) للرسوم المتحركة للوجه المدفوعة بالصوت، والذي يحقق زمن انتقال فائق الانخفاض وتخصيصاً عالي الدقة من خلال الجمع بين تمثيل حركة هرمي زمني ومسترجع أسلوب متعدد الوسائط ديناميكي للقضاء على قيود الاستباق الصوتي وقيود الترميز المسبق.

Xuangeng Chu, Yu Han, Wei Mao, Shih-En Wei2026-04-28
💻 computer science

A Pose-only Geometric Constraint for Multi-Camera Pose Adjustment

تقترح هذه الورقة قيداً هندسياً يعتمد على الوضعية فقط وخوارزمية ضبط مقابلة لأنظمة الكاميرات المتعددة تعمل على استبعاد النقاط ثلاثية الأبعاد من عملية التحسين لتحقيق كفاءة حسابية فائقة مع الحفاظ على دقة تقدير الوضعية أو تحسينها.

Shunkun Liang, Banglei Guan, Bin Li, Qifeng Yu, Yang Shang2026-04-28
💻 computer science

Weakly Supervised Multicenter Nancy Index Scoring in Ulcerative Colitis Using Foundation Models

تقترح هذه الورقة إطار عمل للتعلم متعدد المثيلات تحت إشراف ضعيف يستفيد من النماذج التأسيسية، وتحديداً نموذج Virchow2، لتحقيق تسجيل قوي وقابل للتفسير لمؤشر نانسي متعدد المراكز لمرض التهاب القولون التقرحي باستخدام تسميات على مستوى الحالة فقط، مما يتغلب على الحاجة إلى التسمية المكلفة على مستوى المنطقة الكثيفة.

Adam Kukučka, Ondřej Fabián, Vít Musil, Tomáš Brázdil2026-04-28
💻 computer science

Zoom In, Reason Out: Efficient Far-field Anomaly Detection in Expressway Surveillance Videos via Focused VLM Reasoning Guided by Bayesian Inference

تقترح الورقة البحثية إطار عمل VIBES، وهو إطار عمل غير متزامن وفعال يجمع بين الاستدلال البايزي عبر الإنترنت لتحديد مواقع شذوذ المركبات في المجال البعيد ديناميكيًا مع استدلال نماذج الرؤية واللغة المستهدفة لتحقيق مراقبة للطرق السريعة عالية الدقة وقابلة للتفسير وفي الوقت الفعلي دون التكاليف الحسابية لمعالجة إطارات الفيديو العالمية.

Xiaowei Mao, Bowen Sui, Weijie Zhang, Yawen Yang, Shengnan Guo, Shilong Zhao, Jiaqi Lin, Tingrui Wu, Youfang Lin, Huaiyu (…)2026-04-28
💻 computer science

ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents

تقدم هذه الورقة ClawMark، وهو معيار مرجعي جديد مصمم لتقييم وكلاء الزملاء متعددي الأنماط، ومتعددي الأدوار، ومتعددي الأيام في بيئة ديناميكية وحالة مستمرة، مما يكشف أنه بينما تظهر النماذج الرائدة تقدماً جزئياً، إلا أنها تعاني بشكل كبير في التكيف مع التغييرات الخارجية وتحقيق نجاح كامل للمهام من البداية إلى النهاية.

Fanqing Meng, Lingxiao Du, Zijian Wu, Guanzheng Chen, Xiangyan Liu, Jiaqi Liao, Chonghe Jiang, Zhenglin Wan, Jiawei Gu (…)2026-04-28
💻 computer science

MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation

تقدم هذه الورقة MuSS، وهي مجموعة بيانات ثنائية المسار واسعة النطاق ومعيار للسرد السينمائي مصمم لتطوير توليد الفيديو من "موضوع إلى فيديو" متعدد اللقطات عبر معالجة التحديات في المنطق السردي، والمحاذاة الزمكانية، والحفاظ على الهوية من خلال خط إنتاج وصف تدريجي مبتكر ومقياس تباين "مضاد للنسخ واللصق".

Haojie Zhang, Di Wu, Bingyan Liu, Linjie Zhong, Yuancheng Wei, Xingsong Ye, Nanqing Liu, Yaling Liang2026-04-28
💻 computer science

Bringing a Personal Point of View: Evaluating Dynamic 3D Gaussian Splatting for Egocentric Scene Reconstruction

تقيم هذه الورقة نماذج "Gaussian Splatting" ثلاثية الأبعاد الديناميكية على فيديوهات منظور الشخص الأول باستخدام مجموعة بيانات "EgoExo4D"، كاشفةً أن جودة إعادة البناء أقل باستمرار مقارنة بمناظير المنظور الخارجي، ويرجع ذلك أساساً إلى صعوبات في رندرة المحتوى الثابت بدلاً من العناصر الديناميكية، مما يسلط الض {الضوء} على الحاجة إلى نهج مخصص لمنظور الشخص الأول.

Jan Warchocki, Xi Wang, Jonas Kulhanek, Jan van Gemert2026-04-28