💻 computer science

Can Image Splicing and Copy-Move Forgery Be Detected by the Same Model? Forensim: An Attention-Based State-Space Approach

يُعد Forensim إطار عمل فضاء الحالة القائم على الانتباه، والذي يحقق أداءً رائدًا في كشف تزييفات اللصق ونقل النسخ من خلال تحديد مناطق الهدف المتلاعب بها ومناطق المصدر المقابلة لها بشكل مشترك عبر نهج قناع موحد ثلاثي الفئات.

Soumyaroop Nandi, Prem Natarajan2026-02-11
💻 computer science

VideoWorld 2: Learning Transferable Knowledge from Real-world Videos

يقدم VideoWorld 2 نموذج ديناميكيات كامنة معززاً بالديناميكيات (dLDM) يعمل على فصل ديناميكيات الحركة عن المظهر البصري لتعلم معرفة قابلة للنقل ومرتبطة بالمهام مباشرة من فيديوهات واقعية خام، مما يحسن الأداء بشكل كبير في المهام اليدوية المعقدة والتحكم الروبوتي.

Zhongwei Ren, Yunchao Wei, Xiao Yu, Guixun Luo, Yao Zhao, Bingyi Kang, Jiashi Feng, Xiaojie Jin2026-02-11
💻 computer science

Winner Team Mia at TextVQA Challenge 2021: Vision-and-Language Representation Learning with Pre-trained Sequence-to-Sequence Model

فاز فريق "ميا" (Mia) بتحدي TextVQA لعام 2021 من خلال الضبط الدقيق لنموذج توليدي مسبق التدريب من نوع T5-3B باستخدام مهام تدريب مسبق متخصصة — وهي نمذجة اللغة المقنعة وتنبؤ الموضع النسبي — لمحاذاة الميزات متعددة الوسائط بفعالية للقراءة والاستدلال حول النصوص في الصور.

Yixuan Qiao, Hao Chen, Jun Wang, Shanshan Zhao, Yihao Chen, Xianbin Ye, Ziliang Li, Xianbiao Qi, Peng Gao, Guotong Xie2026-02-10
💬 NLP

Cross-Modal Retrieval for Motion and Text via DropTriple Loss

لمعالجة الفجوة في استرجاع البيانات عبر الوسائط بين الحركة البشرية والنص، تقترح هذه الورقة مشفر ترانسفورمر ثنائي الأحادية مقترناً بـ "فقدان DropTriple" المبتكر الذي يحسن الأداء من خلال تصفية العينات السلبية الزائفة للتركيز على استخراج السلبيات الصعبة حقاً.

Sheng Yan, Yang Liu, Haoqiang Wang, Xin Du, Mengyuan Liu, Hong Liu2026-02-10
💻 computer science

Fast Image-based Neural Relighting with Translucency-Reflection Modeling

تقدم هذه الورقة نموذجاً سريعاً لإعادة البناء وإعادة الإضاءة ثلاثية الأبعاد عصبياً، يوسع التمثيلات الحجمية الضمنية للتعامل بكفاءة مع تأثيرات انتقال الضوء المعقدة، مثل الشفافية والانعكاسات اللامعة، باستخدام الإضاءة القائمة على الصور.

Shizhan Zhu, Shunsuke Saito, Aljaz Bozic, Carlos Aliaga, Trevor Darrell, Christoph Lassner2026-02-10
🤖 AI

Cognitive Edge Device (CED) for Real-Time Environmental Monitoring in Aquatic Ecosystems

تقدم هذه الورقة منصة الحوسبة الطرفية المعرفية (CED) ومجموعتي بيانات جديدتين تحت الماء لتسهيل الكشف في الوقت الفعلي عن جراد البحر الغازي والحطام البلاستيكي باستخدام نماذج كشف الأشياء القائمة على YOLO.

Dennis Monari, Farhad Fassihi Tash, Jordan J. Bird, Ahmad Lotfi, Isibor Kennedy Ihianle, Salisu Wada Yahaya, Isibor Kenn (…)2026-02-10
💻 computer science

Robust Hyperbolic Learning with Curvature-Aware Optimization

تقترح هذه الورقة إطار عمل للتحسين مدركاً للانحناء، يتميز باشتقاق جديد لـ AdamW ريماني (Riemannian AdamW) ونهج قياس قابل للضبط الدقيق، لتحسين الاستقرار، والتعميم، والكفاءة الحسابية للتعلم العميق الزائدي عبر مهام متنوعة.

Ahmad Bdeir, Johannes Burchert, Lars Schmidt-Thieme, Niels Landwehr2026-02-10
🤖 AI

Comprehensive Performance Evaluation of YOLOv12, YOLO11, YOLOv10, YOLOv9 and YOLOv8 on Detecting and Counting Fruitlet in Complex Orchard Environments

تقدم هذه الدراسة تقييماً مقارناً شاملاً لنماذج YOLOv8 وصولاً إلى YOLOv12 للكشف عن الثمار الخضراء غير الناضجة وعدّها في بيئات البساتين المعقدة، حيث وجدت أن نماذج YOLOv9 وYOLOv12 توفر دقة كشف عالية، بينما يوفر نموذج YOLO11n أفضل توازن بين دقة العد وسرعة الاستدلال في الوقت الفعلي.

Ranjan Sapkota, Zhichao Meng, Martin Churuvija, Xiaoqiang Du, Zenghong Ma, Manoj Karkee2026-02-10
⚡ electrical engineering

FCDM: A Physics-Guided Bidirectional Frequency Aware Convolution and Diffusion-Based Model for Sinogram Inpainting

يُعد FCDM إطار عمل انتشار موجّه بالفيزياء لإكمال بيانات السينوجرام، حيث يستخدم الاستدلال الترددي ثنائي الاتجاه والتقنيات القائمة على القناع الواعي بالزوايا للتغلب على قيود الطرق التقليدية الموجهة نحو RGB في الحفاظ على البنية العالمية والاتساق الفيزيائي لبيانات التصوير المقطعي المحوسب منخفض المشاهد.

Jiaze E, Srutarshi Banerjee, Tekin Bicer, Guannan Wang, Yanfu Zhang, Bin Ren2026-02-10
🤖 AI

AgentDrug: Utilizing Large Language Models in An Agentic Workflow for Zero-Shot Molecular Editing

يُعد AgentDrug سير عمل وكيلِيّاً يستخدم حلقة تحسين متداخلة —تجمع بين التحقق الكيميائي المعلوماتي والتغذية الراجعة القائمة على التدرج— لتحسين دقة التحرير الجزيئي بنمط الصفر (zero-shot) باستخدام النماذج اللغوية الكبيرة بشكل كبير.

Khiem Le, Ting Hua, Nitesh V. Chawla2026-02-10