💻 computer science

MoonSeg3R: Monocular Online Zero-Shot Segment Anything in 3D with Reconstructive Foundation Priors

يُعد MoonSeg3R إطار عمل مبتكرًا يحقق تجزئة فورية للأجسام ثلاثية الأبعاد أحادية العدسة بنمط الصفر (zero-shot) عبر الإنترنت من خلال الاستفيد من نموذج إعادة البناء التأسيسي CUT3R لتوليد الأولويات الهندسية، وإدخال وحدة تحسين الاستعلام ذاتية الإشراف، والذاكرة الزمنية، ورموز توزيع الحالة للتغلب على قيود المنهجيات الحالية المعتمدة على خرائط العمق (RGB-D).

Zhipeng Du, Duolikun Danier, Jan Eric Lenssen, Hakan Bilen2026-04-22
🤖 AI

ViDoRe V3: A Comprehensive Evaluation of Retrieval Augmented Generation in Complex Real-World Scenarios

تقدم هذه الورقة ViDoRe v3، وهو معيار متعدد الوسائط شامل يتكون من 10 مجموعات بيانات متنوعة و3,099 استعلاماً تم التحقق منها بشرياً عبر 6 لغات، صُمم لتقييم أنظمة التوليد المعزز بالاسترجاع على مستندات واقعية معقدة وغنية بصرياً مع تسليط الضوء على القيود الحالية في التأسيس البصري والتركيب متعدد المستندات.

António Loison, Quentin Macé, Antoine Edy, Victor Xing, Tom Balough, Gabriel Moreira, Bo Liu, Manuel Faysse, Céline Hude (…)2026-04-22
💻 computer science

SAMannot: A Memory-Efficient, Local, Open-source Framework for Interactive Video Instance Segmentation based on SAM2

يُعد SAMannot إطار عمل مفتوح المصدر، محلي، ويحافظ على الخصوصية، يدمج نسخة محسنة من SAM2 مع سير عمل يعتمد على التدخل البشري لتمكين تقسيم مثيل الفيديو التفاعلي والفعال لإنشاء مجموعات البيانات ذات الدرجة البحثية.

Gergely Dinya, András Gelencsér, Krisztina Kupán, Clemens Küpper, Kristóf Karacs, Anna Gelencsér-Horváth2026-04-22
💻 computer science

Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models

تقدم هذه الورقة البحثية Q-Mask، وهو إطار عمل جديد للتعرف الضوئي على الحروف (OCR) يستخدم مفكك قناع مدفوع باستعلام سببي لربط النص صراحةً بالمناطق المكانية قبل عملية التعرف، مدعوماً بمعيار TextAnchor-Bench ومجموعة بيانات TextAnchor-26M واسعة النطاق لتحسين قدرات تثبيت النص في نماذج الرؤية واللغة بشكل كبير.

Longwei Xu, Feng Feng, Shaojie Zhang, Xin Chen, Hang Li, Anan Du, Hailong Yu, Pei Fu, Zhenbo Luo, Jian Luan2026-04-22
🤖 AI

Geometry-Aware CLIP Retrieval via Local Cross-Modal Alignment and Steering

تقترح هذه الورقة إطار عمل لاسترجاع CLIP مدرك للهندسة يعزز الأداء في مهام ربط الصفات والتركيب من خلال معالجة عدم الاتساق الهندسي المحلي عبر التوجيه المحلي المشروط بالاستعلام وإعادة الترتيب على مستوى الجوار عبر مطابقة هانغاريان، وكل ذلك يمكن تحقيقه في وقت الاستدلال دون إعادة تدريب.

Nirmalendu Prakash, Narmeen Fatimah Oozeer, Xin Su, Phillip Howard, Shaan Shah, Zoe Wanying He, Shuang Wu, Shivam Raval (…)2026-04-22
💻 computer science

StomaD2: An All-in-One System for Intelligent Stomatal Phenotype Analysis via Diffusion-Based Restoration Detection Network

يُعد StomaD2 نظاماً شاملاً غير جراحي يجمع بين استعادة الصور القائمة على الانتشار وشبكة متخصصة للكشف عن الأجسام المدوّرة لتحقيق نمذجة ظواهر الثغور عالية الإنتاجية وبأحدث التقنيات عبر أنواع نباتية متنوعة وظروف ميدانية معقدة.

Quanling Zhao, Meng'en Qin, Yanfeng Sun, Yuan Miao, Xiaohui Yang2026-04-22
⚡ electrical engineering

A Controlled Benchmark of Visual State-Space Backbones with Domain-Shift and Boundary Analysis for Remote-Sensing Segmentation

تقدم هذه الورقة معياراً محكماً ومنضبطاً لنماذج فضاء الحالة البصرية في تقسيم الصور الاستشعارية عن بُعد، كاشفةً أنه بينما توفر هذه النماذج توازناً ملائماً بين الدقة والكفاءة، فإن أداءها يظل محدوداً بمكاسب توسعية متواضعة، وتعميم غير متماثل عبر المجالات، وإخفاقات في تحديد المعالم الحدودية، مما يشير إلى أن التحسينات المستقبلية يجب أن تعطي الأولوية للمتانة وفك التشفير المدرك للحدود على مجرد توسيع نطاق المشفر.

Nichula Wasalathilaka, Dineth Perera, Oshadha Samarakoon, Buddhi Wijenayake, Roshan Godaliyadda, Vijitha Herath, Parakra (…)2026-04-22
💻 computer science

DeltaSeg: Tiered Attention and Deep Delta Learning for Multi-Class Structural Defect Segmentation

تُعد DeltaSeg بنية مشفر-وفك تشفير على شكل حرف U مبتكرة، تستفيد من استراتيجية انتباه متعددة المستويات وآلية انتباه دلتا العميقة لتحقيق تقسيم فائق للعيوب الهيكلية متعددة الفئات، وذلك عبر المعالجة الفعالة لعدم توازن الفئات، وأنواع الأضرار المتنوعة، وتحديد دقيق للحدود عبر مجموعات بيانات مرجعية متعددة.

Enrique Hernandez Noguera, Md Meftahul Ferdaus, Elias Ioup, Mahdi Abdelguerfi2026-04-22
💻 computer science

URoPE: Universal Relative Position Embedding across Geometric Spaces

تقترح الورقة البحثية URoPE، وهو تضمين موضع نسبي عالمي خالٍ من المعلمات وواعٍ بالخصائص الجوهرية، يعمل على توسيع تضمين الموضع الدوار (RoPE) ليشمل فضاءات هندسية عشوائية عبر إسقاط أشعة الكاميرا ثلاثية الأبعاد على مستويات صور ثنائية الأبعاد، مما يعزز أداء المحولات عبر مهام متنوعة مثل تخليق المشاهد الجديدة، وكشف الأشياء ثلاثية الأبعاد، وتقدير العمق.

Yichen Xie, Depu Meng, Chensheng Peng, Yihan Hu, Quentin Herau, Masayoshi Tomizuka, Wei Zhan2026-04-22
💻 computer science

REVEAL: Multimodal Vision-Language Alignment of Retinal Morphometry and Clinical Risks for Incident AD and Dementia Prediction

تقدم الورقة البحثية REVEAL، وهو إطار عمل متعدد الوسائط يعمل على مواءمة صور قاع العين مع ملفات تعريف المخاطر السردية باستخدام التعلم التبايني المدرك للمجموعات للتنبؤ بمرض ألزهايمر والخرف قبل التشخيص السريري بنحو ثماني سنوات، متفوقاً بشكل كبير على النماذج الحالية ذات الحالة الراهنة المتطورة.

Seowung Leem, Lin Gu, Chenyu You, Kuang Gong, Ruogu Fang2026-04-22