💻 computer science

Few-Shot Semantic Segmentation Meets SAM3

تقترح هذه الورقة البحثية FSS-SAM3، وهو نهج للتجزئة الدلالية لعدد قليل من العينات لا يتطلب تدريباً، يستفيد من نموذج Segment Anything 3 (SAM3) مجمد مع استراتيجية دمج مكاني بسيطة لتحقيق أداء رائد مع الكشف عن الطبيعة غير المثمرة للمطالبات السلبية في إعدادات التعلم من أمثلة قليلة.

Yi-Jen Tsai, Yen-Yu Lin, Chien-Yao Wang2026-04-08
💻 computer science

CoEnv: Driving Embodied Multi-Agent Collaboration via Compositional Environment

يقدم CoEnv إطار عمل مبتكر للتعاون متعدد الوكلاء المتجسد الذي يستفيد من "بيئة تركيبية" تدمج بين مكونات العالم الحقيقي والمحاكاة لتمكين استكشاف الاستراتيجيات الآمن، وتوليد الأفعال المدفوع بنماذج اللغة والرؤية الكبيرة (VLM)، والنقل الموثوق من المحاكاة إلى الواقع لمهام المناولة المعقدة.

Li Kang, Yutao Fan, Rui Li, Heng Zhou, Yiran Qin, Zhemeng Zhang, Songtao Huang, Xiufeng Song, Zaibin Zhang, Bruno N. Y. (…)2026-04-08
🤖 AI

Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models

تحدد هذه الورقة أن نماذج اللغات الكبيرة متعددة الوسائط الانتشارية (dMLLMs) غالبًا ما تولد إجابات سابقة لأوانها مع عدم كفاية في الربط البصري أثناء استدلال سلسلة الأفكواب (Chain-of-Thought)، وتقترح عقوبة الموضع والخطوة (PSP) وتوجيه الاستدلال البصري (VRG) لتأخير توليد الإجابة وتعزيز المحاذاة البصرية، مما يؤدي إلى تحسين الدقة وسرعة الاستنتاج بشكل كبير.

Keuntae Kim, Mingyu Kang, Yong Suk Choi2026-04-08
💻 computer science

CLIP-Guided Data Augmentation for Night-Time Image Dehazing

تقدم هذه الورقة إطاراً موحداً لتحدي إزالة الضباب في الصور الليلية NTIRE 2026، والذي يستفيد من تعزيز البيانات الموجه بـ CLIP لبناء مجموعات تدريب متوافقة مع النطاق، ويستخدم استراتيجية تدريب ثنائية المراحل لشبكة NAFNet، ويجمع بين تحسينات وقت الاستدلال لمعالجة أنماط التدهور المعقدة للضباب الليلي تحت إشراف محدود بشكل فعال.

Xining Ge, Weijun Yuan, Gengjia Chang, Xuyang Li, Shuhong Liu2026-04-08
💻 computer science

EchoAgent: Towards Reliable Echocardiography Interpretation with "Eyes","Hands" and "Minds"

تقدم الورقة البحثية EchoAgent، وهو نظام وكيل يدمج قاعدة معرفية قائمة على الخبرة، ومجموعة أدوات هرمية لتحليل وقياس الفيديو، ومركز استدلال منسق لتحقيق سير عمل متكامل ومنسق "عيون-يدين-عقول" من أجل تفسير موثوق وشامل لتخطيط صدى القلب.

Qin Wang, Zhiqing He, Yu Liu, Bowen Guo, Zeju Li, Miao Zhao, Wenhao Ju, Zhiling Luo, Xianhong Shu, Yi Guo, Yuanyuan Wang2026-04-08
💻 computer science

Referring-Aware Visuomotor Policy Learning for Closed-Loop Manipulation

تقدم هذه الورقة البحثية ReV، وهو إطار عمل لسياسة حركية بصرية ذات حلقة مغلقة يعزز المتانة في التلاعب الروبوتي من خلال الاستفوتادة من رؤوس انتشار مقترنة لدمج نقاط مرجعية متفرقة مقدمة من البشر أو المخطط ديناميكياً لإعادة تخطيط المسار في الوقت الفعلي، وكل ذلك أثناء التدريب حصرياً على عروض خبير مضطربة دون بيانات إضافية أو ضبط دقيق.

Jiahua Ma, Yiran Qin, Xin Wen, Yixiong Li, Yuyu Sun, Yulan Guo, Liang Lin, Ruimao Zhang2026-04-08
💻 computer science

Purify-then-Align: Towards Robust Human Sensing under Modality Missing with Knowledge Distillation from Noisy Multimodal Teacher

تقترح هذه الورقة إطار عمل PTA، وهو إطار عمل مبتكر يعتمد على مبدأ "التنقية ثم المحاذاة" (Purify-then-Align) يجمع بين التعلم التلوي وتقطير المعرفة القائم على الانتشار للتغلب على فجوات التمثيل وآثار التلوث، مما يحقق متانة هي الأفضل في مجال الاستشعار البشري في سيناريوهات فقدان النمط (missing modality).

Pengcheng Weng (School of Software Engineering, Xi'an Jiaotong University, China, Institute of Computer Science, Univers (…)2026-04-08
💻 computer science

FunRec: Reconstructing Functional 3D Scenes from Egocentric Interaction Videos

تُعد FunRec طريقة مبتكرة تعيد بناء توائم رقمية ثلاثية الأبعاد وظيفية وجاهزة للمحاكاة للمشاهد الداخلية مباشرة من فيديوهات تفاعل ذات منظور شخصي (egocentric) من نوع RGB-D في بيئات واقعية، وذلك عبر الاكتشاف التلقائي للأجزاء المفصلية وحركيتها، متفوقةً بذلك بشكل كبير على النهج الحالية في دقة التجزئة، ودقة الوضعية، وجودة إعادة البناء.

Alexandros Delitzas, Chenyangguang Zhang, Alexey Gavryushin, Tommaso Di Mario, Boyang Sun, Rishabh Dabral, Leonidas Guib (…)2026-04-08
💻 computer science

Towards Athlete Fatigue Assessment from Association Football Videos

تقترح هذه الورقة وتقيم مساراً مبتكراً يستفيد من فيديوهات كرة القدم البثية أحادية العدسة وإعادة بناء حالة اللعبة لاستخلاص ملفات تعريف تسارع السرعة الكينماتيكية لتقييم تعب الرياضيين بشكل موضوعي، مما يبرهن على إمكاناتها كبديل منخفض التكلفة للمستشعرات المزعجة مع تسليط الضوء على تحديات تقنية محددة.

Xavier Bou, Nathan Correger, Alexandre Cloots, Cédric Gavage, Silvio Giancola, Cédric Schwartz, François Delvaux, Rudi C (…)2026-04-08
💻 computer science

In Depth We Trust: Reliable Monocular Depth Supervision for Gaussian Splatting

تقدم هذه الورقة إطار تدريب يستفيد بشكل موثوق من أولويات العمق أحادية العدسة ذات الضجيج والغموض في المقياس لتعزيز تقنية "Gaussian Splatting" ثلاثية الأبعاد، وذلك عبر تنظيم الهندسة غير محددة المعالم بشكل انتقائي، مما يؤدي إلى تحسين جودة الرندرة والدقة الهندسية دون الحاجة إلى أنظمة متخصصة للحصول على العمق.

Wenhui Xiao, Ethan Goan, Rodrigo Santa Cruz, David Ahmedt-Aristizabal, Olivier Salvado, Clinton Fookes, Leo Lebrat2026-04-08