💻 computer science

CA-IDD: Cross-Attention Guided Identity-Conditional Diffusion for Identity-Consistent Face Swapping

تقدم الورقة البحثية CA-IDD، وهو إطار عمل جديد لتبديل الوجوه يعتمد على الانتشار ويستخدم مدخلات متعددة الوسائط (الهوية، ونظرة العين، وتقسيم الوجه) موجهة عبر الانتباه المتقاطع لتحقيق تفوق في الحفاظ على الهوية والواقعية البصرية مقارنة بالأساليب القائمة على شبكات الخصومة التوليدية (GANs).

Md Shohel Rana, Tanoy Debnath2026-04-28
💻 computer science

Point Cloud Registration for Fusion between SPECT MPI and CTA Images

تقترح هذه الورقة إطار عمل متين للتسجيل القائم على المعالم يدمج التقسيم المعتمد على شبكة U-Net مع خوارزميات التسجيل الدقيق المقارنة (لا سيما BCPD-plus-plus) لتحقيق دمج دون المليمتر لصور SPECT MPI وصور CTA، مما يتيح تحديد الموقع الدقيق لنقص تروية عضلة القلب والتقييم الوظيفي للآفات التاجية.

Ni Yao, Xiangyu Liu, Shaojie Tang, Danyang Sun, Chuang Han, Yanting Li, Jiaofen Nan, Chengyang Li, Fubao Zhu, Chen Zhao (…)2026-04-28
💻 computer science

Diffusion Model as a Generalist Segmentation Learner

تقدم هذه الورقة DiGSeg، وهو إطار عمل يعيد توظيف نماذج الانتشار مسبقة التدريب إلى متعلم تقسيم موحد وعام قادر على تحقيق أداء رائد في كل من مهام التقسيم القياسية ومهام المفردات المفتوحة عبر مجالات متنوعة دون الحاجة إلى تغييرات هيكلية خاصة بكل مجال.

Haoxiao Wang, Antao Xiang, Haiyang Sun, Peilin Sun, Changhao Pan, Yifu Chen, Minjie Hong, Weijie Wang, Shuang Chen, Yue (…)2026-04-28
💻 computer science

CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies

يقدم CF-VLA إطار عمل ثنائي المرحلة من الخشن إلى الناعم يحول ضجيج غاوس غير المعلوماتي إلى تهيئة فعل مهيكلة تليها عملية صقل أحادية الخطوة، مما يحسن بشكل كبير من مقايضة الكفاءة والأداء لسياسات الرؤية واللغة والعمل القائمة على التدفق ويحقق معدلات نجاح رائدة للروبوتات الحقيقية مع تقليل زمن انتقال أخذ العينات بشكل جذري.

Fan Du, Feng Yan, Jianxiong Wu, Xinrun Xu, Weiye Zhang, Weinong Wang, Yu Guo, Bin Qian, Zhihai He2026-04-28
💻 computer science

NeuroClaw Technical Report

يُعد NeuroClaw إطار عمل متعدد الوكلاء متخصصاً في مجال محدد، يُمكّن من إجراء أبحاث التصوير العصبي القابلة للتنفيذ والتكرار من خلال المعالجة المباشرة للبيانات الخام عبر أنماط غير متجانسة، وذلك عبر تسلسل هرمي ثلاثي المستويات للوكلاء وإدارة قوية للبيئة، كما تم التحقق منه بواسطة معيار NeuroBench.

Cheng Wang, Zhibin He, Zhihao Peng, Shengyuan Liu, Yufan Hu, Lichao Sun, Xiang Li, Yixuan Yuan2026-04-28
💻 computer science

WildLIFT: Lifting monocular drone video to 3D for species-agnostic wildlife monitoring

إنّ WildLIFT هو إطار عمل حوسبي يحوّل فيديوهات الطائرات بدون طيار أحادية العدسة إلى تمثيلات ثلاثية الأبعاد مهيكلة مع تجزئة مثالية للنماذج ذات المفردات المفتوحة، مما يتيح الكشف والتتبع ثلاثي الأبعاد المستقل عن نوع الأنواع، والتحليل الكمي لسلوك الحياة البرية وديناميكيات أعدادها، مع تقليل جهد التوسيم اليدوي بشكل كبير.

Vandita Shukla, Fabio Remondino, Blair Costelloe, Benjamin Risse2026-04-28
💻 computer science

DiffuSAM: Diffusion-Based Prompt-Free SAM2 for Few-Shot and Source-Free Medical Image Segmentation

يُعد DiffuSAM إطار عمل لتجزئة الصور الطبية بدون الحاجة إلى مطالبات، حيث يقوم بتكييف نموذج SAM2 عبر تخليق تضمينات شبيهة بالأقنعة من خلال نموذج انتشار خفيف الوزن مشروط بالاتساق المكاني، مما يتيح تكيف النطاق بفعالية في حالات التعلم من أمثلة قليلة أو التكيف دون وجود مصدر، وذلك دون الحاجة إلى مطالبات من المستخدم أو ضبط دقيق مكثف.

Tal Grossman, Noa Cahan, Lev Ayzenberg, Hayit Greenspan2026-04-28
💻 computer science

Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation

يقدم Tuna-2 نموذجاً موحداً أصيلاً متعدد الوسائط يستبدل المشفرات الرؤيوية سابقة التدريب بتضمينات بكسلية مباشرة، محققاً أداءً هو الأفضل في فئته في كل من الفهم والتوليد البصري مع إثبات أن التعلم في فضاء البكسل من طرف إلى طرف هو مسار قابل للتوسع نحو تمثيلات بصرية أقوى.

Zhiheng Liu, Weiming Ren, Xiaoke Huang, Shoufa Chen, Tianhong Li, Mengzhao Chen, Yatai Ji, Sen He, Jonas Schult, Belinda (…)2026-04-28
💻 computer science

V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models

يُعد V-MAGE إطار تقييم مبتكر قائم على الألعاب يستخدم خمس ألعاب فيديو مختلفة ونظام تصنيف ديناميكي يعتمد على نظام ELO لتقييم قدرات الاستنتاج البصري التفاعلي واتخاذ القرار لنماذج اللغات الكبيرة متعددة الوسائط (MLLMs) بشكل منهجي في البيئات المعقدة ذات الفضاء المستمر.

Xiangxi Zheng, Linjie Li, Zhengyuan Yang, Ping Yu, Alex Jinpeng Wang, Rui Yan, Yuan Yao, Lijuan Wang2026-04-27
🤖 AI

Vision-Based Risk Aware Emergency Landing for UAVs in Complex Urban Environments

تقترح هذه الورقة نظام هبوط اضطراري للطائرات بدون طيار يعتمد على الرؤية ويكون مدركاً للمخاطر في البيئات الحضرية المعقدة، وذلك باستخدام التجزئة الدلالية ورسم خرائط المخاطر الديناميكية لتحديد مناطق الهبوط الآمنة وسط العوائق المتحركة وتغيرات الإضاءة، محققةً معدلات نجاح تتجاوز 90% في سيناريوهات من الواقع الفعلي.

Julio de la Torre-Vanegas, Miguel Soriano-Garcia, Israel Becerra, Diego Mercado-Ravell2026-04-27