💻 computer science

Automated Prostate Gland Segmentation in MRI Using nnU-Net

تقدم هذه الورقة نموذجاً متخصصاً يعتمد على التعلم العميق من نوع nnU-Net v2، يحقق تقسيماً آلياً عالي الدقة لغدة البروستاتا عبر التصوير بالرنين المغناطيسي متعدد المعلمات من خلال الاستفوتيد من البيانات متعددة الأنماط وتوصيفات الغدة الكاملة، متفوقاً بشكل كبير على الأدوات العامة مثل TotalSegmentatment مع إظهار قدرة قوية على التعميم عبر مجموعات البيانات.

Pablo Rodriguez-Belenguer, Gloria Ribas, Javier Aquerreta Escribano, Rafael Moreno-Calatayud, Leonor Cerda-Alberich, Lui (…)2026-04-03
💻 computer science

SDesc3D: Towards Layout-Aware 3D Indoor Scene Generation from Short Descriptions

يُعد SDesc3D إطار عمل مبتكرًا لتوليد مشاهد داخلية ثلاثية الأبعاد من أوصاف نصية قصيرة، يتغلب على القيود المتعلقة بالواقعية الفيزيائية وثراء التفاصيل من خلال الاستفاف من الأولويات الهيكلية متعددة المشاهد، وتأصيل التخطيط المدرك للوظائف، ومخطط التأمل والتصحيح التكراري لتعزيز الاستنتاج ثلاثي الأبعاد في ظل التوجيه النصي الشحيح.

Jie Feng, Jiawei Shen, Junjia Huang, Junpeng Zhang, Mingtao Feng, Weisheng Dong, Guanbin Li2026-04-03
💻 computer science

NearID: Identity Representation Learning via Near-identity Distractors

تقدم هذه الورقة NearID، وهو إطار عمل ومجموعة بيانات مبنية على أسس منهجية تستخدم مشتتات شبه متطابقة على خلفيات متطابقة لعزل الهوية عن السياق، مما يكشف عن أوجه القصور في مشفرات الرؤية الحالية ويمكّن من تدريب تمثيلات قوية مدركة للهوية تتفوق بشكل كبير على النماذج الحالية في مهام التوليد المخصص وتحرير الصور.

Aleksandar Cvejic, Rameen Abdal, Abdelrahman Eldesokey, Bernard Ghanem, Peter Wonka2026-04-03
💻 computer science

Resonance4D: Frequency-Domain Motion Supervision for Preset-Free Physical Parameter Learning in 4D Dynamic Physical Scene Simulation

يُعد Resonance4D إطار عمل للمحاكاة رباعية الأبعاد القائمة على الفيزياء، والذي يستفيد من استراتيجية مبتكرة للإشراف على الحركة ثنائية النطاق (Dual-domain Motion Supervision) والتقسيم الصفري (zero-shot segmentation) لتحقيق تعلم عالي الدقة للمعلمات الفيزيائية دون الحاجة إلى إعدادات مسبقة على وحدات معالجة الرسومات الاستهلاكية، وذلك عبر تقليل التكاليف الحسابية والأعباء الإضافية على الذاكرة بشكل كبير مقارنة بالطرق الحالية.

Changshe Zhang, Jie Feng, Siyu Chen, Guanbin Li, Ronghua Shang, Junpeng Zhang2026-04-03
💻 computer science

Test-Time Adaptation for Height Completion via Self-Supervised ViT Features and Monocular Foundation Models

تقدم الورقة البحثية Prior2DSM، وهو إطار عمل للتكيف في وقت الاختبار بدون تدريب، يستفيد من ميزات ViT ذات التعلم الذاتي ونماذج التأسيس أحادية العدسة مع معايرة مقاييس قائمة على تقنية LoRA لإكمال وتحديث نماذج الأسطح الرقمية غير المكتملة بدقة دون الحاجة إلى تدريب مُشرف خاص بالمهمة.

Osher Rafaeli, Tal Svoray, Ariel Nahlieli2026-04-03
💻 computer science

Decouple and Rectify: Semantics-Preserving Structural Enhancement for Open-Vocabulary Remote Sensing Segmentation

تقترح الورقة البحثية DR-Seg، وهو إطار عمل مبتكر يعمل على فك ارتباط سمات CLIP إلى فضاءات فرعية تهيمن عليها الدلالات والبنية لتمكين التعزيز الهيكلي المستهدف عبر سمات DINO والدمج التكيفي، مما يحقق أداءً هو الأفضل في مجال تقسيم الاستشعار عن بعد مفتوح المفردات مع الحفاظ على السلامة الدلالية.

Jie Feng, Fengze Li, Junpeng Zhang, Siyu Chen, Yuping Liang, Junying Chen, Ronghua Shang2026-04-03
💻 computer science

Are VLMs Lost Between Sky and Space? LinkS2^2Bench for UAV-Satellite Dynamic Cross-View Spatial Intelligence

تقدم هذه الورقة البحثية LinkS2^2Bench، وهو أول معيار يربط بين لقطات الطائرات بدون طيار الديناميكية وصور الأقمار الصناعية الثابتة لتقييم وتحسين الذكاء المكاني عبر الرؤى لنماذج الرؤية واللغة، مما يكشف عن فجوات أداء كبيرة ويقترح محول محاذاة عبر الرؤى (Cross-View Alignment Adapter) لمعالجتها.

Dian Liu, Jie Feng, Di Li, Yuhui Zheng, Guanbin Li, Weisheng Dong, Guangming Shi2026-04-03
💻 computer science

Jagle: Building a Large-Scale Japanese Multimodal Post-Training Dataset for Vision-Language Models

تقدم هذه الورقة Jagle، وهو أكبر مجموعة بيانات يابانية لتدريب النماذج متعددة الوسائط بعد التدريب المسبق حتى الآن، والتي تضم 9.2 مليون نموذج تم إنشاؤها من مصادر متنوعة، مما يعزز بشكل كبير أداء نماذج الرؤية واللغة اليابانية مع الحفاظ على قدراتها الإنجليزية أو تحسينها.

Issa Sugiura, Keito Sasagawa, Keisuke Nakao, Koki Maeda, Ziqi Yin, Zhishen Yang, Shuhei Kurita, Yusuke Oda, Ryoko Tokuhi (…)2026-04-03
💻 computer science

True to Tone? Quantifying Skin Tone Fidelity and Bias in Photographic-to-Virtual Human Pipelines

تقترح هذه الورقة منهجية آلية بالكامل وقابلة للتوسع لقياس دقة لون البشرة في مسارات عمل البشر الافتراضيين، كاشفةً أن استراتيجيات الاستخراج الحالية تظهر انحيازاً يعتمد على النمط الظاهري وتنتج باستمرار أخطاءً لونية أعلى بالنسبة لدرجات البشرة الداكنة.

Gabriel Ferri Schneider, Erick Menezes, Rafael Mecenas, Paulo Knob, Victor Araujo, Soraia Raupp Musse2026-04-03
💻 computer science

COMPASS: Complete Multimodal Fusion via Proxy Tokens and Shared Spaces for Ubiquitous Sensing

تقترح الورقة البحثية إطار COMPASS، وهو إطار عمل قوي للدمج متعدد الوسائط يعالج تحديات فقدان الوسائط من خلال تخليق رموز بديلة (proxy tokens) محددة الهدف في فضاء كامن مشترك لضمان تلقي رأس الدمج دائمًا بنية مدخلات كاملة وثابتة، مما يجعله يتفوق على الأساليب الحالية عبر سيناريوهات استشعار متنوعة.

Hao Wang, Yanyu Qian, Pengcheng Weng, Zixuan Xia, William Dan, Yangxin Xu, Fei Wang2026-04-03