🤖 AI

Blind to Position, Biased in Language: Probing Mid-Layer Representational Bias in Vision-Language Encoders for Zero-Shot Language-Grounded Spatial Understanding

تكشف هذه الورقة أن تمثيلات الطبقة النهائية لمشفرات الرؤية واللغة تعاني من عدم الحساسية الموضعية والانزياحات الهندسية المعتمدة على اللغة، مما استدعى اقتراح طريقة لسبر التحيز التمثيلي في الطبقات المتوسطة، والتي حسنت بشكل كبير أداء تقسيم الصور بالإشارة (zero-shot referring image segmentation) واسترجاع الصور من النصوص (text-to-image retrieval).

Na Min An, Inha Kang, Minhyun Lee, Hyunjung Shim2026-03-20
💻 computer science

Object-Centric Representation Learning for Enhanced 3D Semantic Scene Graph Prediction

تقترح هذه الورقة إطار عمل لتعلم التمثيل المتمحور حول الكائنات، والذي يستخدم استراتيجية تدريب مسبق تبايني لتوليد سمات كائن عالية التمييز ويدمج المعلومات الهندسية والدلالية، مما يتفوق بشكل كبير على الأساليب المتطورة في التنبؤ بالمخططات الدلالية للمشاهد ثلاثية الأبعاد.

KunHo Heo, GiHyun Kim, SuYeon Kim, MyeongAh Cho2026-03-20
💻 computer science

CoPRS: Learning Positional Prior from Chain-of-Thought for Reasoning Segmentation

يقدم CoPRS إطار عمل متعدد الوسائط لسلسلة الأفكار (Chain-of-Thought) يربط بين الاستدلال اللغوي والتقطيع من خلال توليد خريطة حرارية موضعية قابلة للتفاضل والتفسير من خطوات الاستدلال، مما يحسن بشكل كبير دقة التنبؤ بالقناع والوضوح التشخيصي في المعايير القياسية.

Zhenyu Lu, Liupeng Li, Jinpeng Wang, Yan Feng, Bin Chen, Ke Chen, Yaowei Wang2026-03-20
💻 computer science

From Far and Near: Perceptual Evaluation of Crowd Representations Across Levels of Detail

تبحث هذه الورقة في كيفية إدراك المستخدمين للجودة البصرية لمختلف تمثيلات الحشود —بما في ذلك الشبكات (meshes)، والمجسمات المسطحة (impostors)، وتمثيلات حقول الإشعاع العصبية (NeRFs)، وغاوسيات ثلاثية الأبعاد (3D Gaussians)— عبر مستويات مختلفة من التفاصيل ومسافات المشاهدة، وذلك لتقديم رؤى لتصميم استراتيجيات رندرة (rendering) محسنة إدراكيًا.

Xiaohan Sun, Carol O'Sullivan2026-03-20
⚡ electrical engineering

Deep learning-based object detection of offshore platforms on Sentinel-1 Imagery and the impact of synthetic training data

تُظهر هذه الدراسة أن تعزيز صور Sentinel-1 الحقيقية بالبيانات الاصطناعية يحسن بشكل كبير من أداء ونقل القدرة الجغرافية لنماذج التعلم العميق YOLOv10 للكشف عن المنصات البحرية عبر مناطق عالمية متنوعة، محققاً زيادة في مقياس F1 من 0.85 إلى 0.90.

Robin Spanier, Thorsten Hoeser, Claudia Kuenzer2026-03-20
💻 computer science

Otter: Mitigating Background Distractions of Wide-Angle Few-Shot Action Recognition with Enhanced RWKV

تقترح الورقة البحثية "Otter"، وهو إطار عمل مبتكر يخفف من تشتت الخلفية في التعرف على الأفعال بلقطات واسعة الزاوية ومن عدد قليل من الأمثلة، وذلك عبر دمج وحدة تجزئة مركبة للتركيز على الموضوعات ووحدة إعادة بناء زمنية لاستعادة العلاقات الزمنية، محققاً أداءً هو الأفضل حالياً عبر العديد من المعايير المرجعية.

Wenbo Huang, Jinghui Zhang, Zhenghao Chen, Guang Li, Lei Zhang, Yang Cao, Fang Dong, Takahiro Ogawa, Miki Haseyama2026-03-20
🤖 AI

Seeing Beyond the Image: ECG and Anatomical Knowledge-Guided Myocardial Scar Segmentation from Late Gadolinium-Enhanced Images

تقترح هذه الورقة إطار عمل متعدد الوسائط مبتكر يدمج الإشارات الفيزيولوجية الكهربائية المستمدة من تخطيط كهربائية القلب مع الأولويات التشريحية AHA-17 عبر آلية دمج الميزات المدركة زمنياً لتحسين دقة تقسيم الندبات العضلية القلبية من صور الرنين المغناطيسي المعززة بالجادولينيوم المتأخر بشكل كبير مقارنة بالنماذج المرجعية التي تعتمد على الصور فقط.

Farheen Ramzan, Yusuf Kiberu, Nikesh Jathanna, Meryem Jabrane, Vicente Grau, Shahnaz Jamil-Copley, Richard H. Clayton, C (…)2026-03-20
💻 computer science

DuoTeach: Dual Role Self-Teaching for Coarse-to-Fine Decision Coordination in Vision--Language Models

تقدم الورقة البحثية DuoTeach، وهو إطار عمل للتعليم الذاتي ثنائي الأدوار يعزز التنسيق من الخشن إلى الناعم في نماذج الرؤية واللغة من خلال توليد آثار معلم متماسكة عبر عمليات التدحرج المشروطة بالقرار وتكريرها في نموذج طالب، مما يحسن بشكل كبير من موثوقية المسار والتعميم في حالة الصفر على المهام ذات الهيكل التصنيفي دون الحاجة إلى تسميات أرضية حقيقية.

Wei Yang, Yiran Zhu, Zilin Li, Xunjia Zhang, Jun Xia, Hongtao Wang2026-03-20
💻 computer science

Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-Rollout

تقدم الورقة البحثية \infty-RoPE، وهو إطار عمل للاستدلال بدون تدريب يتيح توليد فيديو سينمائي، وقابل للتحكم في الأفعال، وذو أفق لانهائي من خلال التغلب على الحدود الزمنية لـ 3D-RoPE عبر تقنيات Block-Relativistic RoPE وKV Flush وRoPE Cut.

Hidir Yesiltepe, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Pinar Yanardag2026-03-20
💻 computer science

Efficient and Scalable Monocular Human-Object Interaction Motion Reconstruction

تتناول هذه الورقة تحدي استخراج بيانات التفاعل بين الإنسان والأشياء رباعية الأبعاد (4D) من فيديوهات الإنترنت أحادية الكاميرا عبر تقديم نموذج ترميز فعال، وهو متنبئ النقاط البينية (InterPoint predictor)، وإطار تحسين حل التفاعل بين الإنسان والأشياء رباعي الأبعاد (4DHOISolver)، اللذين يُمكّنان معاً من إنشاء مجموعة بيانات Open4DHOI واسعة النطاق لتدريب الروبوتات العامة.

Boran Wen, Ye Lu, Sirui Wang, Keyan Wan, Jiahong Zhou, Junxuan Liang, Xinpeng Liu, Bang Xiao, Ruiyang Liu, Yong-Lu Li2026-03-20