💻 computer science

Bodhi VLM: Privacy-Alignment Modeling for Hierarchical Visual Representations in Vision Backbones and VLM Encoders via Bottom-Up and Top-Down Feature Search

تقدم الورقة البحثية Bodhi VLM، وهو إطار عمل لنمذجة مواءمة الخصوصية يستخدم استراتيجيات بحث عن الميزات من الأسفل إلى الأعلى ومن الأعلى إلى الأسفل جنباً إلى جنب مع وحدة تقييم الخصوصية القائمة على توقع التوقع الأقصى (Expectation-Maximization) لتوليد إشارات مواءمة الميزانية القابلة للتفسير للمفاهيم الحساسة ضمن التمثيلات البصرية الهرمية لكل من النماذج الرؤيوية الخلفية والنماذج الرؤيوية-اللغوية.

Bo Ma, Wei Qi Yan, Jinsong Wu2026-03-19
⚡ electrical engineering

Halfway to 3D: Ensembling 2.5D and 3D Models for Robust COVID-19 CT Diagnosis

تقترح هذه الورقة إطار عمل للتعلم العميق قوي لتشخيص كوفيد-19 من صور الأشعة المقطعية للصدر، والذي يدمج بين فرع يعتمد على DINOv3 ثنائي الأبعاد (2.5D) لاستخراج ميزات مستوى الشريحة، وفرع ResNet-18 ثلاثي الأبعاد مع تدريب مسبق متقدم للسياق الحجمي، محققاً أداءً هو الأفضل في فئته على مقياس PHAROS-AIF-MIH.

Tuan-Anh Yang, Bao V. Q. Bui, Chanh-Quang Vo-Van, Truong-Son Hy2026-03-19
💻 computer science

Workflow-Aware Structured Layer Decomposition for Illustration Production

تقترح هذه الورقة إطار عمل مدركاً لسير العمل يقوم بتفكيك رسومات الأنمي إلى طبقات إنتاج ذات دلالات معنوية (الخطوط، واللون المسطح، والظل، والإضاءة) باستخدام تضمينات خفيفة الوزن وخسائر متخصصة، مما يتيح تحكماً محسناً ومهام تحرير لاحقة عبر محاكاة مسار إنشاء الأنمي القياسي.

Tianyu Zhang, Dongchi Li, Keiichi Sawada, Haoran Xie2026-03-19
💻 computer science

Next-Frame Decoding for Ultra-Low-Bitrate Image Compression with Video Diffusion Priors

تقدم هذه الورقة إطار عمل جديد لضغط الصور بمعدل بت منخفض للغاية يستفيد من نماذج انتشار الفيديو مسبقة التدريب للتنبؤ بصور عالية الدقة من إطارات مرجعية دلالية مدمجة، محققاً جودة إدراكية فائقة وسرعات فك تشفير أسرع بكثير مقارنة بالأساليب القائمة على الانتشار الحالية.

Yunuo Chen, Chuqin Zhou, Jiangchuan Li, Xiaoyue Ling, Bing He, Jincheng Dai, Li Song, Guo Lu2026-03-19
💻 computer science

The Truth, the Whole Truth, and Nothing but the Truth: Automatic Visualization Evaluation from Reconstruction Quality

تقترح هذه الورقة مقياساً آلياً وقابلاً للتوسع لتقييم التصورات البيانية المُنشأة بواسطة الذكاء الاصطناعي، وذلك عبر قياس دقة إعادة بناء البيانات الأصلية الكامنة من التصور البياني، مما يلغي الحاجة إلى مجموعات بيانات مكلفة مصنفة بشرياً.

Roxana Bujack, Li-Ta Lo, Ethan Stam, Ayan Biswas, David Rogers2026-03-19
💻 computer science

Multi-Modal Multi-Agent Reinforcement Learning for Radiology Report Generation: Radiologist-Like Workflow with Clinically Verifiable Rewards

تقدم الورقة البحثية MARL-Rad، وهو إطار عمل جديد للتعلم المعزز متعدد الوكلاء ومتعدد الوسائط ينسق بين الوكلاء المخصصين لمناطق محددة والوكلاء العالميين من خلال مكافآت يمكن التحقق منها سريرياً لتوليد تقارير الأشعة بفعالية سريرية رائدة ودقة محسنة على مجموعات بيانات MIMIC-CXR وIU X-ray.

Kaito Baba, Satoshi Kodera2026-03-19
💻 computer science

Leveraging Large Vision Model for Multi-UAV Co-perception in Low-Altitude Wireless Networks

تقترح هذه الورقة إطار عمل الطائرات بدون طيار بمساعدة المحطة الأساسية (BHU)، والذي يدمج اختيار بكسلات Top-K، ودمج ميزات BEV القائم على Swin-large، وخوارزمية التعلم التعزيزي العميق القائمة على نموذج الانتشار لتحقيق إدراك تعاوني متعدد الطائرات بدون طيار كفء في الاتصالات مع تقليل العبء بشكل كبير وتعزيز الأداء في الشبكات اللاسلكية منخفضة الارتفاع.

Yunting Xu, Jiacheng Wang, Ruichen Zhang, Changyuan Zhao, Yinqiu Liu, Dusit Niyato, Liang Yu, Haibo Zhou, Dong In Kim2026-03-19
💻 computer science

GenLie: A Global-Enhanced Lie Detection Network under Sparsity and Semantic Interference

تُعد GenLie شبكة معززة عالميًا تعالج تحديات الإشارات الخادعة الشحيحة والضوضاء المرتبطة بالهوية في كشف الكذب القائم على الفيديو من خلال التقاط السمات المحلية الدقيقة تحت إشراف عالمي، محققةً أداءً هو الأفضل في فئته عبر مجموعات بيانات متنوعة.

Zongshun Zhang, Yao Liu, Qiao Liu, Xuefeng Peng, Peiyuan Jiang, Jiaye Yang, Daibing Yao, Wei Lin2026-03-19
💻 computer science

TDMM-LM: Bridging Facial Understanding and Animation via Language Models

تعالج هذه الورقة ندرة البيانات الوجهية المقترنة بالنصوص من خلال توليد مجموعة بيانات واسعة النطاق من معلمات الوجه ثلاثية الأبعاد والمطالبات، والتي تُستخدم بعد ذلك لتدريب نموذج لغوي قادر على الترجمة ثنائية الاتجاه بين الأوصاف اللغوية الطبيعية وتسلسلات الحركة الوجهية من أجل رسوم متحركة وفهم موحد مشروط بالنص.

Luchuan Song, Pinxin Liu, Haiyang Liu, Zhenchao Jin, Yolo Yunlong Tang, Zichong Xu, Susan Liang, Jing Bi, Jason J Corso (…)2026-03-19
⚡ electrical engineering

On the Degrees of Freedom of Gridded Control Points in Learning-Based Medical Image Registration

تقدم هذه الورقة البحثية GridReg، وهو إطار عمل لترجمة الصور الطبية يعتمد على التعلم ويستخدم نقاط تحكم شبكية متفرقة وآليات انتباه تقاطعي لتحقيق دقة فائقة مع تقليل التكلفة الحسابية واستهلاك الذاكرة مقارنة بطرق الفوكسل الكثيفة أو النقاط المفتاحية المبعثرة.

Wen Yan, Qianye Yang, Yipei Wang, Shonit Punwani, Mark Emberton, Vasilis Stavrinides, Yipeng Hu, Dean Barratt2026-03-19