💻 computer science

FlowScene: Style-Consistent Indoor Scene Generation with Multimodal Graph Rectified Flow

يقدم FlowScene نموذجاً توليدياً ثلاثي الفروع يستفيد من الرسوم البيانية متعددة الوسائط وآلية تدفق مُصحح وثيقة الترابط لتوليد مشاهد داخلية عالية الدقة ومتسقة الأسلوب في آن واحد، مع تحكم دقيق في تخطيطات الأشياء وأشكالها وأنسجتها.

Zhifei Yang, Guangyao Zhai, Keyang Lu, YuYang Yin, Chao Zhang, Zhen Xiao, Jieyi Long, Nassir Navab, Yikai Wang2026-03-23
🤖 machine learning

K-GMRF: Kinetic Gauss-Markov Random Field for First-Principles Covariance Tracking on Lie Groups

تقدم الورقة البحثية K-GMRF، وهو إطار عمل عبر الإنترنت وخالٍ من التدريب، يقوم بنمذجة تتبع التغاير كحركة جسم صلب قسرية على زمر لي باستخدام ديناميكيات أويلر-بوانكاريه والتكامل اللاهندسي لتحقيق خطأ حالة مستقرة صفري واستقرار فائق مقارنة بالطرق الحالية من الدرجة الأولى.

ZhiMing Li2026-03-23
🤖 AI

FB-CLIP: Fine-Grained Zero-Shot Anomaly Detection with Foreground-Background Disentanglement

يُعد FB-CLIP إطار عمل للكشف عن الشذوذ بنمط (zero-shot)، وهو يعمل على تحسين دقة التحديد الموضعي في السيناريوهات دقيقة التفاصيل من خلال فصل ميزات المقدمة عن الخلفية عبر تمثيلات نصية متعددة الاستراتيجيات، وفصل بصري متعدد الرؤى، وتنظيم الاتساق الدلالي.

Ming Hu, Yongsheng Huo, Mingyu Dou, Jianfu Yin, Peng Zhao, Yao Wang, Cong Hu, Bingliang Hu, Quan Wang2026-03-23
🤖 AI

LoD-Loc v3: Generalized Aerial Localization in Dense Cities using Instance Silhouette Alignment

يُعد LoD-Loc v3 طريقةً مبتكرةً للتحديد البصري للمواقع من الجو في البيئات الحضرية الكثيفة، حيث يتغلب على قيود التعميم والغموض التي واجهت سلفه من خلال الاستفادة من مجموعة بيانات جديدة ضخمة لتجزئة المثيل والتحول من محاذاة السمات الدلالية إلى محاذاة ظلال المثيل.

Shuaibang Peng, Juelin Zhu, Xia Li, Kun Yang, Maojun Zhang, Yu Liu, Shen Yan2026-03-23
💻 computer science

OrbitNVS: Harnessing Video Diffusion Priors for Novel View Synthesis

تُعد OrbitNVS طريقة مبتكرة لتخليق المشاهد من زوايا رؤية مختلفة، حيث تعيد صياغة المهمة كعملية توليد فيديو مداري عبر تكييف نموذج انتشار فيديو مُدرب مسبقاً باستخدام محولات كاميرا، وآلية انتباه موجهة بخرائط النورمال لضمان الاتساق الهندسي، وإشراف في فضاء البكسل لتحقيق أداء رائد، لا سيما في حالات الرؤية الأحادية الصعبة.

Jinglin Liang, Zijian Zhou, Rui Huang, Shuangping Huang, Yichen Gong2026-03-23
💻 computer science

CS-MUNet: A Channel-Spatial Dual-Stream Mamba Network for Multi-Organ Segmentation

تُعد CS-MUNet شبكة "مامبا" (Mamba) ثنائية المسار مبتكرة تعزز تقسيم الأعضاء البطنية متعددة الأعضاء من خلال دمج وحدة "مامبا حالة الوعي بالحدود" للدمج الصريح للحدود، ووحدة "تجميع حالة مامبا للقنوات" للتعاون الدلالي عبر القنوات، محققةً أداءً هو الأفضل في فئته على المعايير المرجعية العامة.

Yuyang Zheng, Mingda Zhang, Jianglong Qin, Qi Mo, Jingdan Pan, Haozhe Hu, Hongyi Huang2026-03-23
💻 computer science

Making Video Models Adhere to User Intent with Minor Adjustments

تقترح هذه الورقة طريقة لتعزيز جودة توليد النص إلى فيديو والالتزام بالتحكم من خلال تحسين المربعات المحيطة المقدمة من المستخدم عبر أقنعة قابلة للتفاضل وهدف تعظيم الانتباه الذي يربطها بخرائط الانتباه الداخلية للنموذج.

Daniel Ajisafe, Eric Hedlin, Helge Rhodin, Kwang Moo Yi2026-03-23
💻 computer science

Vision-Language Attribute Disentanglement and Reinforcement for Lifelong Person Re-Identification

تقترح هذه الورقة البحثية VLADR، وهو نهج جديد يعتمد على نماذج الرؤية واللغة لتعريف هوية الأشخاص مدى الحياة، والذي يستخدم فك الارتباط بين سمات النص متعددة الحبيبات والتعزيز المتبادل عبر النطاقات بين الوسائط للاستفادة بفعالية من المعرفة التفصيلية للسمات، مما يعزز بشكل كبير نقل المعرفة ويخفف من حدة النسيان الكارثي.

Kunlun Xu, Haotong Cheng, Jiangmeng Li, Xu Zou, Jiahuan Zhou2026-03-23
💻 computer science

BALM: A Model-Agnostic Framework for Balanced Multimodal Learning under Imbalanced Missing Rates

تقدم هذه الورقة BALM، وهو إطار عمل غير مرتبط بنموذج محدد يعالج تحديات معدلات الفقد غير المتوازنة في التعلم متعدد الوسائط من خلال وحدتي معايرة الميزات وإعادة توازن التدرج، مما يعزز المتانة والأداء عبر أنماط فقد متنوعة دون تغيير بنيات النماذج الأساسية.

Phuong-Anh Nguyen, Tien Anh Pham, Duc-Trong Le, Cam-Van Thi Nguyen2026-03-23
💻 computer science

ReLi3D: Relightable Multi-view 3D Reconstruction with Disentangled Illumination

يقدم ReLi3D مساراً موحداً ومتكاملاً يستفيد من قيود متعددة الرؤى واستراتيجية تنبؤ مبتكرة ثنائية المسار لإعادة بناء الهندسة ثلاثية الأبعاد الكاملة، والمواد المتغيرة مكانياً، وإضاءة البيئة في آن واحد من صور متفرقة في أقل من ثانية واحدة، مما يتيح التوليد الفوري للأصول ثلاثية الأبعاد القابلة لإعادة الإضاءة.

Jan-Niklas Dihlmann, Mark Boss, Simon Donne, Andreas Engelhardt, Hendrik P. A. Lensch, Varun Jampani2026-03-23