💻 computer science

FideDiff: Efficient Diffusion Model for High-Fidelity Image Motion Deblurring

يُعد FideDiff نموذج انتشار جديداً بخطوة واحدة يحقق إزالة ضبابية حركة الصور بدقة عالية من خلال إعادة صياغة المهمة كمسألة تعلم اتساق مع مسارات ضبابية متطابقة، وتكامل Kernel ControlNet، والتنبؤ بالخطوات الزمنية التكيفية، متجاوزاً بذلك قيود سرعة الاستنتاج والدقة التي تعاني منها الطرق الحالية القائمة على الانتشار.

Xiaoyang Liu, Zhengyan Zhou, Zihang Xu, Jiezhang Cao, Zheng Chen, Yulun Zhang2026-03-24
🤖 AI

Learning to Generate Rigid Body Interactions with Video Diffusion Models

تقدم هذه الورقة KineMask، وهو إطار عمل جديد لتوليد الفيديو يستفيد من استراتيجية تدريب ثنائية المراحل باستخدام أقنعة الكائنات والدمج بين الحركة منخفضة المستوى والاشتراط النصي عالي المستوى لتمكين التفاعلات الفيزيائية المنطقية للأجسام الصلبة والتعميم على المشاهد الواقعية.

David Romero, Ariana Bermudez, Viacheslav Iablochnikov, Hao Li, Fabio Pizzati, Ivan Laptev2026-03-24
🤖 machine learning

Your VAR Model is Secretly an Efficient and Explainable Generative Classifier

تقدم هذه الورقة البحثية مصنف Adaptive VAR Classifier+^+، وهو مصنف توليدي جديد وفعال يعتمد على النمذجة التوليدية الذاتية البصرية، والذي يتفوق على الأساليب القائمة على الانتشار في السرعة والدقة مع تقديم مزايا فريدة في قابلية التفسير البصري ومقاومة النسيان الكارثي.

Yi-Chung Chen, David I. Inouye, Jing Gao2026-03-24
🤖 AI

What "Not" to Detect: Negation-Aware VLMs via Structured Reasoning and Token Merging

تقدم هذه الورقة CoVAND، وهو مسار بيانات لتوليد بيانات نفي عالية الجودة، وNegToMe، وهو وحدة دمج رموز خفيفة الوزن تحافظ هيكلياً على إشارات النفي للتخفيف بفعالية من الانحياز الإيجابي وتحسين الأداء المدرك للنفي بشكل كبير في نماذج الرؤية واللغة.

Inha Kang, Youngsun Lim, Seonho Lee, Jiho Choi, Junsuk Choe, Hyunjung Shim2026-03-24
💻 computer science

Expand Your SCOPE: Semantic Cognition over Potential-Based Exploration for Embodied Visual Navigation

تقدم هذه الورقة SCOPE، وهو إطار عمل للتعلم الصفري في الملاحة البصرية المجسدة يعزز التخطيط طويل الأمد من خلال الاستفادة من النماذج اللغوية البصرية لتقدير إمكانات الاستكشاف القائمة على الحدود ودمج آلية إعادة النظر الذاتي لتحسين اتخاذ القرار، مما يؤدي إلى التفوق على النماذج المرجعية الحالية في الدقة والتعميم.

Ningnan Wang, Weihuang Chen, Liming Chen, Haoxuan Ji, Zhongyu Guo, Xuchong Zhang, Hongbin Sun2026-03-24
💬 NLP

From Synthetic Scenes to Real Performance: Enhancing Spatial Reasoning in VLMs

تقترح هذه الورقة إطاراً للتحكم في توليد البيانات الاصطناعية لضبط النماذج اللغوية البصرية، وهو ما يقضي على تحيزات التوسيم واختلالات التوزيع، مما يؤدي إلى تحسن في الأداء بنسبة 13% في مهام الاستدلال المكاني في العالم الحقيقي مقارنة بالنماذج المدربة على مجموعات البيانات القياسية من العالم الحقيقي.

Massimo Rizzoli, Simone Alghisi, Seyed Mahed Mousavi, Giuseppe Riccardi2026-03-24
💻 computer science

MetroGS: Efficient and Stable Reconstruction of Geometrically Accurate High-Fidelity Large-Scale Scenes

يُعد MetroGS إطار عمل جديداً لتقنية "Gaussian Splatting" يحقق إعادة بناء فعالة ومستقرة ودقيقة هندسياً للمشاهد الحضرية واسعة النطاق من خلال دمج تمثيل "Gaussian" ثنائي الأبعاد الموزع، والتعزيز الكثيف المهيكل مع أولويات "SfM"، والتحسين الهندسي الهجين التدريجي، ونمذجة المظهر الموجهة بالعمق.

Kehua Chen, Tianlu Mao, Xinzhu Ma, Hao Jiang, Zehao Li, Zihan Liu, Shuqi Gao, Honglong Zhao, Feng Dai, Yucheng Zhang, Zh (…)2026-03-24
🤖 machine learning

Bridging Modalities via Progressive Re-alignment for Multimodal Test-Time Adaptation

تقترح هذه الورقة البحثية BriMPR، وهو إطار عمل جديد للتكيف في وقت الاختبار متعدد الوسائط يعالج انزياحات التوزيع المعقدة عبر توظيف استراتيجية "فرق تسد" لمحاذاة الميزات أحادية الوسائط أولاً عبر ضبط المحفزات، ثم صقل المحاذاة الدلالية عبر الوسائط من خلال التعلم التبايني على البيانات ذات الملصقات الزائفة.

Jiacheng Li, Songhe Feng2026-03-24
💻 computer science

PhysGen: Physically Grounded 3D Shape Generation for Industrial Design

يقدم PhysGen مساراً موحداً لتوليد الأشكال ثلاثية الأبعاد القائم على الفيزياء، والذي يستفيد من مشفر تلقائي متباين (VAE) للشكل والفيزياء وعملية مطابقة تدفق تبادلية مع توجيه فيزيائي صريح لإنتاج تصميمات صناعية ليست معقولة بصرياً فحسب، بل وصالحة فيزيائياً أيضاً.

Yingxuan You, Chen Zhao, Hantao Zhang, Ming Xu, Pascal Fua2026-03-24
💻 computer science

LatentFM: A Latent Flow Matching Approach for Generative Medical Image Segmentation

تقترح الورقة البحثية نموذج LatentFM، وهو نموذج توليدي قائم على مطابقة التدفق (flow matching) يعمل في فضاء كامن عبر مشفرات تلقائية متباينة (variational autoencoders)، والذي يحقق دقة فائقة في تقسيم الصور الطبية مع توفير تنبؤات مدركة لعدم اليقين وخرائط ثقة.

Huynh Trinh Ngoc, Hoang Anh Nguyen Kim, Toan Nguyen Hai, Long Tran Quoc2026-03-24