💻 computer science

InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing

تقدم الورقة البحثية نموذج InternVL-U، وهو نموذج متعدد الوسائط موحد خفيف الوزن بـ 4 مليارات معلمة، يعمل على إضفاء الطابع الديمقراطي على قدرات الفهم والاستدلال والتوليد والتحرير المتقدمة من خلال توظيف بنية معيارية ومسار لتخليق البيانات يرتكز على الاستدلال، محققاً توازناً فائقاً بين الأداء والكفاءة يتفوق بشكل ملحوظ على النماذج المرجعية الأكبر حجماً مثل BAGEL.

Changyao Tian, Danni Yang, Guanzhou Chen, Erfei Cui, Zhaokai Wang, Yuchen Duan, Penghao Yin, Sitao Chen, Ganlin Yang, Mi (…)2026-03-11
💻 computer science

DISPLAY: Directable Human-Object Interaction Video Generation via Sparse Motion Guidance and Multi-Task Auxiliary

تقدم الورقة البحثية إطار عمل DISPLAY، وهو إطار لتوليد فيديوهات تفاعل بين الإنسان والأشياء قابلة للتحكم ومتسقة فيزيائياً من خلال استخدام توجيه حركة متفرق (إحداثيات المعصم وصناديق الإحاطة للأشياء)، وآلية انتباه تركز على الأشياء، واستراتيجية تدريب مساعدة متعددة المهام للتغلب على القيود في المرونة والتعميم وندرة البيانات.

Jiazhi Guan, Quanwei Yang, Luying Huang, Junhao Liang, Borong Liang, Haocheng Feng, Wei He, Kaisiyuan Wang, Hang Zhou, J (…)2026-03-11
💻 computer science

WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition

يُعد WikiCLIP إطار عمل تباينيًا فعالًا للتعرف على الكيانات المرئية في النطاق المفتوح، حيث يستفيد من تضمينات النماذج اللغوية الكبيرة المعززة بمكيف معرفي موجه بصريًا وتوليف السلبيات الصعبة ليتفوق بشكل كبير على النماذج التوليدية الأساسية مع تقليل زمن انتقال الاستدلال بنحو 100 ضعف.

Shan Ning, Longtian Qiu, Jiaxuan Sun, Xuming He2026-03-11
💻 computer science

Fine-grained Motion Retrieval via Joint-Angle Motion Images and Token-Patch Late Interaction

تقترح هذه الورقة إطار عمل لتفسير استرجاع الحركة من النصوص يمثل حركة الإنسان ثلاثية الأبعاد كصور زيفية لزوايا المفاصل يتم معالجتها بواسطة محولات الرؤية (Vision Transformers) وتتم محاذاتها مع النصوص عبر آلية تفاعل متأخرة على مستوى الرمز (token-wise late interaction)، مما يتغلب على قيود طرق التضمين العالمي من خلال التقاط الارتباطات دقيقة التفاصيل وتحسين دقة الاسترجاع.

Yao Zhang, Zhuchenyang Liu, Yanlan He, Thomas Ploetz, Yu Xiao2026-03-11
🤖 AI

Adaptive Clinical-Aware Latent Diffusion for Multimodal Brain Image Generation and Missing Modality Imputation

تقدم الورقة البحثية ACADiff، وهو إطار عمل انتشار كامن تكيفي مدرك سريريًا يقوم بتخليق بيانات تصوير الدماغ متعددة الأنماط المفقودة (sMRI وFDG-PET وAV45-PET) من خلال دمج الملاحظات التصويرية مع البيانات الوصفية السريرية المشفرة بواسطة GPT-4o، محققًا جودة توليد فائقة وأداءً تشخيصيًا قويًا حتى عند فقدان ما يصل إلى 80% من الأنماط.

Rong Zhou, Houliang Zhou, Yao Su, Brian Y. Chen, Yu Zhang, Lifang He, Alzheimer's Disease Neuroimaging Initiative2026-03-11
🤖 AI

No Image, No Problem: End-to-End Multi-Task Cardiac Analysis from Undersampled k-Space

تقترح الورقة البحثية إطار عمل k-MTR، وهو إطار عمل مبتكر يتجاوز خطوة إعادة بناء الصور التقليدية من خلال التعلم المباشر لسمات التشخيص القلبي متعدد المهام من بيانات k-space ناقصة العينات عبر متشعب دلالي مشترك، مما يؤدي إلى القضاء على عيوب إعادة البناء وتحقيق أداء تنافسي عبر مهام الانحدار والتصنيف والتجزئة.

Yundi Zhang, Sevgi Gokce Kafali, Niklas Bubeck, Daniel Rueckert, Jiazhen Pan2026-03-11
💻 computer science

ReCoSplat: Autoregressive Feed-Forward Gaussian Splatting Using Render-and-Compare

يُعد ReCoSplat نموذجًا للتطبيع الغاوسي (Gaussian Splatting) يعمل بنظام التغذية الأمامية ذات التوليد الذاتي، وهو يتغلب على معضلة عدم تطابق الوضعية بين التدريب والاستدلال من خلال وحدة "الرندرة والمقارنة" (Render-and-Compare) المبتكرة، ويحقق حالة متطورة في تخليق المشاهد الجديدة عبر الإنترنت مع معالجة فعالة للتسلسلات الطويلة عبر ضغط ذاكرة التخزين المؤقت (KV cache) الهجين.

Freeman Cheng, Botao Ye, Xueting Li, Junqi You, Fangneng Zhan, Ming-Hsuan Yang2026-03-11
💻 computer science

DivCon: Divide and Conquer for Complex Numerical and Spatial Reasoning in Text-to-Image Generation

يقدم DivCon إطار عمل "فرق تسد" الذي يفصل عملية توليد النص إلى صورة إلى خطوات مبسطة من الاستدلال العددي/المكاني وتوليد الكائنات التدريجي، مما يمكّن النماذج خفيفة الوزن من تحقيق دقة تخطيط وجودة إدراكية فائقة للمطالبات المعقدة متعددة الكائنات دون الاعتماد على نماذج لغوية كبيرة مغلقة المصدر.

Yuhao Jia, Wenhan Tan2026-03-10
🤖 machine learning

Exploring Diffusion Models' Corruption Stage in Few-Shot Fine-tuning and Mitigating with Bayesian Neural Networks

تحدد هذه الورقة "مرحلة فساد" في نماذج الانتشار المضبوطة بدقة عبر التعلم القليل، والناتجة عن تضييق توزيع التعلم، وتقترح نهجاً للشبكة العصبية البايزية باستخدام الاستدلال التبايني لتوسيع هذا التوزيع، مما يقلل من الفساد ويحسن دقة الصور وجودتها وتنوعها دون تكاليف إضافية عند الاستدلال.

Xiaoyu Wu, Jiaru Zhang, Yang Hua, Bohan Lyu, Hao Wang, Tao Song, Haibing Guan2026-03-10
💻 computer science

RDM: Recurrent Diffusion Model for Human Motion Generation

تقترح هذه الورقة نموذج الانتشار المتكرر (RDM)، وهو نموذج انتشار يعتمد على التدفقات الطبيعية (Normalizing Flows) لتهيئة عملية التوليد بناءً على الإطارات المشوشة السابقة، مما يتيح توليد حركة بشرية طويلة المدى بكفاءة مع تقليل التكاليف الحسابية مع الحفاظ على توافق عالٍ مع النصوص الوصفية.

Mirgahney Mohamed, Harry Jake Cunningham, Marc P. Deisenroth, Lourdes Agapito2026-03-10