🤖 AI

StruMPL: Multi-task Dense Regression under Disjoint Partial Supervision and MNAR Labels

تُعد StruMPL إطار عمل جديد للانحدار الكثيف متعدد المهام يقوم بتقدير الكتلة الحيوية فوق الأرضية للغابات والمتغيرات الهيكلية بشكل مشترك من خلال دمج المشفرات المشتركة، وتصحيح البيانات المفقودة عشوائياً (MNAR) مكانياً عبر رؤوس الميل والتعويض، والقيود الفيزيائية القابلة للتعلم، باستخدام فقدان الوزن العكسي الاحتمالي المعزز (Augmented IPW) للتغلب بفعالية على تحديات الإشراف الجزئي المنفصل وتسميات البيانات المتحيزة.

Reza M. Asiyabi, Juan Alberto Molina-Valero, The SEOSAW Partnership, Steven Hancock, Casey M. Ryan2026-05-20
💻 computer science

Feed-Forward Gaussian Splatting from Sparse Aerial Views

تقدم هذه الورقة AnyCity، وهو إطار عمل توليدي ذو تغذية أمامية يعيد بناء مشاهد حضرية واسعة النطاق من مشاهد جوية متفرقة عبر الجمع بين الهندسة القائمة على الملاحظة والمنطلقات الانتشارية المشروطة بالهياكل الساندة لحل اختلالات الأدلة والقضاء على العيوب مثل التظليل الشبحي والواجهات المنصهرة.

Dongli Wu, Zhuoxiao Li, Tongyan Hua, Yinrui Ren, Xiaobao Wei, Rongjun Qin, Wufan Zhao2026-05-20
💻 computer science

AffectVerse: Emotional World Models for Multimodal Affective Computing

يُعد AffectVerse نموذجاً لغوياً ضخماً متعدد الوسائط يعزز الاستدلال العاطفي من خلال دمج "وحدة عالم المشاعر" (Emotion World Module) للقيام بالتنبؤ الوجداني الكامن قصير المدى عبر التخيل الزمني عابر الوسائط وتجميع المعتقدات، مما يسمح بالتقاط الديناميكيات العاطفية وتحقيق أداء فائق عبر تسعة معايير قياسية.

Bo Zhao, Fanghua Ye, Yixin Ji, Sicheng Zhao, Xiaojiang Peng, Zitong YU2026-05-20
💻 computer science

Towards Fine-Grained Robustness: Attention-Guided Test-Time Prompt Tuning for Vision-Language Models

تقترح الورقة البحثية طريقة "ضبط التلقين عند وقت الاختبار الموجه بالانتباه" (A-TPT)، وهي طريقة مبتكرة تستفيد من تدفق انتباه التدرج المنقح لتحديد المناطق ذات المعنى الدلالي تحت الهجمات العدائية، مما يوجه عمليات التعزيز المتغيرة مكانياً والتجميع متعدد الرؤى لتعزيز متانة النماذج البصرية اللغوية في السيناريوهات دقيقة التفاصيل.

Jia-Wei Hai, Yijun Wang, Xiu-Shen Wei2026-05-20
💻 computer science

SphericalDreamer: Generating Navigable Immersive 3D Worlds with Panorama Fusion

تُعد SphericalDreamer طريقة مبتكرة تولد بيئات خارجية ثلاثية الأبعاد غامرة بالكامل، وقابلة للتنقل، وبعيدة المدى من خلال نصوص وصفية، وذلك عبر إنشاء صور بانورامية متعددة، ورفعها إلى البعد الثالث، ودمجها مع ضمان الاتساق البصري والهندسي.

Antoine Schnepf, Karim Kassab, Flavian Vasile, Andrew Comport2026-05-20
🤖 machine learning

Minimalist Visual Inertial Odometry

تقدم هذه الورقة نظاماً تقليلياً لتتبع الموضع البصري-القصوري للروبوتات ذات الدفع التفاضلي، يحقق تقديراً قوياً للحركة المستوية من خلال التحسين المشترك لأقنعة "غابور" البصرية وشبكة تلافيفية زمنية لفك تشفير السرعة من أربع قياسات فقط لثنائيات ضوئية مدمجة مع بيانات القصور الذاتي الزاوية، مما يلغي الحاجة إلى كاميرات عالية الدقة أو الضبط الدقيق في العالم الحقيقي.

Francesco Pasti, Jeremy Klotz, Nicola Bellotto, Shree K. Nayar2026-05-20
💻 computer science

CogOmniControl: Reasoning-Driven Controllable Video Generation via Creative Intent Cognition

يُعد CogOmniControl إطار عمل قائمًا على الاستدلال يعمل على تعزيز توليد الفيديو القابل للتحكم من خلال دمج نموذج CogVLM متخصص للإدراك الدقيق للقصد الإبداعي مع مولد CogOmniDiT موحد وآلية اختيار "الأفضل من N" ذات حلقة مغلقة، مما يحقق أداءً فائقًا في المعايير المهنية مقارنة بالنماذج الحالية.

Hongji Yang, Songlian Li, Yucheng Zhou, Xiaotong Zhao, Alan Zhao, Chengzhong Xu, Jianbing Shen2026-05-20
💻 computer science

OP2GS: Object-Aware 3D Gaussian Splatting with Dual-Opacity Primitives

يقدم OP2GS إطار عمل لتقنية "Gaussian Splatting" ثلاثية الأبعاد مدركة للأجسام، يستخدم آلية عتامة مزدوجة لفصل إعادة البناء المرئي عن إشغال المثيل، مما يتيح فهماً فعالاً للمشاهد ذات المفردات المفتوحة دون تكاليف التخزين الباهظة للطرق القائمة على الميزات أو مشكلات تلوث الملصقات في خطوط أنابيب الرفع من 2D إلى 3D.

Guiyu Liu, Niklas Vaara, Janne Mustaniemi, Juho Kannala, Janne Heikkilä2026-05-20
💻 computer science

Spatially Prompted Visual Trajectory Prediction for Egocentric Manipulation

تقدم هذه الورقة المهمة المستحدثة المتمثلة في التنبؤ بالمسار البصري الموجه مكانياً (SP-VTP) للتحكم الذاتي من منظور الشخص الأول، والمدعومة بمجموعة بيانات EgoSPT الجديدة ونموذج SPOT، الذي يستفيد من التوجيهات المكانية الأولية للتنبؤ بمسارات النهاية الطرفية المستقبلية في البيئات الديناميكية والمزدحمة.

Yifan Li, Xinyu Zhou, Yunhao Ge, Yu Kong2026-05-20
💬 NLP

Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models

تقدم هذه الورقة MedFocus، وهو أسلوب عزو قائم على المفاهيم يستفيد من التقييم السببي والنقل الأمثل غير المتوازن لتحديد المناطق ذات المعنى السريري في صور الأشعة السينية للصدر بدقة، مما يعالج فشل الأساليب الحالية في تفسير استدلال نماذج الرؤية واللغة الكبيرة بصدق في التطبيقات الطبية.

Guangzhi Xiong, Qiao Jin, Sanchit Sinha, Zhiyong Lu, Aidong Zhang2026-05-20