🤖 AI

MessyKitchens: Contact-rich object-level 3D scene reconstruction

تقدم هذه الورقة مجموعة بيانات MessyKitchens، التي تتميز بحقيقة أرضية عالية الدقة للمشاهد الواقعية المزدحمة مع اتصالات دقيقة بين الأجسام، وتقترح مُفكك شفرة متعدد الأجسام (MOD) يوسع طرق إعادة البناء أحادية الأجسام لتحقيق إعادة بناء ثلاثية الأبعاد للمشاهد غنية بالاتصالات وواقعية فيزيائياً بأداء رائد.

Junaid Ahmed Ansari, Ran Ding, Fabio Pizzati, Ivan Laptev2026-03-18
💻 computer science

SegviGen: Repurposing 3D Generative Model for Part Segmentation

يقدم SegviGen إطار عمل مبتكر يعيد توظيف النماذج التوليدية ثلاثية الأبعاد مسبقة التدريب لتحقيق حالة متقدمة في تقسيم الأجزاء ثلاثية الأبعاد بأقل قدر من الإشراف، وذلك عبر الاستفاتادة من الأولويات الهيكلية لتلوين الأجزاء المميزة، مما يجعله يتفوق على الأساليب الحالية مع اشتراطه 0.32% فقط من بيانات التدريب المصنفة.

Lin Li, Haoran Feng, Zehuan Huang, Haohua Chen, Wenbo Nie, Shaohua Hou, Keqing Fan, Pan Hu, Sheng Wang, Buyu Li, Lu Shen (…)2026-03-18
🤖 AI

Demystifing Video Reasoning

تتحدى هذه الورقة فرضية "سلسلة الإطارات" السائدة من خلال إثبات أن الاستنتاج في نماذج الفيديو القائمة على الانتشار ينبثق أساساً عبر آلية "سلسلة الخطوات" عبر تكرارات إزالة الضجيج، والتي تتميز بسلوكيات ناشئة مثل الذاكرة العاملة والتصحيح الذاتي، والتي يمكن الاستفادة منها عبر استراتيجية تجميع خالية من التدريب لتعزيز الأداء.

Ruisi Wang, Zhongang Cai, Fanyi Pu, Junxiang Xu, Wanqi Yin, Maijunxian Wang, Ran Ji, Chenyang Gu, Bo Li, Ziqi Huang, Hok (…)2026-03-18
💻 computer science

WorldCam: Interactive Autoregressive 3D Gaming Worlds with Camera Pose as a Unifying Geometric Representation

تقدم هذه الورقة البحثية WorldCam، وهو إطار عمل مبتكر يستخدم وضعية الكاميرا كتمثيل هندسي موحد لتعزيز نماذج عوالم الألعاب ثلاثية الأبعاد التفاعلية من خلال تمكين التحكم الدقيق في الإجراءات عبر تضمين الكاميرا القائم على جبر لي (Lie algebra)، وضمان الاتساق ثلاثي الأبعاد طويل المدى عبر الاسترجاع الموجه بالوضعية العالمية، وكل ذلك مدعوم بمجموعة بيانات ألعاب ضخمة وموسومة حديثة.

Jisu Nam, Yicong Hong, Chun-Hao Paul Huang, Feng Liu, JoungBin Lee, Jiyoung Kim, Siyoon Jin, Yunsung Lee, Jaeyoon Jung (…)2026-03-18
⚡ electrical engineering

MultiTask Learning AI system to assist BCC diagnosis with dual explanation

تقدم هذه الدراسة نظام ذكاء اصطناعي شفافًا للتعلم متعدد المهام يعتمد على MobileNet-V2 وGrad-CAM، يحقق دقة بنسبة 90% في اكتشاف سرطان الخلايا القاعدية من الصور الجلدية مع تقديم تفسيرات قائمة على الأنماط ذات صلة سريرية لتعزيز الثقة في سير عمل طب الجلد عن بُعد.

Iván Matas, Carmen Serrano, Francisca Silva, Amalia Serrano, Tomás Toledo-Pastrana, Begoña Acha2026-03-17
🤖 machine learning

Exploring Low-Dimensional Subspaces in Diffusion Models for Controllable Image Editing

تقدم هذه الورقة LOCO Edit، وهو أسلوب غير خاضع للإشراف وخالٍ من التدريب لتعديل الصور، يستفيد من الاكتشاف النظري للفضاءات الفرعية الدلالية منخفضة الأبعاد والخطية المحلية في نماذج الانتشار لتحقيق تعديلات محلية دقيقة، ومنفصلة، وقابلة للتحكم دون تدريب إضافي.

Siyi Chen, Huijie Zhang, Minzhe Guo, Yifu Lu, Peng Wang, Qing Qu2026-03-17
⚡ electrical engineering

MSEG-VCUQ: Multimodal SEGmentation with Enhanced Vision Foundation Models, Convolutional Neural Networks, and Uncertainty Quantification for High-Speed Video Phase Detection Data

تقترح هذه الورقة إطار عمل هجين يُدعى MSEG-VCUQ، يجمع بين شبكات U-Net CNN ونموذج Segment Anything Model (SAM) مع تقدير عدم اليقين لتحقيق تجزئة قوية وعالية الدقة لبيانات كشف الطور في الفيديو عالي السرعة، مع تقديم أول مجموعات بيانات متعددة الوسائط مفتوحة المصدر لهذا المجال.

Chika Maduabuchi, Ericmoore Jossou, Matteo Bucci2026-03-17
💻 computer science

INST-IT: Boosting Instance Understanding via Explicit Visual Prompt Instruction Tuning

تقدم الورقة البحثية Inst-IT، وهو إطار عمل شامل يتكون من معيار تشخيصي، ومجموعة بيانات لضبط التعليمات واسعة النطاق، ونموذج تدريب مستمر يستفيد من المطالبات المرئية الصريحة لتعزيز قدرات الفهم على مستوى الحالة والفهم العام في النماذج اللغوية الكبيرة متعددة الوسائط بشكل كبير.

Wujian Peng, Lingchen Meng, Yitong Chen, Yiweng Xie, Yang Liu, Tao Gui, Hang Xu, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang2026-03-17
⚡ electrical engineering

Adaptive Voxel-Weighted Loss Using L1 Norms in Deep Neural Networks for Detection and Segmentation of Prostate Cancer Lesions in PET/CT Images

تقترح هذه الورقة دالة فقد "دايس فوكالال" الموزونة بـ L1 (L1-weighted Dice Focal Loss)، وهي دالة فقد تكيفية تعمل على موازنة مقادير التدرج لمعالجة عدم توازن الفئات وتغاير الآفات بفعالية، مما يتفوق بشكل كبير على دوال الفقد التقليدية في اكتشاف وتجزئة آفات سرطان البروستاتا المتكررة عبر بنيات التعلم العميق المتعددة باستخدام صور PSMA PET/CT.

Obed Korshie Dzikunu, Shadab Ahamed, Amirhossein Toosi, Xiaoxiao Li, Arman Rahmim2026-03-17
⚡ electrical engineering

Deep Learning-based Event Data Coding: A Joint Spatiotemporal and Polarity Solution

تقترح هذه الورقة إطار عمل جديد لترميز بيانات الأحداث المشترك القائم على التعلم العميق وفاقد للبيانات (DL-JEC)، والذي يستخدم تمثيلاً لسحابة نقاط أحادية مع اعتبار القطبية سمة و التبنيز المتكيف للمكعبات (voxel binarization) لتحقيق مكاسب ضغط كبيرة مقارنة بالمعايير الحديثة مع الحفاظ على أداء عالٍ لمهام الرؤية الحاسوبية.

Abdelrahman Seleem (Instituto Superior Técnico - Universidade de Lisboa, Lisbon, Portugal), André F. R. Guarda (Institut (…)2026-03-17