💻 computer science

WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens

يُعد WonTok مُجزئاً بصرياً هجيناً يفصل بين الفهم والتوليد عبر الجمع بين الرموز الدلالية القابلة للتعلم، والمستخلصة من نماذج تأسيسية مدربة مسبقاً، مع رموز البكسل لتحقيق أداء فائق في كلتا المهمتين باستخدام بيانات تدريب أقل بكثير من النهج الموحد الحالي.

Yiwei Guo, Shaobin Zhuang, Zhipeng Huang, Canmiao Fu, Chen Li, Jing Lyu, Yali Wang2026-05-19
💻 computer science

Rad-VLSM: A Cross-Modal Framework with Semantics-Assisted Prompting for Medical Segmentation and Diagnosis

يُعد Rad-VLSM إطار عمل ثنائي المراحل ومتعدد الوسائط يستفيد من نموذج BLIP-2 لتحديد موقع الآفات بتوجيه دلالي ومن نموذج SAM للتجميع القوي لضمان تجزئة دقيقة، مما يؤدي في النهاية إلى دمج الميزات البصرية والراديومية لتمكين التشخيص المستند إلى أدلة محددة للآفة بدلاً من التنبؤ المباشر من النص إلى التشخيص.

Fengyi Zhang, Xujie Zeng, Mohan Liu, Zengyi Wang, Yalong Jiang2026-05-19
💻 computer science

Who Generated This 3D Asset? Learning Source Attribution for Generative 3D Models

تتناول هذه الورقة تحدي تحديد المصدر التوليدي للأصول ثلاثية الأبعاد من خلال تقديم أول معيار لنسب المصدر السلبي يغطي 22 نموذجاً، واقتراح محول (Transformer) هرمي متعدد الرؤى ومتعدد الوسائط يحقق دقة عالية عبر دمج البصمات عبر الرؤى، والهندسية، والنطاق الترددي.

Sihan Ma, Siyuan Liang, Dacheng Tao2026-05-19
💻 computer science

Fixed External Cameras as Common Prior Maps for Active 3D Scene Graph Generation

تقدم هذه الورقة إطار عمل يعتمد على نظام RGB فقط ومستقل عن الأجهزة، يستخدم كاميرات خارجية ثابتة كخرائط أولية مشتركة لتمهيد وتوجيه توليد الرسوم البيانية للمشاهد ثلاثية الأبعاد النشط والتزايدي، مما يحسن بشكل كبير من استدعاء الكائنات الأولي وكفاءة الاستكشاف من خلال دمج المشاهد الخارجية واسعة المجال مع ملاحظات الروبوت على متن المنصة.

Giorgia Modi, Davide Buoso, Giuseppe Averta, Daniele De Martini2026-05-19
💻 computer science

Best Segmentation Buddies for Image-Shape Correspondence

تقدم هذه الورقة نهجاً مبتكراً لإنشاء مراسلات قوية من التجزئة إلى التجزئة بين الصور الطبيعية والأشكال ثلاثية الأبعاد غير المزخرفة من خلال سد الفجوة عبر الأنماط المختلفة باستخدام الميزات البصرية المستخلصة وتحديد "أفضل رفاق التجزئة" لربط بكسلات الصورة برؤوس الأشكال المتناظرة دلالياً.

Itai Lang, Dongwei Lyu, Dale Decatur, Rana Hanocka2026-05-19
💻 computer science

RGB-only Active 3D Scene Graph Generation for Indoor Mobile Robots

تقدم هذه الورقة إطار عمل بصرياً بالكامل، ومستقلاً عن الأجهزة، للبناء النشط والتزايدي لرسوم المشاهد ثلاثية الأبعاد باستخدام مدخلات RGB فقط، والذي يوحد بين الإدراك والتخطيط لتحقيق أداء مكافئ للعمق والتفوق بشكل كبير على النماذج الهندسية المرجعية في اكتشاف الأشياء من خلال اختيار وجهة النظر المدفوع دلالياً.

Giorgia Modi, Davide Buoso, Giuseppe Averta, Daniele De Martini2026-05-19
🔬 physics

SIREM: Speech-Informed MRI Reconstruction with Learned Sampling

إنَّ SIREM هو إطار عمل لإعادة بناء صور الرنين المغناطيسي المعتمد على الكلام، والذي يستفيد من الصوت المتزامن كأولوية عابرة للأنماط للتنبؤ بهياكل المجرى الصوتي ودمجها مع بيانات الفضاء-k ناقصة العينات، مما يتيح تصويراً عالي الإنتاجية وفي الوقت الفعلي مع الحفاظ على التفاصيل التشريحية.

Md Hasan, Nyvenn Castro, Daiqi Liu, Lukas Mulzer, Jana Hutter, Jonghye Woo, Moritz Zaiss, Andreas Maier, Paula A. Perez- (…)2026-05-19
💻 computer science

Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos

تقدم هذه الورقة MIGA، وهي طريقة جديدة لا تتطلب تدريباً لتوليد فيديوهات متسقة وغير متناهية الطول عبر توظيف آلية محاذاة ثنائية المرحلة لسد الفجوة بين التدريب والاستنتاج، واستراتيجية تعزيز اتساق مزدوجة تجمع بين التأمل الذاتي والتوجيه بعيد المدى لتحسين التماسك الزمني.

X. Feng, J. Zhu, M. Wu, C. Chen, F. Mao, H. Guo, J. Wu, X. Chu, K. Huang2026-05-19
💻 computer science

RT-Splatting: Joint Reflection-Transmission Modeling with Gaussian Splatting

يُعد RT-Splatting إطار عمل مبتكر يعزز تقنية "Gaussian Splatting" ثلاثية الأبعاد للمشاهد شبه الشفافة من خلال فصل الإشغال الهندسي عن العتامة البصرية لنمذجة الانعكاسات عالية الدقة والنفاذية الواضحة معًا ضمن تمثيل موحد، مع توظيف آلية "بوابة التدرج المدركة للانعكاس" (Specular-Aware Gradient Gating) للتخفيف من غموض الأمثلة وتمكين التصيير في الوقت الفعلي.

Ji Shi, Xianghua Ying, Bowei Xing, Ruohao Guo, Wenzhen Yue2026-05-19
📊 statistics

Improved Baselines with Representation Autoencoders

تقدم هذه الورقة RAEv2، وهو إطار عمل مُحسّن للمُشفّر التلقائي للتمثيل (Representation Autoencoder) يستفيد من التمثيلات متعددة الطبقات المعممة، وآليات REPA المتكاملة، والتوجيه المُعاد تمثيله لتحقيق تقارب أسرع بأكثر من 10 أضعاف وجودة توليد صور رائدة في مجال (state-of-the-art) على مجموعة بيانات ImageNet-256 دون الحاجة إلى تدريب ما بعد المعالجة.

Jaskirat Singh, Boyang Zheng, Zongze Wu, Richard Zhang, Eli Shechtman, Saining Xie2026-05-19