💻 computer science

Affine-Equivariant Kernel Space Encoding for NeRF Editing

تقدم هذه الورقة ترميز فضاء النواة المتماثل مع التآلف (EKS)، وهو ترميز مكاني مبتكر لمجالات الإشعاع العصبي يستخدم نوى غاوسية متباينة الخواص وتقطير الميزات لتمكين تحرير المشاهد الموضعي الواعي للتشوه مع رندرة عالية الدقة مع الحفاظ على تمثيل مدمج وخالٍ من الشبكات.

Mikołaj Zieliński, Krzysztof Byrski, Tomasz Szczepanik, Dominik Belter, Przemysław Spurek2026-02-04
⚡ electrical engineering

A Survey of Medical Point Cloud Shape Learning: Registration, Reconstruction and Variation

تقدم هذه الورقة مسحاً شاملاً لتحليل أشكال السحب النقطية الطبية القائمة على التعلم العميق من عام 2021 إلى عام 2025، حيث تستعرض بشكل منهجي الأساليب، ومجموعات البيانات، والتحديات عبر عمليات التسجيل، وإعادة البناء، ونمذجة التباين، مع تحديد الاتجاهات المستقبلية للنشر السريري.

Tongxu Zhang, Zhiming Liang, Bei Wang2026-02-04
🤖 AI

Training-Free Text-Guided Color Editing with Multi-Modal Diffusion Transformer

تقدم هذه الورقة ColorCtrl، وهي طريقة لا تتطلب تدريباً تستفيد من نماذج المحولات الانتشارية متعددة الوسائط لتحقيق تحرير لوني دقيق ومتسق ومستقر زمنياً بتوجيه نصي في الصور والفيديوهات من خلال فصل البنية واللون عبر التلاعب المستهدف بخرائط الانتباه والرموز.

Zixin Yin, Xili Dai, Ling-Hao Chen, Deyu Zhou, Jianan Wang, Duomin Wang, Gang Yu, Lionel M. Ni, Lei Zhang, Heung-Yeung S (…)2026-02-04
💻 computer science

MultiMAE for Brain MRIs: Robustness to Missing Inputs Using Multi-Modal Masked Autoencoder

تقدم هذه الورقة البحثية مشفرًا تلقائيًا متعدد الوسائط مقنعًا (MultiMAE) لتحليل صور الرنين المغناطيسي ثلاثية الأبعاد للدماغ، والذي يستفيد من الاستدلال عبر التسلسلات أثناء مرحلة ما قبل التدريب للتعامل بمتانة مع تسلسلات المدخلات المفقودة، مما يؤدي إلى تحسينات كبيرة في الأداء مقارنة بالنماذج المرجعية في مهام التجزئة والتصنيف اللاحقة.

Ayhan Can Erdur, Christian Beischl, Daniel Scholz, Jiazhen Pan, Benedikt Wiestler, Daniel Rueckert, Jan C Peeken2026-02-04
💻 computer science

LazyDrag: Enabling Stable Drag-Based Editing on Multi-Modal Diffusion Transformers via Explicit Correspondence

يقدم LazyDrag أول طريقة تحرير صور تعتمد على السحب لنماذج محولات الانتشار متعددة الوسائط، والتي تلغي الاعتماد على المطابقة الضمنية للنقاط من خلال توليد خرائط تطابق صريحة، مما يتيح عكسًا مستقرًا بكامل القوة دون الحاجة إلى تحسين وقت الاختبار، ويحقق أداءً رائدًا في التحكم الهندسي الدقيق والتحريرات المعقدة الموجهة بالنصوص.

Zixin Yin, Xili Dai, Duomin Wang, Xianfang Zeng, Lionel M. Ni, Gang Yu, Heung-Yeung Shum2026-02-04
⚡ electrical engineering

L2M-Reg: Building-level Uncertainty-aware Registration of Outdoor LiDAR Point Clouds and Semantic 3D City Models

تقترح هذه الورقة البحثية L2M-Reg، وهي طريقة جديدة للتسجيل الدقيق القائم على المستويات تعالج صراحةً عدم يقين التعميم في نماذج المدن ثلاثية الأبعاد ذات التفاصيل الدلالية من المستوى الثاني (LoD2) لتحقيق محاذاة دقيقة وفعالة على مستوى المباني مع سحب النقاط لليدار (LiDAR) الخارجية.

Ziyang Xu, Benedikt Schwab, Yihui Yang, Thomas H. Kolbe, Christoph Holst2026-02-04
💬 NLP

Beyond the Vision Encoder: Identifying and Mitigating Spatial Bias in Large Vision-Language Models

تحدد هذه الورقة أن التحيز المكاني في نماذج الرؤية واللغة الكبيرة ينبع من عدم تطابق الانتباه بين مشفر الرؤية والنموذج اللغوي بدلاً من المشفر نفسه، وتقترح آلية خفيفة الوزن لحقن السياق العالمي التكيفي (AGCI) للتخفيف من هذا التحيز وتعزيز المتانة المكانية دون إجراء تعديلات هيكلية.

Yingjie Zhu, Xuefeng Bai, Kehai Chen, Yang Xiang, Youcheng Pan, Yongshuai Hou, Weili Guan, Jun Yu, Min Zhang2026-02-04
🤖 AI

video-SALMONN S: Memory-Enhanced Streaming Audio-Visual LLM

تقدم الورقة البحثية نموذج video-SALMONN S، وهو نموذج لغوي كبير صوتي-بصري تدفقي معزز بالذاكرة، يستخدم التدريب في وقت الاختبار لتحويل التمثيلات قصيرة المدى باستمرار إلى ذاكرة طويلة المدى، مما يمكنه من معالجة فيديوهات تزيد مدتها عن 3 ساعات والتفوق بشكل كبير على النماذج الحالية في معايير التعلم طويل الأمد والتعلم العرضي.

Guangzhi Sun, Yixuan Li, Xiaodong Wu, Yudong Yang, Wei Li, Zejun Ma, Chao Zhang2026-02-04
💬 NLP

SAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuning

يُعد SAIL-RL إطار عمل للتعلم التعزيزي ثنائي المكافأة يعمل على تعزيز النماذج اللغوية الكبيرة متعددة الوسائط من خلال تعليمها تكيفياً متى تنخرط في التفكير العميق مقابل الإجابة المباشرة، مما يؤدي إلى تحسين دقة الاستنتاج، وتقليل الهلوسة، وتحقيق أداء تنافسي ضد النماذج التجارية رفيعة المستوى.

Fangxun Shu, Yongjie Ye, Yue Liao, Zijian Kang, Weijie Yin, Jiacong Wang, Xiao Liang, Shuicheng Yan, Chao Feng2026-02-04
💻 computer science

Rethinking Efficient Mixture-of-Experts for Remote Sensing Modality-Missing Classification

تقترح هذه الورقة إطار عمل MaMOL، وهو إطار عمل "خليط من LoRAs" (Mixture-of-LoRAs) فعال في المعلمات ومدرك لفقدان البيانات، يستخدم آلية توجيه مزدوجة لتوحيد سيناريوهات فقدان الأنماط المتنوعة في تصنيف الاستشعار عن بعد، مما يعزز بشكل كبير من متانة النموذج وقدرته على التعميم مع حد أدنى من التكاليف الحسابية الإضافية.

Qinghao Gao, Jiahui Qu, Wenqian Dong2026-02-04