💻 computer science

Helix4D: Complex 4D Mesh Generation

يُعد Helix4D إطار عمل ديناميكي لتوليد الشبكات (mesh generation) يعمل على تطويع بنية Trellis2 لإنشاء محتوى رباعي الأبعاد مشروط بالفيديو، وذلك عبر إدخال آلية انتباه عبر الإطارات بنظام النافذة المنزلقة وتشفير زمني رباعي الأبعاد خالٍ من المعلمات للتغلب على تحديات التغيرات المعقدة في الطوبولوجيا، والمواد الشفافة، والهياكل الدقيقة.

Jiraphon Yenphraphai, Jianqi Chen, Jian Wang, Gordon Qian, Sergey Tulyakov, Rameen Abdal, Raymond A. Yeh, Peter Wonka, C (…)2026-05-26
💻 computer science

AnyScene: Towards Highly Controllable Driving Scene Generation at Anywhere and Beyond

تقترح الورقة البحثية AnyScene، وهو إطار عمل موحد متمحور حول الإشغال يستفيد من محول انتشار إشغالي مكاني-زماني ووحدة توسيع منظور قائمة على الهندسة لتوليد فيديوهات قيادة متعددة المشاهد عالية الدقة، وعالية التحكم، ومتسقة زمنياً من تخطيطات رؤية علوية (BEV) عشوائية دون الاعتماد على إطارات مرجعية.

Haiming Zhang, Junfei Zhou, Feng Jiang, Jingzhong Li, Zhenglong Guo, Penglin Dai, Jifeng Dai, Yan Xie, Benjin Zhu2026-05-26
🤖 AI

MirrorCheck: Efficient Adversarial Defense for Vision-Language Models

تقترح الورقة البحثية MirrorCheck، وهو إطار عمل للكشف يتميز بالمتانة وعدم الارتباط بنموذج محدد، يدافع عن نماذج الرؤية واللغة ضد الهجمات العدائية التكيفية من خلال الاستفادة من إعادة توليد "النص إلى صورة" للتحقق من الاتساق الدلالي، معززًا باختيار النماذج العشوائي واضطرابات الاستخدام لمرة واحدة.

Samar Fares, Klea Ziu, Toluwani Aremu, Nikita Durasov, Martin Takáč, Pascal Fua, Karthik Nandakumar, Ivan Laptev2026-05-25
💻 computer science

BVI-RLV: A Fully Registered Dataset for Low-Light Video Enhancement

تقدم هذه الورقة البحثية BVI-RLV، وهي مجموعة بيانات فيديو للإضاءة المنخفضة مسجلة بالكامل وتضم أكثر من 30,000 إطار محاذٍ بدقة دون البكسل عبر مشاهد ديناميكية متنوعة، والتي تثبت أن التسجيل الدقيق أمر بالغ الأهمية لتدريب نماذج التعلم العميق لتحقيق أداء فائق في تحسين الفيديو في ظروف الإضاءة المنخفضة مقارنة بمجموعات البيانات غير المسجلة الموجودة حالياً.

Ruirui Lin, Guoxi Huang, Joanne Lin, Qi Sun, Alexandra Malyugina, David R Bull, Nantheera Anantrasirichai2026-05-25
🤖 AI

TerraQ: Spatiotemporal Question-Answering on Satellite Image Archives

تُعد TerraQ نظاماً لمعالجة اللغات الطبيعية صُمم لجعل بيانات مراقبة الأرض أكثر سهولة في الوصول إليها من خلال تمكين المستخدمين من الاستعلام عن أرشيفات الصور الساتلية باستخدام طلبات باللغة الطبيعية تجمع بين البيانات الوصفية وكيانات قاعدة المعرفة المتخصصة.

Sergios-Anestis Kefalidis, Konstantinos Plas, Manolis Koubarakis2026-05-25
💻 computer science

Using Ensemble Diffusion to Estimate Uncertainty for End-to-End Autonomous Driving

تقدم هذه الورقة EnDfuser، وهو نظام قيادة ذاتية من طرف إلى طرف يستخدم الانتشار التجميعي لتوليد توزيع من المسارات المرشحة من بيانات الإدراك المدمجة، مما يتيح اتخاذ قرارات مدركة لعدم اليقين تعمل على تحسين أداء القيادة وقابلية التفسير على معيار LAV.

Florian Wintel, Sigmund H. Høeg, Gabriel Kiss, Frank Lindseth2026-05-25
💻 computer science

Mitigating Object Hallucinations via Sentence-Level Early Intervention

تقدم الورقة البحثية SENTINEL، وهو إطار عمل يعمل على الحد من هلاوس الكائنات في النماذج اللغوية الكبيرة متعددة الوسائط من خلال تعزيز بيانات التفضيل داخل النطاق عبر كواشف ذات مفردات مفتوحة وتطبيق تعلم التفضيل المعتمد على السياق على مستوى الجملة للتدخل المبكر في عملية التوليد دون الحاجة إلى تعليقات توضيحية بشرية.

Shangpin Peng, Senqiao Yang, Li Jiang, Zhuotao Tian2026-05-25
🤖 AI

A drone-based framework for coral habitat mapping via weakly supervised segmentation

تقدم هذه الورقة إطار عمل للتقسيم ضعيف الإشراف متعدد المقاييس يستفيد من التصنيفات على مستوى النقاط من الصور تحت الماء والجوية لتدريب نماذج عالية الدقة لرسم خرائط موائل الشعاب المرجانية واسعة النطاق، محققاً دقة كبيرة دون الحاجة إلى تعليقات توضيحية على مستوى البكسل.

Matteo Contini, Victor Illien, Sylvain Poulain, Serge Bernard, Julien Barde, Sylvain Bonhommeau, Alexis Joly2026-05-25
💻 computer science

Dynamic Weight-based Temporal Aggregation for Low-light Video Enhancement Under Extreme Noise

تقترح الورقة البحثية DWTA-Net، وهو إطار عمل عميق متكرر ومبتكر للتعلم العميق لتحسين الفيديو في ظروف الإضاءة المنخفضة، يجمع بين المحاذاة متعددة الإطارات القائمة على نموذج Mamba والتجميع الزمني القائم على الأوزان الديناميكية الموجه بالتدفق البصري، وذلك لقمع الضجيج الشديد بفعالية مع الحفاظ على الاتساق الزمني والتفاصيل الدقيقة.

Ruirui Lin, Guoxi Huang, Nantheera Anantrasirichai2026-05-25
💻 computer science

A solution to generalized learning from small training sets found in infant repeated visual experiences of individual objects

تُبين هذه الورقة أن التوزيع "المتكتل" وشديد الانحراف للتجارب البصرية التي يواجهها الرضع في حياتهم اليومية — والذي يتميز بالتعرض المتكرر لعدد قليل من نماذج أشياء محددة ضمن مجموعات مترابطة — يُمكّن من التعميم السريع للفئات من خلال أمثلة تدريبية قليلة جداً، مما يقدم حلاً مستوحىً بيولوجياً للتعلم الآلي على مجموعات البيانات الصغيرة.

Frangil Ramirez, Elizabeth Clerkin, David J. Crandall, Linda B. Smith2026-05-25