🤖 AI

CLoPA: Continual Low Parameter Adaptation of Interactive Segmentation for Medical Image Annotation

تقترح الورقة البحثية CLoPA، وهي استراتيجية تكيّف مستمر منخفضة المعلمات، تعمل على ضبط جزء ضئيل من نموذج nnInteractive بناءً على بيانات التوسيم الواردة بكفاءة، مما يحقق بسرعة أداءً بمستوى الخبراء عبر مهام التصوير الطبي المتنوعة دون الحاجة إلى معلمات جديدة أو تغيير مسار الاستدلال.

Parhom Esmaeili, Chayanin Tangwiriyasakul, Eli Gibson, Sebastien Ourselin, M. Jorge Cardoso2026-03-09
💻 computer science

What if? Emulative Simulation with World Models for Situated Reasoning

تقدم هذه الورقة WanderDream، وهي أول مجموعة بيانات واسعة النطاق تضم فيديوهات بانورامية وأزواجاً من الأسئلة والأجوبة تُمكّن الوكلاء من إجراء الاستدلال الموقفي من خلال المحاكاة الذهنية التقمصية للمسارات المستقبلية، مما يتغلب على القيود الفيزيائية وقيود السلامة للاستكشاف الفعلي في العالم الحقيقي.

Ruiping Liu, Yufan Chen, Yuheng Zhang, Junwei Zheng, Kunyu Peng, Chengzhi Wu, Chenguang Huang, Di Wen, Jiaming Zhang, Ka (…)2026-03-09
💻 computer science

Training Flow Matching: The Role of Weighting and Parameterization

تتقصى هذه الورقة بشكل منهجي كيفية تفاعل خيارات ترجيح الفقد وبارامترية المخرجات في نماذج مطابقة التدفق مع أبعاد البيانات، والبنية، وحجم مجموعة البيانات، لتقديم رؤى تصميمية عملية لتحسين كل من دقة إزالة الضجيج وجودة التوليد.

Anne Gagneux, Ségolène Martin, Rémi Gribonval, Mathurin Massias2026-03-09
🤖 AI

Do Foundation Models Know Geometry? Probing Frozen Features for Continuous Physical Measurement

تُثبت هذه الورقة أن سمات نماذج الرؤية واللغة المجمدة تحتوي على معلومات هندسية غنية ومستمرة تتفوق على المخرجات القائمة على النصوص بمقدار 3.3 ضعفًا، مما يكشف أن عنق الزجاجة في الدقة ينبع من أهداف التدريب والتوليد ذاتي الانحدار بدلاً من القيود التمثيلية، كما يتضح من خلال المسابير الخطية عالية الدقة والأداء المتسق عبر بنيات مشفرات متنوعة.

Yakov Pyotr Shkolnikov2026-03-09
💻 computer science

Match4Annotate: Propagating Sparse Video Annotations via Implicit Neural Feature Matching

يُعد Match4Annotate إطار عمل خفيف الوزن يتيح انتشاراً فعالاً وعالي الجودة لتعليقات النقاط والأقنعة المتفرقة عبر تسلسلات الفيديو وداخلها، وذلك من خلال ملاءمة التمثيلات العصبية الضمنية في وقت الاختبار مع ميزات DINOv3، مما يقدم حلاً قابلاً للتوسع لعقبات التعليق في المجالات المتخصصة مثل التصوير الطبي.

Zhuorui Zhang, Roger Pallarès-López, Praneeth Namburi, Brian W. Anthony2026-03-09
💻 computer science

AV-Unified: A Unified Framework for Audio-visual Scene Understanding

تقترح الورقة البحثية AV-Unified، وهو إطار عمل مبتكر يوحد مهام فهم المشاهد السمعية البصرية المتنوعة في بنية واحدة من خلال تحويل المدخلات والمخرجات غير المتجانسة إلى تسلسلات رمزية منفصلة وتوظيف وحدات إدراك مكاني-زماني متعددة المقاييس لالتقاط الارتباطات عبر الوسائط بفعالية.

Guangyao Li, Xin Wang, Wenwu Zhu2026-03-09
💻 computer science

Spatial Calibration of Diffuse LiDARs

تقدم هذه الورقة طريقة معايرة مكانية لأجهزة ليدار (LiDAR) ذات زمن الطيران المباشر المنتشر، والتي تُقدّر بصمات كل بكسل وخرائط الحساسية في مستوي صورة RGB باستخدام رقعة عاكسة للضو belakang مسحوبة، مما يتيح محاذاة ودمجاً دقيقين عبر الوسائط رغم انتهاك افتراضات الشعاع الواحد القياسية.

Nikhil Behari, Ramesh Raskar2026-03-09
💻 computer science

SurgFormer: Scalable Learning of Organ Deformation with Resection Support and Real-Time Inference

تقدم الورقة البحثية SurgFormer، وهو محول بوابي متعدد الدقة وقابل للتوسع يتيح محاكاة عالية الدقة للأنسجة الرخوة في الوقت الفعلي تقريبًا على الشبكات الحجمية من خلال تعلم التنبؤ بالإزاحات عند العقد والتعامل مع عمليات الاستئصال التي تغير الطوبولوجيا عبر إطار عمل موحد تحت إشراف طريقة العناصر المنتهية الممتدة (XFEM).

Ashkan Shahbazi, Elaheh Akbari, Kyvia Pereira, Jon S. Heiselman, Annie C. Benson, Garrison L. H. Johnston, Jie Ying Wu (…)2026-03-09
💻 computer science

Modeling and Measuring Redundancy in Multisource Multimodal Data for Autonomous Driving

تستقصي هذه الورقة البحثية التكرار كعامل حاسم وغير مستكشف بما يكفي لجودة البيانات في القيادة الذاتية من خلال نمذجته وقياسه عبر مجموعات بيانات متعددة المصادر ومتعددة الوسائط، مبرهنةً على أن الإزالة الانتقائية للتسميات المكررة من مناظر الكاميرا المتداخلة وأزواج الصور-ليدار (image-LiDAR) يمكن أن تحسن أو تحافظ على أداء اكتشاف الأشياء، مع الدعوة إلى نهج متمحور حول البيانات لتحسين مجموعات بيانات المركبات ذاتية القيادة.

Yuhan Zhou, Mehri Sattari, Haihua Chen, Kewei Sha2026-03-09
🤖 AI

SUREON: A Benchmark and Vision-Language-Model for Surgical Reasoning

تقدم الورقة البحثية SUREON، وهي مجموعة بيانات ضخمة للأسئلة والأجوبة حول الفيديوهات الجراحية مستمدة من التعليقات الصوتية للمحاضرات الأكاديمية، وتقدم نموذجين متخصصين في الرؤية واللغة يظهران قدرات فائقة في الاستنتاج الجراحي من خلال التفسير الصريح للقصد، والمنطق، والخطوات المستقبلية في المشاهد الجراحية.

Alejandra Perez, Anita Rau, Lee White, Busisiwe Mlambo, Chinedu Nwoye, Muhammad Abdullah Jamal, Omid Mohareri2026-03-09