💻 computer science

Hearing the Room Through the Shape of the Drum: Modal-Guided Sound Recovery from Multi-Point Surface Vibrations

تقدم هذه الورقة طريقة مبتكرة موجهة بالفيزياء تعمل على استعادة صوت المشهد من اهتزازات أسطح الأجسام الصلبة الصعبة عبر التقاط اهتزازات متعددة النقاط وعكس دالة نقل الرنين الخاصة بالجسم باستخدام نموذج تشكيل قائم على النمط، مما يتفوق بشكل كبير على النهج الحالية أحادية النقطة ومعالجة الإشارات.

Shai Bagon, Matan Kichler, Mark Sheinin2026-04-30
💻 computer science

TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection

تقدم هذه الورقة معياراً شاملاً يثبت أن نماذج الرؤية التأسيسية الحديثة تتفوق بشكل كبير على نموذج CLIP في اكتشاف الصور المولدة بواسطة الذكاء الاصطناعي، وتقترح رأس تصنيف يعتمد على تجميع الانتباه القابل للضبط (TAP) يستفيد من هذه النماذج لتحقيق أداء قياسي جديد في اختبارات الكشف الميدانية الصعبة.

Ahmed Abdullah, Nikolas Ebert, Oliver Wasenmüller2026-04-30
💻 computer science

Bridge: Basis-Driven Causal Inference Marries VFMs for Domain Generalization

تقترح هذه الورقة البحثية إطار عمل **Bridge**، وهو إطار عمل جديد قائم على القواعد يدمج الاستدلال السببي مع نماذج الرؤية التأسيسية للتخفيف من الارتباطات الزائفة وتعزيز التعميم النطاقي في اكتشاف الأشياء من خلال تعلم قواعد منخفضة الرتبة لتعديل الباب الأمامي.

Mingbo Hong, Feng Liu, Caroline Gevaert, George Vosselman, Hao Cheng2026-04-30
💻 computer science

Breaking the Rigid Prior: Towards Articulated 3D Anomaly Detection

تقدم هذه الورقة البحثية ArtiAD، وهو أول معيار مرجعي واسع النطاق للكشف عن الشذوذ في الأشكال ثلاثية الأبعاد المفصلية، وتقترح طريقة حقل المسافة الموقعة المدركة للشكل والوضعية (SPA-SDF) للتغلب على قيود الأولويات الصلبة من خلال الفصل الصريح بين التباينات الهندسية الناجمة عن الوضعية وبين العيوب الهيكلية الحقيقية.

Jinye Gan, Bozhong Zheng, Xiaohao Xu, Junye Ren, Zixuan Zhang, Na Ni, Yingna Wu2026-04-30
🤖 machine learning

KAYRA: A Microservice Architecture for AI-Assisted Karyotyping with Cloud and On-Premise Deployment

تقدم هذه الورقة KAYRA، وهي بنية خدمات مصغرة قائمة على الحاويات لنمط نووي مدعوم بالذكاء الاصطناي، تجمع بين خط معالجة تعلم عميق متتالي ونشر مرن عبر السحابة أو في الموقع، مما أظهر تحسينات ذات دلالة إحصائية في دقة التجزئة والتصنيف مقارنة بالأنظمة التجارية القائمة في تقييم سريري تجريبي.

Attila Pintér, Javier Rico, Attila Répai, Jalal Al-Afandi, Adrienn Éva Borsy, András Kozma, Hajnalka Andrikovics, György (…)2026-04-30
💻 computer science

Three-Step Nav: A Hierarchical Global-Local Planner for Zero-Shot Vision-and-Language Navigation

يُعد Three-Step Nav مخططاً هرمياً يعتمد على التعلم الصفري (zero-shot)، حيث يستفيد من النماذج اللغوية الكبيرة متعددة الوسائط لتحسين الملاحة القائمة على الرؤية واللغة عبر تنفيذ بروتوكول ثلاثي الرؤى يتضمن التخطيط العالمي الأمامي، ومحاذاة الهدف الفرعي الحالي، وتدقيق المسار الخلفي للقضاء على الانحراف وتحقيق أداء رائد في مجموعات بيانات R2R-CE وRxR-CE دون الحاجة إلى الضبط الدقيق.

Wanrong Zheng, Yunhao Ge, Laurent Itti2026-04-30
🤖 machine learning

Soft-TransFormers for Continual Learning

مستوحىً من فرضية تذكرة اليانصيب جيدة التهيئة، يقدم البحث "Soft-Transformer" (Soft-TF)، وهو إطار عمل للتعلم المستمر فعال في استخدام المعلمات، يستخدم أقنعة ضربية ذات قيم حقيقية ناعمة على إسقاطات الانتباه الذاتي لنموذج "Transformer" مدرب مسبقاً ومجمد، مدمجاً مع آلية تعزيز مزدوجة لتحقيق أداء يضاهي أفضل النتائج الحالية مع التخفيف بفعالية من النسيان الكارثي.

Haeyong Kang, Chang D. Yoo2026-04-29
💻 computer science

Multimodal Contextualized Support for Enhancing Video Retrieval System

تقترح هذه الورقة نظاماً مبتكراً لاسترجاع الفيديو يتغلب على قيود تحليل الإطار الواحد من خلال دمج البيانات متعددة الوسائط من إطارات فيديو متعددة لالتقاط رؤى وتصورات مجردة وعالية المستوى ومعانٍ كامنة من أجل نتائج استعلام أكثر دقة.

Quoc-Bao Nguyen-Le, Thanh-Huy Le-Nguyen2026-04-29
💻 computer science

Novel 3D Binary Indexed Tree for Volume Computation of 3D Reconstructed Models from Volumetric Data

تقدم هذه الورقة خوارزمية مبتكرة تدمج حساب التفاضل والتكامل متعدد المتغيرات، وطريقة المكعبات الزاحفة (marching cube)، وشجرة الفنويك الثنائية ثلاثية الأبعاد (3D Binary Indexed Tree) لتمكين الحساب الفعال والدقيق للأحجام ثلاثية الأبعاد من بيانات التصوير المقطعي المحوسب (CT) أو التصوير بالرنين المغناطيسي (MR)، محققةً دقة عالية مع انحرافات ضمن نطاق ±0.004cm3\pm 0.004 \text{cm}^3 عبر مختلف البنى التشريحية.

Quoc-Bao Nguyen-Le, Tuan-Hy Le, Anh-Triet Do2026-04-29
💻 computer science

NimbleReg: A light-weight deep-learning framework for diffeomorphic image registration

تُعد NimbleReg إطار عمل للتعلم العميق خفيف الوزن يستفيد من هيكل PointNet ومعلمة حقل السرعة الثابت لتوليد تسجيلات صور تباينية الشكل عبر محاذاة أسطح تشريحية متعددة مجزأة، محققةً أداءً يضاهي الأساليب المعتمدة على الصور والمتطورة مع تجنب التمثيلات الشبكية كثيفة الاستهلاك للأجهزة.

Antoine Legouhy, Ross Callaghan, Nolah Mazet, Vivien Julienne, Hojjat Azadbakht, Hui Zhang2026-04-29