💻 computer science

SWoMo: Neuro-Symbolic World Model for Cataract Surgery Simulation

تقدم هذه الورقة البحثية SWoMo، وهو نموذج عالم عصبي-رمزي لمحاكاة جراحة إعتام عدسة العين يجمع بين محرك رمزي قائم على القواعد لديناميكيات الحركة المرتكزة فيزيائياً ونموذج انتشار للرندرة البصرية الواقعية، محققاً بذلك قدرة فائقة على التعميم والترجمة من المحاكاة إلى الواقع مقارنة بالنهج الحالية.

Ssharvien Kumar Sivakumar, Akwele Johnson, Anirudh Dhingra, Yannik Frisch, Ghazal Ghazaei, Anirban Mukhopadhyay2026-05-21
🤖 AI

OmniVL-Guard Pro: A Tool-Augmented Agent for Omnibus Vision-Language Forensics

يُعد OmniVL-Guard Pro عميلًا مدعومًا بالأدوات يتغلب على قيود التحقيق الجنائي للرؤية واللغة في العالم المغلق من خلال دمج أدوات خارجية متنوعة وتوظيف توليد مسار الأدوات ذاتي التطور ذي الهيكل الشجري جنبًا إلى جنب مع التعلم التعزيزي الوكيل الموجه بالمدقق لتحقيق أحدث مستويات الاستدلال والتعميم في العالم المفتوح في مهام كشف التزوير والتأصيل.

Jinjie Shen, Zheng Huang, Yuchen Zhang, Yujiao Wu, Yaxiong Wang, Lechao Cheng, Shengeng Tang, Tianrui Hui, Nan Pu, Zhun (…)2026-05-21
💻 computer science

Why Latent Actions Fail, and How to Prevent It

تُبين هذه الورقة تحليلياً أن نماذج الفعل الكامن القياسية تفشل لأنها تشفر دون قصد التغيرات الخارجية في الخلفية، وتثبت أن التركيز على المكونات الداخلية أو استخدام أهداف مساعدة مثل الإشراف على الفعل يخفف من هذا التداخل بفعالية.

Jung Min Lee, Taehyun Cho, Li Zhao, Jungwoo Lee2026-05-21
💻 computer science

AI-Assisted Competency Assessment from Egocentric Video in Simulation-Based Nursing Education

تقدم هذه الورقة إطار عمل للذكاء الاصطناعي مكوناً من ثلاث مراحل يحلل فيديوهات محاكاة التمريض من منظور الشخص الأول لتقييم كفاءة المتعلم، مما يكشف عن ارتباط سلبي غير متوقع حيث يُظهر الطلاب ذوو الأداء العالي تدفقات عمل أكثر تنوعاً وصعوبة في التصنيف، مما يشير إلى أن عدم اليقين في التعرف يمكن أن يعمل كإشارة تربوية قيمة إلى جانب الجداول الزمنية للأفعال.

Hanchen David Wang, Yilin Liu, Madison J. Lee, Surya Chand Rayala, Gautam Biswas, Daniel T. Levin, Meiyi Ma2026-05-21
🤖 machine learning

CP-MoE: Consistency-Preserving Mixture-of-Experts for Continual Learning

يُعد CP-MoE إطار عمل جديد للتعلم المستمر يعمل على التخفيف من حدة النسيان الكارثي في النماذج اللغوية الكبيرة (LLMs) والنماذج اللغوية البصرية (VLMs) عبر توظيف خبير عابر لتوجيه دمج التحديثات الخاصة بالمهام في الخبراء المستقرين من خلال توجيه يحافظ على الاتساق وتنظيم مستهدف، محققاً بذلك أداءً رائداً مع موازنة نقل المعرفة واستقرار المعلمات.

Yang Liu, Toan Nguyen, Flora D. Salim2026-05-21
💻 computer science

Regulating Anatomy-Aware Rewards via Trajectory-Integral Feedback for Volumetric Computed Tomography Analysis

تقدم هذه الورقة إطار عمل التغذية الراجعة للتكامل المساري (TIF-GRPO)، الذي يستفيد من مبادئ نظرية التحكم وركيزة قياس الشذوذ السريري المهيكلة (CABS) لتنظيم المكافآت المدركة للتشريح في نماذج الرؤية واللغة الطبية، مما يؤدي إلى القضاء على الهلوسة التقييمية وتعزيز الدقة السريرية في تحليل التصوير المقطعي المحوسب ثلاثي الأبعاد.

Tianwei Lin, Zhongwei Qiu, Jie Cao, Jiang Liu, Wenjie Yan, Bo Zhang, Yu Zhong, Wenqiao Zhang, Yingda Xia, Ling Zhang2026-05-21
🤖 machine learning

FusionCell: Cross-Attentive Fusion of Layout Geometry and Netlist Topology for Standard-Cell Performance Prediction

يُعد FusionCell إطار عمل جديد للتعلم العميق ثنائي الأنماط يدمج هندسة التخطيط الموجه وتوبولوجيا قائمة الشبكات عبر آلية انتباه تقاطعي موجهة توبولوجياً لتحقيق تنبؤ دقيق وسريع للغاية لمقاييس أداء الخلايا القياسية، متفوقاً بشكل كبير على النماذج المرجعية الحالية وطرق المحاكاة التقليدية.

Haoyi Zhang, Kairong Guo, Bojie Zhang, Yibo Lin, Runsheng Wang2026-05-21
💻 computer science

MedCRP-CL: Continual Medical Image Segmentation via Bayesian Nonparametric Semantic Modality Discovery

يُعد MedCRP-CL إطار عمل للتعلم المستمر خالي من إعادة التشغيل لتقسيم الصور الطبية، حيث يستفيد من عملية "المطعم الصيني" (Chinese Restaurant Process) لاكتشاف تجميعات المهام الدلالية ديناميكيًا من النصوص السريرية، مما يتيح عزل المعلمات القائم على البنية ونقل المعرفة، وهو ما يتفوق بشكل كبير على النماذج المرجعية الحالية مع تقليل حجم النموذج والنسيان بشكل جذري.

Ziyuan Gao2026-05-21
💻 computer science

WildRoadBench: A Wild Aerial Road-Damage Grounding Benchmark for Vision-Language Models and Autonomous Agents

تقدم هذه الورقة WildRoadBench، وهو معيار مرجعي جديد لتقييم قدرات نماذج الرؤية واللغة والوكلاء المستقلين المعتمدين على النماذج اللغوية الكبيرة في تحديد مواقع أضرار الطرق الجوية البرية، مما يكشف أن كلا النهجين يعانيان حالياً من أجل تحقيق أداء موثوق في هذا الإعداد المعقد والواقعي.

Bingnan Liu, Chenhang Cui, Rui Huang, Jiani Luo, Zhirong Shen, Tinghao Wang, Xiande Huang, Lingbei Meng, Fei Shen, An Zh (…)2026-05-21
💻 computer science

Tiny-Engram: Trigger-Indexed Concept Tables for Generative Vision

تقدم الورقة البحثية Tiny-Engram، وهو جدول مفاهيم مدمج مفهرس بالمحفزات يتيح التخصيص البصري النمطي في النماذج التوليدية المجمدة من خلال ربط العبارات التحفيزية النادرة بالهويات المستهدفة صراحةً مع الحفاظ على التحكم التركيبي، مما يظهر فعالية قوية في توليد الصور ولكنه يسلط الضوء على الحاجة إلى اقتران نصي-بصري أوثق لتحقيق استمرارية الهوية المستقرة في الفيديو.

Runyuan Cai, Yiming Wang, Yu Lin, Xiaodong Zeng2026-05-21