🤖 AI

DriveCritic: Towards Context-Aware, Human-Aligned Evaluation for Autonomous Driving with Vision-Language Models

يُعد DriveCritic إطار عمل مبتكر يتألف من مجموعة بيانات منسقة لسيناريوهات حرجة السياق ونموذج لغوي بصري مضبوط بدقة، مما يحسن تقييم القيادة الذاتية بشكل كبير من خلال مواءمة درجات المقاييس مع الحكم البشري عبر تعزيز الوعي بالسياق.

Jingyu Song, Zhenxin Li, Shiyi Lan, Xinglong Sun, Nadine Chang, Maying Shen, Joshua Chen, Katherine A. Skinner, Jose M. (…)2026-03-13
💻 computer science

See4D: Pose-Free 4D Generation via Auto-Regressive Video Inpainting

يُعد ™4D إطار عمل لتوليد المحتوى رباعي الأبعاد (4D) خالٍ من تحديد الوضعيات، حيث يستبدل التنبؤ الصريح بالمسار بنموذج طلاء فيديو مشروط بالمنظور ومسار تلقائي ذاتي زماني مكاني لتخليق محتوى رباعي الأبعاد متماسك من فيديوهات عفوية دون الحاجة إلى إشراف ثلاثي الأبعاد أو تعليقات توضيحية لوضعية الكاميرا.

Dongyue Lu, Ao Liang, Tianxin Huang, Xiao Fu, Yuyang Zhao, Baorui Ma, Liang Pan, Wei Yin, Lingdong Kong, Wei Tsang Ooi (…)2026-03-13
💻 computer science

Generalizing Vision-Language Models with Dedicated Prompt Guidance

تقترح هذه الورقة البحثية GuiDG، وهو إطار عمل ثنائي الخطوات يستفيد من خبراء المجال المضبطين عبر التلقين ومن الانتباه عبر الوسائط لتوجيه الضبط الدقيق للمشفر البصري، مما يحل المفاضلة بين التخصص في المجال والتعميم في النماذج البصرية اللغوية مع التفوق على الأساليب الرائدة الحالية في الاختبارات المعيارية بما في ذلك ImageNet-DG المُنشأ حديثاً.

Xinyao Li, Yinjie Min, Hongbo Chen, Zhekai Du, Fengling Li, Jingjing Li2026-03-13
💻 computer science

Contact-Aware Refinement of Human Pose Pseudo-Ground Truth via Bioimpedance Sensing

تقدم الورقة البحثية BioTUCH، وهو إطار عمل مبتكر يعزز دقة تقدير وضعية الجسم البشري ثلاثي الأبعاد من خلال دمج استشعار المعاوقة الحيوية القابل للارتداء للكشف عن قيود الاتصال الذاتي وفرضها، مما أدى إلى تحسن بنسبة 11.7% في أداء إعادة البناء مقارنة بالطرق التقليدية المعتمدة على الرؤية فقط.

Maria-Paola Forte, Nikos Athanasiou, Giulia Ballardini, Jan Ulrich Bartels, Katherine J. Kuchenbecker, Michael J. Black2026-03-13
💻 computer science

LoC-Path: Learning to Compress for Pathology Multimodal Large Language Models

يُعد LoC-Path نموذج لغة لغوي كبير متعدد الوسائط في مجال علم الأمراض يتميز بكفاءة استهلاك الموارد، حيث يعالج التحديات الحسابية لمعالجة الصور الكاملة للشرائح ذات الدقة الجيجا بكسلية من خلال توظيف استراتيجية "الضغط قبل الدمج"، مستخدماً دمجاً للرموز المتفرقة، ومعيد تشكيل (resampler) مدرباً بتقنية الترميم الذاتي المشوه (MAE)، ومقيماً لأهمية الرموز، ومحول توجيه الانتباه المتقاطع، مما يقلل بشكل كبير من تكاليف التدريب وزمن انتقال الاستدلال مع الحفاظ على أداء تشخيصي تنافسي.

Qingqiao Hu, Weimin Lyu, Meilong Xu, Kehan Qi, Xiaoling Hu, Saumya Gupta, Jiawei Zhou, Chao Chen2026-03-13
🤖 AI

SDUM: A Scalable Deep Unrolled Model for Universal MRI Reconstruction

تقدم الورقة البحثية نموذج SDUM، وهو نموذج عميق غير ملفوف وقابل للتوسع يحقق إعادة بناء عالمية ومتطورة للرنين المغناطيسي عبر مختلف البروتوكولات والبيانات السريرية دون الحاجة إلى ضبط دقيق خاص بكل مهمة، وذلك من خلال الاستفادة من بنية قائمة على Restormer، وتقدير متعلم لحساسية الملف، واتساق بيانات مدرك لآلية أخذ العينات، وتدريب توسعي متدرج للمراحل المتتالية.

Puyang Wang, Pengfei Guo, Keyi Chai, Jinyuan Zhou, Daguang Xu, Shanshan Jiang2026-03-13
💻 computer science

ShinyNeRF: Digitizing Anisotropic Appearance in Neural Radiance Fields

يُعد ShinyNeRF إطار عمل مبتكر يعزز حقول الإشعاع العصبي (Neural Radiance Fields) من خلال التقدير المشترك لخصائص السطح ونمذجة الانعكاسات المتماثلة وغير المتماثة عبر مزيج مشفر من توزيعات "فون ميزس-فيشر" (von Mises-Fisher)، مما يحقق مستويات رائدة في رقمنة الأسطح اللامعة المعقدة مثل المعادن المصقولة مع قدرات تحرير منطقية فيزيائياً.

Albert Barreiro, Roger Marí, Rafael Redondo, Gloria Haro, Carles Bosch2026-03-13
🤖 AI

LLMTrack: Semantic Multi-Object Tracking with Multi-modal Large Language Models

تقدم هذه الورقة LLMTrack، وهو إطار عمل جديد يدمج النماذج اللغوية الكبيرة متعددة الوسائط في التتبع الدلالي للأجسام المتعددة عبر نموذج "الفهم الكلي أولاً" ووحدة دمج مكاني-زماني، مدعوماً بمعيار Grand-SMOT الجديد، لتحقيق أداء هندسي هو الأفضل حالياً واستدلال دلالي ديناميكي متفوق من خلال الاستفادة من السرديات عالية الجودة للاستنتاج المعرفي الطبيعي.

Pan Liao, Feng Yang, Di Wu, Jinwen Yu, Yuhua Zhu, Wenhui Zhao, Dingwen Zhang2026-03-13
💻 computer science

TreeDGS: Aerial Gaussian Splatting for Distant DBH Measurement

تُعد TreeDGS طريقة لإعادة البناء الجوي تستفيد من تقنية "Gaussian Splatting" ثلاثية الأبعاد وملاءمة الدوائر الموزونة بالعتامة لتحقيق قياسات دقيقة ومنخفضة التكلفة لقطر جذع الشجرة عند مستوى الصدر (DBH) في المشاهد الغابية المعقدة، متفوقةً بذلك على خطوط الأساس لتقنية "LiDAR" المتطورة رغم التحديات المتمثلة في الجذوع البعيدة والمراقبة بشكل متفرق.

Belal Shaheen, Minh-Hieu Nguyen, Bach-Thuan Bui, Shubham, Tim Wu, Michael Fairley, Matthew David Zane, Michael Wu, James (…)2026-03-13
💻 computer science

MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images

يُعد MedMO نموذجاً تأسيسياً طبياً متعدد الوسائط يستفيد من وصفة تدريب متخصصة متعددة المراحل — تشمل التدريب المسبق عبر الوسائط، والضبط الدقيق للتعليمات متعدد المهام، والتعلم التعزيزي مع مكافآت قابلة للتحقق — لتحقيق أداء فائق في فهم الصور الطبية، والاستنتاج، والتمركز المكاني عبر مجالات سريرية متنوعة.

Ankan Deria, Komal Kumar, Adinath Madhavrao Dukre, Eran Segal, Salman Khan, Imran Razzak2026-03-13