🤖 machine learning

Monocular 3D Object Position Estimation with VLMs for Human-Robot Interaction

تقدم هذه الورقة نموذجاً لغوياً-بصرياً مضبوطاً بدقة يستفيد من الصور اللونية أحادية العدسة (RGB)، واللغة الطبيعية، وحالات الروبوت لتقدير مواضع الأجسام ثلاثية الأبعاد للتفاعل بين الإنسان والروبوت، محققاً متوسط خطأ قدره 13 ملم ومتفوقاً بشكل كبير على النماذج المرجعية غير المضبوطة بدقة.

Ari Wahl, Dorian Gawlinski, David Przewozny, Paul Chojecki, Felix Bießmann, Sebastian Bosse2026-03-03
🤖 machine learning

AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models

تقدم هذه الورقة AgilePruner، وهو إطار عمل تكيفي لتقليم الرموز البصرية لنماذج الرؤية واللغة الكبيرة، يستفيد من الرؤى التجريبية حول نقاط القوة المتكاملة للطرق القائمة على الانتباه والطرق القائمة على التنوع لتقليل العبء الحسابي مع التخفيف من الهلوسة عبر مختلف مستويات تعقيد الصور.

Changwoo Baek, Jouwon Song, Sohyeon Kim, Kyeongbo Kong2026-03-03
💻 computer science

Cross-Modal Guidance for Fast Diffusion-Based Computed Tomography

تقترح هذه الورقة طريقة لتحسين عمليات إعادة بناء التصوير المقطعي الحاسوبي القائمة على الانتشار السريع من بيانات متفرقة عبر دمج وسيط تصوير تكميلي (مثل التصوير المقطعي بالأشعة السينية) كإشارة توجيه دون الحاجة إلى إعادة تدريب نموذج الانتشار المسبق.

Timofey Efimov, Singanallur Venkatakrishnan, Maliha Hossain, Haley Duba-Sullivan, Amirkoushyar Ziabari2026-03-03
💻 computer science

FoSS: Modeling Long Range Dependencies and Multimodal Uncertainty in Trajectory Prediction via Fourier State Space Integration

تُعد FoSS إطار عمل ثنائي الفروع يدمج تحليل فوريه في النطاق الترددي مع نماذج فضاء الحالة الانتقائية ذات الزمن الخطي لتحقيق دقة متطورة في التنبؤ بالمسارات على معايير Argoverse مع تقليل التعقيد الحسابي ومعلمات النموذج بشكل كبير.

Yizhou Huang, Gengze Jiang, Yihua Cheng, Kezhi Wang2026-03-03
💻 computer science

When Does RL Help Medical VLMs? Disentangling Vision, SFT, and RL Gains

تقدم هذه الورقة دراسة منضبطة تُظهر أن التعلم التعزيزي يعمل أساساً على صقل توزيعات المخرجات وتحسين كفاءة أخذ العينات في نماذج الرؤية واللغة الطبية فقط بعد أن ينجح الضبط الدقيق الخاضع للإشراف في إرساء دعم استدلالي غير ضئيل، مما يؤدي إلى وصفة تدريب واعية بالحدود تحقق أداءً قوياً عبر المعايير الطبية.

Ahmadreza Jeddi, Kimia Shaban, Negin Baghbanzadeh, Natasha Sharan, Abhishek Moturu, Elham Dolatabadi, Babak Taati2026-03-03
💻 computer science

Open-Vocabulary vs Supervised Learning Methods for Post-Disaster Visual Scene Understanding

تقدم هذه الورقة تقييماً مقارناً لنماذج التعلم الخاضع للإشراف ونماذج الرؤية ذات المفردات المفتوحة لفهم مشاهد ما بعد الكوارث عبر مجموعات بيانات متعددة، وتخلص إلى أنه بينما توفر النماذج التأسيسية مرونة، يظل التدريب الخاضع للإشراف هو النهج الأكثر موثوقية للكشف بدقة عن الأجسام الصغيرة وتحديد المعالم في مشاهد الكوارث المزدحمة عند توفر التوصيفات.

Anna Michailidou, Georgios Angelidis, Vasileios Argyriou, Panagiotis Sarigiannidis, Georgios Th. Papadopoulos2026-03-03
🤖 AI

You Only Need One Stage: Novel-View Synthesis From A Single Blind Face Image

تقترح الورقة البحثية NVB-Face، وهو إطار عمل جديد أحادي المرحلة يقوم مباشرة بتوليد صور وجوه ذات منظور جديد، عالية الجودة ومتسقة، من مدخل واحد متدهور (أعمى) عبر استخراج الميزات وتحويلها إلى تمثيلات كامنة مدركة ثلاثي الأبعاد من خلال نموذج انتشار، متفوقاً بذلك على مسارات الاستعادة والتركيب التقليدية ثنائية المرحلة.

Taoyue Wang, Xiang Zhang, Xiaotian Li, Huiyuan Yang, Lijun Yin2026-03-03
🤖 AI

MixerCSeg: An Efficient Mixer Architecture for Crack Segmentation via Decoupled Mamba Attention

تُعد MixerCSeg بنية معمارية فعالة ومتطورة لتقسيم الشقوق، حيث تدمج تحليل النسيج المحلي الشبيه بالشبكات العصبية الالتفافية (CNN)، ونمذجة الاعتماد العالمي بأسلوب المحولات (Transformer)، ومعالجة السياق المتسلسل المستوحى من نموذج مامبا (Mamba) ضمن مشفر موحد، معزز بوحدات متخصصة لإدراك الحواف والدمج متعدد المقاييس لتحقيق أداء عالٍ بأقل تكلفة حوسبية.

Zilong Zhao, Zhengming Ding, Pei Niu, Wenhao Sun, Feng Guo2026-03-03
💻 computer science

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models

تقترح هذه الورقة البحثية طريقة AOT، وهي طريقة لا تتطلب تدريباً تعمل على تحسين تقليل الرموز (tokens) في نماذج اللغات الكبيرة للفيديو عبر إنشاء ركائز رموز محلية وعالمية وتجميع السياقات المعلوماتية عبر النقل الأمثل للتخلص بكفاءة من الحشو مع الحفاظ على الدقة المكانية والزمانية.

Jinlong Li, Liyuan Jiang, Haonan Zhang, Nicu Sebe2026-03-03
⚡ electrical engineering

Revisiting Global Token Mixing in Task-Dependent MRI Restoration: Insights from Minimal Gated CNN Baselines

تُثبت هذه الورقة أن فعالية خلط الرموز العالمي (global token mixing) في ترميم صور الرنين المغناطيسي تعتمد بشكل كبير على المهمة، حيث تُظهر أنه في حين تكفي الشبكات العصبية التلافيفية ذات البوابات المحلية (local gated CNNs) لمهام إعادة البناء والتحسين الفائق (super-resolution) المقيدة بالفيزياء أو ببيانات التردد المنخفض المحفوظة، فإن النماذج العالمية تتفوق في مهام إزالة الضجيج التي تنطوي على ضجيج متباين الخواص مكانياً (spatially heteroscedastic noise).

Xiangjian Hou, Chao Qin, Chang Ni, Xin Wang, Chun Yuan, Xiaodong Ma2026-03-03