💻 computer science

RoSHI: A Versatile Robot-oriented Suit for Human Data In-the-Wild

يقدم البحث نظام RoSHI، وهو نظام قابل للارتداء متعدد الاستخدامات يدمج وحدات قياس القصور الذاتي (IMUs) منخفضة التكلفة مع نظارات Project Aria لتقدير وضعية وشكل جسم الإنسان ثلاثي الأبعاد بدقة في إطار متري عالمي، مما يتيح جمع بيانات عالية الجودة في البيئات الواقعية لتدريب سياسات الروبوتات البشرية.

Wenjing Margaret Mao, Jefferson Ng, Luyang Hu, Daniel Gehrig, Antonio Loquercio2026-04-09
🤖 machine learning

Fast Spatial Memory with Elastic Test-Time Training

تقدم هذه الورقة البحثية الذاكرة المكانية السريعة (FSM)، وهي نموذج إعادة بناء رباعي الأبعاد قابل للتوسع يستخدم تدريب وقت الاختبار المرن لتثبيت تحديثات الأوزان السريعة عبر حالة مرساة متطورة، مما يتيح تكيفاً قوياً متعدد القطع عبر تسلسلات طويلة مع التخفيف من النسيان الكارثي واختناقات الذاكرة.

Ziqiao Ma, Xueyang Yu, Haoyu Zhen, Yuncong Yang, Joyce Chai, Chuang Gan2026-04-09
🤖 AI

Aligned Vector Quantization for Edge-Cloud Collabrative Vision-Language Models

تقدم هذه الورقة البحثية LLaVA-AlignedVQ، وهو نظام رؤية ولغة تعاوني بين الحافة والسحابة يستخدم خوارزمية تكميم متجه محاذٍ (Aligned Vector Quantization) مبتكرة لضغط الميزات الوسيطة بنسبة تقارب 1365 ضعفاً، مما يقلل عرض النطاق الترددي وزمن الاستجابة بشكل كبير مع الحفاظ على دقة مماثلة للحلول السحابية فقط.

Xiao Liu, Lijun Zhang, Deepak Ganesan, Hui Guan2026-04-08
🤖 machine learning

Perturb and Recover: Fine-tuning for Effective Backdoor Removal from CLIP

تقدم هذه الورقة طريقة "الاضطراب والاستعادة" (PAR)، وهي طريقة ضبط دقيق بسيطة وفعالة تنجح في إزالة الأبواب الخلفية من نماذج CLIP مع الحفاظ على أدائها القياسي، حتى عندما تتوفر البيانات الاصطناعية فقط.

Naman Deep Singh, Francesco Croce, Matthias Hein2026-04-08
🤖 AI

ENTER: Event Based Interpretable Reasoning for VideoQA

تقدم الورقة البحثية نظام ENTER، وهو نظام لأسئلة وأجوبة الفيديو (VideoQA) قابل للتفسير يستخدم الرسوم البيانية للأحداث لتمثيل أحداث الفيديو وعلاقاتها هيكلياً، مما يتيح استدلالاً قوياً وقابلاً للتفسير من خلال الكود المولد الذي يسد بفعالية الفجوة بين التخطيط من الأعلى إلى الأسفل والمعالجة البصرية من الأسفل إلى الأعلى.

Hammad Ayyubi, Junzhang Liu, Ali Asgarov, Zaber Ibn Abdul Hakim, Najibul Haque Sarker, Zhecan Wang, Chia-Wei Tang, Hani (…)2026-04-08
💻 computer science

Image-to-Text for Medical Reports Using Adaptive Co-Attention and Triple-LSTM Module

تقترح هذه الورقة البحثية نموذج CA-TriNet، وهو نموذج تعلم عميق متعدد الوسائط يدمج وحدة الانتباه المشترك (Co-Attention) وشبكة Triple-LSTM للتغلب على قيود النماذج الضخمة العامة في توليد التقارير الطبية من خلال التمييز بفعالية بين الصور الطبية المتشابهة وتحسين المخرات النصية، مما يحقق أداءً فائقاً عبر مجموعات بيانات متعددة.

Yishen Liu2026-04-08
💻 computer science

ProBA: Probabilistic Bundle Adjustment with the Bhattacharyya Coefficient

إنَّ ProBA هو إطار عمل لضبط الحزم الاحتمالي يستبدل مسارات النقاط الصلبة بمعالم غاوسية ثلاثية الأبعاد ورسم بياني حركي للوضعية لتمكين عملية تحسين "بنية من الحركة" (Structure-from-Motion) قوية وذات بداية باردة من بيانات غير منظمة، وذلك عبر نمذجة عدم اليقين المكاني صراحةً وحل غموض المرآة.

Jason Chui, Hector Andrade-Loarca, Daniel Cremers2026-04-08
💻 computer science

MAMMA: Markerless & Automatic Multi-Person Motion Action Capture

تقدم الورقة البحثية MAMMA، وهو مسار لالتقاط حركة عدة أشخاص بدون علامات، يستخدم بنية مبتكرة قائمة على الاستعلام ومجموعة بيانات اصطناعية ضخمة لاستعادة معلمات SMPL-X بدقة ومعالم ثنائية الأبعاد كثيفة مدركة للتلامس من فيديوهات متعددة الزوايا لأفراد يتفاعلون، محققاً دقة تنافسية مع الأنظمة التجارية القائمة على العلامات دون الحاجة إلى تنظيف يدوي مكثف.

Hanz Cuevas-Velasquez, Anastasios Yiannakidis, Soyong Shin, Giorgio Becherini, Markus Höschle, Joachim Tesch, Taylor Obe (…)2026-04-08
⚡ electrical engineering

HazeMatching: Dehazing Light Microscopy Images with Guided Conditional Flow Matching

تقدم هذه الورقة HazeMatching، وهي طريقة تكرارية مبتكرة تعتمد على مطابقة التدفق الشرطي الموجه، توازن بفعالية بين دقة البيانات والواقعية الإدراكية لإزالة الضباب من صور المجهر الضوئي واسع المجال دون الحاجة إلى عامل تدهور صريح.

Anirban Ray, Ashesh Ashesh, Florian Jug2026-04-08
💬 NLP

MedGemma Technical Report

تقدم الورقة البحثية MedGemma، وهي مجموعة من النماذج التأسيسية الطبية للرؤية واللغة المبنية على Gemma 3، والتي تتفوق بشكل كبير إلى جانب مشفر رؤية متخصص يسمى MedSigLIP على النماذج الأساسية وتقترب من أداء المهام المتخصصة عبر مختلف مهام التصوير والنصوص الطبية مع الحفاظ على القدرات العامة.

Andrew Sellergren, Sahar Kazemzadeh, Tiam Jaroensri, Atilla Kiraly, Madeleine Traverse, Timo Kohlberger, Shawn Xu, Fayaz (…)2026-04-08