💻 computer science

GuideFetch: A Task Coordination Framework for Concurrent Navigation and Object Retrieval in Assistive Robot Dogs

تقدم هذه الورقة "GuideFetch"، وهو إطار عمل لتنسيق المهام يُمكّن فريقاً غير متجانس من الكلاب الروبوتية المساعدة من تنفيذ مهام التنقل واستعادة الأشياء بشكل متزامن عبر الاستفادة من مخططات العمل المولدة والمحققة بواسطة النماذج اللغوية الكبيرة والتنفيذ القائم على الحالة، مما يقلل بشكل كبير من زمن إنجاز المهمة مقارنة بالنهج التسلسلي.

Qian Yin, Ruiping Liu, Kunyu Peng, Jianxiang Man, Isik Baran Sandan, Junwei Zheng, Yufan Chen, Di Wen, Kailun Yang, Rain (…)2026-08-20
💻 computer science

Acquisition Geometry-Assisted Whole-Group Localization of X-ray Fluorescence Maps in Optical Microscopy Images

تقترح هذه الورقة طريقة لتحديد مواقع مجموعات من بلاطات الأشعة السينية الفلورية (XRF) ضمن صور المجهر الضوئي من خلال الاستفادة صراحةً من قيود هندسة الاستحواذ، مما يحسن دقة المحاذاة بشكل كبير مقارنة بوضع البلاطات بشكل مستقل.

Xiangyu Yin, Tatjana Paunesku, Letonia Copeland-Hardin, Martina Ralle, Zichao Wendy Di, Si Chen, Gayle E. Woloschak, Bar (…)2026-08-20
💻 computer science

XRF-to-Optical Field-of-View Localization with Vision Language Models

تقترح هذه الورقة سير عمل قائم على "الاقتراح والتحقق" يجمع بين النماذج اللغوية الرؤيوية الخالية من التدريب والتشابه القائم على الصور لتحقيق تحديد دقيق لمجال الرؤية بين صور الأشعة السينية الفلورية وصور المجهر الضوئي، مما يعالج بنجاح التحديات في كل من سيناريوهات التصوير الارتباطي ذات التوافق العالي والمنخفض.

Xiangyu Yin, Tatjana Paunesku, Letonia Copeland-Hardin, Martina Ralle, Zichao Wendy Di, Si Chen, Gayle E. Woloschak, Bar (…)2026-08-20
💻 computer science

A Configurable Privacy-Preserving MRI Processing Workflow Using Deep Learning-Based Brain Extraction and Adaptive Anatomical Preservation

تقدم هذه الورقة سير عمل قائم على لغة بايثون، وهو قابل للضبط والتكرار والتفاعل، يعزز استخراج الدماغ باستخدام التعلم العميق مع الحفاظ التكيفي على المعالم التشريحية وضبط الجودة المتكامل لتحقيق التوازن بين حماية الخصوصية والمنفعة التشريحية في معالجة التصوير بالرنين المغناطيسي الهيكلي.

Rayeef Ali Khan, Komal Raj Mahantesh2026-08-20
💻 computer science

Reproducible Multimodal Affordance Prediction

لمعالجة تحديات عدم الاتساق في التقييم ومحدودية قابلية التكرار في التنبؤ بالإمكانات متعدد الوسائط، تقترح هذه الورقة "ورقة الإمكانات" (Affordance Sheet)، وهي معيار توثيق شامل يفصل صياغات المهام، والنماذج، ومجموعات البيانات، والبروتوكولات لتمكين القياس المرجعي العادل والنشر الموثوق في العالم الحقيقي.

Tommaso Apicella, Alessio Xompero, Andrea Cavallaro2026-08-20
💬 NLP

From Inference to Adaptation: A Unified Optimal Transport View of Vision Language Model

تقترح هذه الورقة البحثية \algname، وهو إطار عمل موحد للتكيف في وقت الاختبار (Test-Time Adaptation) للنماذج الرؤية-اللغوية، يقوم بالربط بين الاستدلال والتكيف من خلال صياغة التصنيف صفري القدرة (zero-shot classification) كمسألة نقل أمثل من نوع واسرستاين (Wasserstein Optimal Transport) لتوليد تسميات مستعارة (pseudo-labels) قوية، والتي تُستخدم لاحقاً في فقد تباين (Info-NCE contrastive loss) متوافق نظرياً لتحقيق أداء رائد (state-of-the-art) تحت ظروف تغير التوزيع.

Qi Yu, Zhichen Zeng, Katherine Tieu, Xiyuan Yang, Ruizhong Qiu, Yuchen Yan, Lihui Liu, Yanjun Zhao, Lingjie Chen, Jingru (…)2026-08-20
🤖 AI

TTSD-FAR: Test-Time Self-Distillation with Fisher-Anchored Restoration for Missing-Modality Emotion Recognition in LVLMs

تقترح هذه الورقة إطار عمل TTSD-FAR، وهو إطار عمل فعال من حيث المعلمات يجمع بين التقطير الذاتي في وقت الاختبار والترميم المرتكز على فشر لتمكين نماذج اللغة والفيديو الكبيرة من التكيف بمتانة مع الوسائط المفقودة أو المشوشة أثناء التعرف على العواطف، مع منع تدهور الأداء من خلال مراقبة الاستقرار وتصحيح الانحراف.

Muhammad Haseeb Aslam, Alessandro Koerich, Marco Pedersoli, Ali Etemad, Eric Granger2026-08-20
💻 computer science

Depth Anything V4: Dynamic 4D Scene Reconstruction via Riemannian Flow Matching on 4D Gaussian Splatting

يقدم نظام Depth Anything V4 (DAV4) إطار عمل مبتكر لإعادة بناء المشاهد الديناميكية رباعية الأبعاد أحادية الكاميرا، والذي يستفيد من مطابقة التدفق الريماني على معاملات التغطية الغاوسية رباعية الأبعاد لضمان صحة الحالات الوسيطة وتحقيق أداء فائق دون الحاجة إلى تسميات عمق مُعدة بشرياً.

Jiaming Fan, Jian Lu, Jinling Jia, Chenbin Zhang2026-08-20
💻 computer science

JSL-DC: A Word-Level Japanese Sign Language Dataset with Linguist-Derived Descriptions for Distinguishing Confusable Signs

تقدم هذه الورقة البحثية JSL-DC، وهي أكبر مجموعة بيانات للغة الإشارة اليابانية المتمحورة حول الصم وتضم 36.7 ألف فيديو وأوصافاً مستمدة من لغويين للإشارات المتشابهة، مما يُمكّن نموذجاً جديداً من التفوق على أساليب التعرف الرائدة بنسبة 9.8% في مجموعات فرعية صعبة.

Ken Takaki, Asuka Ando, Misa Suzuki, Uiko Yano, Masaya Tsujimoto, Bill Neubauer, Ananay Vikram Gupta, Rose Shao, Matthia (…)2026-08-20
💻 computer science

CoMVS-GS: Collaborative Multi-View Stereo and 3D Gaussian Splatting for Surface Reconstruction

يُعد CoMVS-GS إطار عمل مبتكر لإعادة بناء الأسطح يعمل على تعزيز تقنية Gaussian Splatting ثلاثية الأبعاد من خلال دمج الرؤية متعددة المناظر (Multi-View Stereo) من أجل تهيئة قوية هندسياً، وتوظيف الإشراف المتبادل لـ PatchMatch-3DGS لتنقية المناطق ضعيفة القيود، واستخدام مسار قطع "ديلاوني" (Delaunay graph-cut) لاستخراج شبكات عالية الجودة، مما يحقق دقة هندسية فائقة وتماسكاً في الشبكات في كل من المشاهد الداخلية والخارجية.

Shihan Chen, Junjing Zhang, Qingsong Yan, Haibing Liu, Haofan Ren, Fei Deng2026-08-20