💻 computer science

Learning Brain Representation with Hierarchical Visual Embeddings

تقترح هذه الورقة استراتيجية لمحاذاة صور الدماغ تستخدم مشفرات بصرية متعددة سابقة التدريب لالتقاط التمثيلات الهرمية، وتُقدم "أولوية دمج" (Fusion Prior) لتعزيز الاتساق التوزيعي، مما يحقق توازناً بين دقة الاسترجاع الدلالي ودقة إعادة البناء على مستوى البكسل.

Jiawen Zheng, Haonan Jia, Ming Li, Yuhui Zheng, Yufeng Zeng, Yang Gao, Chen Liang2026-02-10
🤖 machine learning

Evaluating Object-Centric Models beyond Object Discovery

تقترح هذه الورقة إطار تقييم جديد للتعلم المتمحور حول الكائنات يتجاوز مجرد اكتشاف الكائنات عبر استخدام نماذج الرؤية واللغة (VLMs) المضبوطة بالتعليمات لقياس مدى فائدة التمثيل في الاستدلال المعقد، وتقديم مقياس موحد لتقييم جودة التوطين والجودة الدلالية معاً.

Krishnakant Singh, Simone Schaub-Meyer, Stefan Roth2026-02-10
⚡ electrical engineering

Fine-Grained Cat Breed Recognition with Global Context Vision Transformer

تقدم هذه الورقة البحثية نهجاً للتعرف على سلالات القطط بدقة عالية باستخدام بنية محول الرؤية ذو السياق العالمي (GCViT-Tiny)، محققةً دقة اختبار بلغت 92.00% على مجموعة بيانات Oxford-IIIT Pet من خلال تعزيز البيانات المكثف.

Mowmita Parvin Hera, Md. Shahriar Mahmud Kallol, Shohanur Rahman Nirob, Md. Badsha Bulbul, Jubayer Ahmed, M. Zhourul Isl (…)2026-02-10
🤖 AI

Beyond Core and Penumbra: Bi-Temporal Image-Driven Stroke Evolution Analysis

تقترح هذه الورقة إطار عمل للتحليل ثنائي الزمن يستخدم السمات الراديومية والسمات المستخرجة عبر التعلم العميق من تصوير التروية الدماغية المحوسب (CTP) عند الدخول وتصوير الانتشار (DWI) في مرحلة المتابعة لتوصيف تطور السكتة الدماغية، مما يثبت أن تضمينات السمات يمكنها بفعالية التمييز بين المنطقة المصابة (المنطقة المهددة بالخطر) القابلة للإنقاذ والأنسجة غير القابلة للإنقاذ.

Md Sazidur Rahman, Kjersti Engan, Kathinka Dæhli Kurz, Mahdieh Khanmohammadi2026-02-10
🤖 machine learning

LLM-Guided Diagnostic Evidence Alignment for Medical Vision-Language Pretraining under Limited Pairing

لمعالجة أوجه القصور في المحاذاة العالمية والمحلية في التدريب المسبق للرؤية واللغة الطبية، تقترح هذه الورقة **LGDEA**، وهي طريقة تسخر النماذج اللغوية الكبيرة (LLMs) لاستخراج الأدلة التشخيصية الرئيسية من التقارير لتمكين المحاذاة عبر الوسائط على مستوى الأدلة، مما يحسن الأداء بفعالية مع تقليل الاعتماد على البيانات المقترنة.

Huimin Yan, Liang Bai, Xian Yang, Long Chen2026-02-10
💻 computer science

Human Identification at a Distance: Challenges, Methods and Results on the Competition HID 2025

تُقدم هذه الورقة نتائج مسابقة HID 2025، التي تُقيّم أداء التعرف على مشية الإنسان على مجموعة بيانات SUSTech-Competition الصعبة، وتُظهر أن التطورات الخوارزمية الأخيرة قد حققت دقة قياسية جديدة بلغت 94.2% رغم التباينات البيئية الكبيرة.

Jingzhe Ma, Meng Zhang, Jianlong Yu, Kun Liu, Zunxiao Xu, Xue Cheng, Junjie Zhou, Yanfei Wang, Jiahang Li, Zepeng Wang (…)2026-02-10
🤖 AI

Cross-Camera Cow Identification via Disentangled Representation Learning

تقترح هذه الورقة إطار عمل لتحديد هوية الأبقار عبر الكاميرات بناءً على تعلم التمثيل المفكك ونظرية ضمان قابلية التحديد في الفضاءات الجزئية (SIG)، مما يحسن القدرة على التعميم للتعامل مع كاميرات غير مرئية من خلال تفكيك الصور إلى سمات هوية ثابتة وتغيرات خاصة بكل كاميرا.

Runcheng Wang, Yaru Chen, Guiguo Zhang, Honghua Jiang, Yongliang Qiao2026-02-10
🤖 AI

Automated rock joint trace mapping using a supervised learning model trained on synthetic data generated by parametric modelling

تقترح هذه الورقة إطار عمل للتعلم الآلي مدفوعاً بالجيولوجيا يستخدم نماذج شبكة الكسور المنفصلة البارامترية لتوليد بيانات تدريب اصطناعية، مما يتيح رسم خرائط آلية فعالة لآثار المفاصل الصخرية من خلال الجمع بين التدريب المختلط والضبط الدقيق على مجموعات بيانات من العالم الحقيقي.

Jessica Ka Yi Chiu, Tom Frode Hansen, Eivind Magnus Paulsen, Ole Jakob Mengshoel2026-02-10
🤖 AI

From Dead Pixels to Editable Slides: Infographic Reconstruction into Native Google Slides via Vision-Language Region Understanding

تقدم الورقة البحثية **Images2Slides**، وهو مسار عمل يعتمد على واجهة برمجة التطبيقات (API) يستخدم نماذج الرؤية واللغة لتحويل صور الإنفوجرافيك الثابتة إلى شرائح Google Slides قابلة للتعديل عبر استخراج مواصفات على مستوى المناطق وإعادة بنائها كعناصر أصلية.

Leonardo Gonzalez2026-02-10
🤖 AI

Process-of-Thought Reasoning for Videos

تقترح الورقة البحثية "التفكير عبر العمليات" (PoT) للفيديوهات، وهو إطار عمل غير مرتبط بنموذج محدد يعمل على تحسين فهم الفيديو من خلال تفكيك الاستدلال المعقد إلى تسلسل من الخطوات الصريحة والقابلة للتحقق التي تتضمن اختيار الأدلة الزمنية، وتحديثات الحالة، والتركيب المقيد لتعزيز الدقة الواقعية والقابلية للتفسير.

Jusheng Zhang, Kaitong Cai, Jian Wang, Yongsen Zheng, Kwok-Yan Lam, Keze Wang2026-02-10