💻 computer science

VERIA: Verification-Centric Multimodal Instance Augmentation for Long-Tailed 3D Object Detection

تُعد VERIA إطار عمل لتعزيز النماذج متعدد الوسائط يرتكز على التحقق، حيث يقوم بتخليق بيانات RGB-LiDAR متزامنة باستخدام النماذج التأسيسية ويطبق تحققًا دلاليًا وهندسيًا متسلسلاً لمعالجة التوزيعات طويلة الذيل في كشف الأجسام ثلاثية الأبعاد بفعالية من خلال تحسين تنوع الفئات النادرة ووضع سياق المشهد.

Jumin Lee, Siyeong Lee, Namil Kim, Sung-Eui Yoon2026-03-26
💻 computer science

RS-SSM: Refining Forgotten Specifics in State Space Model for Video Semantic Segmentation

تقدم هذه الورقة RS-SSM، وهو نهج مبتكر للتجزئة الدلالية للفيديو يعالج فقدان التفاصيل المكانية والزمانية المحددة في نماذج فضاء الحالة من خلال توظيف مدرك سعة عبر القنوات ومُحسِّن معلومات بوابة النسيان لاستعادة المعلومات المنسية بشكل تكيفي، مما يحقق أداءً هو الأفضل حالياً مع كفاءة حسابية عالية.

Kai Zhu, Zhenyu Cui, Zehua Zang, Jiahuan Zhou2026-03-26
💻 computer science

Refining time-space traffic diagrams: A neighborhood-adaptive linear regression method

تقترح هذه الورقة طريقة انحدار خطي متكيفة مع الجوار تستفيد من تشابه الأنماط المحلية لتحسين مخططات حركة المرور الزمانية-المكانية منخفضة الدقة، مما يحسن الدقة بشكل كبير ويلتقط ديناميكيات حركة المرور الفريدة مع التفوق على الطرق المرجعية في الدقة والمتانة باستخدام حد أدنى من بيانات التدريب.

Zhihong Yao, Yi Yu, Yunxia Wu, Hao Li, Yangsheng Jiang, Zhengbing He2026-03-26
💻 computer science

Boosting Document Parsing Efficiency and Performance with Coarse-to-Fine Visual Processing

تقدم الورقة البحثية PaddleOCR-VL، وهو نموذج لغوي بصري جديد بـ 0.9 مليار معلمة يعمل بآلية من الخشن إلى الناعم، يستخدم وحدة تركيز المنطقة الصالحة خفيفة الوزن لتحديد ومعالجة المناطق الوثائقية ذات الصلة دلاليًا فقط، مما يحقق أداء تحليل هو الأفضل في فئته مع تقليل التكاليف الحسابية ورموز الرؤية بشكل كبير مقارنة بالنهج عالية الدقة الحالية.

Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Xueqing Wang, Changda Zhou, Hongen Liu, Manhui (…)2026-03-26
💬 NLP

GameplayQA: A Benchmarking Framework for Decision-Dense POV-Synced Multi-Video Understanding of 3D Virtual Agents

تقدم الورقة البحثية GameplayQA، وهو إطار عمل مرجعي مبتكر يقيم قدرة النماذج اللغوية الكبيرة متعددة الوسائط على فهم واستنتاج أسلوب اللعب ثلاثي الأبعاد كثيف المنظور الأول ومتعدد الوكلاء من خلال تعليقات توضيحية ثلاثية عالية التردد، مما يكشف عن فجوات كبيرة في قدرات النماذج الحالية في الربط الزمني، وعزو الوكلاء، واتخاذ القرار مقارنة بالأداء البشري.

Yunzhe Wang, Runhui Xu, Kexin Zheng, Tianyi Zhang, Jayavibhav Niranjan Kogundi, Soham Hans, Volkan Ustun2026-03-26
💻 computer science

PP-OCRv5: A Specialized 5M-Parameter Model Rivaling Billion-Parameter Vision-Language Models on OCR Tasks

تقدم هذه الورقة البحثية نموذج PP-OCRv5، وهو نموذج للتعرف الضوئي على الحروف (OCR) عالي الكفاءة يضم 5 ملايين معلمة، وينافس في دقته النماذج اللغوية البصرية ذات المليارات من المعلمات مع تقديم قدرة فائقة على تحديد مواقع النصوص وهلوسة أقل، مما يثبت أن جودة البيانات وتنوعها أكثر أهمية من حجم النموذج لتحقيق أداء عالٍ في التعرف الضوئي على الحروف.

Cheng Cui, Yubo Zhang, Ting Sun, Xueqing Wang, Hongen Liu, Manhui Lin, Yue Zhang, Tingquan Gao, Changda Zhou, Jiaxuan Li (…)2026-03-26
💻 computer science

Causal Transfer in Medical Image Analysis

تقدم هذه الدراسة المسحية مفهوم تعلم النقل السببي (CTL) في تحليل الصور الطبية وتعمل على تنظيمه، مقترحةً تصنيفاً موحداً يدمج الاستدلال السببي مع تعلم النقل للتغلب على انزياحات النطاق، وتعزيز متانة النماذج عبر مختلف الإعدادات السريرية، ودعم النشر الموثوق للذكاء الاصطناعي.

Mohammed M. Abdelsamea, Daniel Tweneboah Anyimadu, Tasneem Selim, Saif Alzubi, Lei Zhang, Ahmed Karam Eldaly, Xujiong Ye2026-03-26
💻 computer science

The Gait Signature of Frailty: Transfer Learning based Deep Gait Models for Scalable Frailty Assessment

تقدم هذه الورقة مجموعة بيانات للمشي تعتمد على الصور الظلية (silhouette-based)، وهي متاحة للعموم وواقعية سريرياً، وتثبت أن استراتيجيات التعلم بنقل المعرفة — وتحديداً تجميد الميزات منخفضة المستوى بشكل انتقائي مع تكييف التمثيلات عالية المستوى — تُمكّن من بناء نماذج تعلم عميق قابلة للتوسع وغير جراحية وقابلة للتفسير لتقييم الهزال بدقة عبر الطيف السريري الكامل.

Laura McDaniel, Basudha Pal, Crystal Szczesny, Yuxiang Guo, Ryan Roemmich, Peter Abadir, Rama Chellappa2026-03-26
💻 computer science

Positive-First Most Ambiguous: A Simple Active Learning Criterion for Interactive Retrieval of Rare Categories

تقدم هذه الورقة معيار "الأكثر غموضاً مع الأولوية للإيجاب" (PF-MA)، وهو معيار تعلم نشط مبتكر صُمم للتغلب على قيود الطرق التقليدية في عمليات الاسترجاع التفاعلي ذات الميزانية المنخفضة وغير المتوازنة، وذلك من خلال إعطاء الأولوية للعينات الإيجابية المحتملة القريبة من حد القرار لاكتشاف الفئات الدقيقة النادرة بسرعة مع ضمان تنوع تغطية الفئات.

Kawtar Zaher, Olivier Buisson, Alexis Joly2026-03-26
💻 computer science

Cross-Modal Prototype Alignment and Mixing for Training-Free Few-Shot Classification

تقترح هذه الورقة طريقة لتصنيف التعلم القليل من الأمثلة (few-shot classification) خالية من التدريب، تعمل على تعزيز أداء نموذج CLIP عبر خلط النماذج الأولية للنصوص والصور، وتكرير التمثيلات الصورية من خلال الإسقاط الدلالي المحاذي للنص أو نمذجة تغاير الفئات للحد من الضجيج وتحسين دقة التصنيف عبر معايير قياسية متنوعة.

Dipam Goswami, Simone Magistri, Gido M. van de Ven, Bartłomiej Twardowski, Andrew D. Bagdanov, Tinne Tuytelaars, Joost v (…)2026-03-26