💻 computer science

Arbitrarily Shaped Scene Text Detection: A Decade of Advances and Systematic Analysis

تقدم هذه الورقة أول مسح شامل للكشف عن النصوص في المشاهد ذات الأشكال التعسفية من خلال مراجعة تطورها التقني، واقتراح أطر عمل موحدة لتوحيد الإعدادات التجريبية لإجراء مقارنات عادلة للأداء، وتحديد اتجاهات البحث المستقبلية للنهوض بهذا المجال.

Pengwen Dai, Feiyang He, Chaolang Li, Xugong Qin, Wenqi Ren, Xiaochun Cao2026-08-25
💻 computer science

STA-VPT: SpatioTemporally Aligned Visual Prompt Tuning

يقدم STA-VPT نموذجاً جديداً للتلقين البصري يتعلم خرائط رموز تلقينية محاذية مكانياً أو مكانياً-زمانياً للحفاظ على بنية المدخلات وتمكين التلقين الدقيق المحدد لكل منطقة، وبذلك يتغلب على قيود طرق التلقين المتسلسلة والمتجانسة التقليدية.

Wenjie Pei, Tongqi Xia, Qizhong Tan, Jiandong Tian, Guangming Lu, Jun Yu2026-08-25
💻 computer science

Exploring learning environments for label\-efficient cancer diagnosis

تُظهر هذه الدراسة أن التعلم شبه المُشرف يمثل بديلاً فعالاً للغاية ومنخفض التكلفة للتعلم المُشرف في التنبؤ بسرطان الكلى والرئة والثدي، حيث حقق دقة مماثلة باستخدام عدد أقل بكثير من العينات المُصنفة عبر نماذج متعددة للتعلم العميق سابقة التدريب.

Samta Rani, Tanvir Ahmad, Sarfaraz Masood, Chandni Saxena2026-08-25
🤖 machine learning

SIG: A Synthetic Identity Generation Pipeline for Generating Evaluation Datasets for Face Recognition

تقدم هذه الورقة مسار توليد الهوية الاصطناعية (SIG)، وهو وسيلة لإنشاء مجموعات بيانات وجوه اصطناعية مستمدة من مصادر أخلاقية، ومتوازنة، وقابلة للتحكم للتغلب على التحديات اللوجستية وتحديات الخصوصية لجمع البيانات التقليدي، وتثبت فعاليتها من خلال إصدار مجموعة بيانات ControlFace10k مفتوحة المصدر لتقييم خوارزميات التعرف على الوجوه والتحيز.

Kassi Nzalasse, Rishav Raj, Eli Laird, Corey Clark2026-08-25
💻 computer science

Expert-level vision-language foundation model for real-world radiology and comprehensive evaluation

تقدم هذه الورقة RadFound، وهو نموذج تأسيسي مفتوح المصدر للرؤية واللغة واسع النطاق تم تدريبه على أكثر من 8.1 مليون صورة إشعاعية و250,000 زوج من الصور والنصوص عبر 19 نظامًا عضويًا، والذي يُظهر أداءً فائقًا بمستوى الخبراء في مهام الإدراك والتوليد متعدد الوسائط مقارنة بالنماذج الحالية من خلال بنية مبتكرة وتقييم شامل على معيار RadVLBench الجديد.

Xiaohong Liu, Guoxing Yang, Yulin Luo, Jiaji Mao, Xiang Zhang, Haibo Wang, Zhiyang He, Ming Gao, Shanghang Zhang, Jun Sh (…)2026-08-25
🧬 biology

QuantFormer: Learning to Quantize for Neural Activity Forecasting in Mouse Visual Cortex

تقدم الورقة البحثية QuantFormer، وهو نموذج جديد قائم على المحولات (transformer) يعيد صياغة التنبؤ بالنشاط العصبي كمسألة تصنيف من خلال التكميم الديناميكي للإشارات والرموز الخاصة بالنيورونات، محققاً أداءً هو الأفضل في فئته في التنبؤ بديناميكيات القشرة البصرية للفئران من بيانات التصوير الكالسيومي ثنائي الفوتون.

Salvatore Calcagno, Isaak Kavasidis, Simone Palazzo, Marco Brondi, Luca Sità, Giacomo Turri, Daniela Giordano, Vladimir (…)2026-08-25
💬 NLP

A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges

تقدم هذه الدراسة نظرة عامة محدثة على نماذج الرؤية واللغة الضخمة حتى عام 2026، متتبعةً تطورها المعماري من الأنظمة القائمة على الموائمات إلى نماذج العالم والعمل الموحدة، ومحللةً التحول في المعايير المرجعية نحو مهام الاستدلال المعقدة والمهام المتجسدة، ومراجعةً أساليب المحاذاة لما بعد التدريب مع تسليط الضوء على التحديات الحرجة في الهلوسة، والسلامة، والكفاءة.

Zongxia Li, Xiyang Wu, Hongyang Du, Fuxiao Liu, Huy Nghiem, Guangyao Shi2026-08-25
💬 NLP

Benchmarking and Boosting Multilingual Capabilities of LVLMs via OCR-Centric Reinforcement Learning

تقدم هذه الورقة PM4Bench، وهو معيار متعدد الوسائط متوازي بدقة يكشف أن التعرف الضوئي على الحروف (OCR) هو سبب رئيسي في التفاوتات عبر اللغات في النماذج اللغوية الكبيرة متعددة الوسائط (LVLMs)، وتقترح استراتيجية تعلم تعزيزي تركز على التعرف الضوئي على الحروف وخالية من الملصقات لتعزيز القدرات متعددة اللغات بفعالية وتقليل فجوات الأداء.

Junyuan Gao, Jiahe Song, Jiang Wu, Runchuan Zhu, Guanlin Shen, Shasha Wang, Xingjian Wei, Haote Yang, Weijia Li, Bin Wan (…)2026-08-25
💻 computer science

Imitating Radiological Scrolling: A Global-Local Attention Model for 3D Chest CT Volumes Multi-Label Anomaly Classification

تقدم هذه الورقة البحثية نموذج CT-Scroll، وهو نموذج انتباه عالمي-محلي يحاكي سلوك التمرير لدى أطباء الأشعة لمعالجة تحديات تصنيف الشذوذ متعدد الملصقات في أحجام الأشعة المقطعية للصدر ثلاثية الأبعاد بفعالية من خلال التقاط التبعيات طويلة المدى والتفاصيل المحلية.

Theo Di Piazza, Carole Lazarus, Olivier Nempont, Loic Boussel2026-08-25
⚡ electrical engineering

Using Wavelet Domain Fingerprints to Improve Source Camera Identification

تقدم هذه الورقة إطار عمل للبصمة الرقمية في مجال المويجات يقوم بتحديد هوية الكاميرا المصدر مباشرة على معاملات المويجات بدلاً من إعادة بناء الصور المكانية، مما يقلل بشكل كبير من التكاليف الحسابية مع الحفاظ على دقة التحديد للتطبيقات واسعة النطاق.

Xinle Tian, Matthew Nunes, Emiko Dupont, Shaunagh Downing, Freddie Lichtenstein, Matt Burns2026-08-25