💻 computer science

PaddleOCR-VL-1.5: Towards a Multi-Task 0.9B VLM for Robust In-the-Wild Document Parsing

يُعد PaddleOCR-VL-1.5 نموذجاً لغوياً بصرياً مطوراً فائق الصغر بحجم 0.9 مليار معلمة، يحقق أداءً هو الأفضل في مجاله في مهام تحليل المستندات، بما في ذلك المتانة ضد التشوهات الفيزيائية الواقعية والقدرات الجديدة مثل التعرف على الأختام وتحديد مواقع النصوص.

Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Xueqing Wang, Changda Zhou, Hongen Liu, Manhui (…)2026-04-07
🤖 machine learning

Compact Hypercube Embeddings for Fast Text-based Wildlife Observation Retrieval

تقدم هذه الورقة إطار عمل يستخدم تضمينات المكعب الفائق المدمجة والضبط الدقيق كفء المعلمات للنماذج التأسيسية مثل BioCLIP وBioLingual لتمكين استرجاع نصي سريع، وفعال من حيث الذاكرة، وعالي الأداء لأرشيفات صور وصوتيات الحياة البرية واسعة النطاق.

Ilyass Moummad, Marius Miron, David Robinson, Kawtar Zaher, Hervé Goëau, Olivier Pietquin, Pierre Bonnet, Emmanuel Cheml (…)2026-04-07
🤖 machine learning

InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs

تقترح هذه الورقة InfoTok، وهو إطار عمل للتنظيم القائم على نظرية المعلومات والمستند إلى مبدأ عنق الزجاجة للمعلومات، والذي يعمل على تحسين الترميز الرمزي البصري المشترك في النماذج اللغوية الكبيرة الموحدة متعددة الوسائط من خلال فرض قيود المعلومات المتبادلة لتحقيق التوازن بين الضغط والصلة بالمهمة، مما يؤدي إلى تحسين كل من فهم الصور وتوليدها دون الحاجة إلى بيانات تدريب إضافية.

Lv Tang, Tianyi Zheng, Bo Li, Xingyu Li2026-04-07
🤖 AI

Neural Implicit 3D Cardiac Shape Reconstruction from Sparse CT Angiography Slices Mimicking 2D Transthoracic Echocardiography Views

تقترح هذه الورقة طريقة تعتمد على دالة عصبية ضمنية تعيد بناء أشكال قلبية ثلاثية الأبعاد دقيقة من مستويات تصوير مقطعي محوسب وعائي متباعدة تحاكي مناظر تخطيط صدى القلب ثنائية الأبعاد، مما يظهر تفوقاً في التقدير الحجمي لحجرات القلب مقارنة بالمعيار السريري لقاعدة سيمبسون ثنائية المستوي.

Gino E. Jansen, Carolina Brás, R. Nils Planken, Mark J. Schuuring, Berto J. Bouma, Ivana Išgum2026-04-07
💻 computer science

3DXTalker: Unifying Identity, Lip Sync, Emotion, and Spatial Dynamics in Expressive 3D Talking Avatars

تقترح الورقة البحثية 3DXTalker، وهو إطار عمل موحد يولد صوراً رمزية ثلاثية الأبعاد ناطقة ومعبرة من خلال دمج نمذجة الهوية القابلة للتوسع، ومزامنة حركة الشفاه المدركة للعواطف، والديناميكيات المكانية القابلة للتحكم عبر مسار جديد لتنسيق البيانات ومحول يعتمد على مطابقة التدفق.

Zhongju Wang, Zhenhong Sun, Beier Wang, Yifu Wang, Daoyi Dong, Huadong Mo, Hongdong Li2026-04-07
💻 computer science

NeuroSymb-MRG: Differentiable Abductive Reasoning with Active Uncertainty Minimization for Radiology Report Generation

يُعد NeuroSymb-MRG إطاراً موحداً يجمع بين الاستدلال الاختطافي العصبي الرمزي والتقليل النشط لعدم اليقين لتوليد تقارير إشعاعية مهيكلة ومتسقة سريرياً من خلال دمج المفاهيم المستمدة من الصور، وسلاسل المنطق القابلة للتفاضل، والتحسين المعزز بالاسترجاع.

Rong Fu, Yiqing Lyu, Chunlei Meng, Muge Qi, Yabin Jin, Qi Zhao, Li Bao, Juntao Gao, Fuqian Shi, Nilanjan Dey, Wei Luo, S (…)2026-04-07
💻 computer science

JAMMEval: A Refined Collection of Japanese Benchmarks for Reliable VLM Evaluation

تقدم هذه الورقة JAMMEval، وهي مجموعة منقحة من معايير القياس اليابانية التي تم إنشاؤها من خلال التوسيم البشري المنهجي لمعالجة مشكلات جودة البيانات في مجموعات البيانات الحالية، مما يتيح تقييماً أكثر موثوقية ودقة لنماذج الرؤية واللغة.

Issa Sugiura, Koki Maeda, Shuhei Kurita, Yusuke Oda, Daisuke Kawahara, Naoaki Okazaki2026-04-07
💻 computer science

Street-Legal Physical-World Adversarial Rim for License Plates

تقدم هذه الورقة SPAR، وهو إطار هجومي منخفض التكلفة، وقابل للتحقيق مادياً، ومسموح به قانونياً، ينجح في اختراق أنظمة التعرف الآلي على لوحات ترخيص المركبات (ALPR) الحديثة عن طريق تقليل الدقة بنسبة 60% وتمكين انتحال الشخصية المستهدف دون حجب لوحة ترخيص المركبة.

Nikhil Kalidasu, Sahana Ganapathy2026-04-07
💻 computer science

VBGS-SLAM: Variational Bayesian Gaussian Splatting Simultaneous Localization and Mapping

يُعد VBGS-SLAM إطار عمل جديد لتقدير الموقع ورسم الخرائط المتزامن (SLAM) يدمج الاستدلال البايزي المتغير مع تقنية التقطيع الغاوسي ثلاثي الأبعاد (3D Gaussian Splatting) لتمكين تتبع وضعية الكاميرا وتحسين الخريطة بوعي بمستوى عدم اليقين من خلال تحديثات مغلقة الصيغة وفعالة، مما يتغلب على مشكلات الحساسية للتهيئة والنسيان الكارثي التي تعاني منها الطرق الحتمية الحالية.

Yuhan Zhu, Yanyu Zhang, Jie Xu, Wei Ren2026-04-07
💻 computer science

A Unified Perspective on Adversarial Membership Manipulation in Vision Models

تقدم هذه الورقة إطاراً موحداً للتلاعب العدائي بالعضوية في نماذج الرؤية، حيث تُثبت أن الاضطرابات غير المحسوسة يمكنها تضليل هجمات استدلال العضوية بشكل موثوق، بينما تقترح استراتيجية كشف جديدة قائمة على هندسة التدرج للتخفيف من حدة هذا التهديد للخصوصية.

Ruize Gao, Kaiwen Zhou, Yongqiang Chen, Feng Liu2026-04-07