💻 computer science

Designing UNICORN: a Unified Benchmark for Imaging in Computational Pathology, Radiology, and Natural Language

تقدم الورقة البحثية UNICORN، وهو معيار مرجعي عام موحد يتميز بإطار تقييم معياري مكون من خطوتين ومقياس تجميعي مبتكر لتقييم تعميم النماذج الطبية التأسيسية عبر الوسائط المتعددة والمهام المختلفة بشكل منهجي عبر بيانات تصوير ولغة طبيعية متنوعة من مؤسسات متعددة.

Michelle Stegeman, Lena Philipp, Fennie van der Graaf, Marina D'Amato, Clément Grisi, Luc Builtjes, Joeran S. Bosma, Jud (…)2026-03-04
💻 computer science

NOVA: Sparse Control, Dense Synthesis for Pair-Free Video Editing

تقدم هذه الورقة NOVA، وهو إطار عمل لتحرير الفيديو غير مقيد بالأزواج يجمع بين توجيهات الإطارات الرئيسية المتفرقة التي يوفرها المستخدم وبين توليد الحركة والنسيج الكثيف، والذي تم تدريبه عبر استراتيجية محاكاة التدهور لتحقيق دقة تحرير عالية واتساق زمني دون الحاجة إلى مجموعات بيانات ضخمة مقترنة.

Tianlin Pan, Jiayi Dai, Chenpu Yuan, Zhengyao Lv, Binxin Yang, Hubery Yin, Chen Li, Jing Lyu, Caifeng Shan, Chenyang Si2026-03-04
💻 computer science

Structure-Aware Text Recognition for Ancient Greek Critical Editions

تتناول هذه الورقة أوجه القصور في نماذج اللغة المرئية في التعرف على التخطيطات المعقدة للطبعات النقدية لليونانية القديمة من خلال تقديم مجموعة بيانات اصطناعية واسعة النطاق ومعيار مرجعي من العالم الحقيقي، مما يثبت أنه بينما يتخلف أداء التعلم الصفري عن الأدوات التقليدية، يمكن للنماذج التي تم ضبطها بدقة مثل Qwen3VL-8B أن تحقق دقة تضاهي أحدث ما توصل إليه العلم.

Nicolas Angleraud, Antonia Karamolegkou, Benoît Sagot, Thibault Clérice2026-03-04
💬 NLP

Nodes Are Early, Edges Are Late: Probing Diagram Representations in Large Vision-Language Models

من خلال سبر أغوار نماذج اللغات الكبيرة متعددة الوسائط (LVLMs) باستخدام مجموعة بيانات رسوم بيانية موجهة اصطناعية، تكشف هذه الدراسة أنه بينما يتم ترميز معلومات العقد والبنية خطياً في مرحلة مبكرة في المشفر البصري، فإن تمثيلات الحواف لا تظهر إلا لاحقاً في الرموز النصية للنموذج اللغوي، مما يفسر معاناة هذه النماذج المستمرة مع الفهم العلاقاتي.

Haruto Yoshida, Keito Kudo, Yoichi Aoki, Ryota Tanaka, Itsumi Saito, Keisuke Sakaguchi, Kentaro Inui2026-03-04
💻 computer science

SemanticDialect: Semantic-Aware Mixed-Format Quantization for Video Diffusion Transformers

تقترح الورقة البحثية SemanticDialect، وهو إطار عمل للكمّنة مختلطة التنسيق ومعتمدة على الدلالة لنماذج محولات الانتشار للفيديو (Video Diffusion Transformers)، يستخدم اختيار التنسيق على مستوى الكتل، وتفكيك التنشيط مع التصحيح المتبقي، وتجميع الرموز الدلالية لتحقيق توليد فيديو عالي الجودة مع تقليل تكاليف الذاكرة والحوسبة بشكل كبير.

Wonsuk Jang, Thierry Tambe2026-03-04
🤖 AI

StegaFFD: Privacy-Preserving Face Forgery Detection via Fine-Grained Steganographic Domain Lifting

تُعد StegaFFD إطار عمل للكشف عن تزييف الوجوه مع الحفاظ على الخصوصية، حيث تقوم بدمج صور الوجوه في صور غطاء طبيعية باستخدام تقنية إخفاء المعلومات (steganography) لتجنب الشبهات، بينما توظف آليات متخصصة للتحلل والانتباه والمحاذاة للكشف بدقة عن عمليات التزييف داخل نطاق الإخفاء رغم التداخل الدلالي.

Guoqing Ma, Xun Lin, Hui Ma, Ajian Liu, Yizhong Liu, Wenzhong Tang, Shan Yu, Chenqi Kong, Yi Yu2026-03-04
💻 computer science

GloPath: An Entity-Centric Foundation Model for Glomerular Lesion Assessment and Clinicopathological Insights

يُعد GloPath نموذجاً تأسيسياً قابلاً للتوسع ومركزاً على الكيانات، تم تدريبه على أكثر من مليون كبيبة كلوية، وهو يتفوق على الأساليب الرائدة في مهام تقييم الآفات المتنوعة ويكشف عن ارتباطات سريرية مرضية هامة، مما يعزز الترجمة السريرية للذكاء الاصطناعي في علم أمراض الكلى.

Qiming He, Jing Li, Tian Guan, Yifei Ma, Zimo Zhao, Yanxia Wang, Hongjing Chen, Yingming Xu, Shuang Ge, Yexing Zhang, Yi (…)2026-03-04
💻 computer science

Semi-Supervised Few-Shot Adaptation of Vision-Language Models

تقترح هذه الورقة طريقة شبه مُشرفة فعالة للتكيف بلقطات قليلة لنماذج الرؤية واللغة في التصوير الطبي، والتي تستفيد من البيانات غير المُصنفة لنشر الملصقات الزائفة المستندة إلى النصوص، مما يقلل متطلبات التوسيم بنسبة تزيد عن 50% مع معالجة تحديات عدم توازن الفئات.

Julio Silva-Rodríguez, Ender Konukoglu2026-03-04
💻 computer science

The Dresden Dataset for 4D Reconstruction of Non-Rigid Abdominal Surgical Scenes

تُعد مجموعة بيانات دريسدن (D4D) معياراً شاملاً يضم أكثر من 300,000 إطار و369 سحابة نقاط من جراحات جثث الخنازير، مما يوفر فيديوهات تنظيرية مقترنة بهندسة الضوء المهيكل عالية الجودة لتمكين التقييم الكمي لطرق إعادة البناء رباعي الأبعاد غير الصلب، وتحديد الموقع ورسم الخرائط آنياً (SLAM)، وتقدير العمق في المشاهد الجراحية البطنية الواقعية.

Reuben Docea, Rayan Younis, Yonghao Long, Maxime Fleury, Jinjing Xu, Chenyang Li, André Schulze, Ann Wierick, Johannes B (…)2026-03-04
💻 computer science

VIRGi: View-dependent Instant Recoloring of 3D Gaussians Splats

تُعد VIRGi طريقة مبتكرة لإعادة تلوين مشاهد Gaussian Splatting ثلاثية الأبعاد بسرعة وواقعية فوتوغرافية من خلال تفكيك اللون إلى مكونات منتشرة (diffuse) وأخرى تعتمد على زاوية الرؤية، مما يتيح تحريراً في الوقت الفعلي باستخدام صورة واحدة يحافظ على اللمعان الانعكاسي ويتفوق على النهج القائم على NeRF.

Alessio Mazzucchelli, Ivan Ojeda-Martin, Fernando Rivas-Manzaneque, Elena Garces, Adrian Penate-Sanchez, Francesc Moreno (…)2026-03-04