💻 computer science

AnchorScore: A CLIP-Based Diagnostic of MLLM Annotation Difficulty

تقدم هذه الورقة AnchorScore، وهو مقياس تشخيصي منخفض التكلفة يعتمد على CLIP، يتنبأ بفعالية بصعوبة التوسيم لكل فئة للنماذج اللغوية الكبيرة متعددة الوسائط (MLLMs)، مما يتيح استراتيجيات توجيه فعالة من حيث التكلفة ومنح الأولوية للمراجعة البشرية دون الحاجة إلى تقييمات مكلفة للنماذج اللغوية الكبيرة متعددة الوسائط.

Yan Ma, Lizhuo Zhang2026-08-18
🤖 machine learning

MIRROR: Multimodal Intelligent Radiology Reasoning and Observation Reporter

يقترح النموذج الأولي MIRROR نظاماً لتقارير الأشعة متعدد الوسائط يربط بين مصنف ومحدد مواقع ومولد نصوص لضمان نتائج قابلة للتدقيق ومستندة إلى احتمالات النموذج، مع تسليط الضوء على أنه على الرغم من تحقيق تمييز أفضل من الصدفة في مجموعة بيانات ChestMNIST، إلا أن الفائدة العملية للنموذج محدودة للغاية بسبب عدم توازن الفئات مما يجعله يفشل في تقديم تنبؤات إيجابية لمعظم الحالات.

Vignesh Nagarajan, Sriram Venkatapathy2026-08-18
💻 computer science

PersonaShot: Benchmarking Person-Centric Narrative Continuity in Multi-Shot Video Generation

تقدم الورقة البحثية PersonaShot، وهو أول معيار مصمم لتقييم استمرارية السرد المتمحور حول الشخصية في توليد الفيديو متعدد اللقطات، وذلك عبر استخدام 1,000 مقطع و16 مقياساً متخصصاً للكشف عن فجوات كبيرة بين الجودة الإدراكية والتماسك عبر اللقطات في النماذج الحديثة.

Yuji Wang, Yuheng Chen, Teng Hu, Ran Yi, Yijia Hong, Han Feng, Weijian Cao, Chengjie Wang, Lizhuang Ma, Jiangning Zhang2026-08-18
💻 computer science

CytoFormer: A Molecularly Supervised Cell Foundation Model for Histopathology Cell Classification

يُعد CytoFormer نموذجاً تأسيسياً خلوياً مبتكراً يستفيد من بيانات نسيجية (H&E) وبيانات النسخ المتماثل المكاني المزدوجة من 16 عضواً لتحقيق تصنيف دقيق وفعال في استخدام الملصقات وقابل للتعميم للخلايا دون الاعتماد على التعليقات التوضيحية اليدوية لأخصائيي الأمراض.

Jialu Yao, Songhao Li, Alina Yu, Zhi Huang2026-08-18
💻 computer science

VicEdit: Learning to Edit Videos from Visual In-Context Examples

تقدم الورقة البحثية VicEdit، وهو إطار عمل موحد يطور تحرير الفيديو من خلال الاستفادة من مجموعة بيانات جديدة واسعة النطاق (VicEdit-400K) وتقنيات مبتكرة مثل التقطير الدلالي المتكيف مع النمط (Modality-Adaptive Semantic Distillation) وحقن السياق المزدوج (Dual-Context Injection) لدمج الأمثلة البصرية السياقية مع التعليمات النصية بفعالية لتحقيق أداء تحرير فائق.

Yuji Wang, Teng Hu, Yuheng Chen, Ran Yi, Han Feng, Weijian Cao, Chengjie Wang, Lizhuang Ma, Jiangning Zhang2026-08-18
💻 computer science

Beyond Uncertainty: Generalizable Failure Monitoring for Surgical Segmentation under Acquisition Degradation

تقدم هذه الورقة TCSR-Monitor، وهو إطار عمل لاحق للتحليل (post-hoc) يعزز الكشف عن فشل التجزئة الجراحية في ظل تدهور عملية الاستحواذ من خلال الجمع بين الثقة وبين مؤشرات الشكل الملحوظة، والزمنية، وجودة الصورة، مما يظهر قدرة فائقة على التعميم مقارنة بالنماذج المرجعية التي تعتمد على الثقة فقط، مع تسليط الضوء على التحديات المستمرة المتعلقة بالإنذارات الكاذبة والنقل الصفري (zero-shot transfer).

Hieu D. Pham, Dang P. M. Cao, Thanh Trung Huynh2026-08-18
💻 computer science

Revisiting Classifier-Free Guidance Methods in Latent Diffusion Models

تعيد هذه الورقة تقييم ثماني طرق لتعزيز الجودة أثناء الاستنتاج دون الحاجة لتدريب، وهي طرق متجذرة في التوجيه الخالي من المصنف (Classifier-Free Guidance) على نماذج المحولات ذات التدفق المصحح الحديثة، لتجد أن أياً منها لا يتفوق باستمرار على التوجيه الخالي من المصنف القياسي عبر معايير المحاذاة التركيبية والمعايير الدلالية، حيث تقدم العديد من الطرق مكاسب هامشية فقط أو تسبب تدهوراً في الأداء.

Artem Sergievskii, Artyom Turevich, Sergey Kastryulin2026-08-18
💻 computer science

PixRestore: Unified Image Restoration via Pixel Diffusion Transformer

يقدم PixRestore إطار عمل موحداً لترميم الصور يستفيد من نموذج "Diffusion Transformer" في فضاء البكسل وخالٍ من الـ VAE، تم تدريبه من الصفر مع دمج ميزات تكيفي وتقطير بنقلة واحدة لتحقيق دقة فائقة، وجودة إدراكية، وكفاءة تتفوق على الأساليب الحالية القائمة على الانتشار الكامن.

Lingchen Sun, Rongyuan Wu, Xiangtao Kong, Jixin Zhao, Qiaosi Yi, Yujing Sun, Shuaizheng Liu, Zhengqiang Zhang, Lei Zhang2026-08-18
💻 computer science

Unlocking the Potential of Image Editing via Concept Scaling and Dense Supervision

تقدم هذه الورقة ConceptEdit، وهو إطار عمل شامل يعالج أوجه القصور في نماذج تحرير الصور الحالية من خلال إنشاء تصنيف هرمي لأكثر من 1,000 مفهوم دقيق، وبناء مجموعة بيانات ضخمة مكونة من 12 مليون زوج (ConceptEdit-12M) عبر نهج تخليق مدفوع بالمكتبات، واقتراح استراتيجية تدريب قائمة على الإشراف الكثيف لتعزيز أداء النموذج وتقييمه بشكل كبير.

Long Cui, Xiaoqian Liu, Qi Qin, Yi Xin, Tao Lin, Jianguo Li, Linfeng Zhang2026-08-18
💻 computer science

SplatGuide: Geometric Priors from 3D Gaussians for Pose-Free Novel View Synthesis

يحقق SplatGuide أحدث ما توصل إليه العلم في مجال تركيب المشاهد من زوايا رؤية جديدة دون الحاجة لمعرفة الوضعية، وذلك عبر توحيد الصور المُصيغة، وخرائط التصويت للرؤية لكل غاوسيان على حدة، ورموز إعادة البناء من مشهد غاوسيان ثلاثي الأبعاد واحد، لتوفير توجيه هندسي وميزاتي شامل لعمليات الانتشار متعددة المشاهد.

Yejun Zhang, Zihan Wang, Xu Ji, Yihao Wang, Yuxin Hou, Junyuan Fang, Juho-Matti Kilpeläinen, Arno Solin, Hamed Rezazadeg (…)2026-08-18