🤖 machine learning

AnyUp: Universal Feature Upsampling

تقدم AnyUp طريقة عالمية لرفع دقة الميزات أثناء الاستدلال، تتعمم عبر أنواع ميزات الرؤية المتنوعة دون الحاجة إلى إعادة التدريب، مما يضع معياراً جديداً فائقاً في جودة رفع الدقة مع الحفاظ على السلامة الدلالية.

Thomas Wimmer, Prune Truong, Marie-Julie Rakotosaona, Michael Oechsle, Federico Tombari, Bernt Schiele, Jan Eric Lenssen2026-02-17
💻 computer science

Consistent text-to-image generation via scene de-contextualization

تقدم هذه الورقة البحثية طريقة "إزالة سياق المشهد" (SDeC)، وهي طريقة مبتكرة وخالية من التدريب، تعمل على التخفيف من حدة انزياح الهوية في توليد الصور من النصوص عبر كبح الارتباطات بين سياق المشهد الكامن وتضمينات الأوامر النصية بشكل تكيفي، مما يتيح الحفاظ المستمر على الموضوع عبر مشاهد متنوعة دون الحاجة إلى معرفة مسبقة بالبيئات المستهدفة.

Song Tang, Peihao Gong, Kunyu Li, Kai Guo, Boyu Wang, Mao Ye, Jianwei Zhang, Xiatian Zhu2026-02-17
💻 computer science

PRISMM-Bench: A Benchmark of Peer-Review Grounded Multimodal Inconsistencies

يُعدُّ PRISMM-Bench أول معيار مرجعي يستند إلى التناقضات الحقيقية التي رصدها مراجعون أقران في النصوص والأشكال والجداول والمعادلات عبر الأوراق العلمية، وهو مصمم لتقييم وكشف القصور الكبير في النماذج اللغوية الكبيرة متعددة الوسائط الحالية في اكتشاف الأخطاء العلمية متعددة الوسائط وتصحيحها والاستنتاج بشأنها بشكل صارم.

Lukas Selch, Yufang Hou, M. Jehanzeb Mirza, Sivan Doveh, James Glass, Rogerio Feris, Wei Lin2026-02-17
🤖 AI

Top-Down Semantic Refinement for Image Captioning

تقترح هذه الورقة البحثية "التحسين الدلالي من الأعلى إلى الأسفل" (TDSR)، وهو إطار عمل جاهز للاستخدام يعيد تعريف وصف الصور كمسألة تخطيط هرمي تُحل عبر خوارزمية بحث مونت كارلو في شجرة موجهة بصرياً وفعالة، وذلك لتعزيز التماسك العالمي، ودقة التفاصيل، وكبح الهلوسة بشكل كبير في النماذج اللغوية البصرية الكبيرة الحالية.

Jusheng Zhang, Kaitong Cai, Jing Yang, Jian Wang, Chengpei Tang, Keze Wang2026-02-17
💻 computer science

Procedural Mistake Detection via Action Effect Modeling

تقترح هذه الورقة نموذج نمذجة تأثير الفعل (AEM)، وهو إطار عمل موحد يحسن الكشف عن الأخطاء الإجرائية من خلال التحليل المشترك لتنفيذ الفعل والنتائج الناجمة عنه عبر التأسيس البصري ورسوم المشاهد البيانية الرمزية، محققاً أداءً هو الأفضل في فئته على معايسات اختبارية صعبة.

Wenliang Guo, Yujiang Pu, Yu Kong2026-02-17
💻 computer science

SlimEdge: Performance and Device Aware Distributed DNN Deployment on Resource-Constrained Edge Hardware

يقدم البحث إطار عمل "SlimEdge"، الذي يجمع بين تقليم النماذج المهيكل والتحسين متعدد الأهداف لتمكين النشر القوي، والمدرك للأداء، والمقاوم للفشل للشبكات العصبية العميقة الموزعة على أجهزة الحافة محدودة الموارد، محققاً تسريعاً كبيراً في عملية الاستنتاج مع الحفاظ على الدقة في ظل حالات فشل الأجهزة.

Mahadev Sunil Kumar, Arnab Raha, Debayan Das, Gopakumar G, Rounak Chatterjee, Amitava Mukherjee2026-02-17
💻 computer science

Q-Hawkeye: Reliable Visual Policy Optimization for Image Quality Assessment

يُعد Q-Hawkeye إطار عمل موثوقاً لتحسين السياسة البصرية القائم على التعلم المعزز لتقييم جودة الصور، حيث يعمل على تعزيز استقرار التنبؤ والتأصيل الإدراكي من خلال توظيف إعادة التوزين الديناميكي المدرك لعدم اليقين وفقد الإدراك الضمني لمعالجة أوجه القصور في طرق GRPO الحالية.

Wulin Xie, Rui Dai, Ruidong Ding, Kaikui Liu, Xiangxiang Chu, Xinwen Hou, Jie Wen2026-02-17
⚡ electrical engineering

Deep learning Based Correction Algorithms for 3D Medical Reconstruction in Computed Tomography and Macroscopic Imaging

تقترح هذه الورقة إطار عمل هجين للتسجيل يتكون من مرحلتين يجمع بين مطابقة المقطع العرضي الأمثل للمحاذاة العالمية المقيدة وشبكة تعلم عميق خفيفة الوزن لتنقيح التشوه المحلي المتبقي، مما يتيح إعادة بناء ثلاثية الأبعاد قوية ودقيقة لتشريح الكلى من المقاطع العيانية رغم ندرة البيانات والتشوه العالي.

Tomasz Les, Tomasz Markiewicz, Malgorzata Lorent, Miroslaw Dziekiewicz, Krzysztof Siwek2026-02-17
🤖 AI

OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention

يُعد OmniVideo-R1 إطار عمل تعزيزي مبتكر يعزز الاستدلال السمعي البصري في نماذج الفيديو الشاملة عبر توظيف التأسيس كثيف الاستعلام والدمج المنتبه للنماط، محققاً أداءً فائقاً وتعميماً قوياً عبر معايير قياسية متعددة.

Zhangquan Chen, Jiale Tao, Ruihuang Li, Yihao Hu, Ruitao Chen, Zhantao Yang, Xinlei Yu, Haodong Jing, Manyuan Zhang, Shu (…)2026-02-17
💻 computer science

VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model

يُعد VLA-JEPA إطار عمل جديد للتدريب المسبق يعزز نماذج الرؤية واللغة والعمل من خلال توظيف آلية تنبؤ بالحالة الكامنة خالية من التسرب لتعلم تجريدات ديناميكية قوية، مما يتغلب على انحياز المظهر والحركة غير المرغوب فيها لتحقيق تعميم ومتانة فائقين في مهام المعالجة في كل من البيئات المحاكية والواقعية.

Jingwen Sun, Wenyao Zhang, Zekun Qi, Shaojie Ren, Zezhi Liu, Hanxin Zhu, Guangzhong Sun, Xin Jin, Zhibo Chen2026-02-17