💻 computer science

PixSDS: Why Latent SDS Makes Noisy Pixels

تحدد هذه الورقة أن العيوب الهيكلية في تقنية "تقطير درجة التباين" (SDS) في الفضاء الكامن تنشأ من انزياح البكسل الناتج عن المشفر التلقائي المتغير (VAE)، وتقترح طريقة "PixSDS"، وهي طريقة خفيفة الوزن تعمل على إصلاح التدرجات باستخدام اتجاهات الصور المفككة لتخميد الضجيج مع الحفاظ على المحتوى الدلالي.

Vsevolod Skorokhodov2026-08-14
💻 computer science

UniTraffic-Agent: Unified Traffic Video Reasoning for AI City Challenge 2026 Track 3 with Two Out-of-Domain Evaluations

تقدم هذه الورقة UniTraffic-Agent، وهو إطار عمل موحد يستخدم سير عمل "الملاحظة-الاستنتاج-التنفيذ-التحقق" لمعالجة تحديات الاستنتاج في فيديوهات المرور في تحدي AI City 2026، محققاً أداءً رفيع المستوى عبر الاستنتاج في الحالات المرورية الشاذة وتقييمين خارج النطاق لأحداث عدسة عين السمكة ونوايا المشاة.

Peng Li, Qianqian Xu, Shilong Bao, Yangbangyan Jiang, Qingming Huang2026-08-14
💻 computer science

Spatially-Grounded Text-to-Video Generation via Inference-Time Gradient-Free Optimization

تقدم هذه الورقة البحثية GATO-Vid، وهي طريقة جديدة خالية من التدريب ومن التدرج لتوليد الفيديو من النص مع تحديد المواقع مكانياً، والتي تحقق تحديداً دقيقاً للأجسام من خلال حل تحليلي مغلق الصيغة وآلية حقن فورية، متفوقة بشكل كبير على النماذج المرجعية الحالية في الدقة مع تقليل العبء الحسابي إلى أدنى حد.

Guillaume Jeanneret, Mathis Koroglu, Hugo Caselles-Dupré, Arnaud Dapogny, Matthieu Cord2026-08-14
🤖 machine learning

From Local Mismatch to Global Impact: Optimizing Cache Reuse Policy for Efficient Diffusion

تقدم هذه الورقة البحثية "ذاكرة التخزين المؤقت ذات التأثير العالمي" (GCache)، وهو إطار عمل مبتكر يعمل على تحسين استدلال نماذج الانتشار من خلال إعادة صياغة إعادة استخدام الذاكرة المخبئية كمسألة تحسين ثنائي المستوى لمواءمة حدود انتشار الخطأ مع جودة التوليد، مما يحقق تسريعاً كبيراً مع تعزيز الدقة البصرية في مهام الصور والفيديو على حد سواء.

Xichen Ye, Yifan Wu, Zhikang Xie, Xiangyu Yue, Cheng Jin, Weizhong Zhang2026-08-14
💻 computer science

P2Fusion: Prompt-based Progressive Infrared-Visible Image Fusion via Dual-Prior Distillation

تقدم الورقة البحثية P2Fusion، وهو إطار عمل مبتكر قائم على التلقين يستفيد من الأولويات الجوهرية المزدوجة وآلية "التعليم للدمج" مع إعادة معايرة الخبراء الديناميكية ذات البوابة لتحقيق أداء رائد في دمج الصور بالأشعة تحت الحمراء والمرئية وتعزيز متانة اكتشاف الأشياء في المهام اللاحقة بشكل كبير.

Yi Shi, Huichao Xie, Yuqing Wang, Mingyu Wang, Kaihui Yang, Yu Liu, Ruitao Lu, Lizhe Li, Junwei Han, Dingwen Zhang2026-08-14
💻 computer science

RbFT-Net: Rectify-Before-Fuse Temporal Radar Anchors for 4D Radar-Camera Depth Completion

تقترح الورقة البحثية شبكة RbFT-Net، وهي إطار عمل متكامل (end-to-end) يعمل على تحسين إكمال العمق للرادار والكاميرا رباعي الأبعاد (4D radar-camera depth completion) عبر التعامل مع عوائد الرادار المتراكمة كمرتكزات زمنية مشوشة، وتصحيح مواقعها وأعماقها باستخدام الشروط الصورية، ونشر القياسات الموثوقة فقط بشكل انتقائي قبل الدمج متعدد الوسائط للتخفيف من آثار التشتت وعدم المحاذاة الزمنية.

Wentao Zhao, Shouxuan Wu, Yongtao Cen, Tianchen Deng, Yuyang Zhang, Jingchuan Wang2026-08-14
🤖 machine learning

MergeOver: Post-Training Token Merging for Recursive Vision Transformers

تُعد MergeOver طريقة ما بعد التدريب تدمج تقنية "دمج الرموز" (Token Merging) في نماذج المحولات الرؤيوية ذات الأوزان المشتركة بشكل متكرر لتقليل استخدام الذاكرة وزمن الاستجابة بشكل كبير على الأجهزة الطرفية مع الحفاظ على دقة عالية، وكل ذلك دون الحاجة إلى إعادة تدريب مكلفة.

Junseo Kim, Uraz Odyurt, Amirreza Yousefzadeh2026-08-14
🤖 machine learning

TRAPSBench: Vision-Language Models Encode but Fail to Express Epistemic Restraint

تقدم هذه الورقة TRAPSBench ومقياس PECS لتوضيح أنه بينما تمتلك النماذج اللغوية البصرية القدرة الداخلية على اكتشاف متى تكون الأدلة المرئية غير كافية لاتخاذ قرار، إلا أنها تفشل باستمرار في التعبير عن هذا الكبح المعرفي، مما يكشف عن وجود عنق زجاجة حرج في توليد مخرجاتها بدلاً من إدراكها.

Fnu Pramono, John Cai, Sourabh Kulkarni2026-08-14
💻 computer science

UniCon-Former: Unified Convolution Transformer is All You Need for Hand Gesture Recognition

تقترح الورقة البحثية UniCon-Former، وهي بنية محولة تلافيفية موحدة تدمج الإسقاطات التلافيفية لإنشاء هيكل هرمي، مما يساهم في التقاط الميزات المحلية والعالمية بكفاءة من أجل التعرف على إيماءات اليد بأداء متطور مع تقليل التكاليف الحسابية والمعلمات.

Mallika Garg, Debashis Ghosh, Pyari Mohan Pradhan2026-08-14
🤖 machine learning

How Do VLMs Behave When Blind or Misled? Behavioral Evaluation of VLMs on Scientific Figures

تقدم هذه الورقة SciFigBench، وهو معيار شامل وإطار عمل "الممانعة-المقاومة-الحث" (A-R-I) لتقييم الموثوقية السلوكية لنماذج الرؤية واللغة تحت ظروف عدم اليقين في فهم الأشكال العلمية، مما يكشف أن دقة الإدراك والاستدلال العالية لا تضمن قدرة النموذج على الإقرار بنقص الأدلة أو مقاومة السياق المضلل.

Paul Osemudiame Oamen, Owusu-Banahene Osei, Ananya Mukherjee, Christian Greisinger, Steffen Eger, Pius Onobhayedo, Wei Z (…)2026-08-14