🤖 AI

Focusing by Contrastive Attention: Enhancing VLMs' Visual Reasoning

تقترح الورقة البحثية طريقة CARVE، وهي طريقة لا تتطلب تدريباً تعمل على تعزيز الاستنتاج البصري لنماذج الرؤية واللغة عبر الاستفادة من التباين بين خرائط الانتباه العامة والخاصة بالمهمة لتصفية الضوضاء البصرية وصقل التركيز، مما يحقق مكاسب كبيرة في الأداء دون تدريب إضافي أو أدوات خارجية.

Yuyao Ge, Shenghua Liu, Yiwei Wang, Lingrui Mei, Baolong Bi, Xuanshan Zhou, Jiayu Yao, Jiafeng Guo, Xueqi Cheng2026-08-18
💻 computer science

CSMoE: An Efficient Remote Sensing Foundation Model with Soft Mixture-of-Experts

تقدم الورقة البحثية نموذج CSMoE، وهو نموذج تأسيسي فعال للاستشعار عن بعد يجمع بين بنية "خليط الخبراء الناعم" (Soft Mixture-of-Experts) واستراتيجية أخذ عينات موضوعية-مناخية لتحقيق أداء رائد عبر مهام متنوعة مع تقليل التعقيد الحسابي وتكاليف التدريب المسبق بشكل كبير.

Leonard Hackel, Tom Burgert, Begüm Demir2026-08-18
🤖 AI

OpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and Editing

تقدم الورقة البحثية OpenGPT-4o-Image، وهي مجموعة بيانات واسعة النطاق تضم 80,000 زوج من التعليمات والصور تغطي 11 مجالاً و51 مهمة فرعية، والتي تعزز بشكل كبير أداء النماذج متعددة الوسائط الموحدة في توليد الصور وتحريرها من خلال بناء بيانات منهجي ومؤتمت.

Zhihong Chen, Xuehai Bai, Yang Shi, Chaoyou Fu, Huanyu Zhang, Haotian Wang, Xiaoyan Sun, Zhang Zhang, Liang Wang, Yuanxi (…)2026-08-18
💻 computer science

World-in-World: World Models in a Closed-Loop World

تقدم هذه الورقة "World-in-World"، وهي أول منصة مفتوحة لتقييم نماذج العالم التوليدية في بيئات تجسد مغلقة الحلقة، كاشفةً أن القدرة على التحكم، وتدرج الفعل-الملاحظة، وحوسبة وقت الاستدلال هي أكثر أهمية لنجاح المهام من الجودة البصرية وحدها.

Jiahan Zhang, Muqing Jiang, Nanru Dai, Taiming Lu, Arda Uzunoglu, Shunchi Zhang, Yana Wei, Jiahao Wang, Vishal M. Patel (…)2026-08-18
💻 computer science

Mitigating Error Accumulation in Co-Speech Motion Generation via Global Rotation Diffusion and Multi-Level Constraints

تقدم هذه الورقة GlobalDiff، وهو إطار عمل جديد قائم على الانتشار يعمل على التخفيف من تراكم الأخطاء في توليد إيماءات الكلام طويلة المدى من خلال العمل مباشرة في فضاء دوران المفاصل العالمي واستخدام مخطط قيود متعدد المستويات لضمان السلامة الهيكلية والاتساق الزمني.

Xiangyue Zhang, Jianfang Li, Jianqiang Ren, Jiaxu Zhang2026-08-18
💻 computer science

UrbanWorld2.0: A Multimodal Agentic Framework for Reality-Aligned 3D World Generation at City-Scale

تقدم الورقة البحثية UrbanWorld2.0، وهو إطار عمل متعدد الوسائط يعتمد على الوكلاء ويستفيد من التأمل الذاتي التكراري وأدوات تأسيسية متنوعة لإنشاء بيئات ثلاثية الأبعاد عالية الدقة على نطاق مدينة، تتميز بمحاذاة واقعية وجودة إدراكية فائقة مقارنة بالطرق الحالية.

Shengyuan Wang, Zhiheng Zheng, Yu Shang, Lixuan He, Yangcheng Yu, Fan Hangyu, Jie Feng, Qingmin Liao, Yong Li2026-08-18
💻 computer science

DRL-Guided Neural Batch Sampling for Semi-Supervised Pixel-Level Anomaly Detection

تقترح هذه الورقة إطار عمل للتعلم التعزيزي العميق شبه الخاضع للإشراف يدمج بين عينة دفع عصبية، ومشفّر تلقائي، ومتنبئ لتحقيق دقة وتحديد موقع فائقين في الكشف عن الشذوذ على مستوى البكسل في العمليات الصناعية باستخدام بيانات مصنفة محدودة، متفوقة بذلك على الأساليب الرائدة في مجموعة بيانات MVTec AD.

Amirhossein Khadivi Noghredeh, Abdollah Safari, Fatemeh Ziaeetabar, Firoozeh Haghighi2026-08-18
💻 computer science

Detector-Augmented SAMURAI for Long-Duration Drone Tracking

تقدم هذه الورقة امتداداً مدعوماً بالكاشف لنموذج SAMURAI التأسيسي، والذي يعزز بشكل كبير من تتبع الطائرات بدون طيار طويل الأمد والقوي في البيئات الحضرية من خلال التخفيف من حالات انقطاع الكشف وتحسين الأداء أثناء أحداث الخروج وإعادة الدخول.

Tamara R. Lenhard, Andreas Weinmann, Hichem Snoussi, Tobias Koch2026-08-18
💻 computer science

Synthetic Image Detection with CLIP: Understanding and Assessing Predictive Cues

تتقصى هذه الورقة البحثية قابلية التفسير في الكشف عن الصور الاصطناعية القائمة على نموذج CLIP من خلال تقديم معيار SynthCLIC للكشف عن أن هذه النماذج تعتمد على إشارات عامة مرتبطة بالنصوص تتعلق بصقل الصورة وتكوينها بدلاً من عيوب محددة ناتجة عن المولد، مما يسلط الضل على أوجه فشلها المتكاملة والمتميزة في الوقت ذاته مقارنةً بكواشف الأدلة الجنائية الرقمية.

Marco Willi, Melanie Mathys, Michael Graber2026-08-18
🤖 AI

OODBench: Out-of-Distribution Benchmark for Large Vision-Language Models

تقدم هذه الورقة البحثية OODBench، وهو معيار تقييم مؤتمت يتكون من 40 ألف زوج من الحالات خارج التوزيع (OOD) على مستوى المثيل ومقياس تقييم تدريجي لتقييم وكشف التدهور الكبير في أداء النماذج اللغوية الرؤيوية الكبيرة الحالية عند التعامل مع بيانات خارج التوزيع في سيناريوهات العالم الحقيقي بشكل شامل.

Ling Lin, Yang Bai, Heng Su, Congcong Zhu, Yaoxing Wang, Yang Zhou, Huazhu Fu, Jingrun Chen2026-08-18