💻 computer science

Do Less, Achieve More: Do We Need Every-Step Optimization for RL Fine-tuning of Diffusion Models?

تقترح الورقة البحثية AdaScope، وهي طريقة ضبط دقيق تعتمد على التعلم المعزز التكيفي لنماذج الانتشار، تتدخل بشكل انتقائي فقط خلال مراحل إزالة الضجيج المثالية لتقليل التكاليف الحسابية بنسبة 59% وتحسين أداء التوليد بنسبة 66% في آن واحد، مع تجنب عدم الكفاءة الناتج عن التحسين كامل المسار.

Renye Yan, Jikang Cheng, Shikun Sun, Yi Sun, You Wu, Wei Peng, Zongwei Wang, Ling Liang, Junliang Xing, Yimao Cai2026-05-18
💬 NLP

Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination

تكشف هذه الورقة أن نماذج الرؤية واللغة غالباً ما تنتج عبارات تأمل ذاتي مثل "دعني أتحقق مجدداً" كمجرد أنماط نصية بدلاً من تحفيز إعادة فحص بصري حقيقي، وهو استنتاج أثبته إطار عمل VisualSwap الذي يُظهر أن النماذج تفشل تكراراً في اكتشاف عمليات تبديل الصور المختلفة دلالياً رغم مثل هذه الادعاءات.

Chufan Shi, Cheng Yang, Yaokang Wu, Linhao Jin, Bo Shui, Taylor Berg-Kirkpatrick, Xuezhe Ma2026-05-18
💻 computer science

Unlocking Dense Metric Depth Estimation in VLMs

تقدم الورقة البحثية DepthVLM، وهو إطار عمل يحول نموذج رؤية ولغة واحد إلى متنبئ عمق متري كثيف أصيل وفعال من خلال رأس عمق خفيف الوزن وتدريب موحد، متفوقاً بشكل كبير على النماذج الحالية في كل من استعادة الهندسة ثلاثية الأبعاد والاستدلال المكاني مع الحفاظ على القدرات متعددة الوسائط.

Hanxun Yu, Xuan Qu, Yuxin Wang, Jianke Zhu, Lei ke2026-05-18
🤖 AI

Uncertainty-Aware Wildfire Smoke Density Classification from Satellite Imagery via CBAM-Augmented EfficientNet with Evidential Deep Learning

تقترح هذه الورقة إطار عمل معزز بآلية CBAM لشبكة EfficientNet-B3 مع التعلم العميق الأدلّي (Evidential Deep Learning) لتصنيف شدة دخان حرائق الغابات إلى ثلاثة مستويات من صور الأقمار الصناعية، مع تحديد كمية عدم اليقين المعرفي (epistemic) والاليتوري (aleatoric) في تمريرة أمامية واحدة، محققةً دقة بنسبة 93.8% وتحديداً فعالاً لمناطق الدخان الغامضة دون الحاجة إلى أخذ عينات مونت كارلو.

Ranjith Chodavarapu2026-05-18
🤖 AI

RaPD: Resolution-Agnostic Pixel Diffusion via Semantics-Enriched Implicit Representations

يقدم RaPD إطار عمل لانتشار البكسل غير مرتبط بالدقة يعمل ضمن فضاء كامن لمجال صورة عصبية مستمر، مستخدماً التوجيه الدلالي وانتباه الاستعلام بالإحداثيات لتمكين توليد صور عالية الجودة بدقة تعسفية بتكلفة حوسبية ثابتة.

Yanhao Ge, Shanyan Guan, Weihao Wang, Ying Tai, Mingyu You2026-05-18
🤖 machine learning

LoCO: Low-rank Compositional Rotation Fine-tuning

تُعد LoCO طريقةً مبتكرةً للضبط الدقيق بكفاءة المعلمات، حيث تقوم ببناء تحويلات متعامدة باستخدام مصفوفات غير متماثلة منخفضة الرتبة وسلاسل دوران تركيبية للحفاظ على البنية الهندسية للتمثيلات سابقة التدريب مع تمكين الحوسبة المتوازية الفعالة عبر مجالات متنوعة.

An Nguyen, Jaesik Choi, Anh Tong2026-05-18
💻 computer science

AdaEraser: Training-Free Object Removal via Adaptive Attention Suppression

تُعد AdaEraser إطار عمل لإزالة الكائنات دون الحاجة للتدريب، وهي تتفوق على الأساليب الحالية من خلال توظيف استراتيجية كبت الانتباه التكيفي على مستوى الرمز (token-wise)، والتي تعمل على ضبط الانتباه الذاتي ديناميكيًا بناءً على تقدير وجود الكائن لتحقيق التوازن بين الإزالة الفعالة وإعادة بناء الخلفية بجودة عالية.

Dingming Liu2026-05-18
💻 computer science

Invaria: Learning Scale and Density Invariance in Point Clouds via Next-Resolution Prediction

تُعد Invaria مشفرًا للسحب النقطية يحقق الثبات في المقياس والكثافة من خلال التنبؤ بالدقة التالية ومعايرة المجال الاستقبالي، مما يحسن بشكل كبير من القدرة على التعميم عبر تحولات الدقة والمقياس مع تقليل حجم النموذج ومتطلبات الرموز.

Chun-Peng Chang, Shaoxiang Wang, Alain Pagani, Dariu Gavrila, Holger Caesar2026-05-18
🤖 AI

Decomposed Vision-Language Alignment for Fine-Grained Open-Vocabulary Segmentation

تقترح هذه الورقة إطار عمل لمحاذاة الرؤية واللغة المفككة يعزز التجزئة دقيقة التفاصيل ذات المفردات المفتوحة من خلال تحليل المحفزات النصية إلى رموز للمفاهيم ورموز للسمات واستخدام وحدة انتباه متقاطع ذات ميزة بوابة الميزات لفرض الدلالات التركيبية، مما يحسن بشكل كبير من القدرة على التعميم لمجموعات السمات والفئات غير المرئية.

Chenhao Wang, Yingrui Ji, Yu Meng, Yao Zhu2026-05-18
💻 computer science

Sparse Autoencoders enable Robust and Interpretable Fine-tuning of CLIP models

تقترح الورقة البحثية طريقة SAE-FT، وهي طريقة ضبط دقيق فعالة حاسبياً وقابلة للتفسير لنماذج CLIP تستخدم المشفّرات التلقائية المتفرقة (Sparse Autoencoders) لضبط تغييرات التمثيل البصري، مما يؤدي إلى تحسين الأداء في المهام اللاحقة مع الحفاظ على المتانة ضد تغيرات التوزيع ومنع النسيان الكارثي.

Fabian Morelli, Arnas Uselis, Ankit Sonthalia, Seong Joon Oh2026-05-18