💻 computer science

Rationale Matters: Learning Transferable Rubrics via Proxy-Guided Critique for VLMReward Models

تقترح الورقة البحثية Proxy-GRM، وهو إطار عمل مبتكر يعزز أداء وقابلية نقل نماذج المكافأة لنماذج الرؤية واللغة من خلال تدريب وكلاء وسيطين خفيفي الوزن لتقديم تغذية راجعة قابلة للتفاضل حول جودة المعايير أثناء التعلم التعزيزي، محققاً نتائج رائدة مع استخدام بيانات تدريب أقل بكثير.

Weijie Qiu, Dai Guan, Junxin Wang, Zhihang Li, Yongbo Gai, Mengyu Zhou, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang2026-03-18
💻 computer science

FlowComposer: Composable Flows for Compositional Zero-Shot Learning

يُعد FlowComposer إطار عمل غير مرتبط بنموذج محدد للتعلم الصفري التركيبي، يعالج أوجه القصور في الطرق الحالية القائمة على الضبط الدقيق الفعال للمعلمات (PEFT) من خلال توظيف مطابقة التدفق لدمج تدفقات السمات والكائنات صراحةً في تدفق تركيبي، مع الاستفادة من مخطط تعزيز موجه بالتسرب لتحويل تشابك الميزات المتبقية إلى إشارة مفيدة لتحسين التعميم.

Zhenqi He, Lin Li, Long Chen2026-03-18
💻 computer science

HeBA: Heterogeneous Bottleneck Adapters for Robust Vision-Language Models

تُعد HeBA (المحول ذو عنق الزجاجة غير المتجانس) إطاراً معمارياً مبتكراً لنماذج الرؤية واللغة يعمل على تحسين المتانة وأداء التعلم من أمثلة قليلة عبر توظيف معالجة خاصة بكل نمط (التلافيف ثنائية الأبعاد للصور والإسقاطات الكثيفة للنصوص)، وعنق زجاجة ضاغط لتنظيم الميزات، والتهيؤ النشط للتدرج لتسريع التقارب.

Md Jahidul Islam2026-03-18
🤖 AI

Fast-WAM: Do World Action Models Need Test-time Future Imagination?

تقدم الورقة البحثية Fast-WAM، وهي بنية لنموذج عالم-فعل (World Action Model) تُظهر أن التخيل الصريح للمستقبل عند وقت الاختبار ليس ضرورياً لتحقيق أداء قوي في التحكم المجسد، مما يكشف أن الفائدة الرئيسية لنمذجة الفيديو تكمن في تحسين تمثيلات العالم أثناء التدريب بدلاً من توليد الملاحظات المستقبلية.

Tianyuan Yuan, Zibin Dong, Yicheng Liu, Hang Zhao2026-03-18
💬 NLP

Retrieving Counterfactuals Improves Visual In-Context Learning

تقدم الورقة البحثية CIRCLES، وهو إطار عمل مبتكر يعزز التعلم في السياق لنماذج الرؤية واللغة من خلال الاسترجاع النشط لأمثلة بأسلوب التناقض عبر استرجاع الصور المركبة الموجهة بالسمات، مما يتيح استدلالاً سببياً أكثر قوة ويتفوق على الأساليب الحالية القائمة على التشابه عبر مجموعات بيانات متنوعة.

Guangzhi Xiong, Sanchit Sinha, Zhenghao He, Aidong Zhang2026-03-18
💻 computer science

When the City Teaches the Car: Label-Free 3D Perception from Infrastructure

تقترح هذه الورقة نموذج إدراك ثلاثي الأبعاد خالٍ من الملصقات، حيث تعمل وحدات البنية التحتية على جانب الطريق كمعلمين غير خاضعين للإشراف لتوليد ملصقات وهمية لتدريب مركبات القيادة الذاتية، مما يثبت أن مستشعرات المدينة يمكن أن تقلل بشكل كبير من تكاليف التوسيم مع تحقيق أداء كشف تنافسي دون الحاجة إلى بنية تحتية وقت الاختبار.

Zhen Xu, Jinsu Yoo, Cristian Bautista, Zanming Huang, Tai-Yu Pan, Zhenzhen Liu, Katie Z Luo, Mark Campbell, Bharath Hari (…)2026-03-18
💻 computer science

SuCor: Susceptibility Distortion Correction via Parameter-Free and Self-Regularized Optimal Transport

تُعد SuCor طريقة نقل أمثل ذاتية التنظيم وخالية من المعلمات، تعمل على تصحيح التشوهات الهندسية الناجمة عن التأثر في صور EPI من خلال نمذجة حقول التشوه كإزاحات مركزية من نوع Wasserstein-2، محققةً بذلك محاذاة فائقة مع المراجع الهيكلية وأوقات معالجة أسرع مقار بـ FSL TOPUP.

Sreekar Chigurupati, Eleftherios Garyfallidis2026-03-18
💻 computer science

GDPO-SR: Group Direct Preference Optimization for One-Step Generative Image Super-Resolution

تقترح هذه الورقة البحثية إطار عمل GDPO-SR، وهو إطار عمل مبتكر يدمج بين تحسين التفضيل المباشر للمجموعات (Group Direct Preference Optimization) ونموذج انتشار أحادي الخطوة مدرك للضجيج ودالة مكافأة مدركة للسمات، وذلك لتعزيز أداء عملية التراكب الفائق للصور التوليدية أحادية الخطوة من خلال معالجة أوجه القصور في العشوائية، وتنوع العينات، والحفاظ على التفاصيل المحلية.

Qiaosi Yi, Shuai Li, Rongyuan Wu, Lingchen Sun, Zhengqiang Zhang, Lei Zhang2026-03-18
🤖 machine learning

Adaptive Moments are Surprisingly Effective for Plug-and-Play Diffusion Sampling

تقترح الورقة البحثية طريقة بسيطة وفعالة باستخدام تقدير العزم التكيفي لتثبيت درجات الاحتمالية الصاخبة في أخذ عينات الانتشار الموجه، محققةً نتائج رائدة في استعادة الصور والتوليد المشروط بالفئة مع التفوق على النهج الأكثر تعقيداً.

Christian Belardi, Justin Lovelace, Kilian Q. Weinberger, Carla P. Gomes2026-03-18
🔬 materials science

What DINO saw: ALiBi positional encoding reduces positional bias in Vision Transformers

تُثبت هذه الورقة أن الضبط الدقيق لنماذج "Vision Transformers" باستخدام ترميز المواقع "ALiBi" يقلل بفعالية من الانحيازات الموضعية المتأصلة مع الحفاظ على التمثيلات الدلالية العامة، مما يُمكّن من التكيف والتقسيم الناجحين في وضع الصفر (zero-shot) ضمن المجالات المستقلة عن الاتجاه مثل مجهر علم المواد.

Moritz Pawlowsky, Antonis Vamvakeros, Alexander Weiss, Anja Bielefeld, Samuel J. Cooper, Ronan Docherty2026-03-18