💻 computer science

Vision-Language Foundation Models for Comprehensive Automated Pavement Condition Assessment

تقدم هذه الورقة البحثية PaveInstruct، وهي مجموعة بيانات واسعة النطاق تضم ما يقرب من 280,000 زوج من الصور والتعليمات، وPaveGPT، وهو نموذج تأسيسي لغوي بصري تم تدريبه عليها، والذي يتفوق بشكل كبير على النماذج الحالية في تقييم حالة الرصف من خلال تمكين فحص شامل للبنية التحتية، متوافق مع معايير ASTM، وقابل للحوار.

Blessing Agyei Kyem, Joshua Kofi Asamoah, Anthony Dontoh, Armstrong Aboah2026-04-10
💻 computer science

EditCaption: Human-Aligned Instruction Synthesis for Image Editing via Supervised Fine-Tuning and Direct Preference Optimization

تقترح الورقة البحثية EditCaption، وهو مسار معالجة ما بعد التدريب يتكون من مرحلتين يجمع بين الضبط الدقيق الخاضع للإشراف وتحسين التفضيل المباشر لمعالجة أوضاع الفشل المنهجي في نماذج الرؤية واللغة، مما يؤدي إلى توليد ثلاثيات تعليمات عالية الجودة ومتوافقة مع التفضيلات البشرية تعمل على تحسين أداء تحرير الصور بشكل كبير مقارنة بالنماذج المرجعية المتطورة.

Xiangyuan Wang, Honghao Cai, Yunhao Bai, Tianze Zhou, Haohua Chen, Yao Hu, Xu Tang, Yibo Chen, Wei Zhu2026-04-10
💻 computer science

Generalization Under Scrutiny: Cross-Domain Detection Progresses, Pitfalls, and Persistent Challenges

تقدم هذه الدراسة المسحية تحليلاً شاملاً ومنهجياً للكشف عن الكائنات عبر المجالات من خلال تقديم إطار عمل موحد يصنف الأساليب الحالية، ويفحص التعقيدات الفريدة لانزياح المجال في مسارات الكشف، ويراجع المعايير المرجعية، ويحدد الاتجاهات البحثية المستقبلية لتوجيه تطوير أنظمة أكثر قوة.

Saniya M. Deshmukh, Kailash A. Hambarde, Hugo Proença2026-04-10
⚡ electrical engineering

Preventing Overfitting in Deep Image Prior for Hyperspectral Image Denoising

تقترح هذه الورقة طريقة للتخفيف من حدة الإفراط في التخصيص في إزالة الضجيج من الصور فائقة الطيف القائمة على الأولوية الصورية العميقة، وذلك عبر الجمع المشترك بين حد مطابقة البيانات من نوع 1\ell_1 السلس مع التنظيم القائم على التباعد وتحسين المدخلات، مما يحقق أداءً فائقاً على الصور الحقيقية المشوبة بالضجيج مقارنة بالأساليب المتطورة الحالية.

Panagiotis Gkotsis, Athanasios A. Rontogiannis2026-04-10
💬 NLP

Can Vision Language Models Judge Action Quality? An Empirical Evaluation

تقدم هذه الورقة تقييماً تجريبياً شاملاً يكشف أن نماذج الرؤية واللغة المتطورة حالياً لا تؤدي إلا بمستوى أعلى قليلاً من الصدفة العشوائية في تقييم جودة الحركة بسبب التحيزات المنهجية والقيود الجوهرية في تحليل الحركة الدقيقة، مما يشير إلى أن هناك حاجة إلى تقدم كبير قبل النشر الموثوق في العالم الحقيقي.

Miguel Monte e Freitas, Rui Henriques, Ricardo Rei, Pedro Henrique Martins2026-04-10
💻 computer science

InstAP: Instance-Aware Vision-Language Pre-Train for Spatial-Temporal Understanding

تقدم هذه الورقة البحثية إطار InstAP، وهو إطار للتدريب المسبق للرؤية واللغة القائم على الوعي بالنماذج (instance-aware)، والمدعوم بمجموعة بيانات InstVL واسعة النطاق، والذي يعزز بشكل كبير كلاً من الاستدلال على مستوى النموذج والفهم المكاني الزماني الشامل من خلال التحسين المشترك لمحاذاة المشهد الكلية مع أهداف التباين الدقيقة والموضحة على مستوى النموذج.

Ashutosh Kumar, Rajat Saini, Jingjing Pan, Mustafa Erdogan, Mingfang Zhang, Betty Le Dem, Norimasa Kobori, Quan Kong2026-04-10
💻 computer science

PokeGym: A Visually-Driven Long-Horizon Benchmark for Vision-Language Models

تقدم هذه الورقة PokeGym، وهو معيار مرئي وقابل للتوسع طويل الأمد ضمن لعبة العالم المفتوح ثلاثية الأبعاد Pokémon Legends: Z-A، يقيم نماذج الرؤية واللغة في مهام تجسيدية معقدة ويكشف أن التعافي من الجمود الفيزيائي، وليس التخطيط رفيع المستوى، هو العائق الأساسي، مع ملاحظة أوضاع فشل متميزة عبر قدرات النماذج المختلفة.

Ruizhi Zhang, Ye Huang, Yuangang Pan, Chuanfu Shen, Zhilin Liu, Ting Xie, Wen Li, Lixin Duan2026-04-10
💻 computer science

Scaling-Aware Data Selection for End-to-End Autonomous Driving Systems

تقترح هذه الورقة إطار عمل MOSAIC، وهو إطار لاختيار البيانات يراعي التوسع ويعمل على تحسين مزيج بيانات التدريب من خلال تقسيم مجموعات البيانات إلى مجالات وملاءمة قوانين التوسع العصبية مع مقاييس التقييم، مما يثبت تحقيقه أداءً فائقاً في القيادة الذاتية من طرف إلى طرف باستخدام بيانات أقل بنسبة تصل إلى 80% مقارنة بالنماذج المرجعية الحالية.

Tolga Dimlioglu, Nadine Chang, Maying Shen, Rafid Mahmood, Jose M. Alvarez2026-04-10
💬 NLP

SOLAR: Communication-Efficient Model Adaptation via Subspace-Oriented Latent Adapter Reparametrization

تقدم الورقة البحثية SOLAR، وهو إطار عمل لضغط ما بعد التدريب غير مرتبط بنموذج محدد يستفيد من المتجهات الفردية للنموذج التأسيسي لإعادة تمثيل محولات الضبط الدقيق الفعالة للمعلمات (PEFT) في تمثيلات مدمجة وفعالة من حيث الاتصال، مما يقلل بشكل كبير من تكاليف التخزين والنقل مع الحفاظ على أداء المهام عبر المهام اللغوية والبصرية.

Seyed Mahmoud Sajjadi Mohammadabadi, Xiaolong Ma, Lei Yang, Feng Yan, Junshan Zhang2026-04-10
💻 computer science

Phantasia: Context-Adaptive Backdoors in Vision Language Models

تكشف هذه الورقة عن التقدير المبالغ فيه للتخفي في هجمات الأبواب الخلفية الحالية لنماذج الرؤية واللغة، من خلال إثبات سهولة اكتشافها، وتقدم "فانتاسيا" (Phantasia)، وهو هجوم جديد متكيف مع السياق يعمل على مواءمة المخرجات الخبيثة ديناميكيًا مع دلالات المدخلات لتحقيق معدلات نجاح عالية مع التهرب من الدفاعات.

Nam Duong Tran, Phi Le Nguyen2026-04-10