💻 computer science

SecureWebArena: A Holistic Security Evaluation Benchmark for LVLM-based Web Agents

تقدم هذه الورقة SecureWebArena، وهو أول معيار مرجعي شامل مصمم لتقييم أمن وكلاء الويب القائمين على نماذج اللغات الكبيرة المرئية (LVLMs) من خلال مجموعة متكاملة من البيئات الواقعية، وتصنيف مهيكل لنواقل الهجوم، وبروتوكول تقييم متعدد الطبقات يكشف عن الثغرات الأمنية الحرجة والمقايضات عبر فئات النماذج المتنوعة.

Zonghao Ying, Yangguang Shao, Jianle Gan, Gan Xu, Wenxin Zhang, Quanchen Zou, Junzheng Shi, Zhenfei Yin, Mingchuan Zhang (…)2026-04-15
💻 computer science

Exploring Cross-Modal Flows for Few-Shot Learning

تقدم هذه الورقة البحثية "محاذاة مطابقة التدفق" (FMA)، وهو إطار عمل جديد للتعلم بلقطات قليلة ومستقل عن النموذج، يستبدل الضبط الدقيق التقلّي الموفر للمعلمات ذي الخطوة الواحدة بحقل سرعة متعدد الخطوات وعابر للأنماط لتحقيق محاذاة ميزات أكثر دقة ومتانة على مجموعات البيانات الصعبة.

Ziqi Jiang, Yanghao Wang, Long Chen2026-04-15
💬 NLP

JanusCoder: Towards a Foundational Visual-Programmatic Interface for Code Intelligence

تقدم الورقة البحثية JanusCoder، وهو واجهة برمجية بصرية تأسيسية تم تدريبها على أكبر مجموعة بيانات برمجية متعددة الوسائط (JanusCode-800K) لتوليد الكود من النصوص أو المرئيات أو كليهما، محققةً أداءً يضاهي أو يتفوق على النماذج التجارية عبر مهام برمجية متنوعة.

Qiushi Sun, Jingyang Gong, Yang Liu, Qiaosheng Chen, Lei Li, Kai Chen, Qipeng Guo, Ben Kao, Fei Yuan2026-04-15
⚡ electrical engineering

Turbo-DDCM: Fast and Flexible Zero-Shot Diffusion-Based Image Compression

تقدم هذه الورقة البحثية Turbo-DDCM، وهي طريقة لضغط الصور بنمط (zero-shot) سريعة ومرنة تعمل على تسريع إطار عمل DDCM الحالي بشكل كبير من خلال الدمج الفعال لمتجهات ضوضاء متعددة لكل خطوة وتقديم متغيرات تكيفية لتحديد أولويات المناطق والتحكم في التشويه، كل ذلك مع الحفاظ على أداء يضاهي أحدث ما توصل إليه العلم.

Amit Vaisman, Guy Ohayon, Hila Manor, Michael Elad, Tomer Michaeli2026-04-15
💻 computer science

SciPostLayoutTree: A Dataset for Structural Analysis of Scientific Posters

تقدم هذه الورقة SciPostLayoutTree، وهي مجموعة بيانات تضم حوالي 8,000 ملصق علمي مشروح صُممت لمعالجة التحدي غير المستكشف في التحليل الهيكلي لتخطيطات الملصقات، إلى جانب نموذج Layout Tree Decoder مبتكر يستفيد من الميزات البصرية وميزات صناديق الإحاطة للتنبؤ بدقة بالعلاقات المكانية المعقدة مثل ترتيب القراءة والتسلسلات الهرمية بين الأب والابن.

Shohei Tanaka, Atsushi Hashimoto, Yoshitaka Ushiku2026-04-15
💻 computer science

MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models

تقدم الورقة البحثية MASS، وهو إطار عمل محايد للنماذج يعزز قدرات نماذج الرؤية واللغة في الاستدلال والفهم الفيزيائي عبر حقن إشارات مكانية-زمانية من خلال الترميز ثلاثي الأبعاد القائم على العمق وتتبع الحركة، مدعوماً بمعيار MASS-Bench الجديد والضبط الدقيق بالتعزيز لتحقيق أداء يضاهي النماذج مغلقة المصدر ذات الحالة الراهنة.

Xiyang Wu, Zongxia Li, Jihui Jin, Guangyao Shi, Gouthaman KV, Vishnu Raj, Nilotpal Sinha, Jingxi Chen, Fan Du, Dinesh Ma (…)2026-04-15
💬 NLP

CropVLM: Learning to Zoom for Fine-Grained Vision-Language Perception

تُعد CropVLM طريقة خارجية تعتمد على التعلم المعزز ولا تتطلب تدريباً، تعمل على تعزيز الإدراك الدقيق لنماذج الرؤية واللغة من خلال "التقريب" ديناميكياً على مناطق الصور ذات الصلة، مما يحسن الأداء بشكل كبير في المهام عالية الدقة دون الحاجة إلى صناديق إحاطة مصنفة بشرياً أو تعديل النموذج الأساسي.

Miguel Carvalho, Helder Dias, Bruno Martins2026-04-15
💻 computer science

ProPhy: Progressive Physical Alignment for Dynamic World Simulation

يُعد ProPhy إطار عمل تقدمي للمحاذاة الفيزيائية يعزز الاتساق الفيزيائي لمحاكاة العالم الديناميكي من خلال توظيف آلية "خليط من خبراء الفيزياء" المكونة من مرحلتين لاستخراج الأولويات الفيزيائية دقيقة التفاصيل ونقل قدرات الاستدلال البصري اللغوي لتوليد فيديوهات متباينة الخواص وواعية فيزيائياً.

Zijun Wang, Panwen Hu, Jing Wang, Terry Jingchen Zhang, Yuhao Cheng, Long Chen, Yiqiang Yan, Zutao Jiang, Hanhui Li, Xia (…)2026-04-15
💻 computer science

Optimization-Guided Diffusion for Interactive Scene Generation

تقدم الورقة البحثية إطار عمل OMEGA، وهو إطار عمل موجه بالتحسين وخالٍ من التدريب، يعمل على تعزيز توليد المشاهد التفاعلية القائمة على الانتشار من خلال فرض قيود فيزيائية واجتماعية لتحسين الواقعية، والقدرة على التحكم، وتكرار السيناريوهات العدائية ذات الأهمية المتعلقة بالسلامة لتقييم المركبات ذاتية القيادة بشكل كبير.

Shihao Li, Naisheng Ye, Tianyu Li, Kashyap Chitta, Tuo An, Peng Su, Boyang Wang, Haiou Liu, Chen Lv, Hongyang Li2026-04-15
⚡ electrical engineering

SynthPix: A lightspeed PIV image generator

يُعد SynthPix مولداً للصور الاصطناعية عالي الأداء يعتمد على تقنية JAX لتقنية قياس سرعة الصور بالجسيمات (PIV)، حيث يقوم ببث أزواج صور آنية مباشرة إلى مسارات التعلم لتمكين التوليد الفعال للبيانات، واختبار المتانة، والتصميم التجريبي ذي الحلقة المغلقة دون عبء التخزين الناتج عن سير العمل غير المتصل بالإنترنت.

Antonio Terpin, Alan Bonomi, Francesco Banelli, Raffaello D'Andrea2026-04-15