🤖 AI

From Clouds to Hallucinations: Atmospheric Retrieval Hijacking in Remote Sensing Vision-Language RAG

تقدم هذه الورقة CloudWeb، وهو أول هجوم اختطاف لاسترجاع البيانات الجوية يقوم بتعديل صور الاستشعار عن بعد ببراعة عبر أنماط سحب وضباب محسنة لإجبار أنظمة التوليد المعزز بالاسترجاع (RAG) متعددة الوسائط على استرجاع أدلة غير ذات صلة متعلقة بالطقس، مما يتسبب في حدوث هلوسات وانزياحات دلالية في الاستجابات المولدة.

Jiaju Han, Chao Li, Chengyin Hu, Qike Zhang, Xuemeng Sun, Xin Wang, Fengyu Zhang, Xiang Chen, Yiwei Wei, Jiahuan Long, J (…)2026-05-11
🤖 AI

Sword: Style-Robust World Models as Simulators via Dynamic Latent Bootstrapping for VLA Policy Post-Training

تقترح الورقة البحثية إطار عمل Sword، وهو نموذج عالم (World Model) قوي يوظف تعزيز الأسلوب الموجه بالبنية (Structure-Guided Style Augmentation) والتمهيد الكامن الديناميكي (Dynamic Latent Bootstrapping) للتخفيف من إخفاقات التعميم وتراكم الأخطاء في عمليات التشغيل المغلقة الحلقة (closed-loop rollouts)، مما يعزز بشكل كبير من دقة ونجاح تدريب ما بعد التعلم المعزز لسياسات الرؤية واللغة والعمل (Vision-Language-Action policies) على معيار LIBERO.

Jiaxuan Gao, Yongjian Guo, Zhong Guan, Wen Huang, Wanlun Ma, Xi Xiao, Junwu Xiong, Sheng Wen2026-05-11
🤖 AI

RELO: Reinforcement Learning to Localize for Visual Object Tracking

تقدم الورقة البحثية RELO، وهو أسلوب لتتبع الأجسام بصرياً يستبدل الأولويات المكانية المصممة يدوياً بسياسة تحديد مواقع قائمة على التعلم التعزيزي ومُحسّنة وفق مقاييس مباشرة مثل IoU وAUC، مع دمج انتشار الرموز الزمني المتوافق مع الطبقات لتحقيق أداء رائد في هذا المجال.

Xin Chen, Chuanyu Sun, Jiao Xu, Houwen Peng, Dong Wang, Huchuan Lu, Kede Ma2026-05-11
🤖 AI

Exposing and Mitigating Temporal Attack in Deepfake Video Detection

تقدم الورقة البحثية SpInShield، وهو إطار دفاعي يخفف من نقاط الضعف تجاه الهجمات الزمنية في كواشف التزييف العميق من خلال فصل الحركة الدلالية عن الآثار الطيفية عبر خصم طيفي قابل للتعلم وتحسين كبح المسارات المختصرة، مما يحسن بشكل كبير من المتانة ضد التشوهات الطيفية.

Zheyuan Gu, Minghao Shao, Zhen Wang, Yusong Wang, Mingkun Xu, Shijie Zhang, Hao Jiang2026-05-11
🤖 machine learning

SR2^2-LoRA: Self-Rectifying Inter-layer Relations in Low-Rank Adaptation for Class-Incremental Learning

تقترح الورقة البحثية SR2^2-LoRA، وهي طريقة جديدة لضبط المعلمات بكفاءة عالية للتعلم التزايدي للفئات، والتي تخفف من النسيان الكارثي من خلال الإثبات نظرياً وتقييد انحراف العلاقات بين الطبقات عملياً عبر محاذاة القيم المفردة.

Fengqiang Wan, Yipeng Lin, Kan Lv, Yang Yang2026-05-11
💬 NLP

InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search

تقدم هذه الورقة البحثية InterLV-Search، وهو معيار شامل وإطار تقييم للبحث الوكيل متعدد الوسائط المتداخل الذي يسلط الضوء على أوجه القصور الحالية الكبيرة في قدرة الأنظمة على دمج الأدلة النصية والبصرية ديناميكيًا عبر سيناريوهات البحث النشط، والبحث الموجه غير المتصل بالإنترنت، والبحث في الويب المفتوح.

Bohan Hou, Jiuning Gu, Jiayan Guo, Ronghao Dang, Sicong Leng, Xin Li, Xuemeng Song, Jianfei Yang2026-05-11
🤖 AI

Implicit Preference Alignment for Human Image Animation

تقترح هذه الورقة البحثية "محاذاة التفضيل الضمني" (IPA)، وهو إطار عمل فعال من حيث كفاءة البيانات لمرحلة ما بعد التدريب، يعمل على تعزيز توليد حركة اليد عالية الدقة في تحريك صور البشر من خلال محاذاة النماذج مع عينات عالية الجودة ذاتية التوليد دون الحاجة إلى بيانات تفضيل مقترنة باهظة التكلفة.

Yuanzhi Wang, Xuhua Ren, Jiaxiang Cheng, Bing Ma, Kai Yu, Tianxiang Zheng, Qinglin Lu, Zhen Cui2026-05-11
🤖 machine learning

Probabilistic Object Detection with Conformal Prediction

تتناول هذه الورقة تحديات تطبيق التنبؤ المطابق (Conformal Prediction) على كشف الكائنات متعدد المخرجات من خلال تقديم نهج مُقاس ومعالج لكل إحداثي مع معايرة لكل فئة وعملية مكونة من خطوتين، مما يحسن بشكل كبير من حدة فترات التنبؤ وتقاطع الاتحاد (IoU) عبر مجموعات بيانات القيادة الذاتية مع الحفاظ على ضمانات تغطية صارمة.

Christopher Ries, Moussa Kassem Sbeyti, Nicolas Bianco, Nadja Klein2026-05-11
💬 NLP

Tracing the Arrow of Time: Diagnosing Temporal Information Flow in Video-LLMs

تشخص هذه الورقة ضعف قدرات الاستدلال الزمني في النماذج اللغوية الكبيرة للفيديو (Video-LLMs) من خلال تحديد الاختناقات في كل من تصميمات المشفرات البصرية وجهاز الإسقاط (projector)، مما أدى إلى بنية جديدة تحقق أداءً يقارب المثالية في مهمة "سهم الزمن" (Arrow-of-Time) وتحسن بشكل كبير معايير الاستدلال الزمني الأوسع.

Peitao Han, Fei Cheng, Lis K. Pereira, Qianying Liu, Shigeru Kitazawa2026-05-11
🤖 AI

Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding

يُعد Response-G1 إطار عمل مبتكرًا لا يتطلب ضبطًا دقيقًا، حيث يعزز الفهم الاستباقي للفيديو المتدفق من خلال نمذجة المحاذاة بين أدلة الفيديو المتراكمة وشروط الاستعلام صراحةً عبر الرسوم البيانية للمشاهد، مما يتيح اتخاذ قرارات أكثر دقة وقابلية للتفسير بشأن توقيت الاستجابة.

Ke Ma, Jiaqi Tang, Bin Guo, Xueting Han, Ruonan Xu, Qingfeng He, Ziheng Wang, Xu Wang, Qifeng Chen, Zhiwen Yu, Yunhao Li (…)2026-05-11