🤖 machine learning

Geometry-aware 4D Video Generation for Robot Manipulation

تقدم هذه الورقة نموذجاً لتوليد الفيديو رباعي الأبعاد مدركاً للهندسة، يفرض اتساقاً ثلاثي الأبعاد متعدد الرؤى من خلال محاذاة خرائط النقاط عبر الرؤى لإنتاج تسلسلات فيديو مستقبلية متماسكة زمنياً ومتوافقة مكانياً من وجهات نظر جديدة، مما يمكّن سياسات التحكم الروبوتية القوية التي تعمم عبر وجهات نظر كاميرا مختلفة.

Zeyi Liu, Shuang Li, Eric Cousineau, Siyuan Feng, Benjamin Burchfiel, Shuran Song2026-05-19
🤖 machine learning

WaveletInception Networks for on-board Vibration-Based Infrastructure Health Monitoring

تقترح هذه الورقة إطار عمل للتعلم العميق باسم WaveletInception-BiGRU يدمج تحويلات حزم الويفلت القابلة للتعلم، ووحدات Inception-ResNet أحادية الأبعاد متعددة المقاييس، والوحدات ذات التكرار ثنائي الاتجاه (BiGRUs) لتمكين مراقبة دقيقة وآلية وموضعية لصحة البنية التحتية على متن المركبات من خلال إشارات الاهتزاز الخام دون الحاجة إلى معالجة مسبقة صريحة.

Reza Riahi Samani, Alfredo Nunez, Bart De Schutter2026-05-19
💻 computer science

Shallow Deep Learning Can Still Excel in Fine-Grained Few-Shot Learning

تتحدى هذه الورقة الاعتماد السائد على الهياكل الظهرية العميقة في التعلم دقيق التفاصيل من عينات قليلة عبر تقديم LCN-4، وهو بنية ضحلة معززة بتجميع الميزات المدرك للموقع وتقنيات جديدة لتمثيل الموضع والتردد، تحقق أداءً يضاهي أو يتجاوز النماذج العميقة المتطورة.

Chaofei Qi, Chao Ye, Zhitai Liu, Weiyang Lin, Jianbin Qiu2026-05-19
💻 computer science

From Pixels to Places: A Systematic Benchmark for Evaluating Image Geolocalization Ability in Large Language Models

تقدم هذه الورقة IMAGEO-Bench، وهو معيار منهجي يقيم قدرات النماذج اللغوية الكبيرة في تحديد الموقع الجغرافي للصور عبر مجموعات بيانات متنوعة، كاشفاً عن تفاوتات كبيرة في الأداء بين النماذج مفتوحة المصدر والمغلقة، ومسلطاً الضوء على تحيزات جغرافية مكانية حرجة تنحاز للمناطق ذات الموارد العالية.

Lingyao Li, Runlong Yu, Qikai Hu, Bowei Li, Min Deng, Yang Zhou, Xiaowei Jia2026-05-19
🤖 machine learning

DASH: A Meta-Attack Framework for Synthesizing Effective and Stealthy Adversarial Examples

تقدم الورقة البحثية DAASH، وهو إطار عمل للهجوم الميتا (meta-attack) قابل للتفاضل بالكامل، يقوم بتركيب عدة هجمات أساسية مقيدة بـ Lp بشكل استراتيجي من خلال عملية تكيفية متعددة المراحل موجهة بخسارة ميتا (meta-loss) مبتكرة لتوليد أمثلة عدائية تحقق معدلات نجاح أعلى بكثير وجودة إدراكية متفوقة مقارنة بالطرق الرائدة مع التعميم بشكل جيد على الدفاعات غير المرئية.

Abdullah Al Nomaan Nafi, Habibur Rahaman, Zafaryab Haider, Tanzim Mahfuz, Fnu Suya, Swarup Bhunia, Prabuddha Chakraborty2026-05-19
🤖 machine learning

The Loupe: A Plug-and-Play Attention Module for Amplifying Discriminative Features in Vision Transformers

تُعد Loupe وحدة بوابية مكانية خفيفة الوزن وسهلة التوصيل والتشغيل لنماذج المحولات الرؤيوية (Vision Transformers)، حيث تعزز بشكل كبير التصنيف البصري دقيق التفاصيل عبر التنبؤ بأقنعة مكانية متفرقة لتضخيم الميزات التمييزية، محققةً نتائج رائدة عالمياً في مجموعة بيانات CUB-200-2011 مع حد أدنى من الزيادة في عدد المعلمات.

Naren Sengodan2026-05-19
🤖 machine learning

Ordinal Adaptive Correction: A Data-Centric Approach to Ordinal Image Classification with Noisy Labels

تقترح هذه الورقة البحثية "التصحيح التكيفي الرتبي" (ORDAC)، وهو إطار عمل جديد متمحور حول البيانات يستفيد من تعلم توزيع الملصقات لضبط وتصحيح الملصقات الرتبية المشوشة ديناميكيًا أثناء التدريب، مما يحسن بشكل كبير من متانة النموذج ودقته في مجموعات بيانات مثل Adience وDiabetic Retinopathy تحت ظروف ضجيج مختلفة.

Alireza Sedighi Moghaddam, Mohammad Reza Mohammadi2026-05-19
🤖 machine learning

MaskAttn-SDXL: Controllable Region-Level Text-To-Image Generation

تُعد MaskAttn-SDXL وحدة إضافية لنموذج SDXL تعمل على تعزيز توليد الصور من النصوص على مستوى المناطق القابلة للتحكم عبر حقن بوابات مكانية مشروطة بالرموز (token-conditioned spatial gating) في لوغاريتمات الانتباه المتقاطع (cross-attention logits) لتثبيط ارتباطات السمات غير ذات الصلة وتحسين موثوقية التركيب دون تغيير بنية النموذج الأساسي أو الحاجة إلى إشراف إضافي.

Yu Chang, Jiahao Chen, Anzhe Cheng, Paul Bogdan2026-05-19
🤖 machine learning

CoUn: Empowering Machine Unlearning via Contrastive Learning

تقدم الورقة البحثية CoUn، وهو إطار عمل جديد لـ "إلغاء التعلم" (machine unlearning) يستفيد من التعلم التبايني والتعلم الخاضع للإشراف على البيانات المتبقية لإزالة تأثير عينات النسيان بفعالية من خلال تعديل تمثيلاتها الدلالية، مما يجعله يتفوق على الأساليب الحالية الرائدة.

Yasser H. Khalil, Mehdi Setayesh, Hongliang Li2026-05-19