🤖 machine learning

OASIC: Occlusion-Agnostic and Severity-Informed Classification

إن OASIC هو إطار عمل للرؤية الحاسوبية يعمل على تحسين التصنيف في ظل حالات الحجب الشديد من خلال إزالة أنماط العوائق المشتتة في وقت الاختبار ديناميكيًا واختيار نماذج محسنة حسب شدة الحجب بناءً على مستويات الحجب المقدرة، مما يحقق مكاسب كبيرة في الأداء مقارنة بالنهج القياسية.

Kay Gijzen (Leiden University), Gertjan J. Burghouts (TNO), Daniël M. Pelt (Leiden University)2026-04-07
💻 computer science

DINO-VO: Learning Where to Focus for Enhanced State Estimation

يُعد DINO-VO نظاماً للتقدير البصري للمسار أحادي العدسة من طرف إلى طرف، يعمل على تعزيز تقدير الحالة والتعميم عبر بيئات متنوعة من خلال دمج مُنتقي رقع متكيف وقابل للتفاضل، واستخراج ميزات متعدد المهام، وضبط حزم يعتمد على أولوية العمق العكسي للتغلب على قيود استراتيجيات الميزات الاستدلالية.

Qi Chen, Guanghao Li, Sijia Hu, Xin Gao, Junpeng Ma, Xiangyang Xue, Jian Pu2026-04-07
💻 computer science

Rethinking Exposure Correction for Spatially Non-uniform Degradation

تقترح هذه الورقة نموذجاً جديداً لتصحيح التعرض للتدهورات غير المتجانسة مكانياً، والذي يستخدم مشفراً للإشارة المكانية مع أوزان تعديل تكيفية وفقداناً غير منتظم مستوحى من عدم اليقين للتغلب على قيود الطرق الحالية القائمة على الافتراضات العالمية.

Ao Li, Jiawei Sun, Le Dong, Zhenyu Wang, Weisheng Dong2026-04-07
💻 computer science

OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models

يُعد OP-GRPO أول إطار عمل للتعلم التعزيزي خارج السياسة (off-policy) لنماذج مطابقة التدفق (flow-matching)، والذي يعزز كفاءة التدريب من خلال استخدام مخزن استرجاع (replay buffer) مع اختيار مسارات عالية الجودة، وأخذ عينات الأهمية على مستوى التسلسل، وبتر الخطوات المتأخرة لتحقيق أداء فائق بعدد خطوات تدريب أقل بكثير من GRPO القائم على السياسة (on-policy).

Liyu Zhang, Kehan Li, Tingrui Han, Tao Zhao, Yuxuan Sheng, Shibo He, Chao Li2026-04-07
💻 computer science

Scale-Aware Vision-Language Adaptation for Extreme Far-Distance Video Person Re-identification

تقترح هذه الورقة تكييفاً مدركاً للمقياس لنماذج الرؤية واللغة واسعة النطاق، يتميز بهيكل ViT-L/14 مطور مع ضبط دقيق انتقائي، وتجميع انتباه زمني، وتعلم عبر الرؤى، لتحسين المتانة والأداء بشكل كبير في عملية إعادة تحديد هوية الأشخاص في الفيديو من مسافات بعيدة للغاية تحت ظروف صعبة مثل الدقة المنخفضة وعدم تطابق وجهات النظر بين الجوية والأرضية.

Ashwat Rajbhandari, Bharatesh Chakravarthi2026-04-07
🤖 machine learning

Graphic-Design-Bench: A Comprehensive Benchmark for Evaluating AI on Graphic Design Tasks

تقدم هذه الورقة البحثية GraphicDesignBench (GDB)، وهي أول مجموعة اختبار شاملة لتقييم نماذج الذكاء الاصطناعي في مهام التصميم الجرافيكي الاحترافية عبر خمسة محاور — التخطيط، والطباعة، والرسوم البيانية (الإنفوجرافيك)، والقوالب، والتحريك — كاشفةً أنه بينما يمكن تحقيق الفهم الدلالي عالي المستوى، لا تزال النماذج الحالية تعاني بشكل كبير من نقص الدقة، والصلاحية الهيكلية، والاستدلال التكويني المطلوب لأعمال التصميم الواقعية.

Adrienne Deganutti, Elad Hirsch, Haonan Zhu, Jaejung Seol, Purvanshi Mehta2026-04-07
🤖 AI

Hierarchical Semantic Correlation-Aware Masked Autoencoder for Unsupervised Audio-Visual Representation Learning

تقترح هذه الورقة البحثية HSC-MAE، وهو إطار عمل ثنائي المسار يعتمد على نموذج المعلم والطالب، يستفيد من الارتباطات الدلالية الهرمية عبر المستويات العالمية والمحلية ومستويات العينات لتعلم تمثيلات سمعية-بصرية قوية ومتوافقة من بيانات ضعيفة الاقتران وخالية من التسميات، محققاً تحسينات كبيرة في الأداء على معايير AVE وVEGAS.

Donghuo Zeng, Hao Niu, Masato Taya2026-04-07
🤖 AI

HighFM: Towards a Foundation Model for Learning Representations from High-Frequency Earth Observation Data

تقدم هذه الورقة نموذج HighFM، وهو نموذج تأسيسي يستفيد من أكثر من 2 تيرابايت من صور أقمار SEVIRI الاصطناعية ذات الدقة الزمنية العالية وإطار عمل محسّن للترميز التلقائي المقنع لتحقيق أداء فائق في حجب السحب في الوقت الفعلي وكشف الحرائق النشطة مقارنة بالنماذج الجيومكانية الحالية.

Stella Girtsou, Konstantinos Alexis, Giorgos Giannopoulos, Harris Kontoes2026-04-07
🤖 AI

GA-GS: Generation-Assisted Gaussian Splatting for Static Scene Reconstruction

تُعد GA-GS طريقة مبتكرة لإعادة بناء المشاهد ثلاثية الأبعاد الساكنة من فيديوهات أحادية العدسة تحتوي على أجسام ديناميكية، حيث تستفيد من نموذج انتشار لملء المناطق المحجوبة، وتُقدم معاملاً قابلاً للتعلم للأصالة لموازنة الإشراف بين البيانات الحقيقية والمولدة، محققةً أداءً هو الأفضل في فئته على مجموعة بيانات Trajectory-Match التي تم إنشاؤها حديثاً.

Yedong Shen, Shiqi Zhang, Sha Zhang, Yifan Duan, Xinran Zhang, Wenhao Yu, Lu Zhang, Jiajun Deng, Yanyong Zhang2026-04-07
💻 computer science

Spatially-Weighted CLIP for Street-View Geo-localization

تقترح هذه الورقة إطار عمل "كليب الموزون مكانياً" (SW-CLIP)، وهو إطار مبتكر يعزز تحديد الموقع الجغرافي لصور الشوارع من خلال دمج قانون توبلر الأول للجغرافيا في التعلم التبايني عبر الإشراف الناعم المدرك للمسافة وتنظيم اتساق الجوار لتحسين التماسك والدقة المكانية.

Ting Han, Fengjiao Li, Chunsong Chen, Haoling Huang, Yiping Chen, Meiliu Wu2026-04-07