🤖 machine learning

eXplaining to Learn (eX2L): Regularization Using Contrastive Visual Explanation Pairs for Distribution Shifts

تقترح الورقة البحثية eX2L، وهو إطار عمل قابل للتفسير يخفف من حدة انزياحات التوزيع عن طريق معاقبة التشابه بين خرائط Grad-CAM لمصنف التسمية ومصنف المربك لفك الارتباط بين الميزات المربكة، مما يحقق أداءً هو الأفضل في فئته على معيار تحدي Spurious Many-to-Many Hard.

Paulo Mario P. Medina, Jose Marie Antonio Miñoza, Sebastian C. Ibañez2026-05-08
🤖 AI

Continuous-Time Distribution Matching for Few-Step Diffusion Distillation

تقدم هذه الورقة البحثية "مطابقة التوزيع في الزمن المستمر" (CDM)، وهو إطار عمل تقطير مبتكر يعزز نماذج الانتشار ذات الخطوات القليلة عبر استبدال الإشراف المنفصل المتناثر بتحسين ديناميكي مستمر في الزمن ومحاذاة خارج المسار، مما يحقق دقة بصرية عالية دون الاعتماد على وحدات مساعدة معقدة.

Tao Liu, Hao Yan, Mengting Chen, Taihang Hu, Zhengrong Yue, Zihao Pan, Jinsong Lan, Xiaoyong Zhu, Ming-Ming Cheng, Bo Zh (…)2026-05-08
🤖 machine learning

Empirical Evidence for Simply Connected Decision Regions in Image Classifiers

تقدم هذه الورقة أدلة تجريبية على أن مناطق القرار في مصنفات الصور العميقة هي مناطق متصلة ببساطة، وليست مجرد متصلة مساريًا، وذلك من خلال اقتراح والتحقق من صحة إجراء ملء الشبكة الرباعية التكراري الذي يبني أسطحًا حافظة للتسميات ومحدودة بحلقات مغلقة.

Arjhun Swaminathan, Mete Akgün2026-05-08
🤖 machine learning

FREPix: Frequency-Heterogeneous Flow Matching for Pixel-Space Image Generation

يقدم FrePix إطار عمل لمطابقة التدفق غير متجانس التردد لتوليد الصور في فضاء البكسل، والذي يقوم صراحةً بتفكيك وتدريب مكونات التردد المنخفض والتردد العالي بشكل منفصل، محققاً درجات FID تنافسية على مجموعة بيانات ImageNet مع تمكين التوليد الفعال من الخشن إلى الناعم.

Mingfeng Lin, Jiakun Chen, Liang Han, Liqiang Nie2026-05-08
🤖 machine learning

Hyperbolic Concept Bottleneck Models

تقدم الورقة البحثية نماذج عنق الزجاجة للمفاهيم الزائدية (HypCBM)، وهو إطار عمل لاحق (post-hoc) يستفيد من الهندسة الزائدية لنمذجة تسلسلات المفاهيم الهرمية من خلال الاحتواء غير المتماثل، محققاً بذلك قدرة فائقة على التفسير، والاتساق الهرمي، والمتانة مقارنة بالنماذج الإقليدية دون الحاجة إلى إشراف إضافي أو عقوبات مسبقة للتدريب.

Daniel Uyterlinde, Swasti Shreya Mishra, Pascal Mettes2026-05-08
💻 computer science

GeoStack: A Framework for Quasi-Abelian Knowledge Composition in VLMs

يُعد GeoStack إطار عمل معياري يتيح تكوين معرفة فعالة وخالية من النسيان الكارثي في نماذج الرؤية واللغة عبر فرض قيود هندسية على المهايئات والاستفادة من خاصية طي الأوزان لتحقيق استدلال بزمن ثابت بغض النظر عن عدد الخبراء المتكاملين.

Pranav Mantini, Shishir K. Shah2026-05-08
🤖 machine learning

SoftSAE: Dynamic Top-K Selection for Adaptive Sparse Autoencoders

تقدم هذه الورقة البحثية SoftSAE، وهو مشفر تلقائي متباعد (sparse autoencoder) يستخدم عامل Soft Top-K قابل للتفاضل لضبط عدد الميزات النشطة ديناميكيًا بناءً على تعقيد المدخلات، مما يتغلب على قيود مستويات التباعد الثابتة في نماذج Top-K SAE التقليدية من أجل تفسير آلي أكثر دقة وتكيفًا.

Jakub Stępień, Marcin Mazur, Jacek Tabor, Przemysław Spurek2026-05-08
🤖 machine learning

Are We Making Progress in Multimodal Domain Generalization? A Comprehensive Benchmark Study

تقدم هذه الورقة البحثية MMDG-Bench، وهو معيار تقييم شامل يعمل على توحيد التقييم عبر مهام وإعدادات متنوعة ليكشف أن طرق التعميم النطاقي متعدد الوسائط الحالية لا تقدم سوى تحسينات طفيفة مقارنة بالنماذج المرجعية، وتفتقر إلى التفوق المستمر، وتواجه صعوبات كبيرة مع التحديات الواقعية مثل فساد المدخلات وفقدان الوسائط.

Hao Dong, Hongzhao Li, Shupan Li, Muhammad Haris Khan, Eleni Chatzi, Olga Fink2026-05-08
💻 computer science

RoDyGS: Robust Dynamic Gaussian Splatting for Casual Videos

تقدم هذه الورقة البحثية RoDyGS، وهي طريقة تعيد بناء المشاهد ثلاثية الأبعاد الديناميكية من فيديوهات أحادية العدسة غير رسمية عبر فصل العناصر الساكنة والديناميكية صراحةً باستخدام التنظيم الزمكاني، كما تقترح معياراً شاملاً جديداً، Kubric-MRig، لتقييم مناهج تخليق الرؤية الجديدة الديناميكية الخالية من تحديد الوضعية هذه.

Junmyeong Lee, Hoseung Choi, Yoonwoo Jeong, Minsu Cho2026-05-07
💻 computer science

UniMoCo: Unified Modality Completion for Robust Multi-Modal Embeddings

يقدم UniMoCo بنية مبتكرة مع وحدة إكمال للنماذج واستراتيجية تدريب متخصصة لتوليد سمات بصرية من النصوص، مما يضمن تمثيلات متعددة الوسائط قوية ومتسقة عبر مجموعات متنوعة ونادرة من الوسائط المتعددة، مع التخفيف من تدهور الأداء الناتج عن عدم توازن بيانات التدريب في النماذج الحالية للرؤية واللغة.

Jiajun Qin, Yuan Pu, Zhuolun He, Seunggeun Kim, David Z. Pan, Bei Yu2026-05-07