💻 computer science

Exploring Multimodal LMMs for Online Episodic Memory Question Answering on the Edge

تُثبت هذه الورقة البحثية جدوى نشر نظام للإجابة على الأسئلة المتعلقة بالذاكرة العرضية في الوقت الفعلي مع الحفاظ على الخصوصية على الأجهزة الطرفية، وذلك عبر استخدام خط معالجة لنماذج اللغات الكبيرة متعددة الوسائط (MLLM) ثنائي المسارات يحقق دقة تنافسية وزمن استجابة منخفض مقارنة بالحلول القائمة على السحابة.

Giuseppe Lando, Rosario Forte, Antonino Furnari2026-05-14
🤖 machine learning

SubspaceAD: Training-Free Few-Shot Anomaly Detection via Subspace Modeling

يُعد SubspaceAD طريقةً للكشف عن الشذوذ تعتمد على التعلم القليل دون الحاجة لتدريب، حيث تستفيد من ميزات DINOv2 المجمدة وتحليل المكونات الرئيسية (PCA) لنمذجة التباينات الطبيعية في فضاء فرعي منخفض الأبعاد، محققةً أداءً هو الأفضل في فئته على مجموعتي بيانات MVTec-AD وVisA دون الحاجة إلى بنوك ذاكرة، أو بيانات مساعدة، أو ضبط للنموذج.

Camile Lendering, Erkut Akdag, Egor Bondarev2026-05-14
🤖 AI

LINE: LLM-based Iterative Neuron Explanations for Vision Models

تقدم الورقة البحثية إطار عمل LINE، وهو إطار عمل "صندوق أسود" لا يتطلب تدريباً، يستفيد من النماذج اللغوية الكبيرة ومولدات النصوص إلى صور لاكتشاف وتكرير تسميات المفاهيم ذات المفردات المفتوحة لكل عصبون في نماذج الرؤية بشكل تكراري، محققاً أداءً هو الأفضل في فئته وكاشفاً عن مفاهيم جديدة أغفلتها المفردات المحددة مسبقاً.

Vladimir Zaigrajew, Michał Piechota, Gaspar Sekula, Paweł Gelar, Przemysław Biecek2026-05-14
💻 computer science

Does it Really Count? Assessing Semantic Grounding in Text-Guided Class-Agnostic Counting

تكشف هذه الورقة أن نماذج العدّ الحالية المعتمدة على النصوص والمستقلة عن الفئات، والتي تُعد من أحدث ما توصل إليه العلم، غالباً ما تفشل في ربط المطالبات النصية بالأجسام المرئية بشكل صحيح، مما يؤدي إلى نتائج زائفة، وتعالج ذلك من خلال تقديم إطار التقييم PrACo++ ومجموعة بيانات MUCCA لتقييم المحاذاة الدلالية ومتانة النماذج بشكل أفضل.

Giacomo Pacini, Luca Ciampi, Nicola Messina, Nicola Tonellotto, Giuseppe Amato, Fabrizio Falchi2026-05-14
💻 computer science

3DSS: 3D Surface Splatting for Inverse Rendering

تقدم الورقة البحثية تقنية التلطيخ السطحي ثلاثي الأبعاد (3DSS)، وهو مُصيّر تفاضلي يستفيد من نموذج تركيب قائم على التغطية وعينات سطحية موجهة لاستعادة الشكل، والمواد المتغيرة مكانياً، والإضاءة بشكل مشترك من أجل إعادة التصيير العكسي عالي الجودة مع الربط الأصيل بسير عمل القائم على الشبكات المضلعية.

Mae Younes, Adnane Boukhayma2026-05-14
💻 computer science

On-Policy Distillation with Best-of-N Teacher Rollout Selection

تقدم هذه الورقة البحثية إطار عمل BRTS، وهو "اختيار المعلم الأفضل من بين N من عمليات التدحرج" (Best-of-N Rollout Teacher Selection) لعملية التقطير داخل السياسة (on-policy distillation)، والذي يعمل على تحسين أداء الاستنتاج من خلال أخذ عينات من مسارات متعددة للمعلم واختيار المسار الأكثر صحة وتوافقاً مع الطالب لتوفير إشراف موثوق، وبذلك يتغلب على قيود التباين العالي للطرق القياسية.

Ke Zhang, Yunjie Tian, Dongdi Zhao, Yijiang Li, Yuanye Liu, Vishal M Patel, Di Fu2026-05-14
💻 computer science

SciVQR: A Multidisciplinary Multimodal Benchmark for Advanced Scientific Reasoning Evaluation

تقدم الورقة البحثية SciVQR، وهو معيار شامل متعدد الوسائط يمتد عبر 54 مجالاً فرعياً علمياً، والذي يقيم كلاً من الإجابات النهائية وعمليات الاستنتاج لدى النماذج اللغوية الكبيرة، مما يكشف عن قصور كبير في قدرتها على إجراء استدلال علمي معقد ومتعدد التخصصات.

Longteng Guo, Xuanxu Lin, Dongze Hao, Tongtian Yue, Pengkang Huo, Jiatong Ma, Yuchen Liu, Jing Liu2026-05-14
💬 NLP

Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models

تقترح الورقة البحثية وحدة الخيال الكامن (LIM)، وهي آلية انتباه تقاطعي خفيفة الوزن تتنبأ بالتضمينات الكامنة المتخيلة من النص لاستعادة دقة ومعايرة نماذج الرؤية واللغة عند نشرها دون مدخلاتها البصرية الأصلية.

Mingyeong Kim (Kim Jaechul Graduate School of AI, KAIST), Jungwon Choi (Kim Jaechul Graduate School of AI, KAIST), Chaey (…)2026-05-14
💻 computer science

MorphOPC: Advancing Mask Optimization with Multi-scale Hierarchical Morphological Learning

تقدم هذه الورقة MorphOPC، وهو نموذج تعلم عميق هرمي متعدد المقاييس يصيغ توليد الأقنعة كسلسلة من العمليات المورفولوجية العصبية للتغلب على قيود التحويل الهندسي التي تواجه نهج المشفر-فك التشفير الحالي، مما يحقق دقة طباعة فائقة وتكاليف تصنيع أقل في تصحيح القرب البصري.

Yuting Hu, Lei Zhuang, Chen Wang, Ruiyang Qin, Hua Xiang, Gi-joon Nam, Jinjun Xiong2026-05-14
💻 computer science

SSDA: Bridging Spectral and Structural Gaps via Dual Adaptation for Vision-Based Time Series Forecasting

تقدم هذه الورقة SSDA، وهو إطار عمل للتكيف ثنائي المسار يسد الفجوات الطيفية والهيكلية بين صور السلاسل الزمنية المُصورة والصور الطبيعية، مما يطلق العنان للإمكانات الكاملة لنماذج الرؤية الكبيرة من أجل التنبؤ الدقيق بالسلاسل الزمنية.

Mingrui Zhang, Hanchen Yang, Wengen Li, Xudong Jiang, Yichao Zhang, Jihong Guan, Shuigeng Zhou2026-05-14