🤖 machine learning

Integer-Only Operations on Extreme Learning Machine Test Time Classification

تقترح هذه الورقة وتتحقق من صحة مجموعة من التقنيات التي تمكن مصنفات آلة التعلم الأقصى من إجراء التصنيف في وقت الاختبار باستخدام العمليات الصحيحة فقط، مما يقلل بشكل كبير من التكاليف الحسابية واستهلاك الطاقة لتطبيقات الأنظمة المدمجة ومراكز البيانات دون المساس بالدقة.

Emerson Lopes Machadoa, Cristiano Jacques Miosso, Ricardo Pezzuol Jacobi2026-04-07
⚡ electrical engineering

NAIMA: Semantics Aware RGB Guided Depth Super-Resolution

تقترح الورقة البحثية NAIMA، وهي بنية لزيادة دقة العمق الموجهة والواعية بالدلالات، والتي تستفيد من وحدة انتباه التوكن الموجه لاستخلاص الأولويات الدلالية العالمية من تضمينات محولات الرؤية (DINOv2) سابقة التدريب، مما يقلل بفعالية من العيوب الناجمة عن صور RGB ويحسن دقة حدود العمق عبر مختلف مجموعات البيانات وعوامل القياس.

Tayyab Nasir, Daochang Liu, Ajmal Mian2026-04-07
💬 NLP

Responses Fall Short of Understanding: Revealing the Gap between Internal Representations and Responses in Visual Document Understanding

تكشف هذه الورقة عن فجوة كبيرة بين التمثيلات الداخلية والاستجابات المولدة لنماذج اللغات والرؤية الكبيرة في مهام فهم المستندات المرئية، مما يوضح أن المعلومات ذات الصلة بالمهمة غالبًا ما تكون أكثر سهولة في الوصول إليها في الطبقات المتوسطة، وأن الضبط الدقيق لهذه الطبقات يقلص هذه الفجوة بفعالية مع تحسين الأداء العام.

Haruka Kawasaki, Ryota Tanaka, Kyosuke Nishida2026-04-07
💻 computer science

BoxComm: Benchmarking Category-Aware Commentary Generation and Narration Rhythm in Boxing

تقدم هذه الورقة البحثية BoxComm، وهي أول مجموعة بيانات ومعيار واسع النطاق لتوليد التعليق الرياضي على الملاكمة يتميز بتصنيف مبتكر وتقييمات للمحتوى المدرك للفئة وإيقاع السرد، مما يكشف عن قصور النماذج متعددة الوسائط الحالية في التعامل مع الطبيعة السريعة والدقيقة والتكتيكية للرياضات القتالية.

Kaiwen Wang, Kaili Zheng, Rongrong Deng, Yiming Shi, Chenyi Guo, Ji Wu2026-04-07
💻 computer science

Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward

يُعد Saliency-R1 إطار عمل يعزز قابلية التفسير والأمانة في نماذج الرؤية واللغة من خلال توظيف تقنية خريطة بروز مبتكرة وتحسين السياسة النسبية للمجموعات (GRPO) لمواءمة عمليات الاستدلال مع المناطق البصرية الحرجة، مما يقلل الاعتماد على الإشارات النصية والاستجابات غير المستندة إلى أسس بصرية.

Shizhan Gong, Minda Hu, Qiyuan Zhang, Chen Ma, Qi Dou2026-04-07
🤖 AI

StableTTA: Training-Free Test-Time Adaptation that Improves Model Accuracy on ImageNet1K to 96%

تعد StableTTA طريقة للتكيف في وقت الاختبار بدون تدريب، وهي تعالج صراعات التجميع لتعزيز دقة النموذج بشكل كبير على ImageNet-1K، مما يمكّن البنى خفيفة الوزن من التفوق على نماذج Vision Transformers بتكاليف حوسبة أقل بكثير.

Zheng Li, Jerry Cheng, Huanying Helen Gu2026-04-07
🤖 AI

Temporal Inversion for Learning Interval Change in Chest X-Rays

تقدم هذه الورقة إطار عمل TILA، الذي يستفيد من الانعكاس الزمني كإشارة إشرافية لتعزيز قدرة نماذج الرؤية واللغة على اكتشاف ومحاذاة التغيرات في الفترات الاتجاهية في صور الأشعة السينية للصدر، مما يؤدي إلى تحسين أداء تصنيف التطور والاسترجاع.

Hanbin Ko, Kyeongmin Jeon, Doowoong Choi, Chang Min Park2026-04-07
💻 computer science

Visual Prompt Based Reasoning for Offroad Mapping using Multimodal LLMs

تقدم هذه الورقة إطار عمل موحداً يعتمد على التعلم الصفري (zero-shot) لرسم خرائط الطرق الوعرة، والذي يستفيد من نموذج SAM2 للتقطيع (segmentation) ونموذج رؤية-لغة للاستدلال حول المناطق القابلة للقيادة باستخدام التلميحات البصرية، مما يلغي الحاجة إلى نماذج تضاريس منفصلة ومخصصة لمهام معينة مع تحقيق أداء يضاهي أحدث ما توصل إليه العلم والملاحة كاملة الحزمة.

Abdelmoamen Nasser, Yousef Baba'a, Murad Mebrahtu, Nadya Abdel Madjid, Jorge Dias, Majid Khonji2026-04-07
💻 computer science

Erasure or Erosion? Evaluating Compositional Degradation in Unlearned Text-To-Image Diffusion Models

تقيم هذه الورقة البحثية بشكل منهجي عملية "النسيان اللاحق" (post-hoc unlearning) في نماذج الانتشار من النص إلى الصورة، وتكشف عن مقايضة حرجة حيث يؤدي الإزالة الفعالة للمفاهيم غير المرغوب فيها، مثل العري، في كثير من الأحيان إلى تقويض قدرات النموذج في التوليد التركيبي الأوسع مثل ربط الصفات والاستدلال المكاني.

Arian Komaei Koma, Seyed Amir Kasaei, Ali Aghayari, AmirMahdi Sadeghzadeh, Mohammad Hossein Rohban2026-04-07
🤖 machine learning

LP-GEMM: Integrating Layout Propagation into GEMM Operations

تقدم هذه الورقة تقنية LP-GEMM، التي تلغي عمليات تعبئة وتفريغ البيانات الفائضة في عمليات ضرب المصفوفات المتتالية من خلال نشر تخطيطات الذاكرة عبر العمليات، محققةً تسريعاً كبيراً على بنيات x86 وRISC-V مع الحفاظ على الصحة الدلالية الكاملة لمعايير BLAS.

César Guedes Carneiro, Lucas Alvarenga, Guido Araujo, Sandro Rigo2026-04-07