💻 computer science

GAViD: A Large-Scale Multimodal Dataset for Context-Aware Group Affect Recognition from Videos

تقدم هذه الورقة البحثية GAViD، وهو عبارة عن مجموعة بيانات متعددة الوسائط واسعة النطاق تضم 5,091 فيديو غنية بالبيانات الوصفية السياقية وإشارات الحركة لمعالجة ندرة البيانات الخاصة بالتعرف على العاطفة الجماعية، إلى جانب نموذج CAGNet المقترح الذي يحقق أداءً هو الأفضل في مجاله في التعرف على العواطف الجماعية المدركة للسياق.

Deepak Kumar, Abhishek Pratap Singh, Puneet Kumar, Xiaobai Li, Balasubramanian Raman2026-04-20
🤖 AI

A Two-Stage, Object-Centric Deep Learning Framework for Robust Exam Cheating Detection

تقترح هذه الورقة إطار عمل للتعلم العميق يعتمد على الأجسام، وهو نظام قوي مكون من مرحلتين يجمع بين نموذج YOLOv8n لتحديد موقع الطالب ونموذج RexNet-150 مضبوط بدقة لتصنيف السلوك، وذلك لتحقيق كشف عن الغش في الامتحانات يتسم بالدقة العالية، والقابلية للتوسع، والتصميم الأخلاقي، مع تحسن بنسبة 13% عن النماذج المرجعية الحالية القائمة على الفيديو.

Van-Truong Le, Le-Khanh Nguyen, Trong-Doanh Nguyen2026-04-20
🤖 machine learning

Information Router for Mitigating Modality Dominance in Vision-Language Models

تقدم هذه الورقة البحثية \textsc{MoIR} (موجه المعلومات متعدد الوسائط)، وهو أسلوب دمج على مستوى المعلومات يخفف من هيمنة الوسائط في نماذج الرؤية واللغة عبر تحديد الرموز الأقل معلوماتية وتوجيه البيانات المتكاملة من الوسائط الأقوى لبناء تمثيلات كثيفة، مما يؤدي إلى تحسين المتانة والأداء حتى في ظل تدهور الوسائط.

Seulgi Kim, Mohit Prabhushankar, Ghassan AlRegib2026-04-20
💻 computer science

Repurposing 3D Generative Model for Autoregressive Layout Generation

يُعد LaviGen إطار عمل مبتكرًا يعيد توظيف النماذج التوليدية ثلاثية الأبعاد في نظام ذاتي الانحدار لإنشاء تخطيطات ثلاثية الأبعاد معقولة فيزيائيًا ومتماسكة هندسيًا مباشرة في الفضاء ثلاثي الأبعاد الأصلي، محققًا أداءً رائدًا مع تحسن ملحوظ في الكفاءة والمعقولية الفيزيائية على مقياس LayoutVLM.

Haoran Feng, Yifan Niu, Zehuan Huang, Yang-Tian Sun, Chunchao Guo, Yuxin Peng, Lu Sheng2026-04-20
💻 computer science

Real-Time Hand Gesture Recognition: Integrating Skeleton-Based Data Fusion and Multi-Stream CNN

تقدم هذه الورقة إطار عمل للتعرف على إيماءات اليد في الوقت الفعلي يقوم بتحويل بيانات الهيكل العظمي ثلاثية الأبعاد الديناميكية إلى صور RGB ثابتة للمعالجة الفعالة بواسطة شبكة عصبية تلافيفية متعددة المسارات متخصصة، محققةً أداءً هو الأفضل في فئته مع زمن انتقال منخفض على الأجهزة الاستهلاكية عبر خمس مجموعات بيانات مرجعية.

Oluwaleke Yusuf, Maki Habib, Mohamed Moustafa2026-04-17
🤖 machine learning

Maximal Brain Damage Without Data or Optimization: Disrupting Neural Networks via Sign-Bit Flips

تقدم هذه الورقة البحثية "الآفة العصبية العميقة" (Deep Neural Lesion - DNL)، وهي طريقة خالية من البيانات ومن التحسين، توضح كيف يمكن لقلب بضعة بتات إشارة حرجة فقط أن يؤدي إلى تدهور كارثي في أداء الشبكات العصبية العميقة المتنوعة، مع اقتراح دفاع عملي من خلال حماية هذه المعلمات الضعيفة بشكل انتقائي.

Ido Galil, Moshe Kimhi, Ran El-Yaniv2026-04-17
💻 computer science

Safeguarding AI in Medical Imaging: Post-Hoc Out-of-Distribution Detection with Normalizing Flows

تقترح هذه الورقة طريقة تعتمد على التدفق الطبيعي (normalizing flow) لما بعد المعالجة للكشف عن البيانات خارج التوزيع في التصوير الطبي، والتي تتكامل بسلاسة مع النماذج سابقة التدريب دون الحاجة لإعادة التدريب، محققةً أداءً فائقاً على معايير MedOOD وMedMNIST مقارنةً بالنهج الحالية.

Dariush Lotfi, Mohammad-Ali Nikouei Mahani, Mohamad Koohi-Moghadam, Kyongtae Ty Bae2026-04-17
💻 computer science

Estimating the Diameter at Breast Height of Trees in a Forest from RGB

تقدم هذه الورقة مسار عمل منخفض التكلفة وشبه مؤتمت باستخدام فيديو بزاوية 360 درجة من فئة المستهلك وتقنية القياس التصويري من خلال "الاستعادة من الحركة" (SfM) لتقدير قطر جذع الشجرة عند مستوى الصدر بمتوسط خطأ نسبي مطلق يتراوح بين 5-9%، محققةً دقة تضاهي طرق "الليدار" (LiDAR) باهظة الثمن مع تقليل التكلفة والتعقيد التشغيلي بشكل كبير.

Siming He, Zachary Osman, Fernando Cladera, Dexter Ong, Nitant Rai, Patrick Corey Green, Vijay Kumar, Pratik Chaudhari2026-04-17
💻 computer science

MEBench: A Novel Benchmark for Understanding Mutual Exclusivity Bias in Vision-Language Models

تقدم هذه الورقة MEBench، وهو معيار مرجعي جديد يتميز بمسار توليد بيانات قابل للتوسع ومقاييس متخصصة لتقييم انحياز التنافي المتبادل الضعيف وقدرات الاستدلال المكاني للنماذج اللغوية البصرية في سيناريوهات تعلم الكلمات.

Anh Thai, Stefan Stojanov, Zixuan Huang, Bikram Boote, James M. Rehg2026-04-17
💬 NLP

VisRet: Visualization Improves Knowledge-Intensive Text-to-Image Retrieval

تقترح الورقة البحثية VisRet، وهو نموذج استرجاع مبتكر يحسن عملية استرجاع الصور من النصوص عبر توليد صور من الاستعلامات النصية أولاً لتجاوز قيود التضمينات متعددة الوسائط في التقاط العلاقات البصرية الهيكلية، مما يؤدي إلى تفوق ملحوظ على النماذج المرجعية الحالية عبر معايير متعددة ويعزز دقة الإجابة على الأسئلة البصرية في المهام اللاحقة.

Di Wu, Yixin Wan, Kai-Wei Chang2026-04-17