⚡ electrical engineering

Towards Emotion Recognition with 3D Pointclouds Obtained from Facial Expression Images

تقترح هذه الورقة نهجاً يحافظ على الخصوصية للتعرف المستمر على تعبيرات الوجه باستخدام الاستشعار اللاسلكي عالي التردد عبر توليد مجموعة بيانات سحابة نقاط ثلاثية الأبعاد (AffectNet3D) من صور ثنائية الأبعاد باستخدام طريقة قائمة على نموذج FLAME، مما يمكّن نموذج PointNet++ من تحقيق دقة تتجا over 70% ويُظهر أداءً فائقاً عند ضبطه بدقة على بيانات محدودة من العالم الحقيقي مقارنة بالتدريب حصرياً على مجموعات البيانات ثلاثية الأبعاد الموجودة.

Laura Rayón Ropero, Jasper De Laet, Filip Lemic, Pau Sabater Nácher, Nabeel Nisar Bhat, Sergi Abadal, Jeroen Famaey, Edu (…)2026-03-31
💻 computer science

Diversity Matters: Dataset Diversification and Dual-Branch Network for Generalized AI-Generated Image Detection

تقدم الورقة البحثية "التنوع مهم" (Diversity Matters)، وهو إطار عمل مبتكر يعزز قدرة التعميم والمتانة في كشف الصور المولدة بواسطة الذكاء الاصطناعي من خلال توظيف آلية تصفية التشابه في نطاق الميزات لتقنين بيانات تدريب متنوعة، وشبكة ثنائية الفروع تدمج ميزات النطاقين البكسلي والترددي لالتقاط الإشارات الدلالية والهيكلية المتكاملة.

Nusrat Tasnim, Kutub Uddin, Khalid Malik2026-03-31
💻 computer science

Engineering Mythology: A Digital-Physical Framework for Culturally-Inspired Public Art

تقدم هذه الورقة "نافاغونجارا ريبورن" (Navagunjara Reborn)، وهو منحوتة لفعالية "بيرنينج مان" 2025 تدمج بين ميثولوجيا أوديشا والهندسة الرقمية-الفيزيائية لاستعراض إطار عمل تعاوني يربط بين التصنيع الحرفي الموزع، والتحسين الهيكلي، والتغذية الراجعة الرقمية التكرارية للفنون العامة المستوحاة ثقافياً.

Jnaneshwar Das, Christopher Filkins, Rajesh Moharana, Ekadashi Barik, Bishweshwar Das, David Ayers, Christopher Skiba, R (…)2026-03-31
🤖 machine learning

ImagenWorld: Stress-Testing Image Generation Models with Explainable Human Evaluation on Open-ended Real-World Tasks

يقدم البحث ImagenWorld، وهو معيار شامل يتكون من 3,600 مجموعة شروط و20,000 تعليق بشري دقيق عبر ست مهام ومجالات، صُمم لاختبار نماذج توليد الصور من خلال تحليل الأخطاء الموضعي والقابل للتفسير، ويكشف أنه في حين تتفوق النماذج في التوليد الفني والواقعي الفوتوغرافي، فإنها تعاني بشكل كبير في مجالات التحرير والمجالات الغنية بالنصوص.

Samin Mahdizadeh Sani, Max Ku, Nima Jamali, Matina Mahdizadeh Sani, Paria Khoshtab, Wei-Chieh Sun, Parnian Fazel, Zhi Ru (…)2026-03-31
💻 computer science

Wan-R1: Verifiable-Reinforcement Learning for Video Reasoning

تقدم الورقة البحثية Wan-R1، وهو إطار عمل يعزز الاستدلال المرئي في النماذج القائمة على التدفق عبر تكييف تحسين السياسة النسبي المجموعي (GRPO) مع وظائف مكافأة موضوعية وقابلة للتحقق، مما يثبت أن هذا النهج يتفوق بشكل كبير على نماذج المكافأة متعددة الوسائط ونماذج الضبط الدقيق الموجه (SFT) في المهام المكانية والتخطيطية المعقدة.

Ming Liu, Yunbei Zhang, Shilong Liu, Liwen Wang, Wensheng Zhang2026-03-31
💻 computer science

BINO: Encoder Centric Self Supervised Stereo With Native Pair Input

يقدم BINO إطار عمل لتعلم الاستريو ذاتي الإشراف يرتكز على المشفر، حيث يقوم بدمج أزواج الصور المصححة في مرحلة المدخلات لتعلم بنية ثنائية العين قوية داخل مشفر مدمج، محققاً أداءً رائدًا للموصفات المجمدة في مهام الاستريو الكثيفة والاسترجاع دون الاعتماد على وحدات ربط صريحة أثناء التدريب المسبق.

Haokun Zhou2026-03-31
🤖 AI

JaWildText: A Benchmark for Vision-Language Models on Japanese Scene Text Understanding

تقدم الورقة البحثية JaWildText، وهو معيار تشخيصي جديد يتكون من 3,241 صورة لنصوص المشاهد اليابانية من الواقع الفعلي وثلاث مهام متخصصة (STVQA، وKIE، وHandwriting OCR) لتقييم وكشف أوجه القصور في نماذج الرؤية واللغة الحالية عند التعامل مع التعقيدات الخاصة باللغة اليابانية مثل النصوص المختلطة، والكتابة العمودية، وقوائم الرموز الواسعة.

Koki Maeda (Institute of Science Tokyo, Tokyo, Japan, Research and Development Center for Large Language Models, Nationa (…)2026-03-31
🤖 machine learning

Efficient Inference of Large Vision Language Models

تقدم هذه الورقة مسحاً شاملاً للتقنيات الحديثة لتسريع استنتاج نماذج اللغة والرؤية الكبيرة (LVLM)، حيث تقدم تصنيفاً منهجياً عبر أربعة أبعاد هي: ضغط الرموز المرئية، وإدارة الذاكرة، والبنية الفعالة، واستراتيجيات فك الترميز، مع فحص نقدي للقيود الحالية وتحديد الاتجاهات البحثية المستقبلية.

Surendra Pathak2026-03-31
💻 computer science

AffordMatcher: Affordance Learning in 3D Scenes from Visual Signifiers

تقدم هذه الورقة AffordBridge، وهي مجموعة بيانات واسعة النطاق تضم 291,637 من تعليقات التفاعل الوظيفي عبر 685 مشهداً داخلياً، وتقترح AffordMatcher، وهي طريقة تستفيد من الدلالات البصرية لإنشاء مراسلات دلالية بين الصور من نوع RGB والسحب النقطية لتحديد مناطق الإمكانية بدقة في البيئات ثلاثية الأبعاد.

Nghia Vu, Tuong Do, Khang Nguyen, Baoru Huang, Nhat Le, Binh Xuan Nguyen, Erman Tjiputra, Quang D. Tran, Ravi Prakash, T (…)2026-03-31
💻 computer science

RetinexDualV2: Physically-Grounded Dual Retinex for Generalized UHD Image Restoration

يُعد RetinexDualV2 إطار عمل موحد ثنائي المسار قائم على الأسس الفيزيائية، يستفيد من وحدة تجذير فيزيائي مخصصة للمهمة وآلية انتباه ذاتي متعدد الرؤوس مشروطة فيزيائياً ومبتكرةة لتحقيق استعادة صور فائقة الدقة وعالية الجودة، ومعممة، ورائدة عبر مختلف أنواع التدهور دون الحاجة إلى تعديلات هيكلية خاصة بالمهمة.

Mohab Kishawy, Jun Chen2026-03-31