💻 computer science

Do All Vision Transformers Need Registers? A Cross-Architectural Reassessment

تعيد هذه الورقة إنتاج وإعادة تقييم نقدي للادعاءات المتعلقة بضرورة وجود "السجلات" (registers) في نماذج المحولات الرؤيوية (Vision Transformers) عبر مختلف البنيات وأحجام النماذج، مؤكدةً بعض الفوائد مع الكشف عن أن فعاليتها والمصطلحات المرتبطة بها ليست قابلة للتطبيق بشكل عالمي.

Spiros Baxevanakis, Platon Karageorgis, Ioannis Dravilas, Konrad Szewczyk2026-03-30
🤖 AI

ViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?

تقدم الورقة البحثية ViGoR-Bench، وهو إطار عمل معياري موحد مصمم لتقييم قدرات الاستدلال البصري في وضع "الصفر استباقي" (zero-shot) للنماذج التوليدية من خلال تجاوز المقاييس السطحية لتقييم العمليات الوسيطة والأبعاد المعرفية الدقيقة، مما يكشف أن حتى الأنظمة المتطورة تعاني من عجز منطقي كبير.

Haonan Han, Jiancheng Huang, Xiaopeng Sun, Junyan He, Rui Yang, Jie Hu, Xiaojiang Peng, Lin Ma, Xiaoming Wei, Xiu Li2026-03-30
🤖 AI

Dynamic LIBRAS Gesture Recognition via CNN over Spatiotemporal Matrix Representation

تقدم هذه الورقة نظاماً للتعرف على إيماءات لغة الإشارة البرازيلية (LIBRAS) في الوقت الفعلي لأتمتة المنازل، يجمع بين استخراج معالم اليد باستخدام MediaPipe ومصنف شبكة عصبية تلافيفية (CNN) يعمل على مصفوفة زمانية-مكانية، محققاً دقة تصل إلى 95% عبر 11 فئة من الإيماءات دون الاعتماد على الشبكات العصبية المتكررة.

Jasmine Moreira2026-03-30
🤖 AI

GUIDE: A Benchmark for Understanding and Assisting Users in Open-Ended GUI Tasks

تقدم هذه الورقة البحثية GUIDE، وهو معيار مرجعي شامل يتكون من 67.5 ساعة من تسجيلات الشاشة لـ 120 مستخدماً مبتدئاً عبر 10 تطبيقات برمجية، صُمم لتقييم وتحسين قدرة نماذج الذكاء الاصطناعي على اكتشاف سلوك المستخدم، واستنتاج القصد، وتقديم المساعدة في الوقت المناسب في مهام واجهة المستخدم الرسومية (GUI) مفتوحة النهايات، وذلك عبر نقل التركيز من مجرد الأتمتة إلى الفهم التعاوني.

Saelyne Yang, Jaesang Yu, Yi-Hao Peng, Kevin Qinghong Lin, Jae Won Cho, Yale Song, Juho Kim2026-03-30
💻 computer science

Seeing Through Smoke: Surgical Desmoking for Improved Visual Perception

تقدم هذه الورقة نموذجاً يعتمد على تقنية "ترانسفورمر" (Transformer) لإزالة الدخان الجراحي، تم تدريبه على مجموعة بيانات اصطناعية ضخمة ومعيار مرجعي واقعي جرى تنسيقه حديثاً لإزالة الدخان الجراحي من صور التنظير الداخلي بفعالية، مما يعزز الإدراك البصري والمهام اللاحقة مثل تقدير العمق وتجزئة الأدوات.

Jingpei Lu, Fengyi Jiang, Xiaorui Zhang, Lingbo Jin, Omid Mohareri2026-03-30
💻 computer science

Automated Quality Assessment of Blind Sweep Obstetric Ultrasound for Improved Diagnosis

تُثبت هذه الورقة أن التقييم الآلي لجودة فيديوهات مسح التصوير بالموجات فوق الصوتية لولادة الأجنة بطريقة المسح الأعمى (BSOU) أمر بالغ الأهمية لضمان موثوقية التشخيص قبل الولادة المدفوع بالذكاء الاصطناني في المناطق ذات الموارد المحدودة، حيث يكتشف بفعالية انحرافات عملية الاستحواذ ويحسن أداء المهام اللاحقة من خلال حلقات التغذية الراجعة في الوقت الفعلي.

Prasiddha Bhandari, Kanchan Poudel, Nishant Luitel, Bishram Acharya, Angelina Ghimire, Tyler Wellman, Kilian Koepsell, P (…)2026-03-30
💻 computer science

World Reasoning Arena

تقدم هذه الورقة WR-Arena، وهو معيار شامل مصمم لتقييم نماذج العالم بما يتجاوز مجرد التنبؤ البصري البسيط من خلال تقييم قدراتها في دقة محاكاة الأفعال، والتنبؤ طويل المدى، والاستدلال المحاكاتي عبر تصنيف جديد للمهام وتجارب واسعة النطاق تكشف عن فجوات كبيرة بين النماذج الحالية والقدرة البشرية على الاستدلال.

PAN Team, Qiyue Gao, Kun Zhou, Jiannan Xiang, Zihan Liu, Dequan Yang, Junrong Chen, Arif Ahmad, Cong Zeng, Ganesh Bannur (…)2026-03-30
💻 computer science

Few Shots Text to Image Retrieval: New Benchmarking Dataset and Optimization Methods

تقدم هذه الورقة مهمة استرجاع النص إلى الصورة بلقطات قليلة (FSIR) ومجموعة بيانات الاختبار الخاصة بها، FSIR-BD، لمعالجة أوجه القصور في نماذج الرؤية واللغة المدربة مسبقاً في التعامل مع الاستعلامات التركيبية والاستعلامات خارج التوزيع، مع اقتراح طريقتين جديدتين للتحسين تستفيدان من أمثلة مرجعية قليلة اللقطات لتحسين أداء الاسترجاع بشكل كبير.

Ofer Idan, Vladi Vexler, Gil Lederman, Dima Sivov, Aviad Cohen Zada, Shir Niego Komforti2026-03-30
💻 computer science

Shared Representation for 3D Pose Estimation, Action Classification, and Progress Prediction from Tactile Signals

تقدم هذه الورقة SCOTTI، وهو إطار عمل محول تلافيفي مشترك مبتكر يستفيد من التعلم متعدد المهام على مجموعة بيانات لمسية جديدة لتحسين تقدير وضعية الجسم ثلاثية الأبعاد، وتصنيف الحركة، والتنبؤ بتقدم الحركة من إشارات نعل القدم في آن واحد، متفوقاً بذلك على النهج الحالية أحادية المهمة مع معالجة قيود الرؤية الحاسوبية مثل الاحتجاب والخصوصية.

Isaac Han, Seoyoung Lee, Sangyeon Park, Ecehan Akan, Yiyue Luo, Joseph DelPreto, Kyung-Joong Kim2026-03-30
🤖 AI

DiReCT: Disentangled Regularization of Contrastive Trajectories for Physics-Refined Video Generation

تقدم الورقة البحثية DiReCT، وهو إطار عمل لما بعد التدريب يحل مشكلة التشابك بين الدلالات والفيزياء في توليد الفيديو المشروط بالنصوص من خلال تفكيك التعلم التبايني إلى مقاييس كبرى وصغرى لتحسين المنطق الفيزيائي العام دون المساس بالدقة البصرية أو زيادة وقت التدريب.

Abolfazl Meyarian, Amin Karimi Monsefi, Rajiv Ramnath, Ser-Nam Lim2026-03-30