💻 computer science

BARISTA: A Multi-Task Egocentric Benchmark for Compositional Visual Understanding

تقدم الورقة البحثية BARISTA، وهو معيار مرجعي تحدي متعدد المهام من منظور الشخص الأول، يضم 185 مقطع فيديو لتحضير القهوة مشروحة بكثافة مع رسوم بيانية للمشهد لكل إطار لتقييم وتشخيص قدرات الفهم البصري التركيبي عبر مهام إجرائية متنوعة.

Patrick Knab, Orgest Xhelili, Inis Buzi, Drago Andres Guggiana Nilo, Mohd Saquib Khan, Lorenz Kolb, Manuel Scherzer, Ker (…)2026-05-13
💻 computer science

MoCam: Unified Novel View Synthesis via Structured Denoising Dynamics

يقدم MoCam إطار عمل موحداً ومبتكراً لتخليق المشاهد من منظور جديد يستخدم ديناميكيات إزالة الضجيج المهيكلة لفصل المحاذاة الهندسية وتكرير المظهر زمنياً ضمن عملية الانتشار، متجاوزاً بذلك بفعالية قيود الأساليب الحالية عبر تثبيت الهياكل الخشنة أولاً باستخدام الأولويات الهندسية ثم تصحيح الأخطاء وتكرير التفاصيل باستخدام أولويات المظهر.

Haofeng Liu, Yang Zhou, Ziheng Wang, Zhengbo Xu, Zhan Peng, Jie Ma, Jun Liang, Shengfeng He, Jing Li2026-05-13
💻 computer science

EchoTracker2: Enhancing Myocardial Point Tracking by Modeling Local Motion

يُعد EchoTracker2 بنية مبتكرة تعتمد على المرحلة الدقيقة فقط، حيث تعمل على تعزيز تتبع النقاط العضلية القلبية في تخطيط صدى القلب من خلال الاستفماط من السياق المكاني الزماني المحلي والاستدلال الزماني بعيد المدى، محققةً دقةً وتكراريةً وتوافقاً فائقين مع مقاييس الإجهاد السريرية مقارنة بالنماذج الحالية الرائدة.

Md Abulkalam Azad, Vegard Holmstrøm, John Nyberg, Lasse Lovstakken, Håvard Dalen, Bjørnar Grenne, Andreas Østvik2026-05-13
💻 computer science

Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model

تقدم الورقة البحثية إطار عمل SCOLAR، وهو إطار عمل مبتكر يتغلب على "انهيار كسب المعلومات" الذي يحد من طرق الاستدلال البصري الكامنة الحالية باستخدام "detransformer" خفيف الوزن لتوليد رموز بصرية مستقلة ومتسقة ذاتياً، مما يتيح سلاسل استدلال أطول بكثير ويحقق أداءً رائدًا في المعايير المرجعية الواقعية.

Chenfeng Wang, Wei He, Xuhan Zhu, Chunpeng Zhou, Qizhen Li, Song Yan, Yufei Zheng, Chengjun Yu, Fan Lu, Wei Zhai, Yang C (…)2026-05-13
💻 computer science

SyncDPO: Enhancing Temporal Synchronization in Video-Audio Joint Generation via Preference Learning

تقدم هذه الورقة البحثية SyncDPO، وهو إطار عمل فعال لما بعد التدريب يعزز التزامن الزمني في التوليد المشترك للفيديو والصوت من خلال الاستفادة من تحسين التفضيل المباشر مع بناء سلبي قائم على القواعد في الوقت الفعلي والتعلم المنهجي للتغلب على قيود الضبط الدقيق الخاضع للإشراف التقليدي.

Xin Cheng, Xihua Wang, Ying Ba, Yuyue Wang, Kaisi Guan, Yinbo Wang, Wenpu Li, Ruihua Song2026-05-13
💻 computer science

CAD-feature enhanced machine learning for manufacturing effort estimation on sheet metal bending parts

تقترح هذه الورقة نهجاً هجيناً للتعلم الآلي يعمل على إثراء رسوم تمثيل الحدود القائمة على التصميم بمساعدة الحاسوب (CAD) بميزات تصنيع قائمة على القواعد، وذلك لتحسين دقة تقدير جهد ثني الصاج وتوقع قابلية التصنيع بشكل كبير على كل من مجموعات البيانات الاصطناعية والصناعية الواقعية.

Matteo Ballegeer, Toon Van Camp, Willem Jaspers, Alp Bayar, Aung Nyein Soe, Martin Roelfs, Dries F. Benoit, Bieke Decrae (…)2026-05-13
💻 computer science

Beyond Text Prompts: Visual-to-Visual Generation as A Unified Paradigm

تقدم هذه الورقة البحثية **V2V-Zero**، وهو إطار عمل خالٍ من التدريب يتيح التوليد من مرئي إلى مرئي عبر تكييف نماذج الرؤية واللغة الحالية بناءً على صفحات مواصفات بصرية بدلاً من المطالبات النصية، مما يثبت أن هذا النموذج الموحد يحقق أداءً تنافسياً مع الكشف عن القيود الحالية في توليد المحتوى والتحكم الهيكلي عبر نماذج الصور والفيديو.

Yaofang Liu, Kangning Cui, Meng Chu, Zhaoqing Li, Suiyun Zhang, Jean-Michel Morel, Xiaodong Cun, Haoxuan Che, Rui Liu, R (…)2026-05-13
🤖 machine learning

From Model Uncertainty to Human Attention: Localization-Aware Visual Cues for Scalable Annotation Review

تُثبت هذه الورقة أن تصور عدم اليقين المكاني في سير عمل التوسيم المدعوم بالذكاء الاصطناعي يوجه انتباه البشر بفعالية نحو التنبؤات غير الموضعة بدقة، مما يؤدي إلى تسميات عالية الجودة وسرعات مراجعة أعلى مقارنة بالطرق القياسية.

Moussa Kassem Sbeyti, Joshua Holstein, Philipp Spitzer, Nadja Klein, Gerhard Satzger2026-05-13
💻 computer science

Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation

تقدم الورقة البحثية نموذج INSET، وهو نموذج توليد بصري موحد يدمج الصور كرموز مفردات أصلية ضمن التعليمات النصية ويستفيد من محرك بيانات قابل للتوسع يضم 15 مليون عينة متداخلة ليتفوق بشكل كبير على الأساليب الحالية في اتساق الصور المتعددة واتباع التعليمات المعقدة.

Yabo Zhang, Kunchang Li, Dewei Zhou, Xinyu Huang, Xun Wang2026-05-13
💻 computer science

Contrastive Learning under Noisy Temporal Self-Supervision for Colonoscopy Videos

تقترح هذه الورقة إطار عمل للتعلم التبايني المدرك للضجيج يستفيد من البنية الزمنية المتأصلة في فيديوهات تنظير القولون لتعلم تمثيلات قوية للزوائد اللحمية دون الحاجة إلى تعليقات يدوية مكلفة، محققةً أداءً رائدًا عبر مهام متعددة لاحقة باستخدام مشفر خفيف الوزن تم تدريبه على مجموعة بيانات صغيرة.

Luca Parolari, Pietro Gori, Lamberto Ballan, Carlo Biffi, Loic Le Folgoc2026-05-13