💻 computer science

SYNCR: A Cross-Video Reasoning Benchmark with Synthetic Grounding

تقدم هذه الورقة SYNCR، وهو معيار مرجعي اصطناعي محكوم ذو تجذر مُتحقق منه برمجياً يقيم النماذج اللغوية الكبيرة متعددة الوسائط في الاستدلال عبر الفيديوهات، مما يكشف عن فجوة أداء كبيرة بين النماذج الحالية والبشر، لا سيما في مهام الاستدلال الفيزيائي والمكاني الدقيقة.

Sara Ghazanfari, Siddharth Garg, Prashanth Krishnamurthy, Farshad Khorrami2026-05-12
💻 computer science

Beyond Bag-of-Patches: Learning Global Layout via Textual Supervision for Late-Interaction Visual Document Retrieval

تقترح هذه الورقة مشفرًا متعدد الوسائط يعزز استرجاع الوثائق المرئية عبر التفاعل المتأخر من خلال تعلم تضمينات التخطيط العالمي عبر الإشراف النصي، مما يعالج قيود النماذج القائمة على الرقع المحلية ويحقق مكاسب كبيرة في الأداء مقارنة بالنماذج المرجعية المتطورة على مجموعات بيانات متعددة.

Pascal Tilli, Mohsen Mesgar2026-05-12
🤖 machine learning

TARO: Temporal Adversarial Rectification Optimization Using Diffusion Models as Purifiers

تقترح الورقة البحثية TARO، وهي طريقة تنقية في وقت الاستدلال بنمط الصفر (zero-shot)، تستفيد من أولوية درجة (score prior) موجهة زمنياً من أنظمة ضجيج انتشار متعددة لتحقيق التوازن بين التصحيح العالمي القوي ضد الهجمات التكيفية مع الحفاظ على التفاصيل الدلالية.

Daniel Wesego, Pedram Rooshenas2026-05-12
💻 computer science

NICE FACT: Diagnosing and Calibrating VLMs in Quantitative Reasoning for Kinematic Physics

تقدم هذه الورقة NICE وFACT، وهما نموذج تشخيص مزدوج يقيم ويعاير ثقة نماذج الرؤية واللغة في الاستدلال الفيزيائي الحركي، ويكشف أن النماذج الحالية المتطورة غالبًا ما تفشل في تحديد الشروط البصرية المسبقة بشكل صحيح أو تطبيق القوانين الفيزيائية رغم ثقتها.

Jian Lan, Zhicheng Liu, Xinpeng Wang, Yuhao Zhou, Haokun Chen, Jiancheng Lv, Barbara Plank, Thomas Seidl2026-05-12
💻 computer science

CapCLIP: A Vision-Language Representation Alignment Approach for Wireless Capsule Endoscopy Analysis

تقدم هذه الورقة CapCLIP، وهو إطار عمل للرؤية واللغة يعمل على محاذاة صور كبسولة التنظير اللاسلكية مع الأوصاف النصية السريرية لتحقيق تعميم فائق في حالة عدم وجود بيانات مسبقة (zero-shot) وقابلية تفسير دلالي عبر مجموعات بيانات متنوعة مقارنة بالنماذج الحالية القائمة على الرؤية فقط.

Haroon Wahab, Irfan Mehmood, Hassan Ugail2026-05-12
🔬 physics

A Deep Risk Estimator for Known Operator Learning

تقدم هذه الورقة مقدراً عميقاً للمخاطر للشبكات التي تجمع بين المعاملات المتعلمة والمعروفة، والتي تفكك المخاطر الإجمالية إلى حدود خاصة بكل طبقة لتوضيح أن استبدال الطبقات المتعلمة بمعاملات معروفة يقلل من حدود الخطأ ومتطلبات العينات، وهو اكتشاف تم التحقق من صحته من خلال تجارب إعادة بناء التصوير المقطعي المحوسب وقابل للتطبيق على الشبكات العصبية المستنيرة بالفيزياء.

Andreas Maier, Md Hasan, Paulina Conrad, Paula Andrea Perez-Toro2026-05-12
🤖 machine learning

Geometric Flood Depth Estimation: Fusing Transformer-Based Segmentation with Digital Elevation Models

تقترح هذه الورقة طريقة هندسية تدمج تقسيم الفيضانات القائم على نموذج Mask2Former مع نماذج الارتفاع الرقمية لتقدير عمق الفيضان ثلاثي الأبعاد ومنسوب سطح الماء من الصور الجوية أحادية العدسة، مما يتيح الوعي بالموقف السريع بعد الكوارث دون التأخير الناتج عن المحاكاة الهيدروديناميكية.

Nhut Le, Ehsan Karimi, Maryam Rahnemoonfar2026-05-12
💻 computer science

A Two-Stage Motion-Aware Framework for mmWave-based Human Mesh Recovery

تقترح هذه الورقة إطار عمل ثنائي المراحل لاستعادة الشبكة البشرية القائمة على الموجات المليمترية (mmWave)، حيث يقوم أولاً باستخراج الانعكاسات البشرية عبر تقسيم حجمي (voxel segmentation) من الخشن إلى الناعم، ثم يعيد بناء الهندسة ثلاثية الأبعاد للجسم من خلال النمذجة المشتركة لبنية كل إطار وديناميكيات الحركة بين الإطارات، مما يتغلب على تشويش الإشارة ومحدودية القياس الجزئي ليتفوق على النهج الحالية التي تعمل بنظام النهاية إلى النهاية.

Hoang Hai Pham, Shuntian Zheng, Jiaqi Li, Yu Guan2026-05-12
🤖 AI

MC-RFM: Geometry-Aware Few-Shot Adaptation via Mixed-Curvature Riemannian Flow Matching

تقترح الورقة البحثية إطار عمل MC-RFM، وهو إطار عمل للتكيف بلقطات قليلة وكفاءة في المعلمات، يقوم بنمذجة تحديثات الميزات على منوع ريماني ذي انحناء مختلط لالتقاط كل من الدلالات الهرمية والتباينات البصرية المحلية بشكل أفضل، محققاً أداءً هو الأفضل حالياً عبر مختلف معايير الرؤية الحاسوبية والهياكل الأساسية.

Salim Khazem, Ibrahim Mohamed Serouis, Zakaria Ezzahed2026-05-12
🤖 AI

ZAYA1-VL-8B Technical Report

تقدم الورقة البحثية نموذج ZAYA1-VL-8B، وهو نموذج رؤية ولغة مدمج بنظام "خليط الخبراء" (mixture-of-experts) يضم 9.2 مليار معلمة، يستفيد من محولات LoRA المخصصة للرؤية والانتباه ثنائي الاتجاه لتحقيق أداء منافس أو متفوق على النماذج الأكبر والأحدث في مختلف معايير فهم الرؤية.

Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge2026-05-12