💻 computer science

BenthicFlow: Generating Extensible Underwater Environments via Flow Matching

يُعد BenthicFlow إطار عمل توليدي موحد يستخدم نموذج مطابقة تدفق شرطي واحد وعينات مستوحاة من تقنية MultiDiffusion لإنشاء بيئات تحت مائية ثلاثية الأبعاد متماسكة وقابلة للتوسع مكانيًا مع أنسجة RGBD وخرائط عمق متوافقة، مما يعالج بفعالية تحديات ندرة البيانات والتعميم في الرؤية الحاسوبية تحت الماء.

Joaquín Figueira, Camile Lendering, Manfred Gonzalez-Hernandez, Giacomo D'Amicantonio, Erkut Akdag, Egor Bondarev2026-08-25
🤖 machine learning

A Comparative Study of Label-free Representation Quality Metrics in Deep Learning

تقدم هذه الورقة دراسة مقارنة شاملة لمقاييس جودة التمثيل الخالية من الملصقات عبر 260 نموذج رؤية، حيث تحدد الأبعاد الجوهرية باعتبارها المتنبئ الأكثر موثوقية، بينما تثبت أن فعالية جميع المقاييس تتأثر بشكل كبير بفئة البنية وأهداف التدريب.

Daniel Richards Arputharaj, Daniel Jönsson, Gabriel Eilertsen2026-08-25
💻 computer science

Dual-Grained Agent Memory and Shapley Context Attribution for Multimodal Agentic Learner

تقدم هذه الورقة البحثية DG-Mem، وهو إطار عمل ذاكرة وكيلية ثنائية الحبيبات وغير معلمية مستوحاة من أنظمة التعلم المتكاملة، تعمل على تعزيز الاستدلال العلمي والرياضي للنماذج اللغوية الكبيرة متعددة الوسائط المجمدة من خلال مصنف مفاهيم عبر الإنترنت وعزو سياقي قائم على قيمة شابلي، محققةً تحسينات متسقة عبر مقاييس متنوعة دون الحاجة إلى تحديثات التدرج.

Jieke Wang, Tiancheng Shen, Yibo Yang, Ming-Hsuan Yang2026-08-25
💻 computer science

Spotter: Efficient Urban Visual Localization via Geo-Referenced Facade Landmarks in GPS-Degraded Environments

يُعد "سبوتر" (Spotter) إطار عمل قويًا لتحديد الموقع بصريًا في الوقت الفعلي، مصممًا للبيئات الحضرية التي تعاني من ضعف إشارات نظام تحديد المواقع العالمي (GPS)، حيث يستفيد من واجهات المباني المجزأة دلاليًا من قاعدة بيانات غير متصلة بالإنترنت ومدمجة لتحقيق تحديد دقيق للموقع عالميًا على أجهزة الحافة، متفوقًا بذلك على النماذج المرجعية لقياس المسافات ومنافسًا لأحدث الأساليب القائمة على الخرائط بمعدلات إطارات أعلى بكثير.

Antoni Valls, Jordi Sanchez-Riera2026-08-25
💻 computer science

Grounding Free-Form Instructions for Fashion Complementary Image Generation

تقدم هذه الورقة مهمة تجذير متعددة الوسائط جديدة لتوليد صور مكملة للأزياء باستخدام تعليمات لغة طبيعية حرة، مدعومة بمعايير غنية ونموذج StyleFlow المقترح، والذي يولد بفعالية ملابس متماسكة أسلوبياً مع تقليل التعقيد المعماري مقارنة بالنهج الحالية.

Matteo Attimonelli, Claudio Pomo, Alessandro De Bellis, Danilo Danese, Dietmar Jannach, Tommaso Di Noia2026-08-25
💻 computer science

Can Coding Agents Build Robust Baselines? A Skill-Based Approach for Automating the Medical Imaging Model-Development Pipeline

تقدم هذه الورقة سير عمل للذكاء الاصطناعي الوكيل القائم على المهارة والموجه بالأدبيات، والذي يعمل على أتمتة خط إنتاج تطوير نماذج التصوير الطبي بأكمله، حيث نجح في توليد نماذج مرجعية للتعلّم العميق تنافسية عبر معايير متنوعة للتجزئة والتصنيف والكشف، مع تقليل الجهد الهندسي بشكل كبير.

Eugenia Moris, José Ignacio Orlando2026-08-25
💻 computer science

OptiSight: Bridging Semantic Reasoning and Geometric Control for Embodied Navigation

تُعد OptiSight إطار عمل هجين يدمج استدلال نماذج الرؤية واللغة مع التوجيه البصري الحتمي لتمكين الملاحة الذاتية الفعالة داخل المباني دون الحاجة لتدريب مسبق (zero-shot) ضمن ميزانية ذاكرة فيديو تبلغ 8 جيجابايت، وذلك عبر الاستفادة من نموذج Grounded-SAM لتحديد مواقع الأهداف وهندسة الكاميرا للتحكم دون الحاجة إلى رسم خرائط كثيفة.

Alperen Avan, Jordi Sanchez-Riera2026-08-25
💻 computer science

Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

يقدم البحث نظام JoyAI-Echo-1.5، وهو نظام موحد لتوليد الصوت والمرئيات يتميز بنسخة الفيديو الطويل المزودة بذاكرة عبر اللقطات لضمان اتساق الشخصية المستمر، ونسخة النموذج العالمي المزودة بتحكم هندسي في الكاميرا للملاحة التفاعلية، وكلاهما تم تحسينه عبر التدريب المدرك للتدحرج لتحقيق أداء رائد في سرد القصص طويلة المدى وتوليد العوالم التفاعلية.

Nan Duan, Haoyang Huang, Weiyang Jin, Haoran Li, Yaowei Li, Yuming Li, Yijun Liu, Xin Lu, Xiaoxiao Ma, Yanwen Ma, Yaofen (…)2026-08-25
💻 computer science

Image-Conditioned Diffusion Models for Quality Assurance of Organ-at-Risk Segmentations in Radiotherapy

تُثبت هذه الورقة أن نماذج الانتشار المشروطة بالصور تتفوق على المشفرات التلقائية المتغيرة (VAEs) في اكتشاف وتحديد أخطاء التجزئة الدقيقة في تخطيط العلاج الإشعاعي لمنطقة الرأس والعنق، مما يقدم إطاراً واعداً لضمان الجودة الآلي لتخطيط الأعضاء المعرضة للخطر.

Clea Dronne, Catharine H Clark, Xavier Loizeau, Elizabeth Miles, Peter Hoskin, Jamie R McClelland2026-08-25
🤖 AI

Towards Comprehensive Basketball Understanding

تقدم هذه الورقة BasketballBench، وهو معيار متعدد الوسائط شامل مستمد من موسم 2025-2026 لدوري كرة السلة الأمريكي للمحترفين (NBA)، وتقترح BasketballSkills، وهو وكيل يتفوق على النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) الحالية من خلال التركيب الصريح لأدوات الإدراك والاسترجاع الخاصة بالمجال لمعالجة الطبيعة المعقدة والمتكاملة لفهم كرة السلة.

Yirong Hu, Jiayuan Rao, Yu Zhang, Shangzhe Di, Weidi Xie2026-08-25