🤖 machine learning

Seeking the Unfamiliar but Memorable: Conceptual Creativity as Meta-Learning

تقترح هذه الورقة إطار عمل للتعلم الفائق حيث يتم تحسين نموذج توليدي مجمد (المبتكر) عبر إشارة مكافأة مستمدة من التعلم السريع لمراقب متكيف (المُقيّم)، مما يتيح إنتاج مفاهيم وتنوعات أسلوبية جديدة وغير مألوفة ولكنها قابلة للتعلم بسرعة دون الحاجة إلى تكييف لغوي إضافي.

Mengye Ren2026-05-19
🤖 AI

Visual Agentic Memory: Enabling Online Long Video Understanding via Online Indexing, Hierarchical Memory, and Agentic Retrieval

تقترح الورقة البحثية "الذاكرة الوكيلة البصرية" (VAM)، وهي إطار عمل خالٍ من التدريب يعزز فهم الفيديوهات الطويلة عبر الإنترنت من خلال الفهرسة الانتقائية، والتنظيم الهرمي للذاكرة، والاسترجاع الوكيلي، محققةً أداءً هو الأفضل في فئته على اختبارات معيارية مثل OVO-Bench وMM-Lifelong عبر التعامل مع الذاكرة البصرية كركيزة صريحة، وقابلة للفحص، وقابلة للاستعلام.

Aiden Yiliu Li, Nels Numan, Anthony Steed2026-05-19
🤖 machine learning

SeamCam: Quantifying Seamless Camouflage via Multi-Cue Visual Detectability

تقدم هذه الورقة البحثية SeamCam، وهو مقياس مبتكر يحدد كمية التمويه السلس من خلال صياغته كمسألة تحديد موقع بصري مشروطة بالفئة، وهو ما يحقق توافقًا عاليًا مع الأحكام البشرية ويعمل كإشارة تفضيل فعالة لتدريب نماذج الانتشار لتوليد تمويه واقعي، مدعومًا بمجموعة بيانات CamFG-1.5k الجديدة.

Amin Karimi Monsefi, Abolfazl Meyarian, Mridul Khurana, Shuheng Wang, Pouyan Navard, Cheng Zhang, Anuj Karpatne, Wei-Lun (…)2026-05-19
💻 computer science

TriALS: Triphasic-Aided Liver Lesion Segmentation Benchmark in Non-Contrast CT

يقدم تحدي TriALS مجموعة بيانات معيارية متعددة المراكز وإطار تقييم لتجزئة آفات الكبد آلياً على الأشعة المقطعية بدون صبغة، مما يكشف أنه بينما تقترب الخوارزميات الرائدة من مستوى الأداء البشري في الفحوصات المعززة بالصبغة، لا تزال هناك تحديات كبيرة في الصور غير المعززة بالصبغة رغم التحسينات المحرزة مقارنة بالنماذج الجاهزة.

Marawan Elbatel, Mohamed Ghonim, Jiaji Mao, Zhuosheng Lin, Katharina Eckstein, Andrés Martínez Mora, Jonathan Deissler (…)2026-05-19
🤖 machine learning

Attend Locally, Remember Linearly: Linear Attention as Cross-Frame Memory for Autoregressive Video Diffusion

تقدم هذه الورقة البحثية ARL2، وهي بنية انتباه هجينة لانتشار الفيديو ذاتي الانحدار تستبدل الانتباه المتقاطع التربيعي بين الإطارات بحالة متكررة ثابتة الحجم لتحقيق توسع زمني خطي واستخدام ثابت للذاكرة مع الحفاظ على الاتساق الزمني وجودة التوليد أو تحسينهما.

Kunyang Li, Mubarak Shah, Yuzhang Shang2026-05-19
💻 computer science

Controlla: Learning Controllability via Graph-Constrained Latent Geometry

تقدم هذه الورقة Controlla، وهو إطار عمل معياري ينمذج القدرة على التحكم كبنية هندسية كامنة منظمة عبر محاذاة عوامل الهوية والسمات المتعلمة مع الأولويات الرسومية (graph priors) عبر النقل الأمثل المقيد بالرسوم البيانية، مما يحسن الحفاظ على الهوية والاتساق عبر الوسائط في التوليد متعدد الوسائط، وهو ما تم التحقق من صحته على معيار جديد يسمى AffectHuman-43K.

Jamuna S. Murthy, Amin Karimi Monsefi, Rajiv Ramnath2026-05-19
💻 computer science

AtlasVid: Efficient Ultra-High-Resolution Long Video Generation via Decoupled Global-Local Modeling

يقدم AtlasVid إطار عمل عالمي-محلي منفصل يعمل بكفاءة على توليد فيديوهات طويلة فائقة الدقة من خلال الاستفادة من وسيط دلالي منخفض الدقة لتوجيه فرع تفاصيل عالي الدقة، محققاً بذلك تخليقاً بدقة +4K مع تسريع بمقدار 60.9 ضعفاً وخفض تكاليف التدريب بشكل كبير مقارنة بالنماذج الأصلية عالية الدقة.

Ziyang Mai, Yuyao Zhang, Yu-Wing Tai2026-05-19
🤖 machine learning

Multi-Object Tracking Consistently Improves Wildlife Inference

تُثبت هذه الورقة أن دمج نماذج تتبع الأجسام المتعددة (MOT) لدمج التنبؤات الزمنية من بيانات الكاميرات الفخية يحسن بشكل كبير من دقة واتساق تصنيف الحياة البرية من خلال التخفيف من عدم استقرار الملصقات والضجيج من إطار إلى آخر.

Mufhumudzi Muthivhi, Jiahao Huo, Fredrik Gustafsson, Terence L. van Zyl2026-05-19
💻 computer science

Face inpainting with Identity Preserving Latent Diffusion Models

تقترح هذه الورقة البحثية ID-ControlNet، وهو إطار عمل لترميم الوجوه يحافظ على الهوية ومبني على نماذج الانتشار الكامنة، يستخدم تضمينات الهوية الوجهية واستراتيجية فقد ثلاثي متخصصة لإعادة بناء المناطق المحجوبة مع الحفاظ على دقة عالية للهوية دون الحاجة إلى عملية ضبط دقيق مكلفة.

João Santos, Carlos Santiago, Manuel Marques2026-05-19
🤖 AI

GeoWorld-VLM: Geometry from World Models for Vision-Language Models

يعالج GeoWorld-VLM محدودية الاستدلال المكاني في النماذج البصرية اللغوية من خلال استخلاص الإشارات الهندسية ثلاثية الأبعاد من نماذج عالم فيديو مجمدة مشروطة بالكاميرا ونقلها إلى المسار البصري، محققاً تحسينات متسقة في الأداء على معايير الاختبار المكانية مع الحفاظ على القدرات اللغوية للنموذج الأصلي.

Renjie Gu, Kaichen Zhou, Yan Luo, Mengyu Wang2026-05-19