💻 computer science

When Understanding Becomes a Risk: Authenticity and Safety Risks in the Emerging Image Generation Paradigm

تكشف هذه الورقة أن النماذج اللغوية الكبيرة متعددة الوسائط الناشئة تشكل مخاطر سلامة أكبر من نماذج الانتشار التقليدية من خلال توليد محتوى غير آمن بشكل أكبر عبر فهم دلالي متفوق والتهرب من الكشف بفعالية أكبر، مما يسلط الض الضوء على الحاجة الملحة لمعالجة هذه التحديات غير المعترف بها.

Ye Leng, Junjie Chu, Mingjie Li, Chenhao Lin, Chao Shen, Michael Backes, Yun Shen, Yang Zhang2026-03-26
💻 computer science

LaDy: Lagrangian-Dynamic Informed Network for Skeleton-based Action Segmentation via Spatial-Temporal Modulation

تقترح الورقة البحثية إطار عمل LaDy، وهو إطار عمل مبتكر لتجزئة الأفعال الزمنية القائمة على الهيكل العظمي، والذي يدمج ديناميكيات لاغرانج لتخليق القوى المعممة وفرض اتساق الطاقة، مما يعزز كلاً من القدرة على التمييز بين الفئات وتحديد الحدود من خلال وحدة تعديل زمانية-مكانية.

Haoyu Ji, Xueting Liu, Yu Gao, Wenze Huang, Zhihao Yang, Weihong Ren, Zhiyong Wang, Honghai Liu2026-03-26
💻 computer science

Granular Ball Guided Stable Latent Domain Discovery for Domain-General Crowd Counting

تقترح هذه الورقة إطار عمل موجهاً بكرات حبيبية يحقق اكتشافاً مستقراً للمجال الكامن من خلال التجميع الهرمي القائم على التمثيلات واستراتيجية تعلم ثنائية الفرع لفك تشابك الميزات الدلالية والأسلوبية، مما يحسن بشكل كبير من القدرة على التعميم في عد الحشود أحادي المصدر وعام المجال.

Fan Chen, Shuyin Xia, Yi Wang, Xinbo Gao2026-03-26
💻 computer science

Spectral Scalpel: Amplifying Adjacent Action Discrepancy via Frequency-Selective Filtering for Skeleton-Based Action Segmentation

تقترح الورقة البحثية "Spectral Scalpel" (المشرط الطيفي)، وهو إطار عمل جديد للترشيح الانتقائي للترددات لتقسيم الأفعال الزمنية القائم على الهيكل العظمي، والذي يعمل على تعزيز الفروقات بين الأفعال وتحديد الحواف بدقة عبر كبت المكونات الترددية المشتركة وتضخيم الترددات الخاصة بكل فعل بشكل تكيفي.

Haoyu Ji, Bowen Chen, Zhihao Yang, Wenze Huang, Yu Gao, Xueting Liu, Weihong Ren, Zhiyong Wang, Honghai Liu2026-03-26
💻 computer science

CarePilot: A Multi-Agent Framework for Long-Horizon Computer Task Automation in Healthcare

تقدم هذه الورقة CarePilot، وهو إطار عمل متعدد الوكلاء يستخدم نموذج الممثل-الناقد مع آليات ذاكرة مزدوجة للتغلب على قيود النماذج اللغوية الرؤية الحالية في أتمتة المهام الحاسوبية المعقدة وطويلة الأمد ضمن الأنظمة الصحية المتخصصة، محققاً أداءً هو الأفضل في فئته على مقياس CareFlow المقترح حديثاً.

Akash Ghosh, Tajamul Ashraf, Rishu Kumar Singh, Numan Saeed, Sriparna Saha, Xiuying Chen, Salman Khan2026-03-26
💻 computer science

Unlocking Few-Shot Capabilities in LVLMs via Prompt Conditioning and Head Selection

تقدم هذه الورقة البحثية مصنفات تجميع الرؤوس (HEC)، وهي طريقة لا تتطلب تدريباً تستفيد من التكييف عبر المطالبات واختيار رؤوس الانتباه التمييزية داخل نماذج اللغة والرؤية الكبيرة لتحقيق أداء رائد في تصنيف الصور بنمط الصفر (zero-shot) والقليل من الأمثلة (few-shot)، مما يسد بفعالية الفجوة بين نماذج اللغة والرؤية الكبيرة (LVLMs) والأساليب القائمة على نموذج CLIP.

Adhemar de Senneville, Xavier Bou, Jérémy Anger, Rafael Grompone, Gabriele Facciolo2026-03-26
💻 computer science

RVLM: Recursive Vision-Language Models with Adaptive Depth

تقدم الورقة البحثية إطار عمل RVLM، وهو إطار موحد يعزز الذكاء الاصطنا\\ الطبي من خلال الجمع بين حلقة "التوليد-التنفيذ" التكرارية للاستدلال القابل للتدقيق والمستند إلى الكود، وبين وحدة تحكم في العمق التكيفي (RRouter) التي تعمل على تحسين الموارد الحسابية بناءً على تعقيد المهمة، مما أظهر اتساقاً ودقة عاليين في مجموعات بيانات التصوير بالرنين المغناطيسي للدماغ والأشعة السينية للصدر.

Nicanor Mayumu, Zeenath Khan, Melodena Stephens, Patrick Mukala, Farhad Oroumchian2026-03-26
💻 computer science

Memory-Augmented Vision-Language Agents for Persistent and Semantically Consistent Object Captioning

تقدم هذه الورقة عميلاً موحداً للرؤية واللغة مدعوماً بالذاكرة، يعالج عدم الاتساق في وصف الأشياء عبر وجهات النظر المختلفة من خلال دمج ربط البيانات، والتعليق الوصفي، والاستكشاف في إطار عمل واحد ذاتي التراجع، محققاً تحسينات كبيرة في الاتساق الدلالي ودرجات التعليق الوصفي من خلال التدريب ذاتي الإشراف على بيئات ثلاثية الأبعاد واقعية للغاية.

Tommaso Galliena, Stefano Rosa, Tommaso Apicella, Pietro Morerio, Alessio Del Bue, Lorenzo Natale2026-03-26
💻 computer science

Accelerating Diffusion-based Video Editing via Heterogeneous Caching: Beyond Full Computing at Sampled Denoising Timestep

تقدم هذه الورقة البحثية HetCache، وهو إطار عمل لا يتطلب تدريباً يعمل على تسريع تحرير الفيديو القائم على النماذج الانتشارية من خلال استغلال التكرار الهيكلي داخل محولات الانتشار (Diffusion Transformers) لتخزين رموز السياق بشكل انتقائي، مما يحقق تسريعاً في زمن الاستجابة بمقدار 2.67 ضعفاً وخفضاً كبيراً في العمليات الحسابية (FLOPs) مع تدهور طفيف للغاية في الجودة.

Tianyi Liu, Ye Lu, Linfeng Zhang, Chen Cai, Jianjun Gao, Yi Wang, Kim-Hui Yap, Lap-Pui Chau2026-03-26
💻 computer science

TopoMesh: High-Fidelity Mesh Autoencoding via Topological Unification

يقدم TopoMesh مشفرًا تلقائيًا (VAE) قائمًا على الفوكسل المتناثر يوحد بين المشبكات الحقيقية والمتوقعة تحت إطار عمل طوبولوجي مشترك لـ "Dual Marching Cubes"، مما يتيح إشرافًا صريحًا على مستوى المشبك لتحسين إعادة البناء ثلاثي الأبعاد عالي الدقة والحفاظ على الميزات الحادة بشكل كبير مقارنة بالطرق الحالية.

Guan Luo, Xiu Li, Rui Chen, Xuanyu Yi, Jing Lin, Chia-Hao Chen, Jiahang Liu, Song-Hai Zhang, Jianfeng Zhang2026-03-26