💻 computer science

Few-Shot Generative Model Adaption via Identity Injection and Preservation

تقترح هذه الورقة إطار عمل "حقن وحفظ الهوية" (I2^2P)، وهو إطار عمل مبتكر يخفف من نسيان الهوية في تكييف النماذج التوليدية في حالات التعلم بلقطات قليلة، وذلك عبر دمج معرفة هوية النطاق المصدر في الفضاء الكامن للنطاق المستهدف وفرض قيود الاتساق من خلال وحدة استبدال هوية متخصصة.

Yeqi He, Liang Li, Jiehua Zhang, Yaoqi Sun, Xichun Sheng, Zhidong Zhao, Chenggang Yan2026-03-25
💻 computer science

Zero-Shot Personalization of Objects via Textual Inversion

تقترح هذه الورقة إطار عمل جديداً، لا يتطلب تدريباً، يحقق تخصيصاً سريعاً وصفرياً (zero-shot) لأي كائن في نماذج الانتشار عبر استخدام شبكة متعلمة للتنبؤ بتمثيلات قلب النص (textual inversion embeddings) الخاصة بالكائن، مما يتغلب على قيود الأساليب الحالية التي تركز بشكل أساسي على الأشخاص.

Aniket Roy, Maitreya Suin, Rama Chellappa2026-03-25
🤖 AI

Concept-based explanations of Segmentation and Detection models in Natural Disaster Management

تقترح هذه الورقة إطار عمل جديداً للقابلية للتفسير يوسع نطاق انتشار الصلة على مستوى الطبقات (Layer-wise Relevance Propagation) ليشمل نموذج PIDNet، ويطبق التفسيرات القائمة على المفاهيم النموذجية (Prototypical Concept-based Explanations) على نموذج YOLO، مما يتيح رؤى شفافة على مستوى المفاهيم لنماذج تقسيم الفيضانات وكشف السيارات مع الحفاظ على الأداء في الوقت الفعلي المطلوب للنشر على الطائرات بدون طيار (UAVs) محدودة الموارد في إدارة الكوارث الطبيعية.

Samar Heydari, Jawher Said, Galip Ümit Yolcu, Evgenii Kortukov, Elena Golimblevskaia, Evgenios Vlachos, Vasileios Mygdal (…)2026-03-25
💻 computer science

Cog3DMap: Multi-View Vision-Language Reasoning with 3D Cognitive Maps

يعالج Cog3DMap محدودية الاستدلال المكاني في النماذج اللغوية الكبيرة متعددة الوسائط من خلال تقديم إطار عمل يقوم بشكل متكرر ببناء خريطة معرفية ثلاثية الأبعاد صريحة وذات أساس هندسي من صور متعددة الزوايا، مما يتيح الاستدلال المباشر على البيانات ذات البنية المكانية ويحقق أداءً هو الأفضل في فئته.

Chanyoung Gwak, Yoonwoo Jeong, Byungwoo Jeon, Hyunseok Lee, Jinwoo Shin, Minsu Cho2026-03-25
💬 NLP

YOLOv10 with Kolmogorov-Arnold networks and vision-language foundation models for interpretable object detection and trustworthy multimodal AI in computer vision perception

تقترح هذه الورقة إطار عمل لتفسير كشف الأشياء يعزز موثوقية YOLOv10 في الأنظمة ذاتية القيادة من خلال توظيف شبكات كولموغوروف-أرنولد لتصور موثوقية الثقة القائمة على الميزات، ودمج نماذج BLIP التأسيسية لفهم المشهد متعدد الوسائط.

Marios Impraimakis, Daniel Vazquez, Feiyu Zhou2026-03-25
🤖 machine learning

HUydra: Full-Range Lung CT Synthesis via Multiple HU Interval Generative Modelling

تقدم هذه الورقة HUydra، وهو إطار عمل توليدي مبتكر يتغلب على التحديات الحسابية لتوليد صور الأشعة المقطعية للرئة بكامل نطاق وحدات هونسفيلد (HU) من خلال تفكيك نطاق وحدات هونسفيلد إلى فترات محددة لكل نوع من الأنسجة للنمذجة الفردية ثم إعادة بناء المسح الكامل، مما يحقق دقة بصرية وتناسقاً تشريحياً وكفاءة متفوقة مقارنة بالنماذج المرجعية التقليدية.

António Cardoso, Pedro Sousa, Tania Pereira, Hélder P. Oliveira2026-03-25
💻 computer science

MLLM-HWSI: A Multimodal Large Language Model for Hierarchical Whole Slide Image Understanding

يُعدُّ MLLM-HWSI نموذجًا لغويًا كبيرًا متعدد الوسائط ومبتكرًا يطور علم الأمراض الحسابي من خلال محاذاة الميزات المرئية مع اللغة عبر أربعة مستويات هرمية — من الخلايا إلى الشرائح الكاملة — مما يُمكِّن من الاستدلال القابل للتفسير والمستند إلى الأدلة ويحقق أداءً رائدًا في المهام التشخيصية المتنوعة.

Basit Alawode, Arif Mahmood, Muaz Khalifa Al-Radi, Shahad Albastaki, Asim Khan, Muhammad Bilal, Moshira Ali Abdalla, Moh (…)2026-03-25
💻 computer science

Automatic Segmentation of 3D CT scans with SAM2 using a zero-shot approach

تثبت هذه الورقة البحثية جدوى التقسيم ثلاثي الأبعاد للصور الطبية بنمط "الصفر استباقي" (zero-shot) بالكامل من خلال تكييف نموذج (SAM2) مع بيانات التصوير المقطعي المحوسب الحجمية عبر تعديلات تعتمد على الاستنتاج فقط، والتي تعامل الشرائح كمتتاليات مرتبة، محققةً نتائج متماسكة على مجموعة بيانات (TotalSegmentator) دون الحاجة إلى أي ضبط دقيق.

Miquel Lopez Escoriza, Pau Amargant Alvarez2026-03-25
💻 computer science

SMSP: A Plug-and-Play Strategy of Multi-Scale Perception for MLLMs to Perceive Visual Illusions

تقدم هذه الورقة مجموعة بيانات IlluChar وإطار عمل SMSP القابل للتوصيل والتشغيل لمعالجة ضعف النماذج اللغوية الكبيرة متعددة الوسائط تجاه الأوهام البصرية الناتجة عن انحياز الانتباه عالي التردد، مما يحسن دقة إدراكها بشكل كبير من خلال التوافق مع الاستراتيجيات البصرية البشرية.

Jinzhe Tu, Ruilei Guo, Zihan Guo, Junxiao Yang, Shiyao Cui, Minlie Huang2026-03-25
💻 computer science

3rd Place of MeViS-Audio Track of the 5th PVUW: VIRST-Audio

يُعد VIRST-Audio إطار عمل عملي حقق المركز الثالث في مسار MeViS-Audio ضمن تحدي PVUW الخامس عبر تحويل الاستعلامات الصوتية إلى نصوص بواسطة تقنية التعرف التلقائي على الكلام (ASR) لأغراض التجزئة، وتوظيف آلية بوابية مدركة للوجود لتعزيز المتانة والحد من الأقنعة المهلوسة.

Jihwan Hong, Jaeyoung Do2026-03-25