🤖 AI

Imitation Game for Adversarial Disillusion with Chain-of-Thought Reasoning in Generative AI

تقترح هذه الورقة إطار دفاع موحد يسمى "لعبة التقليد"، والذي يستخدم عميلاً توليدياً متعدد الوسائط مدفوعاً بسلسلة من الأفكار لتحييد الأوهام العدائية الاستنتاجية والاستقرائية من خلال إعادة بناء الجوهر الدلالي للمدخلات بدلاً من عكسها إلى حالتها الأصلية.

Ching-Chun Chang, Fan-Yun Chen, Shih-Hong Gu, Kai Gao, Hanrui Wang, Isao Echizen2026-05-01
💻 computer science

Primus: Enforcing Attention Usage for 3D Medical Image Segmentation

تقدم هذه الورقة بحثاً حول Primus وPrimusV2، وهما أول بنيات معمارية تنافسية ترتكز على نماذج المحولات (Transformer) لتقسيم الصور الطبية ثلاثية الأبعاد، والتي تتغلب على قيود النماذج الهجينة من خلال تعظيم استخدام آلية الانتباه، محققةً بذلك أداءً هو الأفضل في فئته يتفوق على أو يضاهي الأساليب الرائدة القائمة على الشبكات العصبية الالتفافية (CNN) عبر تسعة مجموعات بيانات عامة.

Tassilo Wald, Saikat Roy, Fabian Isensee, Constantin Ulrich, Sebastian Ziegler, Dasha Trofimova, Raphael Stock, Michael (…)2026-05-01
🤖 AI

A Woman with a Knife or A Knife with a Woman? Measuring Directional Bias Amplification in Image Captions

تقدم هذه الورقة البحثية "تضخيم الانحياز الاتجاهي في الوصف" (DBAC)، وهو مقياس جديد مدرك للغة يتغلب على قيود الطرق الحالية من خلال القياس الدقيق وتحديد مصادر تضخيم الانحياز في نماذج وصف الصور، لا سيما فيما يتعلق بسمات النوع الاجتماعي والعرق.

Rahul Nair, Bhanu Tokas, Hannah Kerner2026-05-01
💻 computer science

GuideDog: A Real-World Egocentric Multimodal Dataset for Blind and Low-Vision Accessibility-Aware Guidance

تقدم هذه الورقة GuideDog، وهو مجموعة بيانات جديدة متعددة الوسائط من منظور الشخص الأول في العالم الحقيقي تضم 22,000 زوج من الصور والأوصاف من 46 دولة ومعياراً مرجعياً مطابقاً، صُممت لتعزيز الملاحة الواعية بإمكانيات الوصول للأفراد المكفوفين وضعاف البصر من خلال الاستفيد من مسار تحقق بشري-ذكاء اصطناعي قابل للتوسع يرتكز على معايير الخبراء.

Junhyeok Kim, Jaewoo Park, Junhee Park, Sangeyl Lee, Jiwan Chung, Jisung Kim, Ji Hoon Joung, Youngjae Yu2026-05-01
💬 NLP

Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues

تكشف هذه الورقة أن نماذج الرؤية واللغة تظهر أداءً أقل بكثير من البشر في استنتاج اتجاه نظرة العين لأنها تعتمد بشكل خاطئ على اتجاه الرأس بدلاً من مظهر العين، وهو انحياز يُعزى إلى بيانات التدريب وليس إلى بنية النموذج.

Zory Zhang, Pinyuan Feng, Bingyang Wang, Tianwei Zhao, Suyang Yu, Qingying Gao, Hokin Deng, Ziqiao Ma, Yijiang Li, Dezhi (…)2026-05-01
💬 NLP

Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs

تقدم هذه الورقة VISE، وهو أول معيار لتقييم التملق في النماذج اللغوية الكبيرة المرئية (Video-LLMs) من خلال تحليل ميلها للتماشي مع مدخلات المستخدم المضللة على حساب الأدلة البصرية، وتقترح استراتيجيتين لا تعتمدان على التدريب للتخفيف من هذا الانحياز عبر تعزيز التجذر البصري والتدخل أثناء الاستنتاج.

Wenrui Zhou, Mohamed Hendy, Shu Yang, Qingsong Yang, Zikun Guo, Yuyu Luo, Lijie Hu, Di Wang2026-05-01
🤖 AI

Tell-Tale Watermarks for Explanatory Reasoning in Synthetic Media Forensics

تقترح هذه الورقة نظام علامات مائية "كاشف" مبتكرًا يستخدم أدلة قابلة للتفسير ومستجيبة للتحويل لإعادة بناء سلسلة توليد الوسائط الاصطناعية وإجراء استدلال تفسيري حول تسلسل التعديلات المحددة التي طُبقت، مما يساعد في التحليل الجنائي للتمييز بين الواقع والتزييف.

Ching-Chun Chang, Isao Echizen2026-05-01
💻 computer science

Rethinking Pulmonary Embolism Segmentation: A Study of Current Approaches and Challenges with an Open Weight Model

تعالج هذه الدراسة القيود الحرجة في أبحاث تجزئة الانصمام الرئوي من خلال تنسيق مجموعة بيانات جديدة مكونة من 490 مسحاً، وتقييم تسع بنيات ثنائية وثلاثية الأبعاد بشكل منهجي لإثبات أن نماذج 3D U-Net مع مشفرات ResNet تتفوق على النماذج الأخرى، وإصدار نموذج مفتوح الأوزان هو الأفضل أداءً لتعزيز قابلية التكرار وتسليط الضوء على التحديات المستمرة في اكتشاف الانصمام البعيد.

Yixin Zhang, Ryan Chamberlain, Lawrence Ngo, Kevin Kramer, Maciej A. Mazurowski2026-05-01
🤖 AI

Focal Modulation and Bidirectional Feature Fusion Network for Medical Image Segmentation

تقترح الورقة البحثية شبكة FM-BFF-Net، وهي شبكة هجينة لتقسيم الصور الطبية تدمج بين مكونات تلافيفية ومكونات محولة مع تعديل بؤري ودمج ميزات ثنائي الاتجاه لالتقاط السياق العالمي بفعالية وتعزيز دقة الحدود، محققةً أداءً هو الأفضل في فئته عبر ثماني مجموعات بيانات متنوعة للتصوير الطبي.

Moin Safdar, Shahzaib Iqbal, Mubeen Ghafoor, Tariq M. Khan, Imran Razzak, Thantrira Porntaveetus, Hamid Alinejad-Rokny2026-05-01
🤖 machine learning

PVeRA: Probabilistic Vector-Based Random Matrix Adaptation

تقدم هذه الورقة البحثية PVeRA، وهي امتداد احتمالي لمحول VeRA يقوم بتعديل مصفوفاته منخفضة الرتبة المشتركة للتعامل بشكل أفضل مع غموض المدخلات وتحقيق أداء متفوق في معيار VTAB-1k مقارنة بطرق التكيف الفعالة في المعلمات الموجودة.

Leo Fillioux, Enzo Ferrante, Paul-Henry Cournède, Maria Vakalopoulou, Stergios Christodoulidis2026-05-01