💻 computer science

VIHD: Visual Intervention-based Hallucination Detection for Medical Visual Question Answering

تقترح الورقة البحثية VIHD، وهي طريقة مبتكرة للكشف عن الهلوسة في مهام الإجابة على الأسئلة البصرية الطبية، والتي تعمل على تحسين النهج الحالية من خلال تحديد طبقات فك التشفير المهيمنة بصرياً وتطبيق قناع للرموز البصرية المستهدفة لمعايرة الإنتروبيا الدلالية، مما يؤدي إلى كشف الهلوسة التي تفتقر إلى الأدلة البصرية بشكل أكثر فعالية.

Jiayi Chen, Benteng Ma, Zehui Liao, Winston Chong, Yasmeen George, Jianfei Cai2026-05-21
💻 computer science

AttriStory: Fine-grained Attribute Realization for Visual Storytelling with Diffusion Models

تقدم الورقة البحثية AttriStory، وهو معيار جديد ووحدة تحسين كامنة قابلة للتوصيل والتشغيل مع دالة خسارة متخصصة، لمعالجة الفجوة الحرجة المتمثلة في تحقيق السمات الدقيقة (مثل اللون والملمس) في السرد البصري مع الحفاظ على اتساق الشخصية عبر المشاهد السردية.

Manogna Sreenivas, Rohit Kumar, Soma Biswas2026-05-21
💻 computer science

Findings of the Counter Turing Test: AI-Generated Image Detection

تقدم هذه الورقة نتائج اختبار "تيرنج المضاد" (Counter Turing Test) الخاص بورشة عمل Defactify 4.0، والذي استخدم مجموعة بيانات MS COCOAI جديدة لإثبات أنه بينما يمكن اكتشاف الصور المُنشأة بواسطة الذكاء الاصطناعي بدقة عالية، فإن تحديد النموذج التوليدي المحدد المسؤول عنها يظل تحدياً كبيراً.

Rajarshi Roy, Nasrin Imanpour, Ashhar Aziz, Shashwat Bajpai, Gurpreet Singh, Shwetangshu Biswas, Kapil Wanaskar, Parth P (…)2026-05-21
💻 computer science

What Semantics Survive the Connector? Diagnosing VLM-to-DiT Alignment in Video Editing

تتحدى هذه الورقة الافتراض السائد بأن وحدات الربط يمكنها مواءمة نماذج الرؤية واللغة بسلاسة مع محولات الانتشار من أجل تحرير الفيديو، حيث تثبت من خلال مجموعة بيانات تشخيصية جديدة (TRACE-Edit) وبروتوكول خاص أن هذه المواءمة تعمل كعنق زجاجة دلالي شديد يؤدي إلى تدهور المتغيرات الهيكلية دقيقة التفاصيل.

Hangyu Lin, Chao Wen, Chengming Xu, Jianxiong Gao, Jiangning Zhang, Xiaobin Hu, Yanwei Fu2026-05-21
💻 computer science

HyDAR-Pano3D: A Hybrid Disentangled Anatomical Recovery Framework for Panoramic-to-3D Reconstruction

يُعد HyDAR-Pano3D إطار عمل هجينًا مبتكرًا ذا مرحلتين يعمل على فصل استعادة البنية التشريحية عن الاختلافات المورفولوجية الخاصة بكل مريض لتحقيق إعادة بناء ثلاثية الأبعاد عالية الدقة ومتينة سريريًا للتشريح القحفي الوجهي من الصور الشعاعية البانورامية ثنائية الأبعاد، متفوقًا بشكل كبير على طرق الانحدار المباشر الحالية.

Yaoyao Yue, Jérôme Schmid, Xiaoshuang Li, Eduardo Delamare, Jinman Kim2026-05-21
💻 computer science

USV: Towards Understanding the User-generated Short-form Videos

تقدم هذه الورقة البحثية USV، وهي مجموعة بيانات واسعة النطاق تضم 224 ألف فيديو قصير من إنشاء المستخدمين، صُممت لتعزيز الفهم الدلالي عالي المستوى للفيديو من خلال إنشاء مهام التعرف على المواضيع واسترجاع الفيديو والنص، مصحوبة بنماذج مرجعية مقترحة ومعايير شاملة.

Haoyue Cheng, Su Xu, Liwei Jin, Wayne Wu, Chen Qian, Limin Wang2026-05-21
🤖 machine learning

Activation-Free Backbones for Image Recognition: Polynomial Alternatives within MetaFormer-Style Vision Models

تقدم هذه الورقة PolyNeXt، وهي عائلة من النماذج الرؤيوية الأساسية الخالية من دوال التنشيط التي تستبدل الدوال غير الخطية القياسية ببدائل متعددة الحدود باستخدام نواتج هادامارد ضمن بنيات من طراز MetaFormer، محققةً أداءً هو الأفضل في حالته في مهام التعرف على الصور والتقسيم مع تقليل التكاليف الحسابية.

Jeffrey Wang, Jonathan Gregory, Grigorios G. Chrysos2026-05-21
💻 computer science

ProCrit: Self-Elicited Multi-Perspective Reasoning with Critic-Guided Revision for Multimodal Sarcasm Detection

تقترح هذه الورقة ProCrit، وهو إطار عمل "مقترح-ناقد" (proposal-critic) مبتكر يتيح الاستنتاج متعدد المنظور المستقل والمستخلص ذاتياً، والمراجعة المستهدفة بتوجيه من ناقد خارجي لتعزيز الكشف عن السخرية متعدد الوسائط من خلال التغلب على قيود المنظورات التحليلية الثابتة والمحددة مسبقاً.

Yingjia Xu, Jiulong Wu, Bowen Zhang, Baokui Guo, Siyuan Chai, Min Cao2026-05-21
💻 computer science

Map-Mono-Ego: Map-Grounded Global Human Pose Estimation from Monocular Egocentric Video

تقدم الورقة البحثية MapMonoEgo، وهو إطار عمل مبتكر يحقق تقديرًا متسقًا عالميًا للوضعية البشرية من فيديو أحادي المنظور من منظور الشخص الأول عبر الاستففادة من سحابة نقاط ثلاثية الأبعاد ممسوحة مسبقًا للتغلب على غموض المقياس والانزياح الانتقالي، والذي تم التحقق من صحته من خلال مجموعة بيانات AIST-Living الجديدة وأداء متفوق مقابل النماذج المرجعية الحالية.

Hiroyuki Deguchi, Ryosuke Hori, Kotaro Amaya, Tsubasa Maruyama, Mitsunori Tada, Hideo Saito2026-05-21
💻 computer science

FruitEnsemble: MLLM-Guided Arbitration for Heterogeneous ensemble in Fine-Grained Fruit Recognition

تقدم هذه الورقة FruitEnsemble، وهو إطار استدلال ديناميكي جديد يتكون من مرحلتين يجمع بين مجموعة غير متجانسة موزونة ونموذج لغوي كبير متعدد الوسائط (MLLM) للتحكيم الخبير، محققاً دقة هي الأفضل في حالتها في التعرف الدقيق على الفاكهة من خلال معالجة تحديات ندرة البيانات والتشابه البصري العالي.

Enhui Yu, Junhui Li, Ruitong Lu, Jialu Li, Youshan Zhang2026-05-21