💻 computer science

ASGNet: Adaptive Spectrum Guidance Network for Automatic Polyp Segmentation

تقترح هذه الورقة شبكة التوجيه الطيفي التكيفية (ASGNet)، التي تتغلب على قيود الإدراك المحلي لأساليب التعلم العميق الحالية من خلال دمج الميزات الطيفية مع السمات العالمية عبر وحدة إدراك غير محلي موجهة طيفياً، ومستخرج دلالي متعدد المصادر، وفك تشفير تفاعلي كثيف عبر الطبقات، محققةً أداءً فائقاً في تقسيم السلائل عبر خمس معايير مقارنة بـ 21 نهجاً من أحدث التقنيات المتاحة.

Yanguang Sun, Hengmin Zhang, Jianjun Qian, Jian Yang, Lei Luo2026-04-17
💬 NLP

Knowing When Not to Answer: Evaluating Abstention in Multimodal Reasoning Systems

تقدم هذه الورقة معيار MM-AQA لتقييم الامتناع الفعال في الأنظمة متعددة الوسائط، كاشفةً أن النماذج الحالية للرؤية واللغة والأنظمة متعددة الوكلاء نادراً ما تمتنع عن الإجابة على الأسئلة غير القابلة للإجابة، وأن تحسين هذه القدرة يتطلب تدريباً مدركاً للامتناع بدلاً من الاعتماد على تحسين التلقين أو زيادة تعقيد الوكيل.

Nishanth Madhusudhan, Vikas Yadav, Alexandre Lacoste2026-04-17
💻 computer science

NTIRE 2026 Challenge on Video Saliency Prediction: Methods and Results

تقدم هذه الورقة تحدي NTIRE 2026 حول التنبؤ بالبروز في الفيديو، حيث تفصل إنشاء مجموعة بيانات جديدة ذات ترخيص مفتوح تضم أكثر من 5,000 مُقيّم، ومشاركة 20 فريقاً، وتقييم سبع طرق نهائية على 800 فيديو اختبار، مع إتاحة جميع الموارد للعموم.

Andrey Moskalenko, Alexey Bryncev, Ivan Kosmynin, Kira Shilovskaya, Mikhail Erofeev, Dmitry Vatolin, Radu Timofte, Kun W (…)2026-04-17
🤖 AI

MetaDent: Labeling Clinical Images for Vision-Language Models in Dentistry

تقدم هذه الورقة MetaDent، وهو مورد شامل يتألف من مجموعة بيانات لصور الأسنان واسعة النطاق، وإطار عمل جديد للتعليق التوضيحي شبه المهيكل، ومعايير قياسية مستمدة عبر النماذج اللغوية الكبيرة (LLMs)، لمعالة ندرة البيانات المصنفة دقيقة التفاصيل وتقييم القيود الحالية للنماذج الرؤية-اللغوية في فهم الصور السريرية داخل الفم.

Meng-Xun Li, Wen-Hui Deng, Zhi-Xing Wu, Chun-Xiao Jin, Jia-Min Wu, Yue Han, James Kit Hon Tsoi, Gui-Song Xia, Cui Huang2026-04-17
💬 NLP

Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models

تكشف هذه الورقة أنه بينما تُظهر نماذج الرؤية واللغة المدربة على الاستنتاج سلوكيات تصحيحية أقوى، إلا أنها تظل عرضة لـ "قصور ذاتي في الإجابة" وإشارات نصية مضللة يمكن أن تحجب الاعتماد على النمط، مما يثبت أن تفسيرات "سلسلة الأفكار" توفر رؤية جزئية ومضللة محتملة لكيفية دمج هذه النماذج للمعلومات البصرية والنصية.

Danae Sánchez Villegas, Samuel Lewis-Lim, Nikolaos Aletras, Desmond Elliott2026-04-17
🤖 AI

ADAPT: Benchmarking Commonsense Planning under Unspecified Affordance Constraints

تقدم الورقة البحثية DynAfford، وهو معيار لتقييم الوكلاء المتجسدين في البيئات الديناميكية ذات قيود الإمكانيات غير المحددة، وتقترح ADAPT، وهي وحدة قابلة للتشغيل المباشر تعزز متانة التخطيط من خلال دمج الاستدلال الصريح على الإمكانيات المدعوم بنموذج رؤية ولغة متكيف مع المجال.

Pei-An Chen, Yong-Ching Liang, Jia-Fong Yeh, Hung-Ting Su, Yi-Ting Chen, Min Sun, Winston Hsu2026-04-17
💻 computer science

Prompt-to-Gesture: Measuring the Capabilities of Image-to-Video Deictic Gesture Generation

تقدم هذه الورقة مساراً يستفيد من النماذج التأسيسية لتحويل الصور إلى فيديو لتوليد بيانات إيماءات إشارية واقعية ومتغيرة من عينات بشرية محدودة، مما يثبت أن هذه البيانات الاصطناعية تعزز بفعالية مجموعات البيانات التقليدية وتحسن أداء النماذج في المهام اللاحقة.

Hassan Ali, Doreen Jirak, Luca Müller, Stefan Wermter2026-04-17
🤖 AI

UniDoc-RL: Coarse-to-Fine Visual RAG with Hierarchical Actions and Dense Rewards

يُعد UniDoc-RL إطار عمل موحداً للتعلم التعزيزي يعمل على تعزيز تقنية الـ Visual RAG من خلال صياغة عملية اكتساب المعلومات المرئية كمسألة اتخاذ قرار متسلسل ذات إجراءات هرمية ومكافآت كثيفة، مما يمكّن وكيل نماذج اللغة الكبيرة متعددة الوسائط (LVLM) من تنقيح الأدلة تدريجياً بدءاً من الاسترجاع العام للمستندات وصولاً إلى الاقتصاص الدقيق للمناطق لتحقيق استدلال معقد فائق الجودة.

Jun Wang, Shuo Tan, Zelong Sun, Tiancheng Gu, Yongle Zhao, Ziyong Feng, Kaicheng Yang, Cewu Lu2026-04-17
💻 computer science

Implicit Neural Representations: A Signal Processing Perspective

تستعرض هذه المقالة التمثيلات العصبية الضمنية (INRs) من منظور معالجة الإشارات، متتبعةً تطورها من الشبكات القائمة على الإحداثيات إلى البنيات المتقدمة التي تتغلب على الانحياز الطيفي، مع تسليط الضوء على تطبيقاتها في مجالات متنوعة وتحديد التحديات النظرية الرئيسية.

Dhananjaya Jayasundara, Vishal M. Patel2026-04-17
💻 computer science

Attention-Gated Convolutional Networks for Scanner-Agnostic Quality Assessment

تقترح هذه الورقة إطار عمل هجينًا يجمع بين الشبكات العصبية الالتفافية (CNN) وآلية الانتباه (Attention) يحقق كشفًا قويًا ومستقلاً عن نوع الماسح الضوئي لآثار الحركة في التصوير بالرنين المغناطيسي البنيوي، وذلك عبر دمج استخراج الميزات المكانية الهرمية مع آلية الانتباه المتقاطع متعدد الرؤوس لإعطاء الأولوية لبصمات الآثار العامة مع تصفية الاختلافات الخاصة بكل موقع، مما يثبت دقة عالية في كل من مجموعات البيانات المرئية وغير المرئية دون الحاجة لإعادة التدريب.

Chinmay Bakhale, Anil Sao2026-04-17