💻 computer science

GraphLeap: Decoupling Graph Construction and Convolution for Vision GNN Acceleration on FPGA

تقدم هذه الورقة GraphLeap، وهو إطار عمل لإنشاء الرسوم البيانية والالتفاف المنفصل الذي يتيح المعالجة المتزامنة للتغلب على عنق الزجاجة الحسابي في الشبكات العصبية الرسومية للرؤية، والذي تم استغلاله بعد ذلك لبناء أول مسرع FPGA متكامل (end-to-end) يحقق تسريعًا يصل إلى 95.7 ضعفًا مقارنة بوحدات المعالجة المركزية و8.5 ضعفًا مقارنة بوحدات معالجة الرسومات.

Anvitha Ramachandran, Dhruv Parikh, Viktor Prasanna2026-04-24
💻 computer science

an interpretable vision transformer framework for automated brain tumor classification

تقدم هذه الورقة إطار عمل "ترانسفورمر رؤية" (Vision Transformer) قابلاً للتفسير يدمج المعالجة المسبقة المعززة بالتباين، واستراتيجيات التدريب المتقدمة، والتصور القائم على الانتباه لتحقيق دقة رائدة بلغت 99.29% في التصنيف الآلي لأورام الدماغ إلى أربع فئات من صور الرنين المغناطيسي.

Chinedu Emmanuel Mbonu, Tochukwu Sunday Belonwu, Okwuchukwu Ejike Chukwuogo, Kenechukwu Sylvanus Anigbogu2026-04-24
💻 computer science

The First Challenge on Remote Sensing Infrared Image Super-Resolution at NTIRE 2026: Benchmark Results and Method Overview

تقدم هذه الورقة نتائج المعايير المرجعية ونظرة عامة على المنهجية الخاصة بتحدي NTIRE 2026 لرفع دقة الصور بالأشعة تحت الحمراء للاستشعار عن بعد، والذي شاركت فيه 13 فرقًا للتنافس على استعادة صور الأشعة تحت الحمراء عالية الدقة من مدخلات منخفضة الدقة بهدف تطوير تطبيقات الاستشعار عن بعد في العالم الحقيقي.

Kai Liu, Haoyang Yue, Zeli Lin, Zheng Chen, Jingkai Wang, Jue Gong, Jiatong Li, Xianglong Yan, Libo Zhu, Jianze Li, Ziqi (…)2026-04-24
💻 computer science

Teacher-Guided Routing for Sparse Vision Mixture-of-Experts

تقترح الورقة البحثية TGR-MoE، وهي طريقة تعمل على تثبيت تدريب نماذج الرؤية من نوع "خليط الخبراء" (Vision Mixture-of-Experts) المتفرقة عبر استخدام مخرجات التوجيه من نموذج معلم كثيف مدرب مسبقاً كإشراف زائف لتوجيه اختيار الخبراء ومنع ديناميكيات التوجيه غير المستقرة.

Masahiro Kada, Ryota Yoshihashi, Satoshi Ikehata, Rei Kawakami, Ikuro Sato2026-04-24
💻 computer science

Latent Denoising Improves Visual Alignment in Large Multimodal Models

تقترح هذه الورقة إطار تدريب يعمل على تحسين المحاذاة البصرية والمتانة للنماذج اللغوية الكبيرة متعددة الوسائط من خلال تطبيق هدف إزالة الضجيج الكامن لاستعادة الميزات البصرية النظيفة من الرموز المشوهة، مما يعزز الأداء في كل من المعايير القياسية وتحت تغيرات التوزيع دون إضافة عبء حسابي عند الاستدلال.

Dhruv Parikh, Jacob Fein-Ashley, Rajgopal Kannan, Viktor Prasanna2026-04-24
💬 NLP

Beyond Single Plots: A Benchmark for Question Answering on Multi-Charts

تقدم هذه الورقة PolyChartQA، وهي مجموعة بيانات متوسطة الحجم من صور الرسوم البيانية المتعددة وأزواج الأسئلة والأجوبة المصممة لاختبار وتقييم أداء النماذج اللغوية متعددة الوسائط في استخلاص الرؤى من التصورات البيانية المعقدة والمتعددة.

Azher Ahmed Efat, Seok Hwan Song, Wallapak Tavanapong2026-04-24
💻 computer science

KD-CVG: A Knowledge-Driven Approach for Creative Video Generation

تقدم هذه الورقة البحثية إطار عمل KD-CVG، وهو إطار عمل قائم على المعرفة يستفيد من قاعدة معرفية شاملة للإعلانات الإبداعية ووحدتين جديدتين — هما الاسترجاع الواعي دلاليًا والمرجع المعرفي متعدد الوسائط — للتغلب على تحديات المحاذاة الدلالية والتكيف مع الحركة في توليد الفيديوهات الإبداعية للإعلانات.

Linkai Liu, Wei Feng, Xi Zhao, Shen Zhang, Xingye Chen, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Yuchen Zhou, Z (…)2026-04-24
💻 computer science

VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought

تقدم هذه الورقة VG-CoT، وهي مجموعة بيانات ومعيار يتم إنشاؤهما تلقائيًا وبشكل قابل للتوسع، يعززان موثوقية نماذج اللغة والرؤية الكبيرة من خلال ربط الاستدلال متعدد الخطوات بالأدلة البصرية المرتكزة صراحةً عبر مسار مكون من ثلاث مراحل، وتقييم الأداء عبر جودة المبررات، ودقة الإجابة، والتوافق بين الاستدلال والإجابة.

Byeonggeuk Lim, Kyeonghyun Kim, JungMin Yun, YoungBin Kim2026-04-24
💻 computer science

Pre-process for segmentation task with nonlinear diffusion filters

تقترح هذه الورقة عائلة جديدة من مرشحات الانتشار غير الخطي المصممة لمعالجة الصور مسبقاً لغرض التجزئة، وذلك عبر توليد صور ذات ثبات جزئي مع حواف حادة وغير ضبابية، مع توفير إطار نظري يضمن سلامة المسألة ويثبت فعالية الطريقة على صور حقيقية.

Javier Sanguino, Carlos Platero, Olga Velasco2026-04-24
💻 computer science

Do MLLMs Understand Pointing? Benchmarking and Enhancing Referential Reasoning in Egocentric Vision

تقدم هذه الورقة البحثية EgoPoint-Bench، وهو معيار شامل يضم أكثر من 11,000 عينة لتقييم ومعالجة "الهلوسة المرجعية" في النماذج اللغوية الكبيرة متعددة الوسائط، مما يثبت أن الضبط الدقيق على بياناتها الاصطناعية يعزز بشكل كبير التمركز المكاني الدقيق لإيماءات الإشارة من منظور الشخص الأول.

Chentao Li, Zirui Gao, Mingze Gao, Yinglian Ren, Jianjiang Feng, Jie Zhou2026-04-24