💻 computer science

mKG-RAG: Leveraging Multimodal Knowledge Graphs in Retrieval-Augmented Generation for Knowledge-intensive VQA

تقترح هذه الورقة البحثية إطار عمل mKG-RAG، وهو إطار عمل جديد للتوليد المعزز بالاسترجاع يستفيد من الرسوم البيانية للمعرفة متعددة الوسائط واستراتيجية استرجاع ثنائية المرحلة للتغلب على قيود الطرق القائمة على المستندات غير المهيكلة، محققاً أداءً هو الأفضل في حالته في مجال الإجابة على الأسئلة البصرية كثيفة المعرفة.

Xu Yuan, Liangbo Ning, Qingqing Ye, Wenqi Fan, Qing Li2026-04-28
💻 computer science

Smoothing Slot Attention Iterations and Recurrences

تقدم هذه الورقة SmoothSA، وهي طريقة تعزز التعلم المرتكز على الأشياء من خلال تسخين الاستعلامات ذات البداية الباردة مسبقاً باستخدام سمات المدخلات، والتمييز بين تحويلات التجميع بين الإطارات الأولية واللاحقة لتحسين اكتشاف الأشياء، والتعرف عليها، والاستدلال البصري في كل من الصور ومقاطع الفيديو.

Rongzhen Zhao, Wenyan Yang, Juho Kannala, Joni Pajarinen2026-04-28
🔬 optics

Learning Binary Sampling Patterns for Single-Pixel Imaging using Bilevel Optimisation

تقترح هذه الورقة طريقة تحسين ثنائية المستوى باستخدام مُقدّر العبور المباشر (Straight-Through Estimator) والتنظيم التبايني المتعلم لتصميم أنماط إضاءة ثنائية محددة للمهام في التصوير أحادي البكسل، مما يظهر أداء إعادة بناء فائقاً في سيناريوهات نقص البيانات ونقص أخذ العينات الشديد.

Serban Cristian Tudosie, Alexander Denker, Zeljko Kereta, Simon Arridge2026-04-28
💻 computer science

Self-Rewarding Vision-Language Model via Reasoning Decomposition

تقدم الورقة البحثية Vision SR1، وهو إطار عمل للتعلم التعزيزي ذاتي المكافأة مكون من ثلاث مراحل يقوم بتفكيك الاستدلال إلى مكونات بصرية ولغوية للتخفيف من الهلوسة البصرية وتقليل الاعتماد على الاختصارات اللغوية في النماذج اللغوية البصرية دون الحاجة إلى إشراف بصري خارجي أو عبء إضافي على وحدة معالجة الرسومات.

Zongxia Li, Wenhao Yu, Chengsong Huang, Zhenwen Liang, Rui Liu, Fuxiao Liu, Jingxi Che, Dian Yu, Jordan Boyd-Graber, Hai (…)2026-04-28
💻 computer science

EMCompress: Video-LLMs with Endomorphic Multimodal Compression

تقدم هذه الورقة EMCompress، وهو إطار عمل مستوحى من الإدراك يصيغ ضغط الوسائط المتعددة الداخلي (EMC) كتحول هيكلي يحافظ على ثبات الإجابة لحل التوتر بين أخذ العينات الإطارية الثابتة والدلالات الزمنية دقيقة التفاصيل في الاستنتاج للفيديوهات الطويلة، محققاً مكاسب أداء كبيرة في نماذج الفيديو اللغوية الكبيرة (Video-LLMs).

Zheyu Fan, Jiateng Liu, Yuji Zhang, Zihan Wang, Yi R. Fung, Manling Li, Heng Ji2026-04-28
💻 computer science

BIR-Adapter: A parameter-efficient diffusion adapter for blind image restoration

تقدم الورقة البحثية BIR-Adapter، وهو محول انتشار (diffusion adapter) فعال في المعلمات وقابل للتوصيل والتشغيل، يحقق أداءً تنافسيًا في استعادة الصور العمياء بمعلمات مدربة أقل بما يصل إلى 36 ضعفًا من الطرق المتطورة، وذلك عبر الاستفادة من التمثيلات المعلوماتية من النماذج مسبقة التدريب وتوظيف آلية توجيه أخذ العينات للحد من الهلوسة.

Cem Eteke, Alexander Griessel, Wolfgang Kellerer, Eckehard Steinbach2026-04-28
💻 computer science

Animalbooth: multimodal feature enhancement for animal subject personalization

يُعد AnimalBooth إطار عمل مبتكر يعزز توليد صور الحيوانات المخصصة من خلال دمج شبكة حيوانية (Animal Net)، وانتباه تكيفي، وتكامل ميزات محكوم بالتردد للحد من انحراف الهوية وتحسين الدقة والجودة الإدراكية، مدعوماً بمجموعة بيانات AnimalBench الجديدة عالية الدقة والمعدة خصيصاً لهذا الغرض.

Chen Liu, Haitao Wu, Kafeng Wang, Weiran Huang2026-04-28
🤖 machine learning

What Drives Compositional Generalization? The Importance of Continuous Training Objectives in Visual Generative Models

تتقصى هذه الورقة البحثية الدوافع الكامنة وراء التعميم التركيبي في النماذج التوليدية البصرية، حيث تحدد أن التدريب على التوزيعات المستمرة وتوفير تكييف معلوماتي هما عاملان رئيسيان، وتُبين أن تعزيز النماذج المنفصلة بهدف إضافي مستمر قائم على نموذج (JEPA) يحسن قدرتها على توليد تركيبات مفاهيمية جديدة.

Karim Farid, Rajat Sahay, Yumna Ali Alnaggar, Simon Schrodi, Volker Fischer, Cordelia Schmid, Thomas Brox2026-04-28
🤖 machine learning

Resolution scaling governs DINOv3 transfer performance in chest radiograph classification

تُظهر هذه الدراسة أن DINOv3 يقدم أفضل أداء لتصنيف صور الأشعة السينية للصدر للبالغين عند استخدامه مع هيكل ConvNeXt-B بدقة 512x512، لا سيما في حالات الاعتلالات الصغيرة أو تلك المعتمدة على الحدود، رغم أن فوائده لا تمتد إلى مجموعات الأطفال أو الدقة الأعلى بشكل ملحوظ.

Soroosh Tayebi Arasteh, Mina Shaigan, Christiane Kuhl, Jakob Nikolas Kather, Sven Nebelung, Daniel Truhn2026-04-28
💻 computer science

ImmerIris: A Large-Scale Dataset and Benchmark for Off-Axis and Unconstrained Iris Recognition in Immersive Applications

تقدم هذه الورقة البحثية ImmerIris، وهي أكبر مجموعة بيانات عامة لقزحية العين حتى الآن تم جمعها عبر شاشات العرض المثبتة على الرأس للتطبيقات الغامرة، وتقترح نموذج تعرّف جديداً خالياً من المعايرة يتفوق على الطرق التقليدية من خلال التعلم المباشر من صور العين ذات المحور المنحرف والمعدلة بحد أدنى.

Yuxi Mi, Qiuyang Yuan, Zhizhou Zhong, Xuan Zhao, Jiaogen Zhou, Fubao Zhu, Jihong Guan, Shuigeng Zhou2026-04-28