💻 computer science

ReMATF: Recurrent Motion-Adaptive Multi-scale Turbulence Mitigation for Dynamic Scenes

يُعدُّ MatRF إطار عمل متكرر وخفيف الوزن يعمل على تخفيف حدة الاضطرابات الجوية في المشاهد الديناميكية من خلال استخدام مشفر-فك تشفير متعدد المقاييس ودمج زمني متكيف مع الحركة على إطارين فقط، محققاً جودة بصرية وتناسقاً زمنياً فائقين بتكاليف حوسبة أقل بكثير من الطرق الحالية القائمة على المحولات متعددة الإطارات.

Zhiming Liu, Zhicheng Zou, Nantheera Anantrasirichai2026-05-21
🧬 biology

ProtoPathway: Biologically Structured Prototype-Pathway Fusion for Multimodal Cancer Survival Prediction

يُعد ProtoPathway إطار عمل متعدد الوسائط مصمماً ليكون قابلاً للتفسير، حيث يدمج صور الشرائح الكاملة والبيانات النسخية عبر نماذج شكلية قابلة للتعلم وتضمينات مسارات Reactome لتحقيق تنبؤ تنافسي ببقاء مرضى السرطان مع قابلية تفسير أصيلة ومبنية بيولوجياً عبر الجينات والمسارات ومورفولوجيا الأنسجة.

Amaya Gallagher-Syed, Costantino Pitzalis, Myles J. Lewis, Michael R. Barnes, Gregory Slabaugh2026-05-21
💻 computer science

WikiVQABench: A Knowledge-Grounded Visual Question Answering Benchmark from Wikipedia and Wikidata

تقدم الورقة البحثية WikiVQABench، وهو معيار تم تنسيقه بشرياً يجمع بين صور ويكيبيديا وتوضيحاتها وبيانات ويكيداتا لتقييم قدرات الاستدلال القائمة على المعرفة لنماذج الرؤية واللغة من خلال أسئلة متعددة الخيارات تتطلب معلومات خارجية تتجاوز الإدراك البصري.

Basel Shbita, Pengyuan Li, Anna Lisa Gentile2026-05-21
📊 statistics

Variance Reduction for Expectations with Diffusion Teachers

تقدم الورقة البحثية إطار عمل CARV، وهو إطار لتقليل التباين مدرك للحوسبة يستفيد من الحسابات المسبقة المستهلكة (amortized upstream computations)، وأخذ عينات الأهمية للخطوات الزمنية، وبناء دالة التوزيع التراكمي العكسي الطبقي (stratified-inverse-CDF) لخفض تباين مُقدّر مونت كارلو بشكل كبير وتحسين كفاءة الحوسبة في مسارات الانتشار (diffusion-based pipelines) مثل تحويل النص إلى ثلاثي الأبعاد (text-to-3D) وإسناد البيانات (data attribution).

Jesse Bettencourt, Xindi Wu, Matan Atzmon, James Lucas, Jonathan Lorraine2026-05-21
💻 computer science

TextBoost: Boosting Text Encoder for Personalized Text-to-Image Generation

يُعد TextBoost طريقة فعالة للتخصيص من خطوة واحدة لنماذج الانتشار من النص إلى الصورة، حيث يحقق توليدًا عالي الجودة ومتنوعًا ودقيقًا من خلال الضبط الدقيق الانتقائي للمُشفر النصي باستخدام آلية حافظة للسببية ومهايئات خفيفة الوزن، مما يقلل بشكل كبير من متطلبات التخزين ووقت التقارب مقارنة بالأساليب التقليدية.

NaHyeon Park, Kunhee Kim, Hyunjung Shim2026-05-20
⚡ electrical engineering

Rapid patient-specific neural networks for intraoperative X-ray to volume registration

تقدم الورقة البحثية **xvr**، وهو إطار عمل للتعلم الذاتي يجمع بين نموذج تأسيسي شامل للتشريح وشبكات عصبية خاصة بكل مريض لتحقيق تسجيل ثنائي وثلاثي الأبعاد سريع وعالي الدقة وقابل للتعميم للتوجيه بالأشعة السينية أثناء العمليات الجراحية دون الحاجة إلى تعليقات توضيحية يدوية.

Vivek Gopalakrishnan, David-Dimitris Chlorogiannis, Andrew Abumoussa, Anna M. Larson, Nazim Haouchine, Darren B. Orbach (…)2026-05-20
🤖 machine learning

Less is More: Efficient Black-box Attribution via Minimal Interpretable Subset Selection

تقدم هذه الورقة البحثية LiMA، وهي طريقة عزو (attribution) جديدة تعتمد على الصندوق الأسود (black-box)، والتي تعيد صياغة تحديد مناطق المدخلات المؤثرة كمسألة اختيار مجموعة فرعية تحت مجموعية (submodular subset selection)، وتستخدم خوارزمية بحث جشعة ثنائية الاتجاه لتحقيق تفسيرات أكثر دقة وكفاءة وقابلية للتعميم مع تحسن ملحو-ظ في مقاييس الأداء مقارنة بالنهج الرائدة الحالية.

Ruoyu Chen, Siyuan Liang, Jingzhi Li, Shiming Liu, Li Liu, Hua Zhang, Xiaochun Cao2026-05-20
🤖 AI

Slot-MLLM: Object-Centric Visual Tokenization for Multimodal LLM

تقدم هذه الورقة البحثية Slot-MLLM، وهو إطار عمل مبتكر يستخدم أداة ترميز بصري متمحورة حول الكائنات تعتمد على "انتباه الفتحة" (Slot Attention) لتمكين النماذج اللغوية الكبيرة متعددة الوسائط من ترميز وتوليد محتوى بصري تفصيلي على مستوى الكائن بفعالية ضمن نموذج تنبؤ الرمز التالي الموحد.

Donghwan Chi, Hyomin Kim, Yoonjin Oh, Yongjin Kim, Donghoon Lee, Daejin Jo, Jongmin Kim, Junyeob Baek, Sungjin Ahn, Sung (…)2026-05-20
💻 computer science

USIGAN: Unbalanced Self-Information Feature Transport for Weakly Paired Image IHC Virtual Staining

تقترح الورقة البحثية USIGAN، وهو نموذج توليدي مبتكر يستخدم نقل ميزات المعلومات الذاتية غير المتوازنة وآليات اتساق متخصصة لتحقيق صبغ افتراضي لصبغة الكيمياء النسيجية المناعية (IHC) عالي الجودة ومتسق مرضياً من صور صبغة الهيماتوكسيلين والإيوسين (H&E) في ظل ظروف الاقتران الضعيف، وذلك من خلال التخفيف الفعال من عدم التجانس المكاني والخرائط غير الدقيقة.

Yue Peng, Bing Xiong, Fuqiang Chen, De Eybo, RanRan Zhang, Wanming Hu, Jing Cai, Wenjian Qin2026-05-20
💻 computer science

MapAnything: Evaluating Monocular Metric Depth Models for 3D Urban Asset Localization

تقدم هذه الورقة "MapAnything"، وهو إطار عمل مبتكر يعمل على أتمتة التحديد الجغرافي ثلاثي الأبعاد للأجسام والحوادث الحضرية من صور أحادية العدسة (monocular images) عبر الاستفادة من نماذج تقدير العمق المتري، محققاً دقة عالية تم التحقق منها مقابل بيانات "ليدار" (LiDAR) من أجل إدارة قابلة للتوسع للأصول الحضرية.

Miriam Louise Carnot, Jonas Kunze, Erik Quinten Fastermann, Eric Peukert, André Ludwig, Bogdan Franczyk2026-05-20