⚡ electrical engineering

Automated Histopathology Report Generation via Pyramidal Feature Extraction and the UNI Foundation Model

تقترح هذه الورقة إطار عمل هرمي للرؤية واللغة يستفيد من نموذج UNI التأسيسي المجمد لاستخراج ميزات الرقع الهرمية متعددة الدقة، ومن مُفكك شفرة "ترانسفورمر" (Transformer decoder) المرمز بنموذج BioGPT لتوليد تقارير تشخيصية من صور الأنسجة المرضية ذات الجيجابكسل، مع تعزيز الموثوقية بشكل أكبر من خلال خطوة تحقق قائمة على الاسترجاع.

Ahmet Halici, Ece Tugba Cebeci, Musa Balci, Mustafa Cini, Serkan Sokmen2026-02-19
🤖 machine learning

Let's Split Up: Zero-Shot Classifier Edits for Fine-Grained Video Understanding

تقدم هذه الورقة البحثية "تقسيم الفئات" (category splitting)، وهي طريقة تحرير من نوع "التعلم الصفري" (zero-shot) تعمل على تنقيح مصنفات الفيديو الخشنة إلى فئات فرعية دقيقة عبر الاستفادة من البنية التركيبية الكامنة، مما يتيح التكيف مع التمايزات الناشئة دون الحاجة لإعادة تدريب مكلفة مع الحفاظ على الأداء في الفئات الموجودة مسبقاً.

Kaiting Liu, Hazel Doughty2026-02-19
💻 computer science

Arc2Morph: Identity-Preserving Facial Morphing with Arc2Face

تقدم هذه الورقة البحثية Arc2Morph، وهي تقنية جديدة لدمج الوجوه تعتمد على التعلم العميق وتستفيد من نموذج Arc2Face التأسيسي، والتي تحقق هجمات دمج مع الحفاظ على الهوية بفعالية تضاهي الطرق التقليدية القائمة على المعالم، مما يشكل تحدياً كبيراً لأنظمة التعرف على الوجوه الحالية.

Nicolò Di Domenico, Annalisa Franco, Matteo Ferrara, Davide Maltoni2026-02-19
💻 computer science

Unpaired Image-to-Image Translation via a Self-Supervised Semantic Bridge

تقترح هذه الورقة "الجسر الدلالي ذاتي الإشراف" (SSB)، وهو إطار عمل يستفيد من المشفرات البصرية ذاتية الإشراف لإنشاء فضاء كامن هندسي مشترك لنماذج جسر الانتشار، مما يتيح ترجمة الصور من مجال إلى آخر غير مقترنة بدقة عالية وأمانة مكانية دون إشراف عبر المجالات.

Jiaming Liu, Felix Petersen, Yunhe Gao, Yabin Zhang, Hyojin Kim, Akshay S. Chaudhari, Yu Sun, Stefano Ermon, Sergios Gat (…)2026-02-19
🤖 machine learning

Are Object-Centric Representations Better At Compositional Generalization?

تقدم هذه الورقة معياراً شاملاً للإجابة على الأسئلة البصرية يوضح أن التمثيلات المتمحورة حول الأشياء تتفوق على المشفرات الرؤيوية الكثيفة في التعميم التركيبي، لا سيما في ظل قيود تنوع البيانات المحدودة، أو أحجام مجموعات البيانات الأصغر، أو الحوسبة المقيدة في المهام اللاحقة.

Ferdinand Kapl, Amir Mohammad Karimi Mamaghan, Maximilian Seitzer, Karl Henrik Johansson, Carsten Marr, Stefan Bauer, An (…)2026-02-19
💻 computer science

TeCoNeRV: Leveraging Temporal Coherence for Compressible Neural Representations for Videos

يعالج TeCoNeRV قيود القابلية للتوسع والكفاءة في ضغط الفيديو القائم على الشبكات الفائقة (hypernetwork) من خلال تقديم إطار عمل للتنبؤ بالأوزان مفكك مكانياً وزمانياً، ومخطط لتخزين المتبقيات، وتنظيم التماسك الزمني، محققاً بذلك تفوقاً في نسبة PSNR، ومعدلات بت أقل، وسرعات ترميز أسرع عبر دقات متعددة مقارنة بالطرق الحالية.

Namitha Padmanabhan, Matthew Gwilliam, Abhinav Shrivastava2026-02-19
🤖 AI

DARB-Splatting: Generalizing Splatting with Decaying Anisotropic Radial Basis Functions

تقدم هذه الورقة DARB-Splatting، وهي طريقة جديدة لإعادة البناء ثلاثي الأبعاد تعمم تقنية Gaussian Splatting من خلال استخدام دوال القواعد الشعاعية متباينة الخواص والمتلاشية (DARBFs) كأنوية لإعادة البناء، مما يحقق أداءً مقارباً للطرق الحالية القائمة على العائلة الأسية مع توسيع نطاق النوى القابلة للاستخدام بما يتجاوز توزيع غاوس.

Hashiru Pramuditha, Vinasirajan Viruthshaan, Vishagar Arunan, Saeedha Nazar, Sameera Ramasinghe, Simon Lucey, Ranga Rodr (…)2026-02-18
💻 computer science

VITAL: More Understandable Feature Visualization through Distribution Alignment and Relevant Information Flow

تقترح الورقة البحثية VITAL، وهي طريقة مبتكرة لتصور الميزات تجمع بين إحصائيات ميزات الصور الحقيقية ومقاييس تدفق الشبكة ذات الصلة لإنشاء صور نموذجية مفهومة بشرياً، وبذلك تتغلب على العيوب غير القابلة للتمييز والأنماط المتكررة الشائعة في التقنيات الحالية المتطورة.

Ada Gorgun, Bernt Schiele, Jonas Fischer2026-02-18
💻 computer science

Digital Twin Generation from Visual Data: A Survey

تقدم هذه الدراسة المسحية نظرة شاملة على المنهجيات المتطورة لإنشاء التوائم الرقمية ثلاثية الأبعاد من البيانات المرئية، مع تحليل تقنيات مثل "التنقيط الغاوسي ثلاثي الأبعاد" (3D Gaussian Splatting) والنماذج التأسيسية، بينما تتناول التحديات الرئيسية وتحدد الاتجاهات البحثية المستقبلية للتطبيقات في مجالات الروبوتات، والإعلام، والإنشاءات.

Andrew Melnik, Benjamin Alt, Giang Nguyen, Artur Wilkowski, Maciej Stefańczyk, Qirui Wu, Sinan Harms, Helge Rhodin, Mano (…)2026-02-18
🤖 AI

MMS-VPR: Multimodal Street-Level Visual Place Recognition Dataset and Benchmark

تقدم هذه الورقة MMS-VPR، وهي مجموعة بيانات ومنصة تقييم متعددة الوسائط واسعة النطاق مصممة لتعزيز التعرف على الأماكن البصرية على مستوى الشارع في البيئات المخصصة للمشاة من خلال معالجة قيود مجموعات البيانات الحالية التي تركز على المركبات عبر جمع بيانات متنوعة وطويلة الأمد ومتعددة الزوايا في مدينة تشنغدو بالصين.

Yiwei Ou, Xiaobin Ren, Ronggui Sun, Guansong Gao, Kaiqi Zhao, Manfredo Manfredini2026-02-18