🤖 machine learning

ReToken: One Token to Improve Vision-Language Models for Visual Retrieval

تُعد ReToken عبارة عن تضمين واحد خفيف الوزن وقابل للتعلم، يعمل بكفاءة على استرجاع الرموز البصرية ذات الصلة بالاستعلام من ذاكرة التخزين المؤقت (KV cache) المعبأة مسبقاً، مما يحسن بشكل كبير أداء نماذج الرؤية واللغة في مهام استرجاع الصور والفيديوهات ذات السياق الطويل مع بقائه ممكناً من الناحية الحسابية على وحدة معالجة رسوميات واحدة.

Yao Xiao, Reuben Tan, Zhen Zhu, Yuqun Wu, Jianfeng Gao, Derek Hoiem2026-07-31
🤖 AI

A Review on Discriminative Self-supervised Learning Methods in Computer Vision

تقدم هذه الورقة مراجعة شاملة لطرق التعلم الخاضع للإشراف الذاتي التمييزي في الرؤية الحاسوبية، حيث تصنفها بشكل منهجي إلى خمسة نهج رئيسية، وتحلل آلياتها وأداءها عبر المعايير القياسية، وتناقش الأسس النظرية، والتحديات العملية، واتجاهات البحث المستقبلية.

Nikos Giakoumoglou, Tania Stathaki, Athanasios Gkelias2026-07-30
🤖 AI

Relational Representation Distillation

تقترح هذه الورقة البحثية "تقطير التمثيل العلاقاتي" (Relational Representation Distillation)، وهي طريقة مبتكرة لتقطير المعرفة تحافظ على العلاقات النسبية بين الحالات باستخدام معاملات درجة حرارة منفصلة للتغلب على قيود تباعد كولباك - ليبلر (KL divergence) القياسي والتعلم التبايني شديد الصرامة، مما يحقق أداءً فائقاً عبر مهام نقل متنوعة.

Nikos Giakoumoglou, Tania Stathaki2026-07-30
🤖 AI

SynCo: Synthetic Hard Negatives for Contrastive Visual Representation Learning

تقدم SynCo إطار عمل مبتكر يعزز تعلم التمثيلات المرئية التباينية ذاتية الإشراف من خلال توليد سلبيات صعبة اصطناعية متنوعة في فضاء التمثيل، محققة أداءً فائقاً في تصنيف ImageNet ومهام الكشف اللاحقة مقارنة بالطرق الرائدة مثل MoCo-v2 وMoCHI.

Nikos Giakoumoglou, Tania Stathaki2026-07-30
💻 computer science

Neural Radiance Fields for the Real World: A Survey

تقدم هذه الدراسة مراجعة شاملة لمجالات حقول الإشعاع العصبي (NeRFs)، حيث تغطي التطورات النظرية، وتمثيلات المشاهد، والتطبيقات في الرؤية الحاسوبية والروبوتات، بالإضافة إلى مجموعات البيانات وأدوات البرمجة المتاحة، فضلاً عن التحديات الراهنة واتجاهات البحث المستقبلية.

Wenhui Xiao, Remi Chierchia, Rodrigo Santa Cruz, Xuesong Li, David Ahmedt-Aristizabal, Olivier Salvado, Clinton Fookes (…)2026-07-30
💻 computer science

A Closer Look at Dynamic Scene Graph Generation In the Era of Multimodal Large Language Models

تتناول هذه الورقة البحثية أوجه القصور في توليد الرسوم البيانية للمشاهد الديناميكية الحالي من خلال تقديم إطار تقييم شامل يتضمن خمسة مقاييس جديدة واقتراح نموذج مرجعي قوي يعتمد على النماذج اللغوية الكبيرة متعددة الوسائط (MLLM) يستخدم استراتيجية "الاستنتاج ثم التحديد" من الأعلى إلى الأسفل، والتنبؤ بمجموعة العلاقات الزمنية، والضبط الدقيق الواعي بالأهمية لتحقيق أداء رائد.

Xuanming Cui, Jaiminkumar Ashokbhai Bhoi, Chionh Wei Peng, Adriel Kuek, Ser Nam Lim2026-07-30
💻 computer science

OmniAD: Detect and Understand Industrial Anomaly via Multimodal Reasoning

يُعد OmniAD إطار عمل متعدد الوسائط ومبتكرًا يوحد بين كشف الشذوذ وفهمه في البيئات الصناعية من خلال الاستفادة من ترميز القناع القائم على النصوص والاستدلال الموجه بصريًا، محققًا أداءً رائدًا في معيار MMAD عبر استراتيجية تدريب هجينة تجمع بين الضبط الدقيق الخاضع للإشراف والتعلم التعزيزي.

Shifang Zhao, Yiheng Lin, Lu Han, Yao Zhao, Yunchao Wei2026-07-30
💻 computer science

Improving Knowledge Distillation Under Unknown Covariate Shift Through Confidence-Guided Data Augmentation

تقترح هذه الورقة طريقة مبتكرة لتعزيز البيانات تعتمد على الانتشار الموجه بالثقة، والتي تولد عينات تحدي من خلال تعظيم التباين بين المعلم والطالب للتخفيف من حدة الانزياح المشترك في التوزيع وتحسين أداء تقطير المعرفة في ظل محدودية تغطية البيانات.

Niclas Popp, Kevin Alexander Laube, Matthias Hein, Lukas Schott2026-07-30
🤖 AI

Cluster Contrast for Unsupervised Visual Representation Learning

تقدم الورقة البحثية Cluster Contrast (CueCo)، وهي طريقة جديدة لتعلم التمثيل البصري غير الخاضع للإشراف تجمع بشكل تآزري بين أهداف التعلم التبايني والتجميع لتشتيت الميزات غير المتشابهة ومحاذاة الميزات المتشابهة في آن واحد، محققةً أداءً هو الأفضل في فئته على معايير CIFAR وImageNet.

Nikos Giakoumoglou, Tania Stathaki2026-07-30