💻 computer science

Adapting Self-Supervised Representations as a Latent Space for Efficient Generation

تقدم الورقة البحثية RepTok، وهو إطار عمل توليدي فعال يمثل الصور كرموز كامنة مستمرة واحدة مشتقة من نماذج محولات الرؤية ذات التعلم الذاتي والمنقحة، مما يتيح تخليقاً تنافسياً للصور المشروطة بالفئات وتلك القائمة على النصوص مع تقليل تكاليف التدريب والارتباط المكاني بشكل كبير.

Ming Gui, Johannes Schusterbauer, Timy Phan, Felix Krause, Josh Susskind, Miguel Angel Bautista, Björn Ommer2026-04-22
🤖 AI

ReefNet: A Large-Scale Dataset and Benchmark for Fine-Grained Coral Reef Recognition

تقدم هذه الورقة البحثية ReefNet، وهو عبارة عن مجموعة بيانات ومعيار مرجعي عام واسع النطاق يحتوي على ما يقرب من 925,000 تسمية لشعاب مرجانية تم التحقق منها من قبل خبراء ومصنفة وفق تصنيف قياسي، والتي تُستخدم لتقييم وكشف القصور الكبير في نماذج الرؤية واللغة والنماذج متعددة الوسائط الحالية في التعرف الدقيق على المرجان تحت ظروف واقعية من ضجيج التسميات، وعدم توازن الفئات، والانزياح النطاقي.

Abdulwahab Felemban, Yahia Battach, Faizan Farooq Khan, Yuqian Fu, Xuhui Liu, Yesmeen M. Khattab, Yousef A. Radwan, Xian (…)2026-04-22
🤖 machine learning

Ensembling Pruned Attention Heads For Uncertainty-Aware Efficient Transformers

تقدم الورقة البحثية "Hydra Ensembles"، وهي طريقة فعالة تعتمد على نماذج المحولات (transformer) تعمل على تقليم ودمج رؤوس الانتباه لإنشاء نماذج متنوعة ومدمجة تضاهي أو تتفوق على أداء "Deep Ensembles" في تقدير عدم اليقين مع الحفاظ على سرعات استدلال تقارب سرعة الشبكة المنفردة.

Firas Gabetni, Giuseppe Curci, Andrea Pilzer, Subhankar Roy, Elisa Ricci, Gianni Franchi2026-04-22
💻 computer science

Pixels or Positions? Benchmarking Modalities in Group Activity Recognition

تقدم هذه الورقة البحثية SoccerNet-GAR، وهي مجموعة بيانات متعددة الوسائط متزامنة لمباريات كأس العالم 2022، لتقييم التعرف على الأنشطة الجماعية وإثبات أن النماذج القائمة على التتبع التي تستخدم بنية رسومية مبتكرة واعية بالأدوار تتفوق بشكل كبير على النهج القائم على الفيديو في كل من الدقة والكفاءة الحسابية.

Drishya Karki, Merey Ramazanova, Anthony Cioppa, Silvio Giancola, Bernard Ghanem2026-04-22
💻 computer science

Mammo-FM: Breast-specific foundational model for Integrated Mammographic Diagnosis, Prognosis, and Reporting

تقدم الورقة البحثية Mammo-FM، وهو نموذج تأسيسي متخصص في الثدي تم تدريبه مسبقاً على مجموعة بيانات ضخمة ومتنوعة لأكثر من 140,000 مريض توحد بين تشخيص السرطان، والإنذار الطبي، والتقارير المنظمة، مع تفوقه على النماذج العامة الأكبر حجماً بكفاءة وقدرة أكبر على التفسير.

Shantanu Ghosh, Vedant Parthesh Joshi, Rayan Syed, Param Budhraja, Aya Kassem, Katelyn C. Morrison, Alex Tang, Ho Cheung (…)2026-04-22
💻 computer science

MoonSeg3R: Monocular Online Zero-Shot Segment Anything in 3D with Reconstructive Foundation Priors

يُعد MoonSeg3R إطار عمل مبتكرًا يحقق تجزئة فورية للأجسام ثلاثية الأبعاد أحادية العدسة بنمط الصفر (zero-shot) عبر الإنترنت من خلال الاستفيد من نموذج إعادة البناء التأسيسي CUT3R لتوليد الأولويات الهندسية، وإدخال وحدة تحسين الاستعلام ذاتية الإشراف، والذاكرة الزمنية، ورموز توزيع الحالة للتغلب على قيود المنهجيات الحالية المعتمدة على خرائط العمق (RGB-D).

Zhipeng Du, Duolikun Danier, Jan Eric Lenssen, Hakan Bilen2026-04-22
🤖 AI

ViDoRe V3: A Comprehensive Evaluation of Retrieval Augmented Generation in Complex Real-World Scenarios

تقدم هذه الورقة ViDoRe v3، وهو معيار متعدد الوسائط شامل يتكون من 10 مجموعات بيانات متنوعة و3,099 استعلاماً تم التحقق منها بشرياً عبر 6 لغات، صُمم لتقييم أنظمة التوليد المعزز بالاسترجاع على مستندات واقعية معقدة وغنية بصرياً مع تسليط الضوء على القيود الحالية في التأسيس البصري والتركيب متعدد المستندات.

António Loison, Quentin Macé, Antoine Edy, Victor Xing, Tom Balough, Gabriel Moreira, Bo Liu, Manuel Faysse, Céline Hude (…)2026-04-22
💻 computer science

SAMannot: A Memory-Efficient, Local, Open-source Framework for Interactive Video Instance Segmentation based on SAM2

يُعد SAMannot إطار عمل مفتوح المصدر، محلي، ويحافظ على الخصوصية، يدمج نسخة محسنة من SAM2 مع سير عمل يعتمد على التدخل البشري لتمكين تقسيم مثيل الفيديو التفاعلي والفعال لإنشاء مجموعات البيانات ذات الدرجة البحثية.

Gergely Dinya, András Gelencsér, Krisztina Kupán, Clemens Küpper, Kristóf Karacs, Anna Gelencsér-Horváth2026-04-22
💻 computer science

Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models

تقدم هذه الورقة البحثية Q-Mask، وهو إطار عمل جديد للتعرف الضوئي على الحروف (OCR) يستخدم مفكك قناع مدفوع باستعلام سببي لربط النص صراحةً بالمناطق المكانية قبل عملية التعرف، مدعوماً بمعيار TextAnchor-Bench ومجموعة بيانات TextAnchor-26M واسعة النطاق لتحسين قدرات تثبيت النص في نماذج الرؤية واللغة بشكل كبير.

Longwei Xu, Feng Feng, Shaojie Zhang, Xin Chen, Hang Li, Anan Du, Hailong Yu, Pei Fu, Zhenbo Luo, Jian Luan2026-04-22
🤖 AI

Geometry-Aware CLIP Retrieval via Local Cross-Modal Alignment and Steering

تقترح هذه الورقة إطار عمل لاسترجاع CLIP مدرك للهندسة يعزز الأداء في مهام ربط الصفات والتركيب من خلال معالجة عدم الاتساق الهندسي المحلي عبر التوجيه المحلي المشروط بالاستعلام وإعادة الترتيب على مستوى الجوار عبر مطابقة هانغاريان، وكل ذلك يمكن تحقيقه في وقت الاستدلال دون إعادة تدريب.

Nirmalendu Prakash, Narmeen Fatimah Oozeer, Xin Su, Phillip Howard, Shaan Shah, Zoe Wanying He, Shuang Wu, Shivam Raval (…)2026-04-22