💻 computer science

Retrieve and Segment: Are a Few Examples Enough to Bridge the Supervision Gap in Open-Vocabulary Segmentation?

تقترح هذه الورقة مُكيِّفًا وقتيًّا معززًا بالاسترجاع يستفيد من مجموعة دعم قليلة العينات من الصور الموضحة بالبكسل لدمج الميزات النصية والبصرية، مما يجسّر بفعالية فجوة الأداء بين التجزئة مفتوحة المفردات في حالة عدم وجود بيانات مسبقة (zero-shot) والتجزئة الخاضعة للإشراف الكامل، مع الحفاظ على القدرة على التعرف على فئات عشوائية.

Tilemachos Aravanis, Vladan Stojnić, Bill Psomas, Nikos Komodakis, Giorgos Tolias2026-02-27
💬 NLP

Scale Can't Overcome Pragmatics: The Impact of Reporting Bias on Vision-Language Reasoning

تجادل هذه الورقة بأن قيود الاستنتاج في نماذج الرؤية واللغة تنبع من انحياز التقرير في بيانات التدريب التي تغفل المعلومات الضمنية، مما يثبت أن مجرد زيادة حجم النماذج أو البيانات لا يمكن أن يتغلب على هذه المشكلة، وأن التقييم المتعمد للتعليقات التوضيحية التي تلتقط مثل هذه التفاصيل ضروري للتحسين.

Amita Kamath, Jack Hessel, Khyathi Chandu, Jena D. Hwang, Kai-Wei Chang, Ranjay Krishna2026-02-27
🤖 machine learning

A Dataset is Worth 1 MB

تقترح هذه الورقة البحثية طريقة PLADA، التي تقلل تكاليف نقل مجموعات البيانات بشكل جذري إلى أقل من 1 ميجابايت عبر إرسال تسميات الفئات فقط لمجموعة بيانات مرجعية محملة مسبقاً، وذلك باستخدام آلية تقليم لتصفية الصور ذات الصلة دلالياً وتحقيق دقة تصنيف عالية دون نقل بيانات البكسل الخام.

Elad Kimchi Shoshani, Leeyam Gabay, Yedid Hoshen2026-02-27
💻 computer science

Real-Time Motion Detection Using Dynamic Mode Decomposition

تقترح هذه الورقة خوارزمية للكشف عن الحركة في الوقت الفعلي لمقاطع الفيديو المتدفقة تستخدم تحليل التفكيك النمطي الديناميكي لتحديد حركة المقدمة من خلال تحليل التوافق بين تطور سمات الفيديو والقيم الذاتية للمصفوفة الناتجة، مما يثبت فعاليتها في لقطات الأمن عبر تحليل منحنى خصائص التشغيل (ROC) والتحقق المتقاطع.

Marco Mignacca, Simone Brugiapaglia, Jason J. Bramburger2026-02-26
💻 computer science

PoseAdapt: Sustainable Human Pose Estimation via Continual Learning Benchmarks and Toolkit

يُعد PoseAdapt إطار عمل ومجموعة معايير مفتوحة المصدر تُمكّن من تقدير وضعية جسم الإنسان بشكل مستدام عبر توفير بروتوكولات موحدة للتعلم المستمر، مما يسمح للنماذج بالتكيف مع المجالات والأنماط ومجموعات النقاط المفتاحية المتغيرة بأقل قدر من الإشراف ودون الحاجة إلى إعادة تدريب كامل مكلف حاسوبياً.

Muhammad Saif Ullah Khan, Didier Stricker2026-02-26
💬 NLP

Renaissance: Investigating the Pretraining of Vision-Language Encoders

تقدم هذه الورقة "رينيسانس" (Renaissance)، وهو إطار تقييم مرن للرؤية واللغة، لتوضيح أنه من خلال التحليل التلوي أن تجميد أجزاء كبيرة من النماذج أثناء التدريب المسبق يقلل بشكل كبير من تكاليف الحوسبة مع تأثير ضئيل على الأداء، وللتحقيق في آثار تهيئة نماذج المحولات للرؤية واللغة إما من نماذج الرؤية أو نماذج النصوص.

Clayton Fields, Casey Kennington2026-02-26
💻 computer science

Benchmarking Vision-Based Object Tracking for USVs in Complex Maritime Environments

تقترح هذه الدراسة وتتحقق من صحة إطار عمل لتتبع الأجسام بتوجيه رؤيوي للمركبات السطحية غير المأهولة (USVs) في البيئات البحرية المعقدة عبر إجراء مقارنة معيارية لسبعة من خوارزميات التتبع القائمة على التعلم العميق وخوارزميات التحكم، لتحدد في النهاية أن نموذج (SeqTrack) القائم على المحولات (Transformer) ومتحكم المنظم الخطي التربيعي (LQR) هما الحل الأكثر قوة للتتبع المستقر في الظروف القاسية.

Muhayy Ud Din, Ahsan B. Bakht, Waseem Akram, Yihao Dong, Lakmal Seneviratne, Irfan Hussain2026-02-26
🤖 machine learning

Object-Centric World Models from Few-Shot Annotations for Sample-Efficient Reinforcement Learning

تقدم هذه الورقة البحثية OC-STORM، وهو إطار عمل للتعلم التعزيزي القائم على النموذج وذو توجه كائني، يستفيد من الإطارات المشروحة بعدد قليل من العينات والتقسيم المسبق التدريب لتحسين كفاءة العينات وتوقع الديناميكيات في البيئات البصرية المعقدة، متفوقاً بذلك على النماذج المرجعية الحالية في اختبارات Atari 100k وHollow Knight.

Weipu Zhang, Adam Jelley, Trevor McInroe, Amos Storkey, Gang Wang2026-02-26
💬 NLP

VOILA: Evaluation of MLLMs For Perceptual Understanding and Analogical Reasoning

تقدم هذه الورقة البحثية VOILA، وهو معيار ديناميكي يقيم قدرة النماذج اللغوية الكبيرة متعددة الوسائط على إجراء الاستدلال العلائقي التجريدي من خلال القياسات البصرية، مما يكشف أن النماذج الحالية تعاني بشكل كبير في العلاقات بين الصور مقارنة بالأداء البشري رغم التحسينات الناتجة عن استراتيجيات التلقين متعدد الخطوات.

Nilay Yilmaz, Maitreya Patel, Yiran Lawrence Luo, Tejas Gokhale, Chitta Baral, Suren Jayasuriya, Yezhou Yang2026-02-26
💻 computer science

TRACE: Your Diffusion Model is Secretly an Instance Edge Detector

يُظهر نموذج TRACE أن نماذج الانتشار من النص إلى الصورة تُشفّر بطبيعتها أولويات حدود الكائنات، مما يُمكّن من طريقة تجزئة غير خاضعة للإشراف وسريعة تستخرج الحواف من خرائط الانتباه الذاتي لتحقيق أداء رائد دون الحاجة إلى تعليقات توضيحية مكلفة على مستوى الكائن.

Sanghyun Jo, Ziseok Lee, Wooyeol Lee, Jonghyun Choi, Jaesik Park, Kyungsu Kim2026-02-26