💻 computer science

VeGaS: Video Gaussian Splatting

تقدم الورقة البحثية VeGaS، وهو نموذج تمثيل فيديو مبتكر يستخدم عائلة من توزيعات "غاوس" المطوية لترميز الفيديوهات كـ "غاوس" ثنائية الأبعاد، محققاً جودة إعادة بناء إطارات هي الأفضل في فئتها مع تمكين قدرات تحرير فيديو واقعية تتفوق على أساليب "تشتت غاوس ثلاثي الأبعاد" الحالية.

Weronika Smolak-Dyżewska, Dawid Malarz, Kornel Howil, Jan Kaczmarczyk, Marcin Mazur, Przemysław Spurek2026-02-19
💬 NLP

RoboSpatial: Teaching Spatial Understanding to 2D and 3D Vision-Language Models for Robotics

تقدم هذه الورقة البحثية RoboSpatial، وهو عبارة عن مجموعة بيانات واسعة النطاق تضم مليون صورة، و5,000 مسح ثلاثي الأبعاد، و3 ملايين علاقة مكانية مشروحة من مشاهد داخلية وطاولات حقيقية، صُممت لتعزيز قدرات الاستدلال المكاني لنماذج الرؤية واللغة ثنائية وثلاثية الأبعاد المخصصة للروبوتات من خلال معالجة نقص فهم الإطار المرجعي في بيانات التدريب الحالية.

Chan Hee Song, Valts Blukis, Jonathan Tremblay, Stephen Tyree, Yu Su, Stan Birchfield2026-02-19
🤖 AI

PromptGuard: Soft Prompt-Guided Unsafe Content Moderation for Text-to-Image Models

يُعد PromptGuard تقنية مبتكرة وفعالة للإشراف على المحتوى لنماذج تحويل النص إلى صورة، حيث يعمل على تحسين المطالبات الناعمة (soft prompts) الشاملة والخاصة بالفئات ضمن فضاء التضمين النصي، وذلك بهدف كبح توليد المحتوى غير اللائق (NSFW) بفعالية مع الحفاظ على جودة الصورة وسرعة الاستدلال.

Lingzhi Yuan, Xinfeng Li, Chejian Xu, Guanhong Tao, Xiaojun Jia, Yihao Huang, Wei Dong, Yang Liu, Xiaofeng Wang, Bo Li2026-02-19
🤖 machine learning

CARL: Camera-Agnostic Representation Learning for Spectral Image Analysis

تقدم الورقة البحثية نموذج CARL، وهو نموذج تعلم تمثيل جديد غير مرتبط بنوع الكاميرا يستخدم مشفرًا طيفيًا يعتمد على الانتباه الذاتي والانتباه المتقاطع والتعلم الذاتي القائم على الميزات للتغلب على التباين الطيفي عبر وسائط التصوير بالألوان (RGB) والمتعددة الأطياف وفائقة الأطياف، مما يظهر قوة وقدرة فائقتين على التعميم في مجالات متنوعة مثل الطب، والقيادة الذاتية، والاستشعار عن بعد.

Alexander Baumann, Leonardo Ayala, Silvia Seidlitz, Jan Sellner, Alexander Studier-Fischer, Berkin Özdemir, Lena Maier-H (…)2026-02-19
💻 computer science

Attention, Please! Revisiting Attentive Probing Through the Lens of Efficiency

تقدم هذه الورقة البحثية آلية "الاستقصاء الفعال" (Efficient Probing - EP)، وهي آلية انتباه تقاطعي متعدد الاستعلامات وخفيفة الوزن تتفوق على طرق الاستقصاء الخطية والمنتبهة الحالية من خلال تحسين المقايضة بين الدقة وكفاءة المعلمات مع الكشف عن رؤى جديدة حول تمثيلات النماذج.

Bill Psomas, Dionysis Christopoulos, Eirini Baltzi, Ioannis Kakogeorgiou, Tilemachos Aravanis, Nikos Komodakis, Konstant (…)2026-02-19
🤖 AI

MedReasoner: Reinforcement Learning Drives Reasoning Grounding from Clinical Thought to Pixel-Level Precision

تقدم هذه الورقة MedReasoner، وهو إطار عمل مدفوع بالتعلم المعزز يفصل بين الاستدلال السريري والتقسيم على مستوى البكسل لمعالجة تحدي الاستعلامات الضمنية في التصوير الطبي، مدعوماً بمهمة تجذير الاستدلال الطبي الموحد (UMRG) المُعرفة حديثاً ومجموعة بيانات U-MRG-14K المكونة من 14 ألف عينة.

Zhonghao Yan, Muxi Diao, Yuxuan Yang, Ruoyan Jing, Jiayuan Xu, Kaizhou Zhang, Lele Yang, Yanxi Liu, Kongming Liang, Zhan (…)2026-02-19
🤖 AI

COGITAO: A Visual Reasoning Framework To Study Compositionality & Generalization

تقدم الورقة البحثية COGITAO، وهو إطار عمل ومعيار مفتوح المصدر ونمطي يقوم بتوليد الملايين من المهام البصرية الفريدة القائمة على القواعد لدراسة وتوضيح أوجه القصور في النماذج الحالية المتطورة في تركيب المفاهيم المتعلمة والتعميم على الإعدادات الجديدة بشكل منهجي.

Yassine Taoudi-Benchekroun, Klim Troyan, Pascal Sager, Stefan Gerber, Lukas Tuggener, Benjamin Grewe2026-02-19
🤖 AI

Language-Guided Invariance Probing of Vision-Language Models

تقدم هذه الورقة البحثية "استقصاء الثبات الموجه لغوياً" (LGIP)، وهو معيار مرجعي جديد يقيم نماذج الرؤية واللغة في قدرتها على الحفاظ على الاتساق مع إعادة الصياغة التي تحافظ على المعنى، والحساسية تجاه التعديلات الدلالية التي تغير المعنى، مما يكشف أنه بينما تحقق بعض النماذج مثل EVA02-CLIP توازناً قوياً، تظهر نماذج أخرى مثل SigLIP هشاشة لغوية كبيرة غالباً ما لا تكتشفها مقاييس الاسترجاع القياسية.

Jae Joong Lee2026-02-19
💻 computer science

PartUV: Part-Based UV Unwrapping of 3D Meshes

يُعد PartUV خط إنتاج مبتكر لفك التغليف (UV unwrapping) يعتمد على الأجزاء، حيث يستفيد من التحلل الدلالي والاستدلالات الهندسية لإنشاء مخططات أقل عدداً وأقل تشوهاً مع حد أدنى من الدرزات، متفوقاً بشكل كبير على الطرق الحالية في التعامل مع المشبكات ثلاثية الأبعاد الناتجة عن الذكاء الاصطناعي والمشوشة.

Zhaoning Wang, Xinyue Wei, Ruoxi Shi, Xiaoshuai Zhang, Hao Su, Minghua Liu2026-02-19
⚡ electrical engineering

Rotterdam artery-vein segmentation (RAV) dataset

تقدم هذه الورقة مجموعة بيانات "شريان-وريد روتردام" (RAV)، وهي مجموعة متنوعة من صور قاع العين الملونة عالية الجودة مع تعليقات توضيحية لتجزئة الشرايين والأوردة تم التحقق من اتصالها والمستمدة من دراسة روتردام، والمصممة لدعم تطوير واختبار نماذج التعلم الآلي القوية لتحليل الأوعية الدموية في الشبكية تحت ظروف التصوير الواقعية.

Jose Vargas Quiros, Bart Liefers, Karin van Garderen, Jeroen Vermeulen, Eyened Reading Center, Caroline Klaver2026-02-19