💻 computer science

Beyond the Encoder: Joint Encoder-Decoder Contrastive Pre-Training Improves Dense Prediction

تقدم هذه الورقة DeCon، وهو إطار عمل للتعلم الخاضع للإشراف الذاتي يقوم بالتدريب المسبق المشترك للمشفرات وفك التشفير باستخدام فقد تبايني موزون، محققاً أداءً هو الأفضل في فئته عبر مختلف مهام التنبؤ الكثيف ومجموعات البيانات من خلال تعزيز جودة التمثيل بشكل كبير مقارنة بالنهج التقليدي المقتصر على المشفر فقط.

Sébastien Quetin, Tapotosh Ghosh, Farhad Maleki2026-03-05
💬 NLP

Why 1 + 1 < 1 in Visual Token Pruning: Beyond Naive Integration via Multi-Objective Balanced Covering

تقدم هذه الورقة البحثية إطار عمل "التغطية المتوازنة متعددة الأهداف" (MoB)، وهو إطار عمل مبتكر لتقليم الرموز البصرية يستفيد من مسافة هوسدورف ونظرية التغطية بـ ϵ\epsilon لاستخلاص حد خطأ في صيغة مغلقة وموازنة محاذاة المطالبات مع الحفاظ البصري ديناميكيًا، مما يحقق تسارعًا كبيرًا في الاستدلال مع أدنى حد من فقدان الأداء عبر مختلف النماذج متعددة الوسائط.

Yangfu Li, Hongjian Zhan, Tianyi Chen, Qi Liu, Yue Lu2026-03-05
🤖 AI

Extremely Simple Multimodal Outlier Synthesis for Out-of-Distribution Detection and Segmentation

تقترح هذه الورقة البحثية "خلط الميزات" (Feature Mixing)، وهي طريقة بسيطة للغاية وسريعة ومستقلة عن نوع الوسائط لتخليق القيم المتطرفة متعددة الوسائط، والتي تحقق أداءً هو الأفضل في فئته في اكتشاف وتجزئة البيانات خارج التوزيع مع توفير تسريع كبير، إلى جانب تقديم مجموعة بيانات جديدة متعددة الوسائط تسمى CARLA-OOD.

Moru Liu, Hao Dong, Jessica Kelly, Olga Fink, Mario Trapp2026-03-05
🤖 machine learning

BAH Dataset for Ambivalence/Hesitancy Recognition in Videos for Digital Behavioural Change

تقدم هذه الورقة مجموعة بيانات BAH، وهي مجموعة متعددة الوسائط تضم 1,427 مقطع فيديو من 300 مشارك تم تصنيفها للتعرف على التردد والارتباك، إلى جانب نتائج قياس الأداء المرجعية التي تسلط الضوء على الحاجة إلى نماذج متقدمة لدعم التدخلات الصحية الرقمية الشخصية.

Manuela González-González, Soufiane Belharbi, Muhammad Osama Zeeshan, Masoumeh Sharafi, Muhammad Haseeb Aslam, Marco Ped (…)2026-03-05
🤖 machine learning

Do We Need All the Synthetic Data? Targeted Image Augmentation via Diffusion Models

تقدم هذه الورقة TADA، وهو إطار عمل للتعزيز القائم على الانتشار يستهدف توليد صور اصطناعية بشكل انتقائي للأمثلة الصعبة التعلم لتحسين تعميم المصنف مع تقليل العبء الحسابي بشكل كبير مقارنة بالتعزيز الكامل لمجموعة البيانات.

Dang Nguyen, Jiping Li, Jinghao Zheng, Baharan Mirzasoleiman2026-03-05
🤖 AI

VITA: Vision-to-Action Flow Matching Policy

تُعد VITA إطار عمل جديد لمطابقة التدفق، خالٍ من الضجيج ومن التكييف، يعمل على تسريع الاستدلال عبر رسم خرائط التمثيلات المرئية مباشرة إلى أفعال كامنة مهيكلة من خلال مشفر تلقائي مُدرب بشكل مشترك وفك تشفير تدفق كامن، محققاً أداءً هو الأفضل في فئته على مهام روبوتية متنوعة.

Dechen Gao, Boqi Zhao, Andrew Lee, Ian Chuang, Hanchu Zhou, Hang Wang, Zhe Zhao, Junshan Zhang, Iman Soltani2026-03-05
💻 computer science

Classification of Histopathology Slides with Persistent Homology Convolutions

تقدم هذه الورقة البحثية "التلافيف الهومولوجية المستمرة" (Persistent Homology Convolutions)، وهي طريقة مبتكرة تلتقط الميزات الطوبولوجية المحلية في شرائح علم الأمراض النسيجي، مما يثبت أن هذا النهج يتفوق على الشبكات العصبية التلافيفية القياسية في دقة التصنيف ومتانة المعلمات الفائقة من خلال دمج المعلومات الهندسية بفعالية في نماذج التعلم العميق.

Shrunal Pothagoni, Benjamin Schweinhart2026-03-05
💻 computer science

GaitSnippet: Gait Recognition Beyond Unordered Sets and Ordered Sequences

تقترح الورقة البحثية "GaitSnippet"، وهو إطار عمل مبتكر للتعرف على مشية الإنسان، يتغلب على قيود الطرق الحالية القائمة على المجموعات أو التسلسلات من خلال نمذجة المشية كتركيبة من مقتطفات زمنية متعددة المقاييس ومأخوذة عشوائياً لالتقاط الاعتمادات قصيرة المدى وطويلة المدى، محققاً أداءً هو الأفضل في فئته على مجموعات البيانات الرئيسية.

Saihui Hou, Chenye Wang, Wenpeng Lang, Zhengxiang Lan, Yongzhen Huang2026-03-05
💻 computer science

Reinforcing Video Reasoning Segmentation to Think Before It Segments

تقدم الورقة البحثية نموذج Veason-R1، وهو نموذج لغوي بصري ضخم متخصص في تقسيم الاستدلال بالفيديو، والذي يستفيد من تهيئة سلسلة الأفك "Chain-of-Thought" وتحسين السياسة النسبي الجماعي "Group Relative Policy Optimization" مع آلية مكافأة شاملة لتعزيز الاستدلال المكاني والزماني، محققاً أداءً هو الأفضل في حالته وتحسناً في المتانة ضد الهلوسة.

Sitong Gong, Lu Zhang, Yunzhi Zhuge, Xu Jia, Pingping Zhang, Huchuan Lu2026-03-05
🤖 AI

Vision-Zero: Scalable VLM Self-Improvement via Strategic Gamified Self-Play

يُعد Vision-Zero إطار عمل قابلاً للتوسع وخالياً من التسميات، يُمكّن نماذج الرؤية واللغة من تحسين ذاتها من خلال ألعاب لعب ذاتي استراتيجية متعددة الوكلاء يتم إنشاؤها من صور عشوائية، وذلك باستخدام خوارزمية تحسين سياسة اللعب الذاتي التكرارية لتحقيق أداء فائق في أحدث التقنيات دون الحاجة إلى تعليق بشري.

Qinsi Wang, Bo Liu, Tianyi Zhou, Jing Shi, Yueqian Lin, Yiran Chen, Hai Helen Li, Kun Wan, Wentian Zhao2026-03-05