🤖 AI

Extremely Simple Multimodal Outlier Synthesis for Out-of-Distribution Detection and Segmentation

تقترح هذه الورقة البحثية "خلط الميزات" (Feature Mixing)، وهي طريقة بسيطة للغاية وسريعة ومستقلة عن نوع الوسائط لتخليق القيم المتطرفة متعددة الوسائط، والتي تحقق أداءً هو الأفضل في فئته في اكتشاف وتجزئة البيانات خارج التوزيع مع توفير تسريع كبير، إلى جانب تقديم مجموعة بيانات جديدة متعددة الوسائط تسمى CARLA-OOD.

Moru Liu, Hao Dong, Jessica Kelly, Olga Fink, Mario Trapp2026-03-05
🤖 machine learning

BAH Dataset for Ambivalence/Hesitancy Recognition in Videos for Digital Behavioural Change

تقدم هذه الورقة مجموعة بيانات BAH، وهي مجموعة متعددة الوسائط تضم 1,427 مقطع فيديو من 300 مشارك تم تصنيفها للتعرف على التردد والارتباك، إلى جانب نتائج قياس الأداء المرجعية التي تسلط الضوء على الحاجة إلى نماذج متقدمة لدعم التدخلات الصحية الرقمية الشخصية.

Manuela González-González, Soufiane Belharbi, Muhammad Osama Zeeshan, Masoumeh Sharafi, Muhammad Haseeb Aslam, Marco Ped (…)2026-03-05
🤖 machine learning

Do We Need All the Synthetic Data? Targeted Image Augmentation via Diffusion Models

تقدم هذه الورقة TADA، وهو إطار عمل للتعزيز القائم على الانتشار يستهدف توليد صور اصطناعية بشكل انتقائي للأمثلة الصعبة التعلم لتحسين تعميم المصنف مع تقليل العبء الحسابي بشكل كبير مقارنة بالتعزيز الكامل لمجموعة البيانات.

Dang Nguyen, Jiping Li, Jinghao Zheng, Baharan Mirzasoleiman2026-03-05
🤖 AI

VITA: Vision-to-Action Flow Matching Policy

تُعد VITA إطار عمل جديد لمطابقة التدفق، خالٍ من الضجيج ومن التكييف، يعمل على تسريع الاستدلال عبر رسم خرائط التمثيلات المرئية مباشرة إلى أفعال كامنة مهيكلة من خلال مشفر تلقائي مُدرب بشكل مشترك وفك تشفير تدفق كامن، محققاً أداءً هو الأفضل في فئته على مهام روبوتية متنوعة.

Dechen Gao, Boqi Zhao, Andrew Lee, Ian Chuang, Hanchu Zhou, Hang Wang, Zhe Zhao, Junshan Zhang, Iman Soltani2026-03-05
💻 computer science

Classification of Histopathology Slides with Persistent Homology Convolutions

تقدم هذه الورقة البحثية "التلافيف الهومولوجية المستمرة" (Persistent Homology Convolutions)، وهي طريقة مبتكرة تلتقط الميزات الطوبولوجية المحلية في شرائح علم الأمراض النسيجي، مما يثبت أن هذا النهج يتفوق على الشبكات العصبية التلافيفية القياسية في دقة التصنيف ومتانة المعلمات الفائقة من خلال دمج المعلومات الهندسية بفعالية في نماذج التعلم العميق.

Shrunal Pothagoni, Benjamin Schweinhart2026-03-05
💻 computer science

GaitSnippet: Gait Recognition Beyond Unordered Sets and Ordered Sequences

تقترح الورقة البحثية "GaitSnippet"، وهو إطار عمل مبتكر للتعرف على مشية الإنسان، يتغلب على قيود الطرق الحالية القائمة على المجموعات أو التسلسلات من خلال نمذجة المشية كتركيبة من مقتطفات زمنية متعددة المقاييس ومأخوذة عشوائياً لالتقاط الاعتمادات قصيرة المدى وطويلة المدى، محققاً أداءً هو الأفضل في فئته على مجموعات البيانات الرئيسية.

Saihui Hou, Chenye Wang, Wenpeng Lang, Zhengxiang Lan, Yongzhen Huang2026-03-05
💻 computer science

Reinforcing Video Reasoning Segmentation to Think Before It Segments

تقدم الورقة البحثية نموذج Veason-R1، وهو نموذج لغوي بصري ضخم متخصص في تقسيم الاستدلال بالفيديو، والذي يستفيد من تهيئة سلسلة الأفك "Chain-of-Thought" وتحسين السياسة النسبي الجماعي "Group Relative Policy Optimization" مع آلية مكافأة شاملة لتعزيز الاستدلال المكاني والزماني، محققاً أداءً هو الأفضل في حالته وتحسناً في المتانة ضد الهلوسة.

Sitong Gong, Lu Zhang, Yunzhi Zhuge, Xu Jia, Pingping Zhang, Huchuan Lu2026-03-05
🤖 AI

Vision-Zero: Scalable VLM Self-Improvement via Strategic Gamified Self-Play

يُعد Vision-Zero إطار عمل قابلاً للتوسع وخالياً من التسميات، يُمكّن نماذج الرؤية واللغة من تحسين ذاتها من خلال ألعاب لعب ذاتي استراتيجية متعددة الوكلاء يتم إنشاؤها من صور عشوائية، وذلك باستخدام خوارزمية تحسين سياسة اللعب الذاتي التكرارية لتحقيق أداء فائق في أحدث التقنيات دون الحاجة إلى تعليق بشري.

Qinsi Wang, Bo Liu, Tianyi Zhou, Jing Shi, Yueqian Lin, Yiran Chen, Hai Helen Li, Kun Wan, Wentian Zhao2026-03-05
🤖 AI

Training-Free Reward-Guided Image Editing via Trajectory Optimal Control

تقدم هذه الورقة إطار عمل خالٍ من التدريب لتحرير الصور الموجه بالمكافأة، حيث تصيغ العملية كمسألة تحكم أمثل للمسار، مما يمكن النموذج من تعزيز أهداف محددة مع الحفاظ على دقة الصورة المصدر دون الحاجة إلى تدريب إضافي أو المعاناة من اختراق المكافأة.

Jinho Chang, Jaemin Kim, Jong Chul Ye2026-03-05
💻 computer science

Factuality Matters: When Image Generation and Editing Meet Structured Visuals

تتناول هذه الورقة البحثية أوجه القصور في نماذج توليد الصور الحالية في التعامل مع المرئيات الهيكلية من خلال تقديم إطار عمل شامل يتضمن مجموعة بيانات مكونة من 1.3 مليون زوج، ونموذج VLM-FLUX.1 موحد تم تدريبه باستخدام منهج تعليمي ثلاثي المراحل واستدلال خارجي، ومعيار StructBench مع مقياس StructScore لتقييم وتحسين الدقة الواقعية في توليد الرسوم البيانية والمخططات وتعديلها.

Le Zhuo, Songhao Han, Yuandong Pu, Boxiang Qiu, Sayak Paul, Yue Liao, Yihao Liu, Jie Shao, Xi Chen, Si Liu, Hongsheng Li2026-03-05