🤖 machine learning

Beyond Toy Benchmarks: A Systematic Evaluation of OOD Detection Methods For Plant Pathology Classification

تقيم هذه الورقة بشكل منهجي ست طرق للكشف عن البيانات خارج التوزيع (OOD) على مجموعة بيانات أمراض النباتات (Plant Pathology 2021) دقيقة التفاصيل، حيث تُظهر أن الضبط الدقيق القائم على الطاقة يتفوق على النماذج المرجعية من خلال إعادة هيكلة فضاء التضمين ومعايرة الدرجات، بينما تكشف أيضاً عن عدم استقرار تدريبي عملي في طرق التحسين المقيد التي غالباً ما يتم التغاضي عنها في المعايير القياسية.

Devesh Shah2026-05-12
💻 computer science

FlowADMM: Plug-and-play ADMM with Flow-based Renoise-Denoise Priors

تقدم هذه الورقة FlowADMM، وهو خوارزمية ADMM قابلة للتوصيل والتشغيل تستفيد من عامل "إعادة الضجيج-إزالة الضجيج" حتمي مُصاغ مشتق من النماذج التوليدية القائمة على التدفق لتحقيق أداء رائد في مختلف المسائل العكسية مع ضمانات تقارب صارمة وكفاءة محسنة.

Hendrik Sommerhoff, Michael Moeller2026-05-12
💻 computer science

CAST: Channel-Aware Spatial Transfer Learning with Pseudo-Image Radar for Sign Language Recognition

تقدم هذه الورقة CAST، وهي بنية ثنائية المسار تستفيد من التعلم الانتقالي المكاني المدرك للقنوات ومعالجة الإشارات المدركة للفيزياء لتحقيق أداء هو الأفضل في حالته في التعرف على لغة الإشارة المنفصلة باستخدام بيانات رادار 60 جيجاهرتز ذات القدرة فقط، متفوقة بذلك على النماذج المرجعية أحادية النموذج بنسبة 3.3% في دقة النوع الأول (Top-1).

Md. Shakhoyat Rahman Shujon, Sheikh Md. Galib Mahim, Md. Milon Islam, Md Rezwanul Haque, Md Rabiul Islam, Hamdi Altaheri (…)2026-05-12
🤖 AI

Gate-and-Merge: Zero-shot Compositional Personalization of Vision Language Models

تقدم هذه الورقة "Gate-and-Merge"، وهو إطار عمل للتعلم الصفري (zero-shot) للتخصيص التركيبي في نماذج الرؤية واللغة، والذي يتعلم المفاهيم بشكل مستقل عبر محولات LoRA ويدمجها عند الاستدلال باستخدام آلية بوابات (gating mechanism) لضمان أداء مفكك وخالٍ من التداخل دون الحاجة إلى تدريب على التزامن.

Guodong Ding, Angela Yao2026-05-12
💻 computer science

SynerMedGen: Synergizing Medical Multimodal Understanding with Generation via Task Alignment

يُعد SynerMedGen إطاراً طبياً موحداً يدمج بين الفهم والتوليد متعدد الوسائط من خلال مبدأ فهم جديد متوافق مع التوليد واستراتيجية تدريب ثنائية المراحل، محققاً أداءً فائقاً في تخليق الصور الطبية ومطلقاً مجموعة بيانات واسعة النطاق لدعم المزيد من الأبحاث.

Weiren Zhao, Yi Dong, Cheng Chen2026-05-12
🤖 AI

Control Your View: High-Resolution Global Semantic Manipulation in Learned Image Compression

تتناول هذه الورقة التحدي الذي كان مستعصياً في السابق والمتمثل في التلاعب الدلالي العالمي عالي الدقة في ضغط الصور المتعلم عبر تحليل فشل الهجمات القياسية واقتراح طريقة PGD2^{2}-GSM جديدة ذات جدول زمني لـ "الاضمحلال الهندسي الدوري" لتنفيذ مثل هذه الهجمات بنجاح.

Jiaming Liang, Chi-Man Pun, Weisi Lin, Greta Seng Peng Mok2026-05-12
💻 computer science

Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation

يُعد Unison إطار عمل موحداً يحقق أداءً فائقاً في توليد المحتوى الصوتي والمرئي المتمحور حول الإنسان من خلال التناغم الصريح بين الحركة والكلام والمؤثرات الصوتية عبر استراتيجيات فك الارتباط الصوتي الموجه دلالياً والفرض المتبادل عبر الوسائط لضمان المحاذاة الزمنية الدقيقة والوضوح الصوتي.

Shihao Cheng, Jiaxu Zhang, Quanyue Song, Shansong Liu, Zhizhi Guo, Xiaolei Zhang, Chi Zhang, Xuelong Li, Zhigang Tu2026-05-12
💻 computer science

CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models

يقدم CollabVR إطار عمل مغلق الحلقة يعزز الاستدلال بالفيديو من خلال دمج نماذج الرؤية واللغة (VLMs) مع نماذج توليد الفيديو (VGMs) على مستوى الخطوات، حيث يقوم نموذج الرؤية واللغة بالتخطيط والتحقق وإصلاح المقاطع المولدة بشكل تكراري للتغلب على الانحراف طويل الأمد وأخطاء المحاكاة، مما يحسن الأداء بشكل كبير في المهام المعقدة مقارنة بالنماذج المرجعية الحالية.

Joowon Kim, Seungho Shin, Joonhyung Park, Eunho Yang2026-05-12
🤖 AI

PPU-Bench:Real World Benchmark for Personalized Partial Unlearning in Vision Language Models

تقدم هذه الورقة البحثية PPU-Bench، وهو معيار مرجعي واقعي لتقييم عملية "النسيان الجزئي المخصص" في النماذج اللغوية الكبيرة متعددة الوسائط من خلال 24 ألف عينة عبر ثلاثة إعدادات تحديّة، مما يكشف عن قصور كبير في الأساليب الحالية ويدفع نحو اقتراح "التحسين الواعي بالحدود" (BAO) لفرض الحدود الحقائقية داخل الموضوع الواحد بفعالية.

Jiahui Guang, Zexun Zhan, Zhenlin Xu, Cuiyun Gao, Haiyan Wang, Jing Li, Zhaoquan Gu, Yanchun Zhang2026-05-12
💻 computer science

LightAVSeg: Lightweight Audio-Visual Segmentation

يُعد LightAVSeg إطار عمل خفيف الوزن للتجزئة السمعية البصرية يحقق كفاءة وأداءً رائدين من خلال استبدال الانتباه المتقاطع الكثيف والمكلف حوسبياً بتصميم مفكك ذي تكلفة خطية للترشيح الدلالي والتمركز المكاني، إلى جانب فقدان محاذاة مساعد لتعزيز اتساق التدريب.

Qing Zhong, Guodong Ding, Lingqiao Liu, Zaiwen Feng, Lin Yuanbo Wu, Angela Yao2026-05-12