💻 computer science

Structured State-Space Regularization for Compact and Generation-Friendly Image Tokenization

تقدم هذه الورقة منظماً جديداً يعمل على محاذاة مشفرات الصور مع ديناميكيات نماذج فضاء الحالة لنقل الوعي بالتردد إلى الميزات الكامنة، مما يحقق تمثيلاً مدمجاً يحسن بشكل كبير من القدرة على التوليد مع حد أدنى من الفقد في دقة إعادة البناء.

Jinsung Lee, Jaemin Oh, Namhun Kim, Dongwon Kim, Byung-Jun Yoon, Suha Kwak2026-04-15
💻 computer science

LDEPrompt: Layer-importance guided Dual Expandable Prompt Pool for Pre-trained Model-based Class-Incremental Learning

يقدم LDEPrompt مجمع مطالبات مزدوج قابل للتوسع وقائم على أهمية الطبقات، يتغلب على قيود الطرق الحالية من خلال تمكين الاختيار التكيفي للطبقات والتوسع الديناميكي لمجمع المطالبات، محققاً أداءً هو الأفضل في فئته في التعلم التزايدي للفئات.

Linjie Li, Zhenyu Wu, Huiyu Xiao, Yang Ji2026-04-15
💻 computer science

OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video

تقدم هذه الورقة البحثية OmniScript، وهو نموذج لغوي شامل متعدد الوسائط بكفاءة عالية يمتلك 8 مليارات معلمة، ومعياراً جديداً مُصنفاً بشرياً صُمم لمعالجة مهمة تحويل الفيديو إلى نص (video-to-script) المستحدثة عبر توليد نصوص سينمائية مفصلة، هرمية البنية، ومترابطة زمنياً لمقاطع الفيديو السينمائية طويلة المدى.

Junfu Pu, Yuxin Chen, Teng Wang, Ying Shan2026-04-15
💻 computer science

Boxes2Pixels: Learning Defect Segmentation from Noisy SAM Masks

تقترح الورقة البحثية Boxes2Pixels، وهو إطار عمل قوي تجاه الضجيج يقوم باستخلاص المعرفة من الأقنعة الزائفة لنموذج Segment Anything Model (SAM) المشوبة بالضجيج إلى شبكة طالب مدمجة باستخدام فك التشفير الهرمي والتصحيح الذاتي عبر الإنترنت لتحقيق أداء فائق في تقسيم العيوب بعدد أقل بكثير من المعلمات القابلة للتدريب في معايير الفحص الصناعي.

Camile Lendering, Erkut Akdag, Egor Bondarev2026-04-15
💻 computer science

Development and evaluation of CADe systems in low-prevalence setting: The RARE25 challenge for early detection of Barrett's neoplasia

يضع تحدي RARE25 معياراً مرجعياً يراعي معدل الانتشار للكشف المبكر عن تسرطن باريت، كاشفاً أنه في حين تحقق أنظمة الكشف بمساعدة الحاسوب (CADe) الحالية أداءً تمييزياً قوياً، فإن قيمتها التنبؤية الإيجابية المنخفضة في الإعدادات الواقعية ذات الانتشار المنخفض تسلط الض fear على الحاجة الماسة إلى نهج قوي ومستقل عن معدل الانتشار لضمان الفائدة السريرية.

Tim J. M. Jaspers, Francisco Caetano, Cris H. B. Claessens, Carolus H. J. Kusters, Rixta A. H. van Eijck van Heslinga, F (…)2026-04-15
💻 computer science

NeuVolEx: Implicit Neural Features for Volume Exploration

تقدم الورقة البحثية NeuVolEx، وهو إطار عمل جديد لاستكشاف الحجم يستفيد من التمثيلات الميزتية المتعلمة أثناء تدريب التمثيل العصبي الضمني (INR)، والمعززة بمشفر هيكلي وتعلم متعدد المهام، لتمكين التصنيف القوي لمنطقة الاهتمام (ROI) وتوصية وجهات النظر حتى في ظل إشراف مستخدم ضئيل.

Haill An, Suhyeon Kim, Donghyuk Choo, Younhyun Jung2026-04-15
💻 computer science

Precision Synthesis of Multi-Tracer PET via VLM-Modulated Rectified Flow for Stratifying Mild Cognitive Impairment

تقدم الورقة البحثية إطار عمل DIReCT++، وهو إطار عمل مبتكر يجمع بين التدفق المصحح ثلاثي الأبعاد ونموذج رؤية-لغة متكيف مع النطاق لتخليق صور PET متعددة المتتبعات عالية الدقة من صور MRI والبيانات السريرية، مما يتيح التصنيف الدقيق لضعف الإدراك الخفيف من أجل التشخيص المبكر لمرض ألزهايمر.

Tuo Liu, Shuijin Lin, Shaozhen Yan, Haifeng Wang, Jie Lu, Jianhua Ma, Chunfeng Lian2026-04-15
💻 computer science

Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding

تقوم هذه الورقة البحثية بقياس أداء نموذجي Google Gemini 2.5 Flash وFlash Lite في فهم مشاهد الفيديو، كاشفةً أنه بينما يحقق الاستنتاج الإضافي عوائد متناقصة بعد بضع مئات من الرموز (tokens)، فإن Flash Lite يقدم أفضل توازن بين الكفاءة والجودة، إلا أن حدود الرموز الصارمة يمكن أن تؤدي إلى "هلوسات خطوة الضغط" حيث تظهر تفاصيل غير مستنتجة في المخرجات النهائية.

Shivam Sharma, Sankalp Nagaonkar, Ashish Choithani, Ashutosh Trivedi2026-04-15
💻 computer science

H-SPAM: Hierarchical Superpixel Anything Model

يُعد H-SPAM إطار عمل موحداً يُنشئ سوبر بيكسل (superpixels) هرمية دقيقة ومنتظمة ومتداخلة بشكل مثالي عبر الاستفادة من الميزات العميقة وعملية دمج مناطق ثنائية المراحل، متفوقاً بذلك على الأساليب الهرمية الحالية مع مضاهاة أداء الأساليب غير الهرمية المتطورة.

Julien Walther, Rémi Giraud, Michaël Clément2026-04-15
💻 computer science

Variational Latent Entropy Estimation Disentanglement: Controlled Attribute Leakage for Face Recognition

تقترح الورقة البحثية VLEED، وهي طريقة مشفر تلقائي تبايني لاحق (post-hoc variational autoencoder) تعمل على فك الارتباط بين السمات الحساسة مثل الجنس والعرق وبين تضمينات التعرف على الوجوه لتعزيز الخصوصية والعدالة مع الحفاظ على فائدة التحقق وتقليل التحيز الديموغرافي.

Ünsal Öztürk (Idiap Research Institute, Martigny, Switzerland), Vedrana Krivokuća Hahn (Idiap Research Institute, Martig (…)2026-04-15