⚡ electrical engineering

A Comparative Study of Transformer and Convolutional Models for Crop Segmentation from Satellite Image Time Series

تقدم هذه الورقة دراسة مقارنة لنماذج الشبكات العصبية الالتفافية (CNN) والنماذج القائمة على المحولات (Transformer) لتقسيم المحاصيل من السلاسل الزمنية لصور سنتينل-2 (Sentinel-2)، حيث تُظهر أن البنيات التي تضع نماذج صريحة للارتباطات الزمنية، ولا سيما نموذج TSViT، تتفوق على الشبكات العصبية الالتفافية ثلاثية الأبعاد التقليدية ونهج المحولات المقتصرة على الجانب المكاني، بينما يوفر نموذج VistaFormer توازناً مثالياً بين الكفاءة والأداء.

Mattia Gatti, Ignazio Gallo, Nicola Landro, Christian Loschiavo, Anwar Ur Rehman, Mirco Boschetti, Riccardo La Grassa2026-05-08
💻 computer science

DOLLAR: Few-Step Video Generation via Distillation and Latent Reward Optimization

يقدم إطار عمل DOLLAR منهجية مبتكرة لتوليد الفيديو في خطوات قليلة تجمع بين التقطير التبايني والتقطير الاتساقي مع نهج تحسين مكافأة كامن موفر للذاكرة، محققاً جودة وتنوعاً في فيديوهات مدتها 10 ثوانٍ يمثلان أحدث ما توصل إليه العلم، مع تسريع سرعات أخذ العينات بما يصل إلى 278.6 مرة.

Zihan Ding, Chi Jin, Difan Liu, Haitian Zheng, Krishna Kumar Singh, Qiang Zhang, Yan Kang, Zhe Lin, Yuchen Liu2026-05-08
💻 computer science

Gungnir: Exploiting Stylistic Features in Images for Backdoor Attacks on Diffusion Models

تقترح الورقة البحثية "Gungnir"، وهو هجوم باب خلفي مبتكر على نماذج الانتشار يستخدم سمات أسلوبية عالية المستوى وخفية كـمحفزات بدلاً من الرقع المرئية الصارخة، وذلك عبر توظيف الضوضاء التنافسية لإعادة البناء والاحتفاظ بالخطوات الزمنية قصيرة المدى للالتفاف على الدفاعات المتطورة مع الحفاظ على سلوك ضار فعال.

Lei Zhang, Yu Pan, Bingrong Dai, Lin Wang2026-05-08
🤖 machine learning

Teaching Metric Distance to Discrete Autoregressive Language Models

تقدم هذه الورقة DIST2Loss، وهي دالة هدف مدركة للمسافة للنماذج اللغوية ذات التوليد الذاتي المنفصل، والتي تستبدل الأهداف التقليدية بنظام "الهدف ذو الحد الواحد" (one-hot) بتوزيعات مرجحة بالمكافأة لتحسين كفاءة البيانات والأداء عبر مهام متنوعة مثل التأسيس البصري، والروبوتات، وتوليد الصور من خلال الاستفادة من العلاقات المترية بين الرموز.

Jiwan Chung, Saejin Kim, Yongrae Jo, Jaewoo Park, Dongjun Min, Youngjae Yu2026-05-08
🔬 condensed matter

Dreaming up scale invariance via inverse renormalization group

تُثبت هذه الورقة أن الشبكات العصبية الدنيا التي تحتوي على ثلاثة معلمات فقط يمكنها عكس إجراء مجموعة إعادة التطبيع احتماليًا لتوليد تكوينات حرجة ثابتة المقياس لنموذج إيزينغ ثنائي الأبعاد، مما يستوعب الخصائص العالمية الجوهرية وقيم مُعاملات مجموعة إعادة التطبيع دون الحاجة إلى بنيات معقدة.

Adam Rançon, Ulysse Rançon, Tomislav Ivek, Ivan Balog2026-05-08
🤖 machine learning

Pulling Back the Curtain on Deep Networks

تقدم هذه المساهمة "السحب الدلالي" (Semantic Pullbacks)، وهي طريقة قائمة على أسس نظرية تفسر الشبكات العميقة كعوامل تآلف مشروطة بالمدخلات لتوليد تفسيرات لاحقة ملائمة إدراكياً، ومستقرة، وموثوقة، وذلك عن طريق إعادة بناء هياكل محلية متماسكة من الخلايا العصبية المستهدفة.

Maciej Satkiewicz, Roberto Corizzo, Marcin Pietroń2026-05-08✓ Author reviewed
💻 computer science

Guidance Watermarking for Diffusion Models

تقدم هذه الورقة البحثية "العلامة المائية التوجيهية" (Guidance Watermarking)، وهي طريقة مبتكرة تدمج أجهزة فك تشفير العلامات المائية الجاهزة في عملية الانتشار عبر التوجيه القائم على التدرج، مما يتيح وضع علامات مائية قوية أثناء عملية التوليد دون الحاجة إلى إعادة التدريب مع الحفاظ على جودة الصور وتنوعها.

Enoal Gesny, Eva Giboulot, Teddy Furon, Vivien Chappelier2026-05-08
🤖 machine learning

Submanifold Sparse Convolutional Networks for Automated 3D Segmentation of Kidneys and Kidney Tumours in Computed Tomography

تقترح هذه الورقة إطار عمل لشبكة تلافيفية تحت-منبسطة متفرقة (SSCN) ثنائية المرحلة، تتيح تجزئة ثلاثية الأبعاد عالية الدقة وذاتية للكلى والأورام في صور الأشعة المقطعية بكفاءة، وذلك من خلال الاستفادة من التناثر الفوكسلي لتقليل استخدام الذاكرة ووقت الاستدلال بشكل كبير مع تحقيق دقة تنافسية على مجموعة بيانات KiTS23.

Saúl Alonso-Monsalve, Leigh H. Whitehead, Adam Aurisano, Lorena Escudero Sanchez2026-05-08
💻 computer science

VideoASMR-Bench: Can AI-Generated ASMR Videos Fool VLMs and Humans?

تقدم الورقة البحثية VideoASMR-Bench، وهو معيار مرجعي جديد يستخدم محتوى ASMR دقيق التفاصيل ليكشف أنه بينما تستطيع نماذج توليد الفيديو المتطورة إنشاء فيديوهات اصطناعية تخدع نماذج فهم الفيديو الحالية، إلا أن البشر يظلون أفضل بكثير في التمييز بين هذه الفيديوهات المولدة بالذكاء الاصطناعي والفيديوهات الحقيقية.

Jiaqi Wang, Weijia Wu, Yi Zhan, Rui Zhao, Ming Hu, James Cheng, Wei Liu, Philip Torr, Kevin Qinghong Lin2026-05-08
💻 computer science

MACE-Dance: Motion-Appearance Cascaded Experts for Music-Driven Dance Video Generation

يُعد MACE-Dance إطار عمل مبتكر لتوليد فيديوهات الرقص المدفوعة بالموسيقى، حيث يستخدم بنية "خليط الخبراء" (Mixture-of-Experts) المتتالية، التي تجمع بين خبير حركة قائم على نموذج BiMamba-Transformer لتخليق حركة ثلاثية الأبعاد واقعية، وخبير مظهر لتوليد فيديو عالي الدقة، مما يحقق أداءً هو الأفضل في فئته من حيث جودة الحركة والمظهر البصري.

Kaixing Yang, Jiashu Zhu, Xulong Tang, Ziqiao Peng, Xiangyue Zhang, Puwei Wang, Jiahong Wu, Xiangxiang Chu, Hongyan Liu (…)2026-05-08