💻 computer science

Through Van Gogh's Eyes: Global Style Transfer with Diffusion Mod

تقدم هذه الورقة البحثية "نقل الأسلوب العالمي" (GST)، وهو نموذج جديد لتخليق الصور الفنية يستفيد من توجيه الأسلوب العالمي وتوجيه محاذاة المحتوى لتجميع أعمال فنية متعددة لفنان مستهدف في صورة محتوى واحدة، مما يتغلب على قيود الأساليب الحالية في التقاط توزيع الأسلوب العالمي للفنان مع الحفاظ على البنية الدلالية وتقليل الانحياز الناتج عن النصوص.

Jeongha Lee, Yujin Kim, Ghazanfar Ali, Suhyun Kim, Jae-In Hwang2026-08-13
💻 computer science

Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections

لمعالجة تحديات القابلية لإعادة الإنتاج وحقوق الطبع والنشر في توليد الموسيقى من الفيديو، تقدم هذه الورقة مجموعة بيانات "مكتبة الموسيقى التصويرية للشاشة المفتوحة" (OSSL-v2) القابلة لإعادة الإنتاج والمكونة من أفلام من الملكية العامة، وتقترح نموذجاً مدركاً للحوار يعزز توليد الموساقى من خلال تعديل الانتباه المتقاطع للفيديو مع الكلام الظاهر على الشاشة.

Haven Kim, Zachary Novack, Julian McAuley, Hao-Wen Dong2026-08-13
💻 computer science

How Can Driving World Models Do Counterfactual Prediction?

تحدد هذه الورقة عدم تطابق جوهري في نماذج عالم القيادة حيث يفشل التنبؤ المعتمد مباشرة على الفعل في الحفاظ على السياق الواقعي للسيناريوهات الافتراضية، وتقترح مسار عمل بسيطاً لا يتطلب تدريباً يدمج الأدلة المرصودة لتحسين دقة التنبؤات الافتراضية بشكل كبير.

Jiaru Zhang, Can Cui, Yi Xu, Xin Ye, Ruqi Zhang, Ziran Wang2026-08-13
🤖 AI

MBA: Multimodal Benchmark and Agents for Real-World Business Ideation

تقدم هذه الورقة MBA-Bench، وهو أول معيار تقييم متعدد الوسائط لتوليد الأفكار التجارية، وتقترح الوكيلين MBA-b وMBA-k اللذين يستفيدان من الإشارات المرئية وأهداف المكافأة المبتكرة للتفوق بشكل كبير على النماذج المرجعية الحالية المعتمدة على النصوص فقط أو متعددة الوسائط في توليد أفكار تجارية إبداعية وقابلة للتنفيذ.

Hojun Choi, Jaeyo Shin, Suin Lee, Hyunjung Shim2026-08-13
💻 computer science

KANResDiff: Learning Local Residual Diffusion via Kolmogorov-Arnold Network for Ambiguous Medical Image Segmentation

تقترح الورقة البحثية KANResDiff، وهو إطار عمل مبتكر يستفيد من شبكات كولموغوروف-أرنولد وجسر شرودنجر المتبقي مع ترميز زمني مستقل لتمكين الانتشار المتبقي المحلي التدريجي والواعي بالمراحل لتحقيق أداء رائد في تقسيم الصور الطبية الغامضة.

Fanding Li (Faculty of Computing, Harbin Institute of Technology, Harbin, China), Chenglin Wang (Faculty of Computing, H (…)2026-08-13
🤖 machine learning

CAM-Guided Saliency Cutout and Image-Based Malware Classification

تستقصي هذه الورقة البحثية فعالية تقنية "القطع السطحي الموجه بخرائط التنشيط الكلاسيكي" (CAM-guided saliency cutout) لتصنيف صور البرمجيات الخبيثة باستخدام مجموعة بيانات RawMal-TF، حيث وجدت أنه على عكس الصور الطبيعية التي يحسن فيها القطع منخفض البروز الأداء، فإن استراتيجيات القطع الموجه بالبروز تؤدي في الواقع إلى خفض الدقة بالنسبة للبرمجيات الخبيث، مما يسلط الضوء على وجود اختلافات جوهرية في النطاق بين هذين النوعين من الصور.

Yasaman Ebrahimi, Martin Jurecek, Mark Stamp2026-08-13
🤖 machine learning

Transferable Above-Ground Biomass (AGB) Estimation Model from Multi-Sensor Data with Sparse Field Calibration

تقدم هذه الورقة إطار عمل قابلاً للنقل يستخدم شبكة عصبية تلافيفية واحدة مدربة عالمياً، تجمع بين بيانات الأقمار الصناعية متعددة المستشعرات ومراجع GEDI، والتي يتم تكييفها بكفاءة مع المناظر الطبيعية المحلية عبر سير عمل معايرة ميدانية خفيف الوزن لتحقيق تقدير عالي الدقة ومتصل مكانياً للكتلة الحيوية للغابات.

Pann Thinzar Seint, Bryan Atwood, Subas Chhatkuli2026-08-13
🤖 machine learning

Robustness of AI-Art Detectors under Generator Shift

تُظهر هذه الورقة أن كواشف الفن المعتمدة على الذكاء الاصطناعي الحالية، رغم فعاليتها ضد المولدات التي تدربت عليها، تعاني من تدهور كبير في الأداء عند مواجهة بنيات أحدث مثل Stable Diffusion 3.5، مما يسلط الضوء على فجوة تعميم حرجة تستوجب استراتيجيات دفاع متعددة الطبقات.

Shivank Singh Thakur, Meien Li, Mark Stamp2026-08-13
🤖 AI

Advancing MLLM-based UAV Image Understanding and Reasoning: A Benchmark and a Training-Free Multi-Agent System

تعالج هذه الورقة البحثية التقييم المجزأ لفهم صور الطائرات بدون طيار من خلال تقديم UAVQA-Bench، وهو معيار شامل يكشف عن أنماط الفشل الرئيسية في النماذج الحالية، وتقترح UAV-MAS، وهو نظام متعدد الوكلاء لا يتطلب تدريباً يتفوق بشكل كبير على النماذج الرائدة من خلال آليات الإدراك المتخصص، والتحسين التكراري، والبحث التكيفي.

Haoyu Zhang, Shuoxun Zhang, Peng Ye, Lin Zhang, Jiakang Yuan, Shenghong Yi, Yuening Wang, Tao Chen2026-08-13
💻 computer science

LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time

يُعد LiveAnimate نظاماً مبتكراً لتوليد الفيديو في الوقت الفعلي بمقياس المليارات، مبنياً على نموذج محول انتشار (Diffusion Transformer) بـ 14 مليار معلمة، يحقق رسوماً متحركة بشرية مستمرة وطويلة الأمد عبر البث مع زمن انتقال ثابت وجودة إدراكية عالية من خلال خط تدريب ثنائي المراحل وآلية انتباه "مصب استرجاع الوضعية" (Pose-Retrieval Sink Attention) المتخصصة.

Yuxuan Zhang, Haozhong Xiong, Yubo Huang, Jiayi Song, Jinpeng Yu, Haofan Wang, Jiaming Liu, Ruihua Huang, Liwei Wang2026-08-13