💻 computer science

So-Fake: Benchmarking and Explaining Social Media Image Forgery Detection

تقدم هذه الورقة So-Fake، وهو إطار عمل شامل يتكون من مجموعة بيانات وسائط اجتماعية واسعة النطاق (So-Fake-Set)، ومعيار اختبار صارم خارج النطاق (So-Fake-OOD)، ونموذج متطور للكشف عن الرؤية واللغة (So-Fake-R1) مصمم لتحسين دقة وتحديد موقع وقابلية تفسير كشف تزييف الصور المُنشأة بواسطة الذكاء الاصطناي على منصات التواصل الاجتماعي.

Zhenglin Huang, Xiangtai Li, Xi Yang, Bei Peng, Xiaowei Huang, Baoyuan Wu, Dacheng Tao, Ming-Hsuan Yang, Guangliang Chen (…)2026-08-03
💻 computer science

AniCrafter: Customizing Realistic Human-Centric Animation via Avatar-Background Conditioning in Video Diffusion Models

يُعد AniCrafter نموذجاً جديداً قائماً على الانتشار يتغلب على قيود الطرق الحالية المعتمدة على الهيكل من خلال تقديم آلية تكييف "الأفاتار-الخلفية"، مما يُمكّن من توليد رسوم متحركة واقعية متمحورة حول الإنسان ومدركة للاحتجاب ضمن خلفيات ديناميكية مفتوحة النطاق.

Muyao Niu, Mingdeng Cao, Yifan Zhan, Qingtian Zhu, Weihang Ran, Yanhong Zeng, Xiao Sun, Zhihang Zhong, Yinqiang Zheng2026-08-03
💬 NLP

Vision Meets Language: A RAG-Augmented YOLOv8 Framework for Coffee Disease Diagnosis and Farmer Assistance

تقترح هذه الورقة إطار عمل جديد للزراعة الدقيقة يدمج نموذج YOLOv8 للكشف عن أمراض أوراق القهوة مع نظام التوليد المعزز بالاسترجاع (RAG) لتزويد المزارعين بتشخيصات واستراتيجيات علاجية بلغة طبيعية دقيقة، وخالية من الهلوسة، وسياقية.

Semanto Mondal2026-08-03
💻 computer science

Deformable Medical Image Registration with KAN-based Implicit Neural Representations

تقدم هذه الورقة البحثية KAN-IDIR وRandKAN-IDIR، وهما أول إطارات عمل لتمثيل عصبي ضمني قائمة على شبكة كولموغوروف-أرنولد لتسجيل الصور الطبية القابلة للتشوه، واللتين تحققان دقة واستقراراً واستقلالية في الدقة الفائقة دون الحاجة إلى تدريب على مجموعات بيانات واسعة النطاق.

Nikita Drozdov, Marat Zinovev, Dmitry Sorokin2026-08-03
🤖 AI

Fast Feature Field (F3\text{F}^3): A Predictive Representation of Events

تقدم هذه الورقة البحثية حقل الميزات السريع (F3\text{F}^3)، وهو تمثيل تنبؤي، متفرق، وفعال للكاميرات القائمة على الأحداث، يحقق معدلات إطارات عالية وأداءً رائدًا عبر مختلف المنصات الروبوتية، وظروف الإضاءة، والمهام اللاحقة مثل التدفق البصري، والتجزئة الدلالية، وتقدير العمق.

Richeek Das, Kostas Daniilidis, Pratik Chaudhari2026-08-03
💬 NLP

Regional Attention-Enhanced Swin Transformer for Clinically Relevant Medical Image Captioning

تقدم هذه الورقة نموذج "Swin Transformer" المعزز بالانتباه الإقليمي، وهو نموذج مدمج وقابل للتفسير يحقق أعلى مستويات الدقة الدلالية في توليد تعليقات طبية ذات صلة سريرية من خلال تضخيم المناطق ذات الأهمية التشخيصية، كما تم التحقق من ذلك عبر الأداء المتفوق على مجموعة بيانات ROCO مقارنة بالنماذج المرجعية الحالية.

Zubia Naz, Farhan Asghar, Muhammad Ishfaq Hussain, Yahya Hadadi, Muhammad Aasim Rafique, Wookjin Choi, Moongu Jeon2026-08-03
💻 computer science

Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length

تقدم هذه الورقة Live Avatar، وهو إطار عمل خوارزمي-نظام مصمم بشكل مشترك يتيح أول توليد عملي، في الوقت الفعلي، وبطول لانهائي لصور رمزية (avatars) مدفوعة بالصوت ذات 14 مليار معلمة، وذلك عبر الجمع بين خط معالجة انتشار سببي مكرر (distilled causal diffusion pipeline) وتوازي خط أنابيب فرض الخطوات الزمنية (Timestep-forcing Pipeline Parallelism) لتحقيق 45 إطاراً في الثانية مع القضاء على انحراف الهوية طويل المدى.

Yubo Huang, Hailong Guo, Fangtai Wu, Weiqiang Wang, Shifeng Zhang, Shijie Huang, Qijun Gan, Lin Liu, Sirui Zhao, Enhong (…)2026-08-03
💻 computer science

Progressive Checkerboards for Autoregressive Multiscale Image Generation

تقدم هذه الورقة ترتيباً ثابتاً مرناً يعتمد على رقع الشطرنج التقدمية لتوليد الصور ذات الترتيب الذاتي متعدد المقاييس، مما يتيح أخذ عينات متوازية فعالة مع تقسيم شجري رباعي متوازن، محققةً أداءً تنافسياً على مجموعة بيانات ImageNet بعدد أقل من خطوات أخذ العينات مقارنة بالأنظمة الحديثة الرائدة.

David Eigen2026-08-03
💻 computer science

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation

تحدد هذه الورقة تعالج ظاهرة "نسيان المطالبة" (prompt forgetting) في نماذج محولات الانتشار متعددة الوسائط (Multimodal Diffusion Transformers)، حيث تتدهور دلالات المطالبة في الطبقات الأعمق، وذلك عبر تقديم طريقة "إعادة حقن المطالبة" (prompt reinjection) التي لا تتطلب تدريباً، والتي تعمل باستمرار على تحسين اتباع التعليمات وجودة توليد الصور الإجمالية عبر اختبارات معيارية متعددة.

Yuxuan Yao, Yuxuan Chen, Hui Li, Kaihui Cheng, Qipeng Guo, Yuwei Sun, Zilong Dong, Jingdong Wang, Siyu Zhu2026-08-03
🤖 AI

Detecting AI-Generated Videos with Spiking Neural Networks

تقدم هذه الورقة البحثية MAST، وهو كاشف يعتمد على الشبكات العصبية النبضية (SNN)، يستفيد من المعالجة الفريدة القائمة على الأحداث للبواقي الزمنية والمسارات الدلالية لتحقيق تعميم فائق عبر المولدات في كشف مقاطع الفيديو المُنشأة بواسطة الذكاء الاصطنا, متفوقاً بذلك على الأساليب الحالية في معيار GenVidBench.

Minsuk Jang, Yujin Yang, Hee-Seon Kim, Minseok Son, Younghun Kim, Changick Kim2026-08-03