💻 computer science

Pixel Ignores, Superpixel Sees: Adverse Weather Image Restoration via Semantic-Center SSM

تقترح هذه الورقة نموذج SSR، وهو نموذج فضاء الحالة الموجه بالمركز الدلالي الذي يعمل على تحسين استعادة الصور في الظروف الجوية السيئة من خلال استبدال المسح المتسلسل للبكسلات التقليدي بآلية مسح انتقائية موجهة بالبكسلات الفائقة وآلية بوابات على مستوى المنطقة للتعامل بشكل أفضل مع التدهورات غير المنتظمة مكانياً.

Dayu Li, Shihao Zhou, Leizhi Shu, Jin Wu, Chi Man Vong, Jufeng Yang2026-08-04
🤖 AI

Investigating Social Bias in Narrative Image Generation

تُظهر هذه الورقة أن التحيزات الاجتماعية في نماذج توليد الصور من النصوص ليست أكثر انتشاراً فحسب، بل تظهر أيضاً بشكل أكثر صراحة في التنسيقات السردية مثل لوحات القصة (الستوري بورد) والقصص المصورة مقارنة بالصور المنفردة، مما يسلط الضال على الحاجة الماسة لتقييم هذه الأنظمة عبر سياقات بصرية متنوعة.

Junyeong Park, Sowon Min, Euna Jang, Soobin Kim, Jiho Jin, Hyunseung Lim, Gahyeon Bae, Hwajung Hong2026-08-04
💻 computer science

Detail Continuation over a Trustworthy Coarse Scale for Autoregressive Super-Resolution

تقترح الورقة البحثية K2N، وهي طريقة جديدة لرفع دقة الصور تعزز موثوقية النماذج التوليدية من خلال إعادة صياغة عملية التوليد الذاتي البصري لتأسيس ميزات موثوقة ذات مقياس خشن مباشرة من المدخلات منخفضة الدقة مع توليد التفاصيل الدقيقة غير المؤكدة فقط عبر عملية التوليد الذاتي، مما يؤدي بفعالية إلى تخفيف آثار الهلوسة.

Hongyi Fang, Jiahui Wu, Yichen Yue, Benjia Zhou, Dan Zeng2026-08-04
🤖 AI

PartMat: Material-Aware 3D Part Decomposition with a Single Global Latent

يُعد PartMat مساراً فعالاً لتفكيك الأجزاء ثلاثية الأبعاد مع مراعاة المواد، حيث يستخدم تمثيلاً كامناً عالمياً واحداً لإنشاء أصول مهيكلة وقابلة للتعديل ذات حدود مواد دقيقة وهندسة مفصلة، مع فصل تكاليف الاستدلال عن عدد الأجزاء.

Guangming Fu, Jin Song, Yiyun Fei, Guoqiu Li, Ruigao Yang, Jianan Jiang2026-08-04
💻 computer science

MoCRA: Mixture of Compositional Rank-1 Atoms for 4K All-in-One Video Restoration

يُعد MoCRA إطار عمل خفيف الوزن وقادر على معالجة فيديوهات بدقة 4K، حيث يستخدم مزيجاً من الذرات التركيبية من الرتبة الأولى لمعالجة تدهورات الضباب والمطر والضجيج وانخفاض الإضاءة في آن واحد دون الحاجة إلى التدفق البصري أو مجموعات بيانات مقترنة، محققاً أداءً وسرعة فائقين على مجموعة بيانات UHV-4K-AIO المقترحة حديثاً.

Yongcong Wang, Pu Wang, Hingchin Chen, Runci Bai, Yucheng Xin, Chen Wu, Chengchao Shen, Guangwei Gao, Siyuan Yao, Pengwe (…)2026-08-04
🤖 machine learning

WorldDynCache: Risk-Controlled Latent Dynamics Approximation for Diffusion World Model

يُعد WorldDynCache إطار عمل محكوم المخاطر يعمل على تسريع استنتاج نماذج العالم الانتشارية من خلال الجمع بين مُقدِّر مخاطر انتقال كامن خفيف الوزن وبديل مرفوع مدرك للشرط والمرحلة، مما يحقق تسريعاً كبيراً مع الحفاظ على جودة توليد فائقة مقارنة بطرق التخزين المؤقت الحالية.

Leyang Chen, Junyi Wu, Shaoqiu Zhang, Yulun Zhang2026-08-04
💻 computer science

Transformer Geometry Observatory TGO-III: Semantic Geometry Observatory

تقدم هذه الورقة إطار عمل TGO-III، الذي يحلل تطور تمثيلات ViT-Small/16 عبر طبقات التدريب لإثبات أن الفصل بين الفئات والهياكل الدلالية التمييزية يظهران تدريجياً جنباً إلى جنب مع توسع المتشعب، مما يدعم فرضية التوسع الدلالي.

Kaustubh Kapil, Kishor P. Upla2026-08-04
💻 computer science

GeoCore-9B: Towards Geo-Aware Generative Foundation Models in Earth Observation

يقدم البحث نموذج GeoCore-9B، وهو نموذج تأسيسي توليدي بـ 9 مليارات معلمة تم تدريبه من الصفر على بيانات رصد الأرض العالمية باستخدام محول انتشار قائم على مطابقة التدفق وفقدان محاذاة دلالي جغرافي مبتكر لتحقيق أداء هو الأفضل في فئته من حيث الدقة البصرية والدقة الهيكلية الجغرافية لمختلف تطبيقات رصد الأرض.

Jeonghyeok Do, Munchurl Kim2026-08-04
💻 computer science

PhotoHOI: Synthesizing 3D Hand-Object Interactions from a Single RGB Photograph

يُعد PhotoHOI إطار عمل مبتكر يعمل على تخليق تسلسلات واقعية لتفاعل اليد مع الأشياء ثلاثية الأبعاد من صورة RGB واحدة وتعليمات لغوية ذات مفردات مفتوحة، وذلك من خلال الاستفادة من التحليل البصري اللغوي، واستعادة المشهد ثلاثي الأبعاد، ومعلومات الاتصال والقبض المتعلمة مسبقاً لتحقيق نجاح عالٍ في المهام والقدرة على التعميم على أشياء غير مرئية مسبقاً.

Zhenhao Zhang, Jiajun Zhang, Wei Min, Yebin Liu2026-08-04
🤖 AI

Recompute or Reuse? Diagnosing and Mitigating Textual Shortcuts in VLM Self-Reflection

تحدد هذه الورقة البحثية "الاختصارات النصية"، حيث تعتمد نماذج الرؤية واللغة (VLMs) على أدلة قديمة من سلاسل الاستدلال السابقة بدلاً من إعادة الحساب بناءً على المدخلات البصرية الجديدة، وتقترح "جدار حماية انتباه الحالة الطازجة" (Fresh-State Attention Firewall) الذي لا يتطلب تدريباً لعزل الحوسبة الطازجة بفعالية وتحسين معدلات التحديث البصري بشكل كبير أثناء التأمل الذاتي.

Wenxiao Fan, Jingling Fu, Fang Li, Luohang Liu, Yu He, Lichen Ma, Zhiyang Yu, Weishan Bi, Junshi Huang, Yan Li, Gu Simiu (…)2026-08-04