🤖 AI

Saliency-Guided Representation with Consistency Policy Learning for Visual Unsupervised Reinforcement Learning

تقترح هذه الورقة إطار عمل SRCP، وهو إطار مبتكر يعزز التعلم التعزيزي البصري غير الخاضع للإشراف بنمط الصفر (zero-shot) عبر فصل تعلم التمثيل عن تدريب التابع من خلال مهمة ديناميكية موجهة بالبروز، ودمج سياسة اتساق مع توجيه خالٍ من المصنف للتغلب على قيود التمثيلات التابعة التقليدية في البيئات عالية الأبعاد.

Jingbo Sun, Qichao Zhang, Songjun Tu, Xing Fang, Yupeng Zheng, Haoran Li, Ke Chen, Dongbin Zhao2026-04-08
⚡ electrical engineering

Leveraging Image Editing Foundation Models for Data-Efficient CT Metal Artifact Reduction

تقترح هذه الورقة طريقة لتقليل آثار المعدن في التصوير المقطعي المحوسب بكفاءة عالية في استخدام البيانات، وذلك عبر إعادة صياغة المهمة كمسألة استدلال سياقي من خلال تكييف نموذج انتشار أساسي للرؤية واللغة باستخدام التكيف منخفض الرتبة (LoRA) والتحكم متعدد المراجع، محققةً نتائج هي الأفضل في فئتها باستخدام 16 إلى 128 مثالاً تدريبياً فقط مع الحد من الهلوسة من خلال التكيف مع المجال.

Ahmet Rasim Emirdagi, Süleyman Aslan, Mısra Yavuz, Görkay Aydemir, Yunus Bilge Kurt, Nasrin Rahimi, Burak Can Biner, M. (…)2026-04-08
💻 computer science

Mixture-of-Modality-Experts with Holistic Token Learning for Fine-Grained Multimodal Visual Analytics in Driver Action Recognition

تقترح هذه الورقة إطار عمل "خليط من خبراء الأنماط" (MoME) المعزز باستراتيجية "تعلم الرموز الشامل" (HTL) لتحقيق دمج متعدد الوسائط تكيفي ودقيق لتمييز أفعال السائقين بمتانة، مما يظهر أداءً فائقًا وقدرة على التفسير مقارنة بالنماذج المرجعية الحالية في الاختبارات القياسية العامة.

Tianyi Liu, Yiming Li, Wenqian Wang, Jiaojiao Wang, Chen Cai, Yi Wang, Kim-Hui Yap2026-04-08
🤖 machine learning

CoStream: Codec-Guided Resource-Efficient System for Video Streaming Analytics

يُعد CoStream نظاماً لتحليلات بث الفيديو كفؤاً في استهلاك الموارد، حيث يستفيد من البيانات الوصفية المتأصلة في الترميز لتوجيه تقليم الرقع عبر الإنترنت وتحديث ذاكرة التخزين المؤقت الانتقائية للمفاتيح والقيم، محققاً تحسناً في الإنتاجية يصل إلى 3 أضعاف وخفضاً في حسابات وحدة معالجة الرسومات بنسبة 87% مع حد أدنى من فقدان الدقة.

Yulin Zou, Yan Chen, Wenyan Chen, JooYoung Park, Shivaraman Nitin, Luo Tao, Francisco Romero, Dmitrii Ustiugov2026-04-08
💻 computer science

Attention, May I Have Your Decision? Localizing Generative Choices in Diffusion Models

تقترح هذه الورقة طريقة ICM، وهي طريقة توجيه دقيقة تعمل على تحديد وتدخل طبقات انتباه ذاتي محددة لمعالجة الخيارات التوليدية الضمنية وإزالة التحيز في نماذج الانتشار من النص إلى الصورة بفعالية.

Katarzyna Zaleska, Łukasz Popek, Monika Wysoczańska, Kamil Deja2026-04-08
💻 computer science

EDGE-Shield: Efficient Denoising-staGE Shield for Violative Content Filtering via Scalable Reference-Based Matching

يُعد EDGE-Shield مرشح محتوى مرجعيًا وقابلًا للتوسع، يقوم بحظر انتهاكات حقوق الطبع والنشر والتزييف العميق بكفاءة أثناء عملية توليد الصور من خلال الاستفوتادة من المطابقة القائمة على التضمين وتحويل xx-pred المبتكر لتقليل زمن الاستجابة بشكل كبير مع الحفاظ على دقة عالية عبر مختلف النماذج التوليدية.

Takara Taniguchi, Ryohei Shimizu, Minh-Duc Vo, Kota Izumi, Shiqi Yang, Teppei Suzuki2026-04-08
🤖 AI

Graph-PiT: Enhancing Structural Coherence in Part-Based Image Synthesis via Graph Priors

يعزز Graph-PiT التماسك الهيكلي في تركيب الصور القائم على الأجزاء من خلال تقديم شبكة عصبية رسومية هرمية تعمل على نمذجة العلاقات المكانية والدلالية بين المكونات المرئية صراحةً كأولوية رسومية، مما يتغلب بذلك على قيود التعامل مع الأجزاء كمجموعات غير مرتبة.

Junbin Zhang, Meng Cao, Feng Tan, Yikai Lin, Yuexian Zou2026-04-08
🤖 AI

Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning

تقدم هذه الورقة إطار عمل مغلق الحلقة لتوليف البرامج الرسومية العلمية يستفيد من مجموعة بيانات SciTikZ-230K عالية الجودة، ومجموعة تقييم SciTikZ-Bench الشاملة، ونموذج تعلم تعزيزي جديد قائم على الاتساق المزدوج الذاتي لتدريب نموذج SciTikZer-8B، الذي يحقق أداءً هو الأفضل في فئته في تحويل المرئيات الثابتة إلى كود TikZ قابل للتنفيذ، متفوقاً بذلك على النماذج متعددة الوسائط الرائدة المملوكة والمفتوحة المصدر.

Juekai Lin, Yun Zhu, Honglin Lin, Sijing Li, Tianwei Lin, Zheng Liu, Xiaoyang Wang, Wenqiao Zhang, Lijun Wu2026-04-08
💻 computer science

SEM-ROVER: Semantic Voxel-Guided Diffusion for Large-Scale Driving Scene Generation

إنَّ SEM-ROVER هو إطار عمل توليدي ثلاثي الأبعاد يستخدم نموذج انتشار مشروط دلاليًا يعمل على شبكة Σ\Sigma-Voxfield منفصلة لتمكين التوليد القابل للتوسع والمتسق متعدد المشاهد لمشاهد القيادة واقعية التصوير واسعة النطاق من خلال التوسيع المكاني التدريجي والرندرة المؤجلة.

Hiba Dahmani, Nathan Piasco, Moussab Bennehar, Luis Roldão, Dzmitry Tsishkou, Laurent Caraffa, Jean-Philippe Tarel, Rola (…)2026-04-08
💻 computer science

Action Images: End-to-End Policy Learning via Multiview Video Generation

تقدم هذه الورقة البحثية "صور الأفعال" (Action Images)، وهو نموذج عالمي موحد للأفعال يصيغ تعلم سياسة الروبوت كعملية توليد فيديو متعدد الزوايا عبر ترجمة أفعال بسبع درجات من الحرية إلى فيديوهات أفعال مرتبطة بالبكسلات، مما يمكن العمود الفقري للفيديو من العمل كسياسة صفرية دون وحدات تحكم منفصلة، مع تحقيق أداء فائق في كل من نجاح المهام الصفرية وجودة توليد الفيديو والأفعال.

Haoyu Zhen, Zixian Gao, Qiao Sun, Yilin Zhao, Yuncong Yang, Yilun Du, Tsun-Hsuan Wang, Yi-Ling Qiao, Chuang Gan2026-04-08