💻 computer science

Image-Guided Geometric Stylization of 3D Meshes

تقترح هذه الورقة إطار عمل للأسلوب الهندسي يقوم بتشويه الشبكات ثلاثية الأبعاد لتعكس الميزات الهندسية لصورة مرجعية عبر الاستفادة من نماذج الانتشار سابقة التدريب لاستخراج الأسلوب التجريدي ومشفر "VAE" تقريبي لحساب التدرج بكفاءة، مما يتيح تغييرات هندسية جذرية مع الحفاظ على طوبولوجيا الشبكة والدلالات على مستوى الأجزاء.

Changwoon Choi, Hyunsoo Lee, Clément Jambon, Yael Vinker, Young Min Kim2026-04-10
💻 computer science

Latent Anomaly Knowledge Excavation: Unveiling Sparse Sensitive Neurons in Vision-Language Models

تقدم هذه الورقة إطار عمل LAKE، وهو إطار عمل لا يتطلب تدريباً يتحدى نموذج الصندوق الأسود لنماذج الرؤية واللغة من خلال إثبات أن اكتشاف الشذوذ يمكن تحقيقه عبر التنشيط المستهدف لنيورونات (عصبونات) نادرة، كامنة، وحساسة للشذوذ باستخدام العينات الطبيعية فقط، مما يحقق أداءً يضاهي أحدث ما توصل إليه العلم مع قابلية تفسير ذاتية.

Shaotian Li, Shangze Li, Chuancheng Shi, Wenhua Wu, Yanqiu Wu, Xiaohan Yu, Fei Shen, Tat-Seng Chua2026-04-10
💻 computer science

HAWK: Head Importance-Aware Visual Token Pruning in Multimodal Models

تُعد HAWK طريقةً لتقليم الرموز المرئية دون الحاجة إلى تدريب لنماذج اللغات الكبيرة متعددة الوسائط، حيث تستفيد من الوعي بأهمية الرأس والانتباه الموجه بالنص لتقليل زمن الاستجابة واستهلاك الذاكرة بشكل كبير مع الحفاظ على دقة تضاهى أعلى المستويات من خلال الاحتفاظ انتقائياً بالرموز المرئية ذات الصلة بالمهمة.

Qihui Zhu, Tao Zhang, Yuchen Wang, Zijian Wen, Mengjie Zhang, Shuangwu Chen, Xiaobin Tan, Jian Yang, Yang Liu, Zhenhua D (…)2026-04-10
💻 computer science

AgriChain Visually Grounded Expert Verified Reasoning for Interpretable Agricultural Vision Language Models

تقدم الورقة البحثية AgriChain، وهي مجموعة بيانات لـ 11,000 صورة زراعية تم التحقق منها من قبل خبراء مع مسوغات تعتمد على تسلسل الأفكى (chain-of-thought)، وتُظهر أن الضبط الدقيق لنموذج Qwen2.5-VL-3B على هذه البيانات يحسن بشكل كبير كلاً من دقة وقابلية تفسير تشخيص أمراض النباتات مقارنة بالنماذج التجارية الرائدة للرؤية واللغة.

Hazza Mahmood, Yongqiang Yu, Rao Anwer2026-04-10
💬 NLP

Are GUI Agents Focused Enough? Automated Distraction via Semantic-level UI Element Injection

تقدم هذه الورقة البحثية "حقن عناصر واجهة المستخدم على المستوى الدلالي"، وهي طريقة للاختبار الهجومي (red-teaming) تقوم بوضع عناصر واجهة مستخدم غير ضارة فوق الواجهة لتضليل وكلاء واجهة المستخدم الرسومية (GUI agents)، مما يكشف أن عمليات الحقن المحسنة هذه تزيد بشكل كبير من معدلات نجاح الهجوم، وتنتقل عبر النماذج، وتخلق عوامل جذب بصرية مستمرة مقارنة بالضوضاء العشوائية.

Wenkui Yang, Chao Jin, Haisu Zhu, Weilin Luo, Derek Yuen, Kun Shao, Huaibo Huang, Junxian Duan, Jie Cao, Ran He2026-04-10
💻 computer science

Reinforcement-Guided Synthetic Data Generation for Privacy-Sensitive Identity Recognition

تقترح هذه الورقة إطار عمل لتوليد البيانات الاصطناعية الموجهة بالتعزيز، يعمل على تكييف النماذج التوليدية سابقة التدريب مع مهام التعرف على الهوية الحساسة للخصوصية من خلال المحاذاة في مرحلة البداية الباردة، وتحسين المكافأة متعدد الأهداف، والاختيار الديناميكي للعينات، مما يكسر حلقة ندرة البيانات مع تحسين دقة التوليد ودقة التصنيف بشكل كبير.

Xuemei Jia, Jiawei Du, Hui Wei, Jun Chen, Joey Tianyi Zhou, Zheng Wang2026-04-10
💻 computer science

Sampling-Aware 3D Spatial Analysis in Multiplexed Imaging

تتقصى هذه الورقة كيفية تأثير هندسة أخذ العينات على استقرار الإحصاءات المكانية في التصوير متعدد الأطياف، وتستعرض وحدة إعادة بناء مدركة للهندسة تتيح تحليلاً ثلاثي الأبعاد متناثرًا وموثوقًا من المقاطع المتسلسلة، مما يوفر إرشادات عملية حول متى يكفي أخذ العينات ثنائي الأبعاد مقابل متى تكون إعادة البناء ثلاثي الأبعاد ضرورية.

Ido Harlev, Tamar Oukhanov, Raz Ben-Uri, Leeat Keren, Shai Bagon2026-04-10
💻 computer science

WorldMAP: Bootstrapping Vision-Language Navigation Trajectory Prediction with Generative World Models

يقدم WorldMAP إطار عمل "معلم-طالب" يستفيد من نماذج العالم التوليدية لتخليق إشراف دلالي-مكاني مهيكل وتسميات مسار مستعارة، مما يمكن نموذج طالب خفيف الوزن من تحقيق أداء رائد في الملاحة الرؤية-اللغوية من خلال تحويل المستقبل المتخيل بفعالية إلى إشارات تعلم راسخة.

Hongjin Chen, Shangyun Jiang, Tonghua Su, Chen Gao, Xinlei Chen, Yong Li, Zhibo Chen2026-04-10
💻 computer science

ImVideoEdit: Image-learning Video Editing via 2D Spatial Difference Attention Blocks

يُعد ImVideoEdit إطار عمل فعال لتحرير الفيديو يحقق نتائج عالية الدقة ومتسقة زمنياً من خلال التعلم حصرياً من أزواج الصور عبر نهج مكاني زماني منفصل، وذلك باستخدام وحدة انتباه الفرق المكاني "تنبؤ-تحديث" وآلية بوابات دلالية ديناميكية موجهة بالنص مع تجميد وحدات الانتباه ثلاثية الأبعاد مسبقة التدريب.

Jiayang Xu, Fan Zhuo, Majun Zhang, Changhao Pan, Zehan Wang, Siyu Chen, Xiaoda Yang, Tao Jin, Zhou Zhao2026-04-10
💻 computer science

Lighting-grounded Video Generation with Renderer-based Agent Reasoning

تقدم الورقة البحثية LiVER، وهو إطار عمل قائم على الانتشار يحقق مستويات رائدة في توليد الفيديو القابل للتحكم في المشهد عبر فك الارتباط بين الخصائص ثلاثية الأبعاد مثل التخطيط، والإضاءة، ومسار الكاميرا من خلال وكيل يعتمد على برنامج عرض ومجموعة بيانات ضخمة ومبتكرة.

Ziqi Cai, Taoyu Yang, Zheng Chang, Si Li, Han Jiang, Shuchen Weng, Boxin Shi2026-04-10