💻 computer science

GaussianGrow: Geometry-aware Gaussian Growing from 3D Point Clouds with Text Guidance

تُعد GaussianGrow طريقة مبتكرة تولد نماذج غاوس ثلاثية الأبعاد عالية الجودة من سحب النقاط ثلاثية الأبعاد عبر تنميتها بشكل تكراري بتوجيه نصي، وذلك باستخدام نماذج الانتشار متعددة المناظير لتخليق المظهر والترميم لضمان الدقة الهندسية والتغطية الكاملة للمناطق غير المرئية.

Weiqi Zhang, Junsheng Zhou, Haotian Geng, Kanle Shi, Shenkun Xu, Yi Fang, Yu-Shen Liu2026-04-08
💻 computer science

Beyond Semantics: Disentangling Information Scope in Sparse Autoencoders for CLIP

تقدم هذه الورقة "نطاق المعلومات" كبُعد جديد للقابلية للتفسير في المشفِّرات التلقائية المتفرقة (Sparse Autoencoders) في نموذج CLIP، مقترحةً "درجة الاعتماد السياقي" للتمييز بين الميزات المحلية المستقرة موقعيًا والميزات العالمية المتغيرة، مما يكشف كيفية تأثير هذه النطاقات المتباينة بشكل منهجي على تنبؤات النموذج وثقته.

Yusung Ro, Jaehyun Choi, Junmo Kim2026-04-08
💻 computer science

Single-Stage Signal Attenuation Diffusion Model for Low-Light Image Enhancement and Denoising

تقترح هذه الورقة نموذج انتشار تخفيف الإشارة (SADM)، وهو إطار عمل جديد أحادي المرحلة يدمج آلية تخفيف الإشارة في عملية الانتشار لتحقيق استعادة السطوع وكبح الضجيج في آن واحد من أجل تحسين الصور منخفضة الإضاءة، مما يلغي الحاجة إلى خطوط المعالجة متعددة المراحل أو الشبكات المساعدة التي تتطلبها الطرق الحالية.

Ying Liu, Junchao Zhang, Caiyun Wu2026-04-08
💬 NLP

Beyond the Beep: Scalable Collision Anticipation and Real-Time Explainability with BADAS-2.0

يعمل نظام BADAS-2.0 على تطوير التنبؤ بالتصادم من خلال تقديم معيار قياسي واسع النطاق طويل الذيل للسيناريوهات النادرة الحرجة للسلامة، وتمكين النشر عند الحواف في الوقت الفعلي عبر تقطير المعرفة الفعال، وتوفير تنبؤات قابلة للتفسير عبر خرائط حرارية للاهتمام المرتكز على الكائنات والاستدلال القائم على الرؤية واللغة.

Roni Goldshmidt, Hamish Scott, Lorenzo Niccolini, Hernan Matzner2026-04-08
💻 computer science

BodhiPromptShield: Pre-Inference Prompt Mediation for Suppressing Privacy Propagation in LLM/VLM Agents

يُعد BodhiPromptShield إطار عمل مدركاً للسياسات يعمل على الحد من انتشار الخصوصية في وكلاء النماذج اللغوية الكبيرة (LLM) والنماذج اللغوية البصرية (VLM) عبر التوسط في المعلومات الحساسة عبر مراحل الاسترجاع، والذاكرة، والأدوات من خلال التجريد الاستراتيجي والاستعادة المتأخرة، متفوقاً بذلك على أساليب إخفاء الهوية الحالية في التقييمات المنضبطة.

Bo Ma, Jinsong Wu, Weiqi Yan2026-04-08
💻 computer science

EfficientMonoHair: Fast Strand-Level Reconstruction from Monocular Video via Multi-View Direction Fusion

يُعد EfficientMonoHair إطار عمل سريعًا ودقيقًا يجمع بين الشبكات العصبية الضمنية والدمج الهندسي متعدد الرؤى واستراتيجية نمو الشعر المتوازية المبتكرةة لتحقيق إعادة بناء للشعر عالية الدقة على مستوى الخصلات من فيديو أحادي العدسة، مع تحسين كفاءة وقت التشغيل بشكل كبير مقارنة بالطرق الرائدة حاليًا.

Da Li, Dominik Engel, Deng Luo, Ivan Viola2026-04-08
🤖 machine learning

Learn to Rank: Visual Attribution by Learning Importance Ranking

تقترح هذه الورقة طريقة عزو بصري قائمة على التعلم تعمل على تحسين مقاييس الحذف والإدراج غير القابلة للتفاضل مباشرة عبر استرخاء "Gumbel-Sinkhorn"، مما يتيح تفسيرات فعالة وكثيفة ومتوافقة مع الحدود لنماذج الرؤية المعقدة، ولا سيما نماذج المحولات (transformers)، من خلال التغلب على المقايضات بين الكفاءة والسببية والدقة الموجودة في النهج الحالية.

David Schinagl, Christian Fruhwirth-Reisinger, Alexander Prutsch, Samuel Schulter, Horst Possegger2026-04-08
💻 computer science

Reading Between the Pixels: An Inscriptive Jailbreak Attack on Text-to-Image Models

تقدم هذه الورقة البحثية "Etch"، وهو إطار عمل هجوم جديد من نوع الصندوق الأسود يستغل قدرات رندرة النصوص الناشئة في نماذج تحويل النص إلى صورة الحديثة لتنفيذ "اختراقات نصية" (inscriptive jailbreaks) عبر تضمين حمولات نصية ضارة داخل صور حميدة، محققاً معدلات نجاح أعلى بكثير من الأساليب الحالية وكاشفاً عن ثغرات حرجة في عمليات المحاذاة الأمنية الحالية.

Zonghao Ying, Haowen Dai, Lianyu Hu, Zonglei Jing, Quanchen Zou, Yaodong Yang, Aishan Liu, Xianglong Liu2026-04-08
💻 computer science

AICA-Bench: Holistically Examining the Capabilities of VLMs in Affective Image Content Analysis

تقدم هذه الورقة AICA-Bench، وهو معيار شامل لتقييم نماذج الرؤية واللغة في التحليل الشامل لمحتوى الصور العاطفي، وتقترح إطار عمل "التحفيز بشجرة التأثير المرتكزة" (GAT) الخالي من التدريب لمعالجة أوجه القصور المحددة في معايرة الكثافة وعمق الوصف.

Dong She, Xianrong Yao, Liqun Chen, Jinghe Yu, Yang Gao, Zhanpeng Jin2026-04-08
🤖 AI

Selective Aggregation of Attention Maps Improves Diffusion-Based Visual Interpretation

تقترح هذه الورقة طريقة تعمل على تجميع خرائط الانتباه المتقاطع بشكل انتقائي من رؤوس الانتباه الأكثر صلة في نماذج الانتشار من النص إلى الصورة لتحسين التفسير البصري ودقة التجزئة بشكل كبير مقارنة بالنهج الحالية مثل DAAM.

Jungwon Park, Jungmin Ko, Dongnam Byun, Wonjong Rhee2026-04-08