💻 computer science

From Local to Global to Mechanistic: An iERF-Centered Unified Framework for Interpreting Vision Models

تقدم هذه الورقة إطار عمل موحداً متمحوراً حول الـ iERF يدمج التفسير المحلي والعالمي والآلي من خلال تفكيك نسبة المشاركة، والتفسير المرتكز على المفاهيم، وعزو المفاهيم بين الطبقات، لتوفير تفسيرات قوية ومدعومة بالأدلة حول كيفية تحويل نماذج الرؤية للبكسلات إلى قرارات.

Yearim Kim, Sangyu Han, Nojun Kwak2026-05-04
💻 computer science

High-Speed Vision Improves Zero-Shot Semantic Understanding of Human Actions

تُثبت هذه الورقة أن استخدام الفيديو عالي السرعة يعزز بشكل كبير الفهم الدلالي لصفر-الخطوة (zero-shot) للأفعال البشرية السريعة، مثل الكيندو، من خلال تحسين قابلية الفصل والاستقرار في تمثيلات الأفعال في مسارات العمل الخالية من التدريب التي تدمج نماذج الفيديو واللغة مع استدلال النماذج اللغوية الكبيرة.

Yongpeng Cao, Yuji Yamakawa2026-05-04
💻 computer science

GOR-IS: 3D Gaussian Object Removal in the Intrinsic Space

تقدم هذه الورقة البحثية GOR-IS، وهو إطار عمل مبتكر لإزالة الأجسام من المشاهد ثلاثية الأبعاد باستخدام التوزيعات الغاوسية (3D Gaussian)، حيث يقوم بتفكيك المشاهد إلى مكونات جوهرية لنمذجة انتقال الضوء بشكل صريح وإجراء عملية الملء (inpainting) في مجالي المادة والإضاءة، مما يحقق اتساقاً فيزيائياً وتماسكاً بصرياً فائقين مقارنة بالطرق الحالية.

Yonghao Zhao, Yupeng Gao, Jian Yang, Jin Xie, Beibei Wang2026-05-04
🤖 machine learning

End-to-End Autoregressive Image Generation with 1D Semantic Tokenizer

تقترح هذه الورقة مسار تدريب متكامل (end-to-end) يعمل على تحسين مشترك لمُرمِّز دلالي أحادي الأبعاد ونموذج توليدي ذاتي الانحدار، محققاً أداءً رائدًا في توليد الصور بـ FID قدره 1.48 على مجموعة بيانات ImageNet 256x256.

Wenda Chu, Bingliang Zhang, Jiaqi Han, Yizhuo Li, Linjie Yang, Yisong Yue, Qiushan Guo2026-05-04
🔬 physics

Scale-Aware Adversarial Analysis: A Diagnostic for Generative AI in Multiscale Complex Systems

تقدم هذه المساهمة إطار عمل للتحليل التنافسي الحساس للمقاييس عبر تفكيك الانتشار المقيد، مما يثبت أن نماذج الذكاء الاصطناعي التوليدي القياسية لا تستوعب القوانين الفيزيائية عبر المقاييس، بل تُظهر بدلاً من ذلك تجمداً هيكلياً وعدم استقرار تحت تأثير الاضطرابات المقيدة فيزيائياً.

Mengke Zhao, Guang-Xing Li, Duo Xu, Keping Qiu2026-05-04
💻 computer science

Colorful-Noise: Training-Free Low-Frequency Noise Manipulation for Color-Based Conditional Image Generation

تقدم هذه الورقة Colorful-Noise، وهي طريقة لا تتطلب تدريباً تعمل على التلاعب بالمكونات منخفضة التردد لضوضاء غاوس (Gaussian noise) المدخلة باستخدام مسبقات صور (image priors) للتحكم بفعالية في البنية العالمية والألوان للصور المولدة في نماذج الانتشار مع الحفاظ على التفاصيل عالية التردد من أجل التباين.

Nadav Z. Cohen, Ofir Abramovich, Ariel Shamir2026-05-04
💻 computer science

Federated Distillation for Whole Slide Image via Gaussian-Mixture Feature Alignment and Curriculum Integration

تقدم الورقة البحثية FedHD، وهو إطار عمل جديد للتعلم الاتحادي لتحليل صور الشرائح الكاملة يعالج التباين عبر المؤسسات من خلال توظيف محاذاة الميزات القائمة على الخليط الغاوسي، والتقطير الاصطناعي واحد لواحد، والتكامل القائم على المنهج الدراسي لتحقيق تدريب تعاوني يحافظ على الخصوصية ومستقل عن البنية الهيكلية ويتفوق على النماذج المرجعية الحالية.

Luru Jing, Cong Cong, Yanyuan Chen, Yongzhi Cao2026-05-04
🤖 AI

Jailbreaking Vision-Language Models Through the Visual Modality

تُثبت هذه الورقة البحثية أنه يمكن كسر حماية نماذج الرؤية واللغة بفعالية من خلال أربعة هجمات مبتكرة على النمط البصري، مما يكشف عن فجوة حرجة في التوافق عبر الأنماط حيث تفشل تدريبات السلامة القائمة على النصوص في التعميم على المدخلات البصرية الضارة.

Aharon Azulay, Jan Dubiński, Zhuoyun Li, Atharv Mittal, Yossi Gandelsman2026-05-04
💻 computer science

Intrinsic Gradient Suppression for Label-Noise Prompt Tuning in Vision-Language Models

تقترح هذه الورقة البحثية طريقة "ضبط التلقين بـ Softmax المزدوج" (DSPT)، وهي طريقة خالية من المعلمات الفائقة تستفيد من كبح التدرج الجوهري عبر التنميط الاحتمالي المتسلسل لتكييف نماذج الرؤية واللغة بمتانة مع ضجيج التصنيفات من خلال التصفية الطبيعية للتحديثات القصوى الناتجة عن العينات المصنفة خطأً.

Jiayu Li, Jiaxin Qi, Sheng Zhou, Jiaqiang Huang, Xiansheng Hua2026-05-04
🤖 AI

BlenderRAG: High-Fidelity 3D Object Generation via Retrieval-Augmented Code Synthesis

يُعد BlenderRAG نظاماً للتوليد المعزز بالاسترجاع يعمل على تحسين دقة واتساق الهندسة في الإنشاء التلقائي للأجسام ثلاثية الأبعاد من اللغة الطبيعية بشكل كبير، وذلك عبر الاستفادة من مجموعة بيانات متعددة الوسائط ومنسقة من الأمثلة التي تم التحقق منها من قبل خبراء لتوجيه النماذج اللغوية الكبيرة الحديثة دون الحاجة إلى الضبط الدقيق.

Massimo Rondelli, Francesco Pivi, Maurizio Gabbrielli2026-05-04