💻 computer science

Metonymy in vision models undermines attention-based interpretability

تكشف هذه الورقة أن نماذج المحولات الرؤية المسبقة التدريب الحديثة تنتهك فرضية الموضعية من خلال إظهار "تسرب داخل الكائن" (الكناية البصرية)، مما يقوض موثوقية أساليب التفسير القائمة على الانتباه في الاستدلال القائم على الأجزاء، وتثبت أن نهجاً ذا مرحلتين يمكنه بفعالية تخفيف هذه المشكلة لتحسين اكتشاف الأجزاء المدفوع بالسمات.

Ananthu Aniraj, Cassio F. Dantas, Dino Ienco, Massimiliano Mancini, Diego Marcos2026-05-08
🤖 machine learning

Autoregressive Visual Generation Needs a Prologue

تقترح الورقة البحثية "Prologue"، وهي طريقة تسد الفجوة بين إعادة البناء والتوليد في نماذج الصور ذات الترتيب الذاتي من خلال إدخال مجموعة منفصلة من الرموز (tokens) التي يتم تدريبها حصرياً على التوليد، مما يحسن جودة الصورة بشكل كبير (بتقليل gFID من 21.01 إلى 10.75 على ImageNet) دون المساس بدقة إعادة البناء.

Bowen Zheng, Weijian Luo, Guang Yang, Colin Zhang, Tianyang Hu2026-05-08
🤖 machine learning

Learning Discrete Autoregressive Priors with Wasserstein Gradient Flow

تقدم هذه الورقة البحثية wAR-Tok، وهي طريقة تعمل على تحسين التوليد الذاتي الانحداري للصور المنفصلة من خلال دمج إشارة مطابقة مسبقة قائمة على تدفق تدرج واسرستاينين في تدريب المرمز (tokenizer)، مما يؤدي إلى محاذاة توزيع الرموز المتعلم مع النموذج الذاتي الانحداري المستهدف دون المساس بجودة إعادة البناء.

Bowen Zheng, Yihong Luo, Tianyang Hu2026-05-08
💻 computer science

Secure Seed-Based Multi-bit Watermarking for Diffusion Models from First Principles

تقدم هذه الورقة إطاراً نظرياً مستقلاً عن النموذج لتقييم العلامات المائية القائمة على البذرة في نماذج الانتشار بناءً على الأمن والمتانة والدقة، وتقترح طريقة مبتكرة تسمى SSB تتيح التحكم الدقيق في هذه المقايضات دون الاعتماد على التقييمات التجريبية المكلفة.

Enoal Gesny, Eva Giboulot2026-05-08
💻 computer science

DynT2I-Eval: A Dynamic Evaluation Framework for Text-to-Image Models

تقدم هذه الورقة DynT2I-Eval، وهو إطار تقييم ديناميكي مؤتمت بالكامل يقلل من حدوث الإفراط في التخصيص وتلوث المعايير في نماذج تحويل النص إلى صورة من خلال توليد مطالبات هيكلية جديدة واستخدام نظام ترتيب عبر الإنترنت قوي لضمان تقييم أداء مستقر وعادل.

Juntong Wang, Jiarui Wang, Huiyu Duan, Lewei Li, Guangtao Zhai, Xiongkuo Min2026-05-08
🤖 machine learning

Bridging visual saliency and large language models for explainable deep learning in medical imaging

تقترح هذه الورقة إطار عمل للتفسير متعدد الوسائط يدمج تصنيف وتجزئة الأورام القائم على الشبكات العصبية التلافيفية (CNN) مع خرائط البروز البصري والنماذج اللغوية الكبيرة لتوليد تقارير تشخيصية بأسلوب إشعاعي قابلة للتفسير بشرياً لتحليل رنين أورام الدماغ، مما يعزز الشفافية والاعتماد السريري للذكاء الاصطناعي في التصوير الطبي.

Paul Valery Nguezet, Elie Tagne Fute, Yusuf Brima, Benoit Martin Azanguezet, Marcellin Atemkeng2026-05-08
🤖 machine learning

Taming the Entropy Cliff: Variable Codebook Size Quantization for Autoregressive Visual Generation

تحدد هذه الورقة ظاهرة "منحدر الإنتروبيا" (Entropy Cliff) في التوليد البصري ذاتي الانحدار، حيث تؤدي مجموعات الرموز ثابتة الحجم إلى حفظ سريع، وتقترح التكميم بحجم مجموعة رموز متغير (VCQ) لزيادة سعة مجموعة الرموز ديناميكيًا على طول التسلسل، مما يحقق جودة توليد صور رائدة وهيكلية دلالية ناشئة دون تغيير إطار التدريب القياسي.

Bowen Zheng, Weijian Luo, Guang Yang, Colin Zhang, Tianyang Hu2026-05-08
💻 computer science

Look Beyond Saliency: Low-Attention Guided Dual Encoding for Video Semantic Search

تقترح هذه الورقة آلية تضمين الانتباه العكسي التي تعزز البحث الدلالي في الفيديو في المشاهد المزدحمة من خلال التقاط المناطق الخلفية المغفلة بشكل صريح، مما يحسن أداء الاستدعاء دون الحاجة إلى تدريب إضافي.

Faisal Aljehrai, Mohammed A. Alkhrashi, Alreem Almuhrij, Sarah Abuhimed, Noorh Aldossary, Abdullah Aldwyish, Raied Aljad (…)2026-05-08
💻 computer science

On-Orbit Real-Time Wildfire Detection Under On-Board Constraints

تقدم هذه الورقة نظاماً تم نشره في المدار للكشف عن حرائق الغابات في بيئة محدودة الموارد على كوكبة من تسعة أقمار صناعية تعمل بالأشعة تحت الحمراء الحرارية، يستخدم التعلم الخاضع للإشراف الذاتي القائم على DenseMAE لتحقيق دقة فائقة وزمن استجابة للتنبيه يقل عن 10 دقائق، مع العمل ضمن حدود صارمة للنموذج تقل عن ميجابايت واحدة وللاستدلال تقل عن 150 مللي ثانية على صور أحادية النطاق غير معايرة.

Matthias Rötzer, Veronika Pörtge, Martin Ickerott, Jayendra Praveen Kumar Chorapalli, Dimitri Scheftelowitsch, Max Berec (…)2026-05-08
⚡ electrical engineering

The frame-level leakage trap: rethinking evaluation protocols for intrinsic image decomposition, with source-separable uncertainty as a case study

تكشف هذه الورقة عن تسريب تقييمي كبير في عملية تفكيك الصور الجوهرية ناتج عن تقسيمات مجموعات البيانات على مستوى الإطارات، وتدعو إلى اعتماد التقسيم على مستوى المشهد كمعيار جديد، وتقدم نموذجاً مستنداً إلى الفيزياء مع عدم يقين قابل للفصل حسب المصدر يحقق أداءً تنافسياً مع تحديد وتصفية البكسلات ذات الخطأ العالي بفعالية.

Jihwan Woo2026-05-08