🤖 machine learning

CASISR: Circular Arbitrary-Scale Image Super-Resolution

تقترح هذه الورقة البحثية نموذج "تعزيز دقة الصور بأسلوب دائري وعشوائي النطاق" (CASISR)، وهو بنية مغلقة الحلقة قائمة على نظرية التحكم الآلي تستفيد من عينات الاختبار لتعزيز أداء التعميم، وتتفوق على الأساليب الرائدة، لا سيما بالنسبة لعوامل القياس الكسرية والصور ذات الحواف الحادة.

Honggui Li, Zhengyang Zhang, Dingtai Li, Sinan Chen, Nahid Md Lokman Hossain, Xinfeng Xu, Yinlu Qin, Ruobing Wang, Hanta (…)2026-05-12
🤖 AI

Text-Guided Multi-Scale Frequency Representation Adaptation

تقترح الورقة البحثية FreqAdapter، وهي طريقة لضبط دقيق فعال في المعلمات تدمج التوجيه النصي لإجراء تكييف للإشارات متعدد المقاييس في النطاق الترددي، مما يتغلب على قيود التكرار ومجال الاستقبال الثابت للنهج الحالية لتحسين الأداء والكفاءة بشكل كبير في النماذج متعددة الوسائط.

Weicai Yan, Xinhua Ma, Wang Lin, Tao Jin2026-05-12
🤖 AI

A Robust Out-of-Distribution Detection Framework via Synergistic Smoothing

تقدم هذه الورقة البحثية ROSS، وهو إطار عمل قوي للكشف عن القيم الخارجة عن التوزيع (out-of-distribution) بعد عملية التدريب (post-hoc)، يستفيد من التنعيم بالوسيط (median smoothing) لقياس عدم استقرار الدرجة المحلية، مما يحقق متانة متماثلة هي الأفضل حالياً ضد هجمات تقليل الدرجة وهجمات تعظيم الدرجة العدائية.

Maria Stoica, Abdelrahman Hekal, Alessio Lomuscio2026-05-12
🤖 AI

Normalization Equivariance for Arbitrary Backbones, with Application to Image Denoising

تقدم هذه الورقة البحثية غلافاً خالياً من المعلمات يسمى WNE يفرض التكافؤ في التطبيع (Normalization Equivariance) حول أي بنية هيكلية خلفية اختيارية من خلال استخدام تحليل (normalize-process-denormalize) إلى عملية تطبيع ومعالجة وإلغاء تطبيع، مما يحسن المتانة تجاه تحولات التوزيع في إزالة ضجيج الصور دون تكبد عبء وقت التشغيل أو القيود الهيكلية للطرق الحالية.

Youssef Saied, François Fleuret2026-05-12
🤖 AI

Where Reliability Lives in Vision-Language Models: A Mechanistic Study of Attention, Hidden States, and Causal Circuits

تتحدى هذه الورقة البحثية الحدس القائل بأن خرائط الانتباه الحادة تشير إلى الموثوقية في نماذج الرؤية واللغة، حيث تُثبت من خلال التحليل الآلي أن بنية الانتباه هي متنبئ شبه معدوم بالصحة، بينما توفر هندسة الحالة الخفية ودوائر الطبقات المتأخرة المتفرقة مؤشرات أكثر دقة بكثير على موثوقية النموذج.

Logan Mann, Ajit Saravanan, Ishan Dave, Shikhar Shiromani, Saadullah Ismail, Yi Xia, Emily Huang2026-05-12
🤖 machine learning

Weakly Supervised Concept Learning for Object-centric Visual Reasoning

تقدم هذه الورقة إطار عمل عصبي-رمزي خاضع للإشراف الضعيف يجمع بين الإدراك المرتكز على الكائنات القائم على الفتحات (slot-based) والمشفرات التلقائية التباينية لتأصيل الرموز من أجل الاستدلال المنطقي، محققةً أداءً عالياً وتعميماً للمجالات بما لا يزيد عن 1% فقط من البيانات المصنفة مع التفوق على النماذج التأسيسية الرائدة.

Sparsh Tiwari, Bettina Finzel, Gesina Schwalbe2026-05-12
💻 computer science

Harmonized Feature Conditioning and Frequency-Prompt Personalization for Multi-Rater Medical Segmentation

تقترح هذه الورقة إطاراً احتمالياً متناغماً يجمع بين التكييف الميزاتي التكيفي لإزالة الآثار مع المحفزات في النطاق الترددي للتخصيص الخاص بالمُقيّم، مما يعمل بفعالية على فك الارتباط بين ضوضاء الاستحواذ والغموض السريري الحقيقي لتحقيق تقسيم صور طبية متعدد المقيمين، متطور ومعاير بدقة.

Sanaz Karimijafarbigloo, Armin Khosravi, Alireza Kheyrkhah, Reza Azad, Mauricio Reyes, Dorit Merhof2026-05-12
💻 computer science

Low-Cost Stereo Vision for Robust 3D Positioning of Thin Radiata Pine Branches in Autonomous Drone Pruning

تقترح هذه الورقة نظام رؤية ستيريو منخفض التكلفة ومثبتاً على طائرة بدون طيار، يجمع بين تقسيم الفروع القائم على نموذج YOLO والتثليث القوي ورفض القيم المتطرفة لتمكين التحديد الدقيق للمواقع ثلاثية الأبعاد لأغصان صنوبر رادياتا الرفيعة من أجل التقليم الذاتي، مما يلغي الحاجة إلى مستشعرات ليدار (LiDAR) باهظة الثمن.

Yida Lin, Bing Xue, Mengjie Zhang, Sam Schofield, Richard Green2026-05-12
🤖 machine learning

Test-Time Training for Visual Foresight Vision-Language-Action Models

تقترح هذه الورقة البحثية T3T^3VF، وهي نهج للتدريب في وقت الاختبار يتميز بآلية تصفية تحديث تكيفية تستفيد من الإشراف الطبيعي بين الصور المستقبلية المتوقعة والملاحظات الفعلية للتخفيف من نقاط الضعف الناتجة عن خروج البيانات عن التوزيع في نماذج الرؤية واللغة والعمل (VLA) الخاصة بالاستبصار البصري، وذلك دون الحاجة إلى تعديلات هيكلية.

Sangwu Park, Wonjoong Kim, Yeonjun In, Sein Kim, Hongseok Kang, Chanyoung Park2026-05-12
🤖 machine learning

Deep Dreams Are Made of This: Visualizing Monosemantic Features in Diffusion Models

تقدم هذه الورقة تقنية "التصور الكامن عبر التحسين" (LVO)، وهي تقنية في التفسير الآلي تجمع بين المشفرات التلقائية المتفرقة والتحسين في الفضاء الكامن لتصور الميزات أحادية المعنى في نماذج الانتشار، حيث نجحت في كشف مفاهيم متماسكة مثل الأشكال البشرية والورود التي تحجبها التمثيلات متعددة المعاني في النماذج المرجعية.

Adam Szokalski, Mateusz Modrzejewski2026-05-12