💬 NLP

When Diffusion Breaks Constraints: Sequential Autoregressive Generation with RL and MCTS

تُظهر هذه الورقة أن نماذج الانتشار تعاني جوهرياً في مهام التوليد المقيد بسبب عدم قدرتها على أخذ عينات من المناطق الممكنة ذات الأبعاد المنخفضة، وتقترح نهجاً تتابعياً ذاتي الانحدار معززاً بالتعلم التعزيزي وبحث شجرة مونت كارلو كبديل أكثر فعالية لاستيفاء القيود الهندسية والفيزيائية الصارمة.

Zirui Zhao, Boye Niu, Harold Soh, David Hsu, Wee Sun Lee2026-05-14
🤖 AI

Improving Classifier-Free Guidance of Flow Matching via Manifold Projection

تقترح هذه الورقة طريقة خالية من التدريب لتحسين التوجيه الخالي من التصنيف في مطابقة التدفق عبر إعادة تفسيره كمسألة تحسين هوموتوبي مع قيود متشعبة، والتي يتم حلها بكفاءة عبر التدرج المتزايد لخفض التدرج وتسريع أندرسون لتعزيز دقة التوليد، والمحاذاة مع المطالبات، والمتانة عبر النماذج واسعة النطاق.

Jian-Feng Cai, Haixia Liu, Zhengyi Su, Chao Wang2026-05-14
🤖 machine learning

Auditing Sybil: Explaining Deep Lung Cancer Risk Prediction Through Generative Interventional Attributions

تقدم هذه الورقة البحثية إطار عمل S(H)NAP، وهو إطار تدقيق غير مرتبط بنموذج محدد يستخدم العزو التدخلي التوليدي ليكشف أنه في حين أن نموذج التعلم العميق "Sybil" يتنبأ بدقة بمخاطر سرطان الرئة، إلا أنه يعاني من أوضاع فشل حرجة مثل الحساسية تجاه المصنوعات الاصطناعية غير المبررة سريريًا وانحياز شعاعي متميز.

Bartlomiej Sobieski, Jakub Grzywaczewski, Karol Dobiczek, Mateusz Wójcik, Tomasz Bartczak, Patryk Szatkowski, Przemysław (…)2026-05-14
🤖 AI

Aligning Forest and Trees in Images & Long Captions for Visually Grounded Understanding

تقدم الورقة البحثية نموذج CAFT، وهو نموذج رؤية-لغة تم تدريبه على 30 مليون زوج من الصور والنصوص، والذي يستخدم مبدأ تعلم هرمي من الجزء إلى الكل لمحاذاة المناطق النصية المحلية مع تفاصيل الصور، محققاً أداءً هو الأفضل في فئته على معايير استرجاع النصوص الطويلة دون الحاجة إلى إشراف صريح على مستوى المناطق.

Byeongju Woo, Zilin Wang, Byeonghyun Pak, Sangwoo Mo, Stella X. Yu2026-05-14
💻 computer science

Perception with Guarantees: Certified Pose Estimation via Reachability Analysis

تقدم هذه الورقة طريقة معتمدة لتقدير الوضعية ثلاثية الأبعاد للوكلاء السيبرانيين الفيزيائيين ذوي المهام الحرجة للسلامة، والتي تستخدم تحليل إمكانية الوصول والتحقق الرسمي من الشبكة العصبية لتوفير ضمانات سلامة للحالات الأسوأ بناءً فقط على صور الكاميرا وهندسة الهدف المعروفة.

Tobias Ladner, Yasser Shoukry, Matthias Althoff2026-05-14
💻 computer science

Exploring Multimodal LMMs for Online Episodic Memory Question Answering on the Edge

تُثبت هذه الورقة البحثية جدوى نشر نظام للإجابة على الأسئلة المتعلقة بالذاكرة العرضية في الوقت الفعلي مع الحفاظ على الخصوصية على الأجهزة الطرفية، وذلك عبر استخدام خط معالجة لنماذج اللغات الكبيرة متعددة الوسائط (MLLM) ثنائي المسارات يحقق دقة تنافسية وزمن استجابة منخفض مقارنة بالحلول القائمة على السحابة.

Giuseppe Lando, Rosario Forte, Antonino Furnari2026-05-14
🤖 machine learning

SubspaceAD: Training-Free Few-Shot Anomaly Detection via Subspace Modeling

يُعد SubspaceAD طريقةً للكشف عن الشذوذ تعتمد على التعلم القليل دون الحاجة لتدريب، حيث تستفيد من ميزات DINOv2 المجمدة وتحليل المكونات الرئيسية (PCA) لنمذجة التباينات الطبيعية في فضاء فرعي منخفض الأبعاد، محققةً أداءً هو الأفضل في فئته على مجموعتي بيانات MVTec-AD وVisA دون الحاجة إلى بنوك ذاكرة، أو بيانات مساعدة، أو ضبط للنموذج.

Camile Lendering, Erkut Akdag, Egor Bondarev2026-05-14
🤖 AI

LINE: LLM-based Iterative Neuron Explanations for Vision Models

تقدم الورقة البحثية إطار عمل LINE، وهو إطار عمل "صندوق أسود" لا يتطلب تدريباً، يستفيد من النماذج اللغوية الكبيرة ومولدات النصوص إلى صور لاكتشاف وتكرير تسميات المفاهيم ذات المفردات المفتوحة لكل عصبون في نماذج الرؤية بشكل تكراري، محققاً أداءً هو الأفضل في فئته وكاشفاً عن مفاهيم جديدة أغفلتها المفردات المحددة مسبقاً.

Vladimir Zaigrajew, Michał Piechota, Gaspar Sekula, Paweł Gelar, Przemysław Biecek2026-05-14
💻 computer science

Does it Really Count? Assessing Semantic Grounding in Text-Guided Class-Agnostic Counting

تكشف هذه الورقة أن نماذج العدّ الحالية المعتمدة على النصوص والمستقلة عن الفئات، والتي تُعد من أحدث ما توصل إليه العلم، غالباً ما تفشل في ربط المطالبات النصية بالأجسام المرئية بشكل صحيح، مما يؤدي إلى نتائج زائفة، وتعالج ذلك من خلال تقديم إطار التقييم PrACo++ ومجموعة بيانات MUCCA لتقييم المحاذاة الدلالية ومتانة النماذج بشكل أفضل.

Giacomo Pacini, Luca Ciampi, Nicola Messina, Nicola Tonellotto, Giuseppe Amato, Fabrizio Falchi2026-05-14
💻 computer science

3DSS: 3D Surface Splatting for Inverse Rendering

تقدم الورقة البحثية تقنية التلطيخ السطحي ثلاثي الأبعاد (3DSS)، وهو مُصيّر تفاضلي يستفيد من نموذج تركيب قائم على التغطية وعينات سطحية موجهة لاستعادة الشكل، والمواد المتغيرة مكانياً، والإضاءة بشكل مشترك من أجل إعادة التصيير العكسي عالي الجودة مع الربط الأصيل بسير عمل القائم على الشبكات المضلعية.

Mae Younes, Adnane Boukhayma2026-05-14