💬 NLP

Learning GUI Grounding with Spatial Reasoning from Visual Feedback

تقدم هذه الورقة البحثية نموذج GUI-Cursor، الذي يعيد صياغة عملية تحديد المواقع في واجهات المستخدم الرسومية (GUI grounding) كمهة بحث تفاعلية باستخدام التغذية الراجعة البصرية من مؤشر (cursor) مُصوَّر والتعلم التعزيزي للتغلب على قيود التنبؤ بالإحداثيات في النماذج اللغوية البصرية (Vision Language Models)، محققاً بذلك أداءً فائقاً في مهام الاستدلال المكاني والمهام الوكيلية (agentic tasks) ببيانات تدريب أقل.

Yu Zhao, Wei-Ning Chen, Huseyin Atahan Inan, Samuel Kessler, Lu Wang, Lukas Wutschitz, Fangkai Yang, Chaoyun Zhang, Pasq (…)2026-05-27
🤖 AI

Scalable GANs with Transformers

تقدم هذه الورقة البحثية GAT، وهي شبكة خصامية توليدية قابلة للتوسع تجمع بين البنيات القائمة على المحولات والتدريب في الفضاء الكامن وتقنيات الاستقرار المستهدفة لتحقيق توليد صور فعال وذو كفاءة عالية يحقق أداءً رائدًا عبر نطاق واسع من سعات النماذج.

Sangeek Hyun, MinKyu Lee, Jae-Pil Heo2026-05-27
🤖 AI

Inference-Time Search Using Side Information for Diffusion-Based Image Reconstruction

تقترح هذه الورقة إطار عمل جديداً لا يتطلب تدريباً، يعزز إعادة بناء الصور القائمة على الانتشار لمختلف المسائل العكسية من خلال دمج معلومات جانبية متنوعة عبر البحث أثناء الاستدلال، مما يحسن الأداء باستمرار عبر العديد من الحلّال والمهام.

Mahdi Farahbakhsh, Vishnu Teja Kunde, Dileep Kalathil, Krishna Narayanan, Jean-Francois Chamberland2026-05-27
💻 computer science

TAG: Tangential Amplifying Guidance for Hallucination-Resistant Sampling

تقدم هذه الورقة البحثية تقنية TAG (التوجيه التماسي التضخيمي)، وهي طريقة للتعامل مع مرحلة الاستنتاج لا تتطلب تدريباً ولا تعتمد على بنية محددة، وتعمل على تقليل الهلوسة في نماذج الانتشار عبر تضخيم مكونات الدرجة المماسية لتوجيه مسارات أخذ العينات نحو مناطق ذات احتمالية أعلى في متشعب البيانات دون إضافة عبء حوسبي كبير.

Hyunmin Cho, Donghoon Ahn, Susung Hong, Jee Eun Kim, Seungryong Kim, Kyong Hwan Jin2026-05-27
💻 computer science

SpaceVista: All-Scale Visual Spatial Reasoning from mm to km

تقدم هذه الورقة SpaceVista، وهو إطار عمل شامل يتميز بمجموعة بيانات SpaceVista-1M، ونموذج SpaceVista-7B، ومعيار تقييم جديد لتمكين الاستدلال البصري المكاني القوي عبر جميع المقاييس من المليمترات إلى الكيلومترات، وذلك من خلال التغلب على قيود تنسيق البيانات وفرط التخصيص المرتبط بمقاييس محددة عبر نظام معرفي مهيكل ونموذج تدريب تدريجي.

Peiwen Sun, Shiqiang Lang, Dongming Wu, Yi Ding, Kaituo Feng, Huadai Liu, Zhen Ye, Rui Liu, Yun-Hui Liu, Jianan Wang, Xi (…)2026-05-27
📊 statistics

VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models

تقدم الورقة البحثية VERA-V، وهو إطار استدلال تبايني يعيد صياغة اكتشاف كسر الحماية متعدد الوسائط باعتباره تعلم توزيع خلفي مشترك على مطالبات النص والصورة، مما يتيح توليد مدخلات عدائية مقترنة ومتخفية تتفوق بشكل كبير على الأساليب الحالية في تجاوز حواجز الحماية لنماذج الرؤية واللغة.

Qilin Liao, Anamika Lochab, Ruqi Zhang2026-05-27
🤖 machine learning

PRBench: A Standardized Probabilistic Robustness Benchmark

تقدم هذه الورقة البحثية PRBench، وهو أول معيار قياسي لتقييم المتانة الاحتمالية في نماذج التعلم العميق، والذي يكشف أنه بينما توفر أساليب التدريب الخصومي مرونة أكبر عبر المعلمات الفائقة، فإن أساليب التدريب الخاصة بالمتانة الاحتمالية تحقق خطأ تعميم أقل ودقة نظيفة أعلى.

Yi Zhang, Zheng Wang, Zhen Chen, Wenjie Ruan, Qing Guo, Siddartha Khastgir, Carsten Maple, Xingyu Zhao2026-05-27
🤖 machine learning

Explainable Cross-Disease Reasoning for Cardiovascular Risk Assessment from Low-Dose Computed Tomography

تقترح هذه الورقة إطار عمل قابلاً للتفسير يستفيد من مسار معلومات سريرية مقيد لتقييم مخاطر القلب والأوعية الدموية من صور الأشعة المقطعية للصدر بجرعة منخفضة، وذلك عبر دمج النتائج الرئوية مع المعرفة الطبية لتوليد مبررات باللغة الطبيعية، محققةً أداءً فائقاً على النماذج المرجعية الحالية في مجموعة بيانات تجربة الفحص الوطني للرئة.

Yifei Zhang, Jiashuo Zhang, Mojtaba Safari, Xiaofeng Yang, Liang Zhao2026-05-27
🤖 machine learning

Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation

تقدم هذه الورقة البحثية "كاندينسكي 5.0" (Kandinsky 5.0)، وهي عائلة من النماذج التأسيسية مفتوحة المصدر التي تضم متغيرات لتوليد الصور والفيديو بما يصل إلى 19 مليار معلمة، والتي تستفيد من دورة حياة شاملة لتنسيق البيانات وتقنيات تدريب متقدمة لتحقيق توليد عالي الدقة للصور وتوليد فيديو مدته 10 ثوانٍ بمستوى رائد في هذا المجال.

Vladimir Arkhipkin, Vladimir Korviakov, Nikolai Gerasimenko, Denis Parkhomenko, Viacheslav Vasilev, Alexey Letunovskiy (…)2026-05-27
🤖 machine learning

Align & Invert: Solving Inverse Problems with Diffusion and Flow-based Models via Representation Alignment

تقترح هذه الورقة إطار عمل لمحاذاة التمثيل (REPA) يستفيد من مشفرات DINOv2 سابقة التدريب لتوجيه النماذج القائمة على الانتشار والتدفق في حل المشكلات العكسية، مع إثبات نظري بأن هذا النهج يقلل من تباعد فضاء التضمين لتحسين جودة إعادة البناء والواقعية الإدراكية مع تقليل خطوات الاستدلال عبر مهام متنوعة.

Loukas Sfountouris, Giannis Daras, Paris Giampouras2026-05-27