🤖 machine learning

ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents

تقدم الورقة البحثية ClawGUI، وهو إطار عمل مفتوح المصدر يوحد تدريب وتقييم ونشر وكلاء واجهات المستخدم الرسومية (GUI) من خلال توفير بنية تحتية مستقرة للتعلم التعزيزي (RL) للأجهزة الافتراضية والمادية، ومسار قياس معياري، ونشر الوكلاء عبر المنصات، مما مكن في النهاية نموذج ClawGUI-2B من التفوق على النماذج المرجعية الحالية في مهام واجهة المستخدم الرسومية للهواتف المحمولة.

Fei Tang, Zhiqiong Lu, Boxuan Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen2026-04-14
🤖 AI

Budget-Aware Uncertainty for Radiotherapy Segmentation QA Using nnU-Net

تقترح هذه الورقة إطار عمل لضمان الجودة القائم على عدم اليقين والمراعي للميزانية لتقسيم العلاج الإشعاعي بناءً على nnU-Net، مما يثبت أن الجمع بين مجموعات نقاط التفتيش المعايرة وتدرج درجة الحرارة يولد بفعالية خرائط عدم يقين لكل فوكسل لتوجيه المراجعة اليدوية المستهدفة لتخطيط حجم الهدف السريري.

Ricardo Coimbra Brioso, Lorenzo Mondo, Damiano Dei, Nicola Lambri, Pietro Mancosu, Marta Scorsetti, Daniele Loiacono2026-04-14
🤖 AI

OmniPrism: Learning Disentangled Visual Concept for Image Generation

يُعد OmniPrism إطار عمل مبتكرًا لفك تشابك المفاهيم البصرية، يستفيد من مسار تدريب تبايني متعامد على مجموعة بيانات متخصصة لتعلم تمثيلات مفاهيمية مفككة وموجهة لغويًا، مما يمكّن نماذج الانتشار من توليد صور إبداعية عالية الجودة مع تحكم دقيق في جوانب محددة مثل المحتوى والأسلوب والتكوين دون حدوث خلط بين المفاهيم.

Yangyang Li, Daqing Liu, Wu Liu, Allen He, Xinchen Liu, Yongdong Zhang, Guoqing Jin2026-04-13
🤖 AI

Chain-of-Zoom: Extreme Super-Resolution via Scale Autoregression and Preference Alignment

إن "سلسلة التكبير" (Chain-of-Zoom - CoZ) هي إطار عمل غير مرتبط بنموذج محدد يحقق تكبيراً فائقاً للصور الفردية عبر تحليل المهمة إلى سلسلة ذاتية الانحدار من حالات المقياس الوسيطة الموجهة بنصوص ناتجة عن نماذج لغوية بصرية كبيرة، والتي يتم تحسينها لاحقاً عبر مواءمة التفضيلات للحفاظ على جودة إدراكية عالية عند مستويات تكبير تتجاوز بكثير نطاق التدريب الأصلي للنموذج.

Bryan Sangwoo Kim, Jeongsol Kim, Jong Chul Ye2026-04-13
💻 computer science

Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration

تقدم هذه الورقة إطار عمل معايرة الانتباه المدرك للثقة (CAAC)، وهو طريقة خالية من التدريب تعمل على الحد من الهلوسة في النماذج اللغوية البصرية الكبيرة من خلال تصحيح الإدراك المكاني وتحيزات الأنماط عبر معايرة الرموز البصرية وإعادة قياس الانتباه التكيفي، مما يحسن الدقة بشكل كبير في مهام التوليد طويل الأمد.

Mehrdad Fazli, Bowen Wei, Ahmet Sari, Ziwei Zhu2026-04-13
🤖 AI

Enhancing the Safety of Medical Vision-Language Models by Synthetic Demonstrations

تقترح هذه الورقة استراتيجية دفاع مبتكرة عند وقت الاستدلال لنماذج الرؤية واللغة الطبية، تستخدم عروضاً توضيحية سريرية اصطناعية للتخفيف بفعالية من هجمات الاختراق البصري والنصي، مع موازنة السلامة والأداء لتجنب الدفاع المفرط.

Zhiyu Xue, Reza Abbasi-Asl, Ramtin Pedarsani2026-04-13
🤖 AI

Listener-Rewarded Thinking in VLMs for Image Preferences

تقدم هذه الورقة إطار عمل لتحسين السياسة النسبية للمجموعات (GRPO) معززاً بالمستمع لنماذج الرؤية واللغة، والذي يستخدم نموذج "مستمع" مستقلاً للتحقق من مسارات الاستدلال وتشكيل إشارات المكافأة، مما يؤدي إلى تحسين التعميم بشكل كبير، وتقليل تناقضات الاستدلال، وتحقيق أداء رائد في مهام محاذاة تفضيلات الصور.

Alexander Gambashidze, Li Pengyi, Matvey Skripkin, Andrey Galichin, Anton Gusarov, Konstantin Sobolev, Andrey Kuznetsov (…)2026-04-13
💻 computer science

Deep Learning Models for Robust Facial Liveness Detection

تقدم هذه الورقة نماذج تعلم عميق مبتكرة، وتحديداً AttackNet V2.2، التي تدمج تحليل الملمس والانعكاس لتحقيق دقة بنسبة 99.9% في كشف حيوية الوجه، مما يتغلب بفعالية على هجمات التزييف المتطورة مثل التزييف العميق عبر خمس مجموعات بيانات متنوعة.

Oleksandr Kuznetsov, Emanuele Frontoni, Luca Romeo, Riccardo Rosati, Andrea Maranesi, Alessandro Muscatello2026-04-13
🤖 machine learning

Generative View Stitching

تقترح الورقة البحثية خوارزمية "الخياطة التوليدية للمشاهد" (Generative View Stitching - GVS)، وهي خوارزمية أخذ عينات متوافقة مع نماذج الفيديو القائمة على "الفرض التوليدي" (Diffusion Forcing) الجاهزة، تتيح توليد فيديو بتوجيه من الكاميرا يكون مستقراً، وخالياً من التصادمات، ومغلقاً للحلقات عبر أخذ عينات لسلاسل كاملة بالتوازي واستخدام "التوجيه الشامل" (Omni Guidance) للتشريط بناءً على الإطارات الماضية والمستقبلية معاً.

Chonghyuk Song, Michal Stary, Boyuan Chen, George Kopanas, Vincent Sitzmann2026-04-13
💻 computer science

How Noise Benefits AI-generated Image Detection

تقترح هذه الورقة PiN-CLIP، وهو إطار عمل مبتكر يستخدم الضوضاء ذات الحافز الإيجابي لتثبيط الاختصارات التدريبية الزائفة وتضخيم الإشارات الجنائية المستقرة، محققاً أداءً رائدًا في التعميم في كشف الصور المولدة بواسطة الذكاء الاصطناًعي عبر 42 نموذجًا توليديًا متنوعًا.

Ziqiang Li, Jiazhen Yan, Fan Wang, Kai Zeng, Zhangjie Fu2026-04-13