💻 computer science

ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning

يُعد ReVSI معياراً وبروتوكول تقييم مقترحاً حديثاً يعالج عدم الصلاحية المنهجية لتقييمات الاستدلال ثلاثي الأبعاد لنماذج الرؤية واللغة (VLM) الحالية من خلال إعادة تعليق 381 مشهداً وإعادة توليد أزواج الأسئلة والأجوبة لضمان كون الأسئلة قابلة للإجابة ودقيقة في ظل مدخلات فيديو واقعية ومنخفضة العينات، مما يكشف عن أوجه القصور التي كانت محجوبة سابقاً في الذكاء المكاني.

Yiming Zhang, Jiacheng Chen, Jiaqi Tan, Yongsen Mao, Wenhu Chen, Angel X. Chang2026-04-28
💻 computer science

See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection

تقدم هذه الورقة "ForeSight"، وهو إطار عمل موحد متعدد الوسائط يعزز استدلال نماذج الرؤية واللغة من خلال دمج أدوات بصرية منخفضة المستوى وآلية تغذية راجعة بصرية قائمة على القناع ضمن نموذج التعلم التعزيزي، محققاً أداءً هو الأفضل في فئته على مجموعة بيانات "CG-SalBench" التي تم إنشاؤها حديثاً.

Zhiheng Wu, Tong Wang, Shuning Wang, Naiming Liu, Yumeng Zhang2026-04-28
💻 computer science

SycoPhantasy: Quantifying Sycophancy and Hallucination in Small Open Weight VLMs for Vision-Language Scoring of Fantasy Characters

تقدم هذه الورقة "معامل التضليل" (Bluffing Coefficient) لقياس التملق في النماذج اللغوية البصرية ذات الأوزان المفتوحة والصغيرة، مما يكشف عن وجود ارتباط عكسي قوي بين حجم النموذج والميل إلى تخصيص درجات عالية غير مبررة دون دليل بصري عند تقييم صور الشخصيات الخيالية.

Arya Shah, Deepali Mishra, Chaklam Silpasuwanchai2026-04-28
⚡ electrical engineering

Semantic Segmentation for Histopathology using Learned Regularization based on Global Proportions

تقدم الورقة البحثية "التقسيم التبايني من نسب الملصقات" (VSLP)، وهو إطار عمل ثنائي المراحل يقوم بالتقسيم النسيجي المرضي على مستوى البكسل دون الحاجة إلى تسميات على مستوى البكسل، وذلك عبر حل مسألة تحسين تبايني تدمج تقديرات الثقة القائمة على المحولات مع نسب الملصقات العالمية ومنظم متعلم.

Yangping Li, Thomas Pinetz, Michael Hölzel, Marieta Toma, Alexander Effland2026-04-28
🤖 machine learning

Diffusion Templates: A Unified Plugin Framework for Controllable Diffusion

تُعد Diffusion Templates إطار عمل موحد ومفتوح المصدر للإضافات يعمل على فصل نماذج الانتشار الأساسية عن القدرات القابلة للتحكم من خلال واجهة معيارية، مما يتيح التكوين التركيبي السلس والنقل الانسيابي لمختلف طرق التحكم (مثل Loora وKV-Cache) عبر مختلف هياكل النماذج الأساسية.

Zhongjie Duan, Hong Zhang, Yingda Chen2026-04-28
🤖 machine learning

Complexity of Linear Regions in Self-supervised Deep ReLU Networks

تتقصى هذه الورقة التعقيد الهندسي للمناطق الخطية في شبكات ReLU ذات التعلم الذاتي، حيث تُثبت أن توزيع وتطور هذه المناطق —المُقاس عبر المقاييس متعددة الوجوه— يرتبطان بجودة التمثيل ويمكن استخدامهما للكشف عن انهيار التمثيل.

Mufhumudzi Muthivhi, Terence L. van Zyl2026-04-28
💻 computer science

AD-Relight: Training-Free Banner Relighting via Illumination Translation with Diffusion Priors

يُعد AD-Relight إطار عمل مبتكرًا لا يتطلب تدريبًا، حيث يستفيد من مسبقات الانتشار (diffusion priors) لإعادة إضاءة لافتات الإعلانات المصممة عبر فوتوشوب بشكل تكيفي، مما يتيح دمجها بسلاسة وواقعية في ظروف إضاءة المشاهد المتنوعة دون الحاجة إلى ملايين الصور التدريبية.

Rameshwar Mishra, A V Subramanyam2026-04-28
💻 computer science

DYMAPIA: A Multi-Domain Framework for Detecting AI-based Video Manipulation

تُعد DYMAPIA إطار عمل للكشف عن التزييف العميق متعدد المجالات يدمج الإشارات المكانية والطيفية والزمنية لتوليد أقنعة شذوذ ديناميكية، مما يوجه مصنف DistXCNet خفيف الوزن لتحقيق دقة رائدة تتجاوز 99% في المعايير الرئيسية مع تمكين النشر الجنائي في الوقت الفعلي.

Md Shohel Rana, Andrew H. Sung2026-04-28
💻 computer science

Zero-to-CAD: Agentic Synthesis of Interpretable CAD Programs at Million-Scale Without Real Data

يقدم Zero-to-CAD إطار عمل وكيلِيًّا يخلّق ما يقرب من مليون تسلسل بناء هندسي قابل للتنفيذ والتفسير دون الاعتماد على بيانات من العالم الحقيقي، مما يسد بفعالية الفجوة بين النطاق الهندسي والقصد التصميمي البارامتري مع تمكين إعادة بناء متفوقة لبرامج التصميم بمساعدة الحاسوب (CAD) القابلة للتحرير من الصور.

Mohammadmehdi Ataei, Farzaneh Askari, Kamal Rahimi Malekshan, Pradeep Kumar Jayaraman2026-04-28
🤖 machine learning

Deployment-Aligned Low-Precision Neural Architecture Search for Spaceborne Edge AI

تقترح هذه الورقة إطار عمل للبحث عن البنى العصبية المدركة للأجهزة (NAS) يدمج قيود عددية منخفضة الدقة مباشرة في عملية التحسين لسد فجوة الدقة بين التدريب بالدقة الكاملة والنشر على أجهزة الحافة محدودة الموارد، مثل وحدات المعالجة البصرية (VPUs) المحمولة فضائياً.

Parampuneet Kaur Thind, Vaibhav Katturu, Giacomo Zema, Roberto Del Prete2026-04-28