💬 NLP

InterChart: Benchmarking Visual Reasoning Across Decomposed and Distributed Chart Information

تقدم الورقة البحثية InterChart، وهو معيار تشخيصي مصمم لتقييم قدرة نماذج الرؤية واللغة على الاستنتاج عبر مخططات متعددة ذات صلة، كاشفاً أن النماذج الحالية المتطورة تعاني بشكل كبير من التكامل عبر المخططات والاستدلال المعقد متعدد الخطوات رغم تحسن أدائها في المهام البصرية المفككة.

Anirudh Iyengar Kaniyar Narayana Iyengar, Srija Mukhopadhyay, Adnan Qidwai, Shubhankar Singh, Dan Roth, Vivek Gupta2026-05-04
💻 computer science

Deepfakes: we need to re-think the concept of "real" images

تجادل ورقة الموقف هذه بأن التركيز الحالي على كشف الصور "المزيفة" معيب جوهرياً لأنه يعتمد على تعريفات ومجموعات بيانات "حقيقية" عفا عليها الزمن، وتحث المجتمع البحثي على إعادة تقييم مفهوم الأصالة بالنظر إلى أن التصوير الفوتوغرافي بالهواتف الذكية الحديثة يستخدم في حد ذاته خوارزميات قائمة على الشبكات العصبية تشبه تلك المستخدمة في النماذج التوليدية.

Janis Keuper, Margret Keuper2026-05-04
💻 computer science

FreeRet: MLLMs as Training-Free Retrievers

تُعد FreeRet إطار عمل يعمل بدون تدريب وقابل للتشغيل المباشر، حيث يستفيد من النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) الجاهزة كأدوات استرجاع قوية ذات مرحلتين عبر توليد تضمينات دلالية مرتكزة للبحث عن المرشحين واستخدام قدراتها الاستنتاجية المتأصلة لإعادة التصنيف بدقة، مما يؤدي إلى التفوق على النماذج التي خضعت لتدريب مكثف دون الحاجة إلى أي ضبط دقيق إضافي.

Yuhan Zhu, Xiangyu Zeng, Chenting Wang, Xinhao Li, Chunxu Liu, Yicheng Xu, Ziang Yan, Yi Wang, Limin Wang2026-05-04
🤖 AI

Unlocking Zero-Shot Geospatial Reasoning via Indirect Rewards

تقدم هذه الورقة البحثية نموذج Geo-R1، وهو نموذج رؤية-لغة يتغلب على ندرة الإشراف في المجالات الجيومكانية من خلال الاستفادة من المكافآت غير المباشلة القابلة للتوسع والتحقق من البيانات الوصفية لتحقيق استدلال قوي صفري المعرفة يتجاوز المتخصصين الخاضعين للإشراف الكامل في اختبارات معيارية متنوعة.

Chenhui Xu, Fuxun Yu, Michael J. Bianco, Jacob Kovarskiy, Raphael Tang, Qi Zhang, Zirui Xu, Will LeVine, Brandon Dubbs (…)2026-05-04
💻 computer science

ClustViT: Clustering-based Token Merging for Semantic Segmentation

يعالج ClustViT التعقيد التربيعي لنماذج "Vision Transformers" في التجزئة الدلالية من خلال تقديم وحدة عنقودية (Cluster module) قابلة للتدريب تدمج الرموز المتشابهة بتوجيه من العناقيد الزائفة، ووحدة إعادة توليد (Regenerator module) تستعيد التفاصيل الدقيقة، مما يحقق كفاءة حسابية كبيرة واستدلالاً أسرع دون المساس بالدقة.

Fabio Montello, Ronja Güldenring, Lazaros Nalpantidis2026-05-04
🤖 machine learning

It's Never Too Late: Noise Optimization for Collapse Recovery in Trained Diffusion Models

تقترح هذه الورقة نهجاً لتحسين الضجيج يخفف من حدة انهيار النمط في نماذج الانتشار المدربة عبر الاستفادة من أهداف بسيطة وعمليات تهيئة ضجيج متنوعة قائمة على التردد لتحقيق جودة وتنوع فائقين في التوليد دون المساس بالدقة.

Anne Harrington, A. Sophia Koepke, Shyamgopal Karthik, Trevor Darrell, Alexei A. Efros2026-05-04
🤖 AI

VecSet-Edit: Unleashing Pre-trained LRM for Mesh Editing from Single Image

يُعد VecSet-Edit أول مسار معالجة يستفيد من نماذج إعادة البناء الضخمة (VecSet Large Reconstruction Models) المدربة مسبقاً للتحرير المباشر للشبكات ثلاثية الأبعاد (3D mesh) من صورة واحدة، وذلك عبر استخدام تقنيات مبتكرة للتحديد المعتمد على الرموز (token-based localization)، والتقليم المدرك للانجراف (drift-aware pruning)، وخبز الأنسجة المحافظ على التفاصيل (detail-preserving texture baking) للتغلب على قيود النهج القائمة على الفوكسل (voxel-based) والنهج متعدد الرؤى (multi-view).

Teng-Fang Hsiao, Bo-Kai Ruan, Yu-Lun Liu, Hong-Han Shuai2026-05-04
💻 computer science

ScreenParse: Moving Beyond Sparse Grounding with Complete Screen Parsing Supervision

تقدم الورقة البحثية ScreenParse، وهي مجموعة بيانات واسعة النطاق ذات تعليقات توضيحية كثيفة لـ 21 مليون عنصر من عناصر واجهة المستخدم عبر 771 ألف لقطة شاشة، وScreenVLM، وهو نموذج مدمج تم تدريبه على هذه البيانات يتفوق بشكل كبير على النماذج التأسيسية الأكبر في تحليل الشاشة ويعزز قدرات الربط من خلال الأولويات الهيكلية القابلة للنقل.

A. Said Gurbuz, Sunghwan Hong, Ahmed Nassar, Marc Pollefeys, Peter Staar2026-05-04
⚡ electrical engineering

TimeRFT: Stimulating Generalizable Time Series Forecasting for TSFMs via Reinforcement Finetuning

يقدم TimeRFT نموذجاً للضبط الدقيق بالتعزيز لنماذج التأسيس للسلاسل الزمنية، يستخدم آلية مكافأة زمنية قائمة على جودة التنبؤ واستراتيجية اختيار بيانات قائمة على الصعوبة للتغلب على قيود الضبط الدقيق الخاضع للإشراف، مما يعزز التعميم ودقة التنبؤ عبر مختلف أنظمة البيانات والتحولات في التوزيع.

Siyang Li, Yize Chen, Zijie Zhu, Yuxin Pan, Yan Guo, Ming Huang, Hui Xiong2026-05-04
⚡ electrical engineering

Broadband Wide Field of View Imaging with Computational Mirrors

تقدم هذه الورقة البحثية "المرايا الحسابية" (Computational Mirrors)، وهو إطار عمل يجمع بين نموذج دالة انتشار نقطة (PSF) مبتكر مستوحى من الفيزياء (SeidelConv) مع التقاط حد أدنى من المجموعات البؤرية (focal stack) لتحقيق تصوير عالي الدقة وواسع مجال الرؤية عبر كامل الطيف المرئي إلى الأشعة تحت الحمراء قصيرة الموجة باستخدام مرايا مقعرة بسيطة لا لونية.

Vishwanath Saragadam, Niki Nezakati, Amit Roy-Chowdhury, Vivek Boominathan2026-05-04