💻 computer science

Training-Free Fine-Grained Semantic Segmentations in Low Data Regimes: A FungiTastic Baseline

تقدم هذه الورقة إطار عمل مكون من مرحلتين ولا يتطلب تدريبًا يسمى FungiTastic، والذي يستفيد من SAM3 لتجزئة الفطر بمعزل عن الفئات ومن نهج مطابقة النماذج الأولية المعزز لـ DINOv3 للتصنيف دقيق التفاصيل، مما يؤسس لأول خط أساس للتجزئة الدلالية دقيقة التفاصيل في أنظمة البيانات المنخفضة.

Sebastian Cavada, Francesco Pelosin, Lapo Faggi2026-05-22
💻 computer science

GeoWeaver: Grounding Visual Tokens with Geometric Evidence before Scene Reasoning

يُعد GeoWeaver إطار عمل لما قبل الاستنتاج يعمل على تعزيز الاستدلال المكاني والزماني في النماذج اللغوية البصرية من خلال التخصيص التكيفي للأدلة الهندسية دقيقة التفاصيل لكل رمز بصري على حدة، مما يجعل الهندسة شرطاً تمثيلياً أساسياً بدلاً من كونها إشارة مساعدة للدمج المتأخر.

Deshui Miao, Xingsen Huang, Yameng Gu, Xin Li, Haijun Zhang, Ming-Hsuan Yang2026-05-22
💻 computer science

Beyond Chamfer Distance: Granular Order-aware Evaluation Metric For Online Mapping

تقدم هذه الورقة SOSPA وPLD، وهما إطار تقييم مبتكر يعتمد على الوعي بالترتيب يتغلب على قيود مسافة تشامفر المحددة بعتبة من خلال توفير تقييم هندسي دقيق وتسجيل كشف ناعم، مما يكشف أن قدرة الكشف هي العائق الأساسي في طرق الخرائط عبر الإنترنت الحالية.

Chouaib Bencheikh Lehocine, Adam Lilja, Junsheng Fu, Lars Hammarstrand2026-05-22
💻 computer science

GLeVE: Graph-Guided Lesion Grounding with Proposal Verification in 3D CT

تقدم الورقة البحثية GLeVE، وهو إطار عمل موجه بالرسوم البيانية يستفيد من الأولويات التشريحية والتحسين القائم على الشجرة الثمانية (octree) لتحقيق تحديد دقيق لمواقع الآفات في التصوير المقطعي المحوسب ثلاثي الأبعاد عبر سد الفجوة الدلالية المكانية بين التقارير الإشعاعية والتشريح الحجمي.

Shuo Jiang, Yuhao Hong, Chunbo Jiang, Weihong Chen, Huangwei Chen, Shenghao Zhu, Beining Wu, Mingxuan Liu, Zhu Zhu, Feiw (…)2026-05-22
💬 NLP

Seeing the Poem: Image-Semantic Detection of AI-Generated Modern Chinese Poetry with MLLMs

تقترح هذه الورقة البحثية وتتحقق من صحة طريقة كشف موجهة بالدلالات الصورية، تستفيد من النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) لدمج الصور المرئية مع التحليل النصي، محققةً أداءً هو الأفضل في فئته في كشف الشعر الصيني الحديث المُنشأ بواسطة الذكاء الاصطناعي، ومتفوقةً بذلك على كل من النماذج اللغوية الكبيرة المعتمدة على النص فقط والمكتشفات التقليدية مثل RoBERTa.

Shanshan Wang, Fengying Ye, Hanjia Lyu, Caiwen Gou, Junchao Wu, Jingming Yao, Chengzhong Xu, Jiebo Luo, Derek F. Wong2026-05-22
⚡ electrical engineering

SegCompass: Exploring Interpretable Alignment with Sparse Autoencoders for Enhanced Reasoning Segmentation

يقدم SegCompass إطار عمل للتجزئة الاستدلالية متكامل الطرفين يستخدم مشفرًا تلقائيًا متفرقًا لإنشاء محاذاة صريحة، وقابلة للتفسير، وقابلة للاشتقاق بين تسلسل التفكير والاستدلال والإدراك البصري، مما يحقق أداءً رائدًا مع تعزيز الشفافية مقارنة بالطرق الحالية "الصندوق الأسود" أو الطرق اللاحقة.

Zhenyu Lu, Liupeng Li, Jinpeng Wang, Haoqian Kang, Yan Feng, Ke Chen, Yaowei Wang2026-05-22
💻 computer science

SEGA: Spectral-Energy Guided Attention for Resolution Extrapolation in Diffusion Transformers

تُعد SEGA طريقةً لا تتطلب تدريباً تعمل على تعزيز استقراء الدقة في محولات الانتشار (Diffusion Transformers) عبر تغيير مقياس الانتباه ديناميكياً عبر مكونات تضمين الموضع الدوراني (Rotary Position Embedding) بناءً على البنية المكانية-الترددية للكمون، مما يحسن كلاً من التماسك الهيكلي ودقة التفاصيل الدقيقة في توليد الصور عالية الدقة.

Javad Rajabi, Kimia Shaban, Koorosh Roohi, David B. Lindell, Babak Taati2026-05-22
💻 computer science

Slimmable ConvNeXt: Width-Adaptive Inference for Efficient Multi-Device Deployment

تقدم الورقة البحثية Slimmable ConvNeXt، وهو إطار عمل للاستنتاج متكيف مع العرض يستفيد من تصميم ConvNeXt الحديث لتمكين النشر الفعال متعدد الأجهزة باستخدام مجموعة أوزان مشتركة واحدة، محققاً دقة فائقة عبر مختلف القيود الحسابية مقارنة بنهج الشبكات العصبية التلافيفية (CNN) ونماذج المحولات الرؤية (Vision Transformer) الحالية دون الحاجة إلى آليات تطبيع معقدة.

Janek Haberer, Jon Eike Wilhelm, Olaf Landsiedel2026-05-22
💻 computer science

Conceptualizing Embeddings: Sparse Disentanglement for Vision-Language Models

تقدم الورقة البحثية CEDAR، وهي طريقة لاحقة (post-hoc) تعمل على فك تشابك الدلالات الداخلية لنماذج الرؤية واللغة مسبقة التدريب إلى سمات قابلة للتفسير ومتعامدة عبر دوران قابل للعكس وعنق زجاجة يعتمد على تشتت (sparsity) من نوع top-kk، مما يكشف عن البنى التركيبية دون زيادة الأبعاد أو المساس بالهندسة الأصلية.

Piotr Kubaty, Patryk Marszałek, Łukasz Struski, Adam Wróbel, Jacek Tabor, Marek Śmieja2026-05-22
💬 NLP

AnyMo: Geometry-Aware Setup-Agnostic Modeling of Human Motion in the Wild

إنّ AnyMo هو إطار عمل مدرك للهندسة وغير مرتبط بإعدادات محددة، يستفيد من محاكاة وحدة قياس القصور الذاتي (IMU) القائمة على الفيزياء والمواءمة مع النماذج اللغوية الكبيرة (LLM) لتمكين فهم قوي ومعمم لحركة الإنسان عبر مختلف الأجهزة القابلة للارتداء ومجموعات البيانات غير المرئية، متفوقاً بشكل كبير على الطرق الحالية في التعرف على الأنشطة في وضع الصفر، والاسترجاع متعدد الوسائط، ووصف الحركة.

Baiyu Chen, Zechen Li, Wilson Wongso, Lihuan Li, Xiachong Lin, Hao Xue, Benjamin Tag, Flora Salim2026-05-22